一名开发者在Hacker News上展示了slotstream项目,该项目实现了在仅有48GB内存的Mac上本地运行104GB的Qwen3.8-Flash-Next模型,推理速度约12token/秒。这一方案通过流式从SSD读取权重、动态内存管理等技术优化,使普通消费级硬件也能运行大型语言模型。
Hetzner已开始提供一项实验性的大语言模型推理服务,名为Hetzner Inference 。该服务采用OpenAI兼容的API接口,运行在Hetzner自有基础设施之上 。