推理加速

科技人工智能

突破三值大语言模型1.58比特存储瓶颈

研究人员提出BITCOS算法,有效降低三值大语言模型的存储成本。该算法分析了29个三值LLM模型中的权重分布特性,发现零权重占比最高达51.5%。利用这一特征,BITCOS采用自适应分布式布局方案,在26个测试模型上的存储效率超过了传统五进制打包方法。

科技人工智能

扩散语言模型的构建与推理加速突破

扩散语言模型正在成为推理阶段的关键技术进展。掩码扩散语言模型(MDLM)本质上是具有随机掩码率的生成式BERT,通过平行生成能够实现显著的推理加速。截至2026年,已有多个产业级扩散模型发布,在质量上与自回归模型相当。

科技人工智能

DiffusionGemma技术报告发布 离散扩散模型实现文本生成加速

研究人员推出了DiffusionGemma,一个采用离散扩散技术的开源语言模型。该模型通过并行处理256个token块而非逐一解码的方式,实现了文本生成的显著加速。