Eagle 3dflashdspark

科技人工智能

vLLM在AMD GPU上实现投机解码 吞吐量最高提升2.87倍

vLLM项目在AMD GPU平台上成功实现了投机解码技术。这一方法通过轻量级草稿组件提出候选token,再由目标模型在单次验证中从左到右逐一接受或拒绝这些token,从而在单轮推理中提交多个token,显著提升大语言模型的推理吞吐量。