头版Folia Daily Briefing
← 返回头版
人工智能

Kimi K3与Fable模型性能对标研究发布

近期研究对开源模型Kimi K3与闭源模型Fable 5进行了全面对标测试。此项评估涵盖约1030个智能体任务,旨在比较两款模型在性能与成本方面的差异。

近期研究对开源模型Kimi K3与闭源模型Fable 5进行了全面对标测试[1]。此项评估涵盖约1030个智能体任务[1],旨在比较两款模型在性能与成本方面的差异。

在SWE基准测试中,K3得分达92.4%,Fable为92.6%[1],两者性能接近。但在成本效益方面,K3展现出明显优势。在Oracle路由测试中,有72-96%的任务由K3处理达到最优结果[1]。

具体来看,在SWE任务上,K3平均消耗55轮和130万tokens完成,而Fable消耗21轮和130K tokens[1]。在长终端任务中,Fable消耗64轮和150万tokens[1]。研究指出,通过提示词缓存技术,即使K3读取10倍tokens,仍然保持成本优势[1]。

研究表明,两个模型在不同任务类型上各有专长,通过实施任务级路由机制,可实现比单一模型更优的综合性能[1]。


Kimi K3Fable 5AI模型基准测试模型路由成本效益对比