Folia
← 返回头版

13个AI模型和4个Agent在多编程语言软件工程任务上的性能对比发布

一份针对软件工程任务的AI模型性能评测排行榜已发布,涵盖13个模型和4个Agent在Go、Java、Python、Rust、TypeScript等编程语言上的表现1。本次基准测试基于111个问题和来自65个开源仓库的数据进行评估1。

排行榜已进行多轮更新。2026年7月1日新增的模型包括GLM 5.2、DeepSeek-V4 Pro、DeepSeek-V4 Flash、MiMo V2.5 Pro、Qwen 3.6系列和Gemma 4 31B1。此前在2026年5月27日曾新增gpt-5.5系列、Claude Opus 4.7和Kimi K2.61。评测框架在2025年9月4日引入了Cost per Problem和Tokens per Problem两项新指标1。所有排行榜问题的Docker镜像和HuggingFace数据集已于2025年7月11日发布1。


评论