Folia
← 返回头版

Artificial Analysis发布Intelligence Index v4.2,新增评估任务防止模型过拟合

Artificial Analysis发布了Intelligence Index v4.2版本更新,在其AI基准测试中加入AA-Briefcase和GDP.pdf两项新评估任务1。其中AA-Briefcase用于评估模型在多周知识工作项目上的表现,涉及数千个输入源文件1;GDP.pdf则是一项跨4,592页PDF的文档推理任务,包含100份PDF、十个领域、1,275条专家标准1。同时,该版本移除了GPQA Diamond评估1。

为了防止模型过拟合,Artificial Analysis将私有测试集的权重从v4.1版本的20%提升至40%,并计划在即将推出的Index v5中进一步提升这一比例1。在此次更新的评测中,Anthropic的Claude Fable 5.1在总排名中位列第一,OpenAI的GPT-6 Astra位列第二,相比前代GPT-5.6 Sol提升4分1。具体而言,GPT-6 Astra在GDP.pdf上得分33.2%,领先Claude Fable 5.1的26.2%;而Claude Fable 5.1则在AA-Briefcase上表现领先1。


评论