大语言模型评估

科技人工智能

Artificial Analysis发布Intelligence Index v4.2,新增评估任务防止模型过拟合

Artificial Analysis发布了Intelligence Index v4.2版本更新,在其AI基准测试中加入AA-Briefcase和GDP.pdf两项新评估任务。其中AA-Briefcase用于评估模型在多周知识工作项目上的表现,涉及数千个输入源文件;GDP.pdf则是一项跨4,592页PDF的文档推…