计算机使用

科技人工智能

AI代理计算机使用能力遭遇瓶颈 绕过界面导致真实表现远低于基准

尽管2024-2025年主要AI实验室纷纷推出计算机使用原型并在基准测试中取得亮眼成绩,但这些AI代理在真实应用场景中的表现却远低于预期。在OSWorld-V2基准测试中,最佳模型的任务完成率仅为20.6%,Agents' Last Exam的最佳结果也仅有26.2%。相比之下,基准测试本身显示的完成率从60.76%…