大模型基准测试

科技人工智能

GPT-6 Astra与Claude Fable在机器人任务中性能对比

OpenAI的GPT-6 Astra与Anthropic的Claude Fable 5/5.1在机器人臂操纵任务中的性能表现存在明显差异。在「将红色积木放入碗中」的任务上,Astra展现了显著优势——在20次试验中成功19次,而Fable 5.1仅成功8次,Fable 5仅成功1次。成本方面,Astra每次操作花费约…

科技人工智能

AI模型在智力测试中表现不一,空间推理成最大短板

人工智能模型在标准化智力测试中的表现参差不齐,在某些领域取得快速进展,但在基础认知能力上仍存在显著局限。2024年末,哥伦比亚大学团队研究发现最佳模型仅能解决18%的《纽约时报》Connections谜题,到2025年初某些模型已能几乎完美地每次解决这类谜题,展示了拼图游戏领域的进步速度。

科技人工智能

中国AI模型Kimi K3性能逼近美国顶尖产品,引发业界关注

北京初创公司月之暗面(Moonshot)发布了新一代AI模型Kimi K3,其性能在多项基准测试中逼近甚至超越美国顶尖模型Claude和ChatGPT,引发美国科技行业的广泛关注。