OpenAI的GPT-6 Astra与Anthropic的Claude Fable 5/5.1在机器人臂操纵任务中的性能表现存在明显差异。在「将红色积木放入碗中」的任务上,Astra展现了显著优势——在20次试验中成功19次,而Fable 5.1仅成功8次,Fable 5仅成功1次。成本方面,Astra每次操作花费约…
人工智能模型在标准化智力测试中的表现参差不齐,在某些领域取得快速进展,但在基础认知能力上仍存在显著局限。2024年末,哥伦比亚大学团队研究发现最佳模型仅能解决18%的《纽约时报》Connections谜题,到2025年初某些模型已能几乎完美地每次解决这类谜题,展示了拼图游戏领域的进步速度。
北京初创公司月之暗面(Moonshot)发布了新一代AI模型Kimi K3,其性能在多项基准测试中逼近甚至超越美国顶尖模型Claude和ChatGPT,引发美国科技行业的广泛关注。