Folia
← 返回头版

三大编码智能体工具选择大测试:16893次运行揭示差异化策略

Armature团队对Claude、Codex和Cursor三个编码智能体进行了大规模对比研究,共进行16893次运行测试,收集了5292个有效会话,涉及51个代码库和18个行业领域1。研究发现这三个智能体在选择第三方服务时采用不同策略,仅在42%的情况下做出相同选择1。

Claude Code倾向于依赖内部知识而较少搜索网络,仅在约30%的会话中进行网络搜索,但在搜索时浏览页面数是Codex的3倍1。相比之下,Codex在94%的会话中使用网络搜索1,而Cursor基于网络做决策的比例为三分之二1。Claude Code自主构建解决方案的能力突出,比例几乎是Codex和Cursor的两倍,达到19%,而后两者均为10%1。

具体的市场选择上,某些服务虽被频繁提及却鲜少被实际采用1。PayPal被提及139次但从未被选中,同类需求中Stripe赢得了其中124个会话1;LangChain被提及194次但仅被选中4次1。在具体领域,Stripe在支付服务上赢率达十分之九1,Neon在数据库领域赢率为66%1,Amazon S3在文件存储领域市场占有率45%1。研究表明编程语言和仓库上下文会显著影响工具选择结果1。


评论