代码审查

科技人工智能

GPT-5.6 Luna vs. GPT-6 Astra:廉价模型能否胜任代码审查?

研究人员对两款AI模型在代码审查中的表现进行了对比测试。GPT-5.6 Luna的定价为输入令牌每百万0.20美元、输出令牌每百万1.20美元,而GPT-6 Astra的定价分别为10美元和50美元 。在50个来自Cal.com、Sentry、Discourse、Keycloak和Grafana的公开拉取请求测试中,…

科技创业公司

Docket:为AI代理生成代码提供逐提交证据记录

Docket是一套为AI代理生成的代码创建证据记录的工具系统。它通过捕捉AI编写代码的完整实现过程(包括尝试的方案、验证步骤和失败记录),并将其与最终的代码差异进行对比,为每个代码块生成证据密度评分,帮助代码审查者快速定位缺乏充分证据支撑的部分。

科技人工智能

构建AI软件工厂:智能代理自动开启、审查与合并代码请求

AI代理正在深刻改变软件开发的生产效率。Stephen Toub曾在35,000英尺高空用手机打开9个拉取请求,其中7个被自动合并。这一案例反映了行业趋势——多家头部科技公司已经建立了成熟的AI驱动代码生产流程。

科技人工智能

GPT-6 Astra 在代码审查中性能领先,但成本显著更高

CodeRabbit 发布的评估报告显示,OpenAI 的 GPT-6 Astra 在代码审查能力上有显著提升。在简单代码审查场景中,Astra 相比 GPT-5.6 Sol 多捕获约 4% 的可行性 Bug,相比 Opus 5 则多捕获 22%。在更复杂的跨文件审查中,Astra 的优势进一步扩大,对比 Sol 领…

科技人工智能

RealDiff 推出运行时行为差异检测工具,支持六种编程语言

RealDiff 是一款用于拉取请求的运行时行为差异检测工具,旨在发现普通源代码审查可能遗漏的运行时行为变更 。该工具支持 .NET、Java、Node.js、Go、Rust 和 Python 六种语言 。其核心机制是通过构建两个 Git 修订版并观察测试执行情况来进行检测,在此过程中学习三次基础运行的噪声基线,从而…

科技互联网

Maiao:为多平台引入 Gerrit 风格代码审查工作流的开源工具

开源项目 Maiao 为 GitHub、GitLab、Gitea、Forgejo、Bitbucket Cloud 及 Cursor Origin 等代码托管平台引入了 Gerrit 风格的 stacked pull requests 工作流 。通过执行 `git review` 命令,该工具能够自动将分支中的每个 c…

科技互联网

GitHub推出Stacked Pull Requests公开预览功能

GitHub已推出Stacked Pull Requests功能的公开预览版,现正向所有仓库逐步推出。这一功能将大型代码变更分解为多个小的、有序的可审查拉取请求,使团队能够并行审查和独立合并各层次的变更。Merge queue对Stacked PRs的支持将在未来几周内逐步推出。

科技人工智能

编程界争论AI代码审查标准:逐行阅读还是依赖测试体系

围绕人工智能生成代码是否需要逐行阅读,编程界近日陷入激烈争论。HashiCorp联合创始人Mitchell Hashimoto发推文主张"I read the code",获得近83万次浏览,强调开发者应当审查代码;而资深开发者Uncle Bob则提出对立观点,称"完全不去读Agent写出来的任何代码",该言论获得超…

科技创业公司

单日审计暴露十类检查失效模式

Claude作为网站工程师在2026年7月18-19日进行的单日审计中,系统地识别了代码检查通过但底层系统实际存在缺陷的十种测试失效模式。