AB
AiBoss
ニュース

研究:AI 编程智能体产出更多代码,却未带来更多软件

一项基于 70 余万名员工数据的分析发现,引入 AI 编程智能体后代码行数、提交数和拉取请求明显增加,但代码评审耗时平均拉长 49%,问题与史诗级需求的解决率没有统计意义上的变化。

核心事实

据 Ars Technica 报道,哈佛大学研究人员 Fiona Chen 与 James Stratton 利用工程团队分析平台 Jellyfish 的汇总数据,考察了 AI 编程工具对软件开发产出的实际影响。样本覆盖 2021 年至 2026 年 3 月期间、700 多家相关软件开发企业的 70 余万名员工,包含约 3 亿条“工作事件”(如提交与拉取请求)以及问题管理软件数据。

研究显示,企业引入 AI 编程智能体后,代码总行数平均增加 30%,提交总数增加 20%,拉取请求数量增加 23%。但由 Jira 等工具跟踪的问题与史诗级需求(即整体软件功能)的解决率,在引入 AI 工具后没有出现统计上显著的变化;研究人员也未发现这些需求在规模或复杂度上出现结构性变化。

背景与影响

研究把差异归因于代码评审环节。引入 AI 编程智能体后,从拉取请求提交到合并的平均“评审流程”时间平均拉长 49%;需要修改的拉取请求占比接近翻倍,每个拉取请求的评论数增加 35%。与此同时,从事代码评审的员工占比上升 14%。研究人员称,无法将显著的就业变化归因于 AI。

研究还发现,AI 在评审环节的介入仍然有限:截至 2026 年 3 月,80% 的受测企业使用了某种形式的 AI 代码评审,但 AI 智能体只贡献了全部评审评论的 23.3% 和全部拉取请求的 10.8%。研究者的结论是,编码阶段获得的效率提升被生产流程下游的约束“吸收”了。

限制与来源

该研究基于 Jellyfish 的汇总分析数据,并以 GitHub 活动分析等方式判断企业何时引入 AI 编程助手或智能体,方法上依赖“双重差分”回归。研究数据截止于 2026 年 3 月,此后 AI 编程智能体的能力已有多次更新;研究也提到,95% 的受测企业已部署 AI 编程智能体,许多团队仍在摸索何时、如何部署更合适。上述结论来自该研究的特定样本与时间窗口,不宜直接外推到所有团队。本文信息源自 Ars Technica 的报道,具体数据与方法细节请以原始研究与相关平台官方信息为准。