AB
AiBoss站
快讯

研究:AI 智能体团队成本高企,质量提升却难以测量

评测机构 Vals AI 在 Vibe Code Bench 上对比单智能体与智能体团队,发现团队成本为单体的 1.8 至 5.1 倍,四项对比中仅一项出现统计显著提升。OpenAI 研究员 Noam Brown 亦表示,多智能体系统主要换来速度而非质量。

核心事实

据 the-decoder.com 报道,评测机构 Vals AI 在名为「Vibe Code Bench」的基准上测试了 GPT-6 Sol 与 Claude Opus 5.5,分别以单智能体和智能体团队两种形式运行,并设置中等与最高两档推理强度。结果显示,团队形式的成本是单智能体的 1.8 倍至 5.1 倍;在四组团队与单体的对比中,只有一组出现统计显著提升——GPT-6 Sol 在中等推理强度下,团队得分高出 7.3 分。在最高推理强度下,团队配置对两款模型都没有带来实质优势。

背景与影响

报道还提到,Anthropic 在自身两项针对 Opus 5.5 的测试中发现,增加智能体数量后质量增益反而缩小:更大的团队能更快达到某一性能水平,但从 10 个智能体扩展到 100 个,24 小时后的分数仅小幅上升。在 ProgramBench 的独立测试中,速度提升伴随更高的 token 消耗。OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 中表示,多智能体系统主要买到的是速度而非更好的质量:四个智能体把任务完成速度提高一倍,成本也翻倍;扩展到 16 个智能体时趋势依旧,但效率略降。他指出效果高度依赖任务类型,网页研究与数学适合并行,写小说则不适合。OpenAI 开发者 Eric Provencher 也警告称,智能体集群很可能是在浪费钱,因为智能体之间的协调会失效,他称之为「协调税」。

限制与来源

上述结论来自 Vals AI 的基准测试与相关从业者的公开表述,具体测试条件、模型版本与评分口径以原始报告为准;相关模型与产品的可用性、定价及功能支持请以各厂商官网当前信息为准。本文不构成任何投资或采购建议。