研究:AI智能体组队干活 花钱多提升少

让一队AI智能体一起干活,效果真的比单打独斗强吗?评测机构Vals AI的最新测试给出了一个让多智能体玩家尴尬的答案:绝大多数情况下,不值得。
研究团队用GPT-6 Sol和Claude Opus 5.5两款模型,在Vibe Code Bench基准上分别测试了单体智能体和智能体团队,每个都跑了中档和最高两档推理强度。结果是,团队模式的成本是单体智能体的1.8倍到5.1倍,但四组对比里只有一组出现了统计显著的提升——中档推理档的GPT-6 Sol团队高出7.3分。到了最高推理档,无论Sol还是Opus 5.5,组队都没带来实质优势。
更有说服力的是Anthropic自己放出的数据。在两项用Opus 5.5做的内部测试中,随着智能体数量增加,质量增益不断缩水:更大的团队确实能更快到达某个性能水平,但从10个智能体扩到100个,跑满24小时后分数只往上挪了一点点。在另一组ProgramBench测试里,知识库任务的得分从1个智能体的0.53涨到10个的0.70,可再往上加到30个、100个,只能爬到0.71和0.74;Lean定理证明任务同样在10个之后基本躺平。速度确实快了,代价是token消耗一路飙升。
OpenAI研究员Noam Brown此前在Dwarkesh播客上也确认过这个规律:多智能体系统买到的主要是速度,不是质量。4个智能体让任务快了一倍,成本也翻了一倍;加到16个,收益效率反而略有下滑。他补充说,效果高度依赖任务类型——网络调研和数学题能很好地并行,写小说不行,「往一部小说上砸一万个智能体,和派一万个人去写一样没有意义」。
OpenAI开发者Eric Provencher最近也公开提醒开发者别急着上智能体集群:大概率是白花钱,因为智能体之间的协调本身就会出问题,他称之为「协调税」。对正在疯狂堆并行智能体的团队来说,这轮交叉验证的结论相当一致——先把单体的推理强度拉满,再考虑要不要组队。
编译自 The Decoder,原标题:"AI agent teams waste massive tokens for barely measurable quality gains, research finds"