Source-linked AI summary

Towards a Science of Scaling Agent Systems

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

arXiv:2512.08296v3cs.AI

TL;DR

智能体性能如何随协作、模型能力和任务因素变化,仍缺乏充分研究。本文在多个基准测试上评估受控架构,发现决定协作成败的是架构—任务对齐,而非智能体数量;相较于单智能体基线,结果范围为 +80.8% 至 −70.0%。

  • 问题

    多智能体协同在何种条件下能让智能体任务受益于单智能体系统之上,仍缺乏充分理解。

  • 方法

    研究在控制提示词、工具和计算资源的同时,跨260种配置、六个基准测试和三个LLM系列改变五种架构及模型能力。

  • 结果

    相较于单智能体基线为 +80.8% 至 −70.0%,在所评估任务中,架构—任务对齐决定协作是否成功。

  • 主要结论与局限

    智能体有效性取决于让协同结构匹配任务特征,而非增加智能体数量。

  • 主要结论与局限

    所评估的六个基准测试可能无法涵盖智能体任务特征的完整范围,包括具身、多用户和长时程时序环境。

Abstract

from arXiv · show

Agents, language model-based systems capable of reasoning, planning, and acting are widely adopted in real-world tasks, yet how their performance changes as these systems scale across key dimensions remains underexplored. We introduce quantitative scaling principles for agent systems as a predictive model, capturing how performance varies with coordination, model capability, and measurable system and task factors. Across 260 configurations spanning six agentic benchmarks, five canonical architectures (Single-Agent and four Multi-Agent: Independent, Centralized, Decentralized, Hybrid), and three LLM families, we perform controlled evaluations, standardizing tools, prompts, and compute to isolate architectural effects. The resulting model achieves a cross-validated R^2=0.373 across all six benchmarks (R^2=0.413 with a task-grounded capability metric). We identify a robust capability-saturation effect and additional patterns: (1) a coordination yields diminishing returns once single-agent baselines exceed certain performance; (2) tool-heavy tasks appear to incur multi-agent overhead; and (3) architectures without centralized verification tend to propagate errors more than those with centralized coordination. Relative performance change compared to single-agent baseline ranges from +80.8% on decomposable financial reasoning to -70.0% on sequential planning, demonstrating that architecture-task alignment determines collaborative success. The framework identifies the best-performing architecture for 87% of held-out configurations and shows consistent relative architecture preferences on unseen frontier models. Agent effectiveness depends on alignment between coordination and task structure, and that mismatched coordination degrades the performance.

1. 引言

本文构建了一个受控框架,用于解释多智能体协作何时有助于或损害智能体任务;成功取决于架构与任务的匹配,而非智能体数量本身。在260种配置中,本文量化了涉及能力、协作开销和错误传播的 scaling 权衡。

  • 智能体任务定义: 智能体任务要求持续的多步环境交互、部分可观测条件下的迭代式信息获取,以及自适应行动,这些特征使其区别于静态的 single-shot benchmark。这一差异解释了为何静态 benchmark 上团队规模的单调收益,无法推广到由协作开销和错误传播主导的任务。
  • 受控评估: 本研究控制 prompts、tools、计算预算和模型能力,同时在五种架构、三个 LLM family、六个 benchmark 和260种配置之间改变协作结构。这一设计解决了既有评估将架构效应与实现选择混为一谈的问题。
  • 贡献: 该预测框架在六个 benchmark 上达到 cross-validated R^2=0.373,采用 task-grounded capability metric 时达到 R^2=0.413,并将架构与任务的匹配识别为协作成功的决定因素。框架结合经验协作指标、推理能力和任务属性来预测性能,并以87%的准确率识别最优架构。
  • Scaling 模式: 在集中式协调下,结构化金融推理的相对性能提升 +80.8%;在独立式协调下,序列规划的相对性能下降 −70.0%。去中心化协调使动态网页导航性能提升 +9.2%,而架构偏好会随任务结构呈现系统性差异。
  • Scaling 模式: 多智能体协作在困难的智能体任务上会带来递减收益甚至负收益:工具密集型工作流承受协作开销,而单智能体准确率超过45%的任务会出现能力饱和。工具—协作权衡的 β=−0.096,p=0.002;能力上限的 β=−0.236,p=0.004。

2. 相关工作

既有研究区分了单智能体与拓扑结构多样的多智能体系统,并将交互式 agentic 任务与静态基准分开。研究结果表明,协调的收益取决于领域与架构,这推动了对协作何时优于强单智能体的系统评估。

  • 多智能体系统与单智能体系统之比较: 单智能体系统只有一个推理中心,而多智能体系统则通过消息传递、共享记忆或编排协议来协调多个由 LLM 驱动的智能体。MAS 拓扑包括 Independent、Decentralized、Centralized 和 Hybrid 架构。
  • Scaling Laws 与协调机制: 相较于配备工具的强单模型,多智能体协调的价值在实证上仍未有定论,因为已有 scaling laws 未发现显著的普适模式 [1]这促使研究者对特定领域的协作扩展进行系统评估。
  • Agentic 任务与基准: 与单轮、非 agentic 基准不同,agentic 任务要求持续的多步交互、部分可观测条件下的信息搜集,以及根据反馈进行自适应细化。示例涵盖 browsing [4] [46]、trading [33]、software engineering 和 planning [21];非 agentic 基准则包括 GSM8K [48]、MMLU [49]、HumanEval [26] 和 SQuAD [50]
  • Agentic 任务与基准: 在非 agentic 基准上,ensemble 的性能可以单调提升——五个智能体在 HumanEval 上达到 89%——而 agentic 协调会引入交互开销与错误级联。经过 10 次交互后,智能体表现出 34% 的重叠,说明其世界状态出现分歧 [23]
  • Scaling Laws 与协调机制: 协调机制与架构—任务对齐可能决定协作是放大还是削弱性能;其中,查询依赖型配置以 6-45% 的成本实现了更优性能。既有工作包括缓解幻觉级联的工作流 [28],以及产生涌现行为的结构化交互 [56]

3. Agent系统与任务

论文从agent、环境、通信拓扑和编排策略四个方面形式化agent系统,并区分single-agent与multi-agent计算。论文定义了协同架构、agentic任务要求和误差放大指标,用于分析系统结构如何影响性能。

  • Agent系统形式化: 一个agent系统由多个agent、共享环境、通信拓扑和编排策略组成;一个agent构成SAS,多于一个agent则构成MAS。Agent通过迭代反馈进行感知、推理和行动。
  • 架构分类: 通信拓扑决定信息流,编排则基于共识或质量阈值控制聚合、覆盖、持久化记忆和终止。所定义的拓扑包括agent到聚合器的Independent、编排器到agent的Centralized、全连接的Decentralized,以及组合式Hybrid。
  • 架构分类: 五种架构将协同机制与通用multi-agent效应分离开来,涵盖顺序式SAS,以及Independent、Centralized、Decentralized和Hybrid MAS。Independent检验并行性,Decentralized加入同伴融合,Centralized加入层级验证,Hybrid则将层级结构与横向灵活性结合起来。
  • 误差指标: 与Independent coordination相比,具备验证机制的架构能更有效地遏制错误,这由任务级和轨迹级误差放大因子衡量。任务级因子比较MAS和SAS的错误率,大于一表示错误净放大,小于一表示错误受到抑制。
  • Agentic任务: Agentic基准要求通过交互、信息收集、规划和信念修正实现序列式相互依赖、部分可观测性和自适应策略形成。GSM8K和MMLU等静态基准评估的是推理能力,而非当前所必需的agentic能力。

4. 实验与结果

在 260 种配置中,多智能体系统并无普遍优势:平均提升为 −0.3%,结果因任务结构和架构而在 −70.0% 至 +80.8% 之间变化。回归 scaling model 可预测架构有效性,交叉验证 R^2=0.373;结合任务基础的 ACI metric 后为 0.413。

  • 领域依赖性: +80.8% 是 Finance Agent 采用 Centralized 后的提升,而 PlanCraft 则下降 −70.0%,因为在序列式工作中,协调开销超过了任务复杂度。Finance 得益于并行信息综合,而 PlanCraft 引入了冗余子任务和协调消息。
  • 能力饱和: SWE-bench Verified 在各 MAS 架构下的性能下降为 −2.1% 至 −14.9%,而 Terminal-Bench 采用 Independent 协调时仅提升 +1.7%。SWE-bench 的这一模式与超过单智能体阈值后的 capability saturation 一致,而 Terminal-Bench 仍低于该阈值。
  • 总体结果: MAS 整体平均提升为 −0.3%(95% CI: [−58.7%, +77.2%]),范围从 PlanCraft Independent 的 −70.0% 到 Finance Centralized 的 +80.8%。较高的方差(σ=37.5%)表明,多智能体收益具有领域特异性,而非普遍存在。
  • 架构–LLM 交互: 没有任何架构在不同领域和供应商之间占据主导:Finance 偏好 Centralized 和 Decentralized 协调,而在提升为正的领域内还会出现供应商特定的偏好。在 Finance Agent 上,Anthropic 的 MAS-Centralized 达到 +127.5%,表明协调效应会因 LLM 家族而异。
  • Scaling model: 交叉验证 scaling regression 在全部260种配置上达到 R^2=0.373,采用 task-grounded Agentic Capability Index 后提升至 R^2=0.413。该模型检验连续的实证协调指标能否比分类架构标签更好地解释性能差异。

5. 局限性

该研究的 scaling principles 仍受到 coordination overhead、工具密集型 failure modes、有限的 heterogeneity 与 prompting、benchmark 覆盖范围、经济成本和统计不确定性的限制。这些约束使更大规模的集体、更广泛的环境以及部分回归模式尚未得到充分验证。

  • 集体规模扩展: 随着 agent 数量增加,通信开销呈超线性增长;当团队规模超过中等水平后,协调效率下降,从而限制了对更大规模集体的结论。该框架仅考察了最多九个 agent,更大规模集体中的有益涌现行为仍未解决。
  • 模型异质性: 异质性分析范围较窄,初步测试未发现证据表明混合不同模型能够绕过 capability-saturation threshold。在各 model family 内,agents 共享基础架构;异质性研究覆盖了 13 个 BrowseComp-Plus 配置。
  • 工具密集型任务: 工具密集型环境是 multi-agent 系统的主要 failure mode 之一,工具数量与系统效率呈负向交互。潜在补救措施包括显式的工具访问调度、capability-aware routing,以及分层工具委派。
  • 提示设计: 各条件使用了相同的 prompts,而非针对模型进行优化,因此 prompt tuning 可能改变所报告的 scaling characteristics。这一局限源于已知的 LLM 行为对提示语 formulation 的敏感性。
  • 外部效度: 六个多样化 benchmark 可能无法覆盖 agentic tasks 的完整谱系,尤其是长时程时间依赖、现实世界反馈回路、具身环境和多模态交互。因此,所报告的 principles 仍有待在 robotic control、medical triage 和多用户社会互动等领域中检验。
  • 成本与推断: 经济可行性仍是一项障碍,因为以 token 为中心的协调可能增加总计算量,而数据集层面的聚类限制了回归推断的确定性。当 G=6 个 clusters 时,一些在朴素 OLS 下显著的预测变量,在 cluster-robust inference 下不再显著;研究结果被表述为由方向一致性支持的描述性模式。

6. 结论

通过260个受控配置,本研究刻画了智能体系统性能如何随协调、模型能力和任务属性变化。能力饱和是最稳健的 scaling effect:当单智能体基线超过约45%后,协调带来的收益递减,这一结论得到校正统计检验的确认。

  • 结论: 当单智能体基线超过约45%后,协调带来的收益递减,表明能力饱和是最稳健的 scaling effect。在 cluster-robust inference(p = 0.004)和 Holm–Bonferroni 多重比较校正下,该发现仍具有统计显著性。
  • 结论: 本研究通过实证刻画了智能体系统性能在协调结构、模型能力和任务属性方面的表现。分析涵盖260个受控配置,涉及三个 LLM 系列和六个 agentic benchmarks。
  • 结论: 这些结论基于涵盖三个 LLM 系列和六个 agentic benchmarks 的受控评估。这一范围支持比较多样化智能体系统配置下的 scaling behavior。

数据可用性

研究使用的全部六个基准数据集均已公开,并在适用情况下记录了实例数量及确定性子集选择方法。全部260个实验配置的逐实例结果已提供于代码仓库中。

  • 数据可用性: 评估涵盖六个公开基准:BrowseComp-Plus [32]、Finance-Agent [33]、PlanCraft [21]、Workbench [34]、SWE-bench Verified [20] 和 TerminalBench [25]这些数据集分别包含100、50、100、100、500和86个实例。
  • 数据可用性: SWE-bench Verified使用以seed 42选取的确定性20实例子集,而TerminalBench使用其前20个实例。
  • 数据可用性: 全部260个实验配置的逐实例结果可在代码仓库的etc/analysis/中获取。

代码可用性 · 附录

该研究提供了一个公共代码仓库,其中包含复现所报告分析所需的评估框架及配套材料。

  • 代码可用性: 该仓库包含评估代码、配置、提示模板、分析脚本和经过脱敏的执行轨迹,其他复现材料已在线记录。代码仓库:https://github.com/ybkim95/agent-scaling

A. 模型智能指数

本研究采用扩展版 Artificial Analysis Intelligence Index,作为统一的、非 agentic 的 LLM 能力度量。对于缺少官方分数的模型,研究以一致方法重构该指数,并标注估算值及方法学局限。

  • 指数构建: Intelligence Index 综合衡量模型在推理、知识、数学、编程、指令遵循、长上下文推理和 agentic workflow 任务上的表现。其构建整合了八套评测体系,包括 MMLU-Pro [6.
  • 指数构建: 该指数通过一致的 zero-shot prompting、pass@1 评分,以及综合推理和问题求解测量,为模型能力提供独立于 agentic 机制和多 agent 协作的基线。这些设计选择支持对研究所用模型进行统一的定量比较。
  • 重构: 对于缺少官方平台结果的模型,研究独立复现选定的评测体系,并依据 Intelligence Index v3.0 的等权重公式计算重构的 Intelligence Index 值。重构值及其组成评测分数和模型元数据列于 Table 6;当无法完整复现时,近似估算值以 * 标记。
  • 局限: 重构分数需要谨慎解读,因为部分长上下文和 agentic 评测具有非确定性,而不可用的大上下文支持可能使估算值成为上界近似。这些值在方法上保持一致,但未经官方认证。

B. 样本外验证 … C.2. 领域特征刻画

样本外验证支持该 scaling framework,但也暴露出系统性的外推误差,尤其是在 Hybrid 架构上。论文还使用基于序列相互依赖性、状态空间复杂度和经验难度的序数分数,将领域复杂度操作化。

  • B. 样本外验证: 在留出模型上,MAS 预测的 MAE = 0.061,相比之下 SAS 为 0.138,表明其在训练范围之外的校准优于单智能体预测。三个留出模型的 Intelligence Index = 75,超出 42–71 的训练范围;由于线性外推,SAS 系统性地过度预测。
  • B. 样本外验证: 在三个留出模型中,73% 的关键发现–模型配对得到验证;能力上限、Centralized 或 Decentralized 最优解,以及 Hybrid 的额外开销均实现了普遍泛化。各模型的验证率分别为 4/5、4/5 和 3/5;BrowseComp 的 Decentralized > Centralized 模式会随模型家族而变化。
  • B. 样本外验证: 在相同的 Intelligence Index = 75 下,GPT-5.2 达到 P_SA = 0.45,而 Gemini-3.0 Pro 和 Flash 分别为 0.36 和 0.34;与此同时,最佳 MAS 性能收敛于 0.48–0.50。这种收敛表明,多智能体架构可能弥补单智能体的局限,但不同模型家族之间的 Intelligence Index 可能无法直接比较。
  • B. 样本外验证: scaling equation 预测 Hybrid 在三个留出模型上均为最优,但 Centralized 和 Decentralized 架构在实证中表现更好。由于外推忽略了 Hybrid 在高能力水平下的额外开销惩罚,该方程对 Hybrid 的预测平均误差为 +37.0%,而 Centralized 为 +3.0%,Decentralized 的有符号误差为 +8.8%。
  • C. 领域复杂度: 领域复杂度 D∈[0, 1] 刻画序列相互依赖性与经验难度,用于分析协调收益何时超过多智能体开销。该刻画旨在区分所评估基准中由性能提升带来的收益与高昂的协调成本。
  • C.1. 复杂度分数赋值: 复杂度分数结合了三项经验性任务属性,并将其归一化至 [0, 1],包括序列相互依赖性、状态空间复杂度和总体经验难度。Finance Agent 等可并行化任务的序列相互依赖性得分较低,而 PlanCraft 等序列化约束满足任务得分较高;动态环境会增加状态空间复杂度。
  • C.2. 领域特征刻画: Table 11 总结了各基准的领域复杂度分数及其定义性任务特征。该表提供了复杂度分析所采用的基准层面领域特征刻画。

C.3. 关键阈值

分析识别出一个约为 D≈0.40 的关键复杂度阈值,决定多智能体架构何时有利或有害。低于该阈值时,任务分解与并行推理带来正向收益;高于该阈值时,协调开销会降低性能,从而使架构适用性受领域内在属性制约。

  • C.3. 关键阈值: D≈0.40 标志着区分多智能体正向收益与负向收益的关键复杂度阈值。低于该阈值时,多智能体架构可从有效的任务分解与并行推理中获益。
  • C.3. 关键阈值: 高于 D≈0.40 时,协调开销会消耗原本用于推理的计算资源,导致性能下降。
  • C.3. 关键阈值: 多智能体架构的适用性根本上受领域内在属性制约,而这些属性反映在任务复杂度中。

D. 数据集 … E.3. Prompt 编译系统

本研究在六个基准上评估 agent 架构,覆盖多样化的推理、规划、工具使用、软件和终端任务。其实现统一了模型访问、agent 配置和 prompt 编译,同时保留各数据集特有的任务要求。

  • D. 数据集: 这些数据集将不同的评测设置具体化,涵盖专家评分标准下的金融分析、多网站信息综合、函数调用工作流、序列式制作、代码仓库补丁以及 CLI 执行。评估采用结构化评分标准、与 ground truth 比较、精确函数调用匹配、环境成功判定、测试套件通过情况以及客观终端标准。
  • E.1. 技术基础设施: 该实现采用统一的 API 访问和 LangChain 编排,以在不同 provider 间统一模型切换、工具集成、对话管理和结构化 prompt。各 provider 的 API 支持 GPT、Gemini 和 Claude 模型;密钥轮换与上下文截断则用于应对运行约束。
  • E.1. 技术基础设施: 各数据集专属的工具环境通过结构化函数调用接口提供网页搜索、代码执行、数学运算和完成标记。在支持函数调用时,工具会动态绑定到语言模型。
  • E. 实现细节: Agent 配置固定了可比的交互预算,同时支持单 agent、独立式、集中式、去中心化和混合式协调模式。单 agent 最多使用 10 次迭代;多 agent 变体则使用指定的 agent 数量、编排或辩论轮次,以及受限的同伴通信。
  • E.2. Agent 配置: 该框架支持异构角色分配,使高能力 orchestrator 能够协调高效或多样化的 worker 模型。模型按 agent 角色进行分配管理,包括去中心化系统中的不同 worker 模型。
  • E.3. Prompt 编译系统: Prompt 编译结合可复用的 YAML 模板、角色专属扩展、条件选择和数据集变量,为不同架构提供一致但特定于任务的指令。变量包括问题描述、上下文和约束;共享的数据集模板则保留任务特异性。

E.4. 评估方法 · E.5. 信息增益计算

评估在控制工具、上下文处理、资源和模型权重的同时,平衡六个基准子集上的计算成本与统计显著性。信息增益通过从采样推理轨迹估计的后验方差缩减,衡量协调带来的不确定性降低。

  • E.4. 评估方法: 六个基准子集使用20–100个实例,其中较小的SWE-bench Verified和Terminal-Bench样本反映了基于Docker的评估成本。Finance Agent使用50个实例;BrowseComp Plus、WorkBench和Plancraft各使用100个;SWE-bench Verified和Terminal-Bench各使用20个。
  • E.4. 评估方法: 通过统一工具、观测结构、截断策略、速率限制和重试机制,控制不同架构之间外部反馈与资源分配的差异。冻结模型权重且不进行微调,从而将架构效应与模型优化影响分离。
  • E.5. 信息增益计算: 信息增益ΔI通过贝叶斯后验方差缩减,量化借助智能体协调实现的任务不确定性降低。该方法比较协调前后的不确定性,而不只依赖最终任务成功率。
  • E.5. 信息增益计算: 不确定性计算使用二元任务成功变量Y,并比较智能体协调前的状态表示与协调后的聚合输出。spre表示初始推理轨迹,spost表示最终聚合输出。
  • E.5. 信息增益计算: Monte Carlo估计在每个状态下以温度τ=0.7生成K=10条推理轨迹,并计算预测成功概率的经验方差。对于二元结果,方差计算可化为基于采样成功概率预测的形式。
  • E.5. 信息增益计算: 对于二元结果,估计量使用采样轨迹上的平均预测成功概率,记为p̂(s)。该平均预测概率提供了约化方差表达式所使用的状态级量。

F. SWE-bench Verified 与 Terminal-Bench 结果

SWE-bench Verified 与 Terminal-Bench 呈现出与能力饱和阈值一致的模式,如结合 95% bootstrap 置信区间报告的解决率所示。这些结果将论文的跨基准 scaling 分析扩展至软件工程和终端使用任务。

  • F. SWE-bench Verified 与 Terminal-Bench 结果: SWE-bench Verified 与 Terminal-Bench 的解决率报告为基于 20 个实例和 10,000 次重采样计算的 95% bootstrap 置信区间。Table 16 将每个数值呈现为点估计,并给出置信区间的下界和上界。
  • F. SWE-bench Verified 与 Terminal-Bench 结果: SWE-bench Verified 与 Terminal-Bench 展现出与能力饱和阈值一致的 scaling 模式。Figure 6 按 Intelligence Index 将两个基准纳入多智能体性能相对于单智能体基线的跨基准分析。
  • F. SWE-bench Verified 与 Terminal-Bench 结果: 在六个基准上,Figure 6 按 Intelligence Index 比较表现最佳的多智能体系统与单智能体基线,揭示出依赖基准的 scaling 动态。OpenAI 和 Google 在结构化任务中呈现协同 scaling,而 Anthropic 模型在开放式环境中的收益减弱或转为负值。
Loading 2512.08296v3…