Source-linked AI summary

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

Liangtao Lin, Qingang Zhang, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

arXiv:2608.17433v1cs.AIcs.MA

TL;DR

现有 MCI agent 往往不顾任务对信息和能力的特定需求,统一使用相同的 harness,因此需要可测量的任务—harness 匹配方法。本文构建任务与 harness 的表示,基于文献和执行结果建立映射,并发现合适的 provision 取决于任务和领域,而不存在普适最优方案。

  • 问题

    现有 harness 策略往往为每项任务提供相同的完整配置,而以往的自适应方法通常只是推断有用性,而非测量充分性。

  • 方法

    本文构建基于系统方程的任务分类,定义累积式 harness 层级,建立两个任务—harness 映射,并采用由 self-check 触发的升级机制。

  • 结果

    合适的 harness 配置因任务类别和领域而异:map-guided escalation 将液冷任务的准确率从 0.652 提升至 0.715,而对电网任务而言,完整 provision 仍具有最优准确率。

  • 结论与局限

    Harness provisioning 遵循依赖领域的准确率—成本 Pareto frontier,因此最完整的 harness 并非普遍最优。

  • 结论与局限

    测得的任务—harness 关系仍需在新领域、新模型和新 harness 实现中进一步验证,并可能需要重新校准。

Abstract

from arXiv · show

LLM agents have been widely adopted to operate mission-critical infrastructure (MCI). These agents normally rely on a harness that determines what information they can access, which tools they can use, and what actions they can take. Existing systems often expose the same comprehensive harness to every task, which may not be necessary and cause resource wastes. In this paper, we focus on the identification of optimal harness configurations, and view it as a resource-matching problem between what each task requires and what the harness provides. To measure this match, we classify MCI tasks based on the mathematical representation of the underlying system and rank harness configurations by the amount and type of information they provide. We then construct task-to-harness mappings from two sources: mining research literature and measuring controlled agent execution. Leveraging the measured mapping, we propose a new harness provisioning algorithm: map-guided escalation. It begins with a task-specific harness and expands to full provision only after a failed self-check. We evaluate our method in two representative MCI tasks: in liquid cooling, it improves the agent accuracy from 0.652 under full provision to 0.715 and achieves accuracy comparable to Reflexion with 48% fewer tokens; In power grids, full provision remains accuracy-optimal, while map-based provisioning offers lower-cost alternatives. These findings show that harness provisioning follows a domain-dependent accuracy-cost Pareto frontier rather than a universal optimum.

1 引言

本文将面向关键任务基础设施智能体的 harness 配置视为任务与 harness 之间的资源匹配问题,在性能、执行成本和不必要的信息暴露之间寻求平衡。本文构建可比较的任务与 harness 表征,从文献和执行测量中建立映射,并提出 map-guided escalation。

  • 问题表述: 本文将 harness 配置表述为任务需求与 harness 所提供信息和能力之间的资源匹配。这一表述明确权衡任务性能、执行成本和不必要的信息暴露。
  • 任务与 harness 表征: 本文引入基于系统方程推导的任务分类体系,并构建一个系统访问权限逐级增加的有序 harness 层级,以可比方式表征任务需求和 harness 提供的资源。检测、诊断和预测等现有标签缺乏跨领域一致的定义,也未能系统覆盖完整的任务空间。
  • 任务到 harness 的映射: 本文基于超过 1,200 篇 MCI O&M 论文和受控执行测量,构建任务到 harness 的映射。文献分析发现,未来结果、潜在状态和干预类任务往往使用更丰富的 harness 资源。
  • 研究动机与结果: 在液冷任务中,若干任务类别在低于完整配置的情况下即可取得最佳性能,同时使用更少的 tokens 和更短的时间,说明全面 harness 并不总是最优。引言指出,完整配置可能并非最优,从而说明了任务特定配置的必要性。
  • 配置策略: 利用该映射,所提出的 map-guided escalation 策略从执行测量得到的配置开始,并在需要时使用扩展资源重试。本文还将直接获取对应 harness 层级描述为一种更简单的、基于映射的替代方案,无需额外的路由调用。

2 相关工作

既有 MCI 运维研究涵盖任务专用流水线、交互式 agent 基准、执行侧改进,以及对工具、上下文、安全与恢复的 harness 级控制。本工作在固定执行器的前提下,沿有序梯度系统改变 harness 配置,以估计各任务类别所需的充分配置。

  • 任务专用 MCI 系统: 任务专用的 MCI 流水线可为检测或诊断提供强有力的解决方案,但无法在运维生命周期内支持通用 agent。示例包括用于异常检测的 EGADS 、用于时间序列监测的 SR-CNN 和 OmniAnomaly [31],以及用于因果根因分析的 CIRCA [16]
  • 交互式 agent 基准: 交互式基准在可执行的基础设施环境中评估 agent,涵盖云故障响应、工业资产维护和交通信号控制。AIOpsLab 覆盖故障生命周期 ,AssetOpsBench 提供工业运维场景 [28],LLMLight 则评估交通信号决策
  • 本文定位: 不同于具有预定义环境和接口的现有基准,本基准沿有序梯度改变 harness 配置,固定执行器,并估计各任务类别所需的充分配置。该设计直接比较任务与 harness 的匹配关系,而不是改变执行器或环境接口。
  • 执行与供给侧适配: 既有 agent 研究主要通过推理、反馈、经验检索、规划、工具使用,或暴露与任务相关的 API 和指令来改进执行。示例包括 ReAct 、Reflexion [33]、ExpeL 、AgentGen [8]、ToolLLM 和 AnyTool [4],以及 Instruction-Tool Retrieval [6]
  • Harness 设计与治理: 近期研究将 harness 视为贯穿执行控制、工具访问、上下文、状态、验证、恢复和资源治理的一等层。相关系统研究了可移植的 harness 规范 [27]、harness 搜索 [14]、配置影响 [38]、可编程工具策略 、信息流约束 [11]、沙箱机制 [40] [42]、权限选择 [36],以及轨迹边界合规 [17]

3 概览

该方法定义任务空间与 harness 空间,通过文献挖掘和受控执行估计二者的关系,并利用所得映射为新任务配置 harness。

  • 3 概览: 该工作流包含三个阶段:定义任务空间与 harness 空间、估计二者的关系,以及利用映射为新任务选择 harness。Figure 1 展示了这一总体方法。
  • 3 概览: 任务根据底层物理系统进行形式化定义,而 harness 则按信息量和能力逐步增加的层级组织。这种任务–harness 组织方式支持比较任务需求与 harness 所提供的内容。
  • 3 概览: 任务到 harness 的映射结合了挖掘得到的 MCI 运维研究,以及在两个 MCI 环境中让同一 agent 在不同 harness 层级下执行受控基准测试的结果。文献分析考察不同任务类别所使用的 harness 层级,而执行实验则对该映射进行经验估计。
  • 3 概览: 对于新任务,直接查找会将映射中的 harness 层级作为最终配置;而 map-guided escalation 则从该层级开始,并在自检失败后使用完整 harness 重试。两种策略都会先将任务归入某一类别,再从映射中获取对应的 harness 层级。

4 任务–Harness 空间

本节将任务–Harness 空间定义为两把可比标尺:一套基于物理系统目标的任务分类体系,以及一套基于 Harness 访问权限的累积式供给层级。二者共同支持将任务类别映射到最低充分 Harness 的可测量关系,同时允许任务特定的非单调性能效应。

  • 任务–Harness 空间: 两把可比标尺将 Harness 供给转化为从任务类别到最低充分 Harness 的可测量映射。任务按其在物理系统中查询或影响的对象组织,而 Harness 按其提供的信息、工具和操作权限组织。
  • 任务空间: 检测、诊断和预测等传统标签被映射到统一物理系统表征中的坐标,而不是作为主要类别使用。例如,检测以当前可观测信号为目标,诊断以当前系统机制为目标,预测则以未来可观测信号为目标。
  • 任务空间: 任务空间通过输出模式、目标时间和目标要素表征每项任务,从而得到 12 个规范类别。目标要素区分可观测信号、潜在状态和系统机制;目标时间区分当前与未来结果;输出模式区分报告与干预。
  • Harness 空间: Harness 供给按累积方式排序,从仅依靠模型推理,经由静态知识和时间观测,逐步扩展到更加丰富的结构访问和物理访问。该层级体现的是对物理系统访问权限的增加,而不是执行器智能程度的提升。
  • Harness 空间: 更高的 Harness 层级并不保证更好的性能,因为任务坐标不会规定固定的 Harness 要求,额外供给还可能增加成本或引入无关上下文。例如,面向未来的任务可能仅凭时间观测即可解决,而当前状态任务可能需要结构模型或仿真。

5 估计任务到 Harness 的映射

任务到 Harness 的映射通过文献证据或受控执行得分,为每个任务类别分配 Harness level。基于容差的规则选择接近证据支持最充分或性能最佳选项的最低 level,在满足需求与避免不必要配置之间取得平衡。

  • 映射规则: 通用映射规则为每个任务类别选择最低的 Harness level,其支持度在特定来源相对于最大值的容差范围内。当多个 Harness level 获得的支持度相近时,该规则可避免不必要的配置。
  • 文献衍生映射: 文献衍生映射根据超过 1,200 篇保留研究中使用的 Harness level,估计实际配置方式;标签由三名标注者分配,并通过多数投票汇总。Figure 2 汇总了 12 个任务类别中的 1,220 篇论文;对于 Act、Future 和 latent-state 任务,分布通常向更高 level 移动,而大多数类别在 K3 或 K5 达到峰值。
  • 文献衍生映射: 文献衍生映射反映的是已确立的配置实践,而非经过验证的充分性,因此高频使用的 Harness 可能仍属不必要、配置不足或配置过度。尽管如此,它仍提供了一个文献规模的视角,展示 Harness 配置如何随任务类别而变化。
  • 执行衍生映射: 执行衍生映射让同一 agent 在液冷和电网环境中的 240 个可重放任务上使用全部五个 Harness level 进行评估,然后选择在最佳测量性能容差范围内的最低 level。只有 Harness 配置发生变化;agent、推理协议和评估流程保持不变。

6 基于映射的 Harness 选择

基于映射的 Harness 选择为每项任务分配特定类别的初始 Harness,并在执行未通过自检时直接升级为完整配置。该方法评估基于文献和执行结果构建的查表变体,以及条件式的 Map-ESC 升级。

  • 初始 Harness 选择: 系统对每项任务进行分类,从任务到 Harness 的映射中选择初始 Harness,并仅使用其开放的信息和能力执行任务。完成任务类别分配后,选择过程是确定性的查表操作,无需额外的路由调用。
  • 条件式升级: 当初始自检失败时,Map-ESC 直接扩展至 K5,开放完整的信息、工具和操作权限,同时复用首次尝试所得的结果。初始结果通过后即被接受;否则,第二次执行使用 K5 下的固定执行器。
  • 方法变体: 评估的变体包括不进行升级的 Lit-Lookup、不进行升级的 Exec-Lookup,以及结合执行映射初始化和由自检触发扩展的 Map-ESC。查表变体用于隔离映射质量的影响,而 Map-ESC 用于测试从实例级变化中恢复的能力。
  • 条件式升级: 升级会跳过中间 Harness 层级,以避免重复执行开销;不同尝试之间,执行器、推理协议和能力边界保持固定。在所评估的领域中,中间重试很少能在到达 K5 之前终止。

7 实验

在液冷和电网环境中的实验表明,harness 需求随任务类别和领域而异,因此任务感知的配置虽有用,但并非始终能达到最优准确率。基于执行结果构建的映射支持高效直接查找和有效的条件式升级,其收益可迁移至不同的执行器模型。

  • 任务与领域效应: Liqid 中接近最优的最低 harness 级别范围为 K2 至 K5,Grid 中为 K3 至 K5;其中,Liqid 有五个类别、Grid 有四个类别在低于 K5 的级别达到峰值。已有文献也显示,Inform 任务主要集中在 K3 附近,而 Future、Act 和 latent-state 任务主要集中在 K5 附近,表明需求取决于任务类别。
  • 映射估计与部署: Exec-Lookup 在 Liqid 和 Grid 上分别达到 0.670 和 0.762,同时仅使用 Full-K5 token 数的 0.86× 和 0.88×;而 Map-ESC 将准确率提升至 0.715 和 0.782。直接查找更有利于效率,而由自检触发的升级则以额外 token 成本为代价提升准确率。
  • 部署结果: 在 Liqid 上,Map-ESC 以 0.715 达到最高的 harness 选择准确率;而在 Grid 上,Full-K5 仍是准确率最优方案,Exec-Lookup 则是成本更低且 Pareto 高效的替代方案。任务感知选择在 Liqid 上同时提升准确率并降低成本;而在 Grid 中减少配置会以准确率换取效率。
  • 部署结果: Map-ESC 的准确率为 0.715,对比之下 Reflexion 为 0.711;在 token 数减少 48% 的同时,Map-ESC 达到相当的准确率,而 ExpeL 则以多消耗 44% token 为代价将准确率提高 0.016。Map-ESC 使用基于执行结果构建的初始 harness,最多进行一次回退至 K5,从而补充执行侧自适应。
  • 泛化: 基于执行结果构建的映射无需重新校准即可迁移至 Qwen3.5-27B,使 Liqid 准确率从 0.706 提升至 0.726;在 Grid 上也保持接近水平,为 0.797,对比之下为 0.808。由单次 Qwen 运行估计的映射表现明显更差,因此可靠的估计受益于更强且重复的执行证据。

8 结论 … A.3 多LLM标注协议

本文将 harness 配置视为一种可度量的部署决策,将数学推导的任务需求与可用信息和能力的累积层级相联系。文献语料库和多模型标注协议提供了经验性的任务–harness 映射,而研究限制则制约了结论向所评估设置之外推广的能力。

  • 8 结论: Harness 配置被表述为一种可度量的部署决策,将数学任务分类体系与由 K1–K5 构成的 harness 信息和能力累积层级相联系。任务–harness 关系同时根据文献提取的配置实践和执行得出的映射进行估计。
  • 8 结论: 将测得的任务–harness 关系推广到新领域、新模型和新实现,需要进一步验证并可能进行重新校准。评估涵盖两个由仿真支持的环境中的 240 个任务,未完全捕捉真实传感器不确定性、分布偏移、组织流程或人类 appr…
  • A 文献语料库与标注: 文献调研使用仅包含 sector 的查询,覆盖 CISA 16 个关键基础设施 sector 中的 13 个,使任务和 harness 分布能够从论文中自然呈现,而非由搜索词决定。Defense Industrial Base、Financial Services 和 Government Facilities 不在研究范围内。
  • A.1 语料库收集与筛选: 筛选流程将约 2,000 篇爬取候选论文缩减为 1,223 篇,其中 1,220 篇获得了完整的任务坐标和 harness 层级标注。在进行全文提取前,LLM 筛选 agent 排除了综述、立场论文,以及不包含主要 MCI 运维任务的论文。
  • A.2 任务与 Harness 标注方案: 分离的任务标注调用和 harness 标注调用可避免标签泄漏:任务调用不知晓方法和名称,而 harness 调用则分配实际使用的最高层级。任务调用返回不含方法信息的主要任务句和三个分类轴标签。
  • A.3 多LLM标注协议: 三个独立的模型提供方为每篇论文分配任务坐标和 harness 层级,多数投票直接解决了 89% 的任务轴标签和 97% 的 harness 标签。任务轴分别通过多数投票进行整合,而 harness 层级则整合为单一的序数标签。
  • A.3 多LLM标注协议: 剩余的 30 个任务坐标分配和 36 个 harness 层级分配,在无法查看原始投票的情况下接受基于证据的裁决,随后进行人工核验。Table 4 报告了最终共识构成和标注者间一致性。
  • A.3 多LLM标注协议: 项目将发布一个交互式文献浏览器,其中包含任务坐标、harness 层级、支持性证据、个体标注、整合标签,以及跨任务空间和 harness 空间的筛选功能。该浏览器旨在支持按任务类别和共识 harness 层级分组查看论文。

A.4 语料库层面发现 … C.4 领域特定差异

本研究将基于文献构建的 harness 映射与液冷和电网中的受控基准相结合,采用累积式、在架构层强制执行的 harness,以及领域特定的能力边界。语料库揭示了系统性的 provision 模式,但仅作为先验;基准构建则采用经验证的任务规格、受控数据划分和逼真的仿真环境。

  • A.4 语料库层面发现: Harness provision 随任务需求增加而上升:从 Inform 到 Act,均值水平增加 0.45;从 Now 到 Future,增加 0.39;在 observable、mechanism 和 latent 目标之间分别为 3.53、3.65 和 4.06。K3 和 K5 分别占文献语料库的 53% 和 28%;Table 5 总结了 12 个任务类别中的分布。
  • A.4 语料库层面发现: 基于文献的映射是 a prior,而非经验证的执行证据,因为它记录的是既有方法的 harness level;样本稀疏的类别会产生较不可靠的估计。它以综述规模说明了 MCI 运维研究如何为各任务类别配置系统信息与能力。
  • B.1 仿真环境 / B.2 场景生成: 基准涵盖液冷和电网,包括 six liquid trajectories 和 ten Grid2Op day or fault windows,覆盖正常运行、过热、退化、过载和级联故障。液冷部分建模了一个包含 10 个机架、130 个节点/149 条边的热液压网络;电网部分采用 IEEE-14,包含 14 个变电站、20 条支路、6 台发电机和 11 个负载。
  • B.3 任务构建: 每个领域在 12 个类别中分别实例化 120 个参数化任务,并通过直接查表、闭式物理公式或基于仿真器的证据,解析确定性 oracle 规格。完整基准包含 240 个任务,并为 Liquid 和 Grid 分别采用约 80 种和 54 种 oracle 方法。
  • B.4 构建集与测试集划分: 每个类别均等划分为 construction and held-out test tasks,仅在 construction 数据上估计 execution-derived map,并仅在 test 数据上评估策略。完整的 K1–K5 sweep 运行于全部 240 个任务;在固定随机种子下,模板族在各划分中进行分层。
  • B.5 程序化与人工验证: Verification 将 ground truth 重新输入,在全部 240 个任务上达到 1.0,审查了数据划分泄漏和 oracle 推导,移除了退化轴,并重新执行了 20 个修正后的 Grid 任务。在报告任何 map 或 policy 结果之前,人工审查修正了两个 Grid ground-truth 值。
  • C.1 累积式 Harness Manifest / C.2 工具与数据接口: Harness 从 K1 到 K5 严格累积,公开 JSON function schemas 和结构化结果,计量仿真器时间与调用次数,并限制返回的时间序列和 transient rollouts。K5 override conventions 覆盖两个领域中的泵、阀门、板功率、发电机/负载和线路停运操作。
  • B.6 代表性任务 / C.3 能力强制执行: 能力边界通过架构强制执行:agents 只能接收其所属 level 的 registry,而 visibility gates 会限制 observation horizons,并在数据源处屏蔽隐藏状态。grading oracle 绕过这些限制,代表性任务见 Table 6。

D 执行与评估协议 … G.2 各类别执行得分

在完整基准实验中,基于执行结果的配置在 Liquid 上以更低 token 成本达到与 Full-K5 相当的准确率,但在 Grid 上牺牲了准确率;在该领域,K5 仍然最优。评估采用确定性重放、任务特定评分、受控 harness 映射和多个基线,以刻画这种依赖领域的权衡。

  • D.1 执行器配置 / D.5 重复实验与随机性: 每个任务均使用冻结的 gpt-5.4 ReAct 风格执行器,每次迭代调用一次,最多执行 20 次,采用隔离执行,并设置 300 s 硬超时和提前 45 s 的软截止时间。在确定性重放上进行三次独立重复实验,非确定性仅来自模型采样;构建集与测试集相互独立。
  • D.2 任务评分 / D.3 LLM 评审 / D.4 成本核算: 得分由确定性的任务特定规则评分与 LLM 评审共同取平均,而 token 成本包含执行器侧的每次调用,延迟则包含工具和模拟器执行时间。评审只能看到问题、ground truth 和最终答案,不能看到 harness 条件、策略、轨迹或经验;评审 token 不计入策略成本。
  • E.1 基于文献的映射 / E.2 基于执行结果的映射: 基于执行结果的下限选择在 εexec=0.05 范围内达到构建任务最佳观测得分的最低 harness level,而基于文献的下限则使用全部 12 个类别中的众数 level。Table 9 在不相交的测试数据上评估所选的、基于执行结果的下限;这些下限先由构建运行估计得到。
  • E.3 容差敏感性: εexec=0.05 的运行点位于平台区间:Grid 下限在 0.05 以内保持不变,Liquid 仅有两个类别发生变化,且测试准确率在 0.05–0.15 范围内除噪声外保持平坦。在 0.05–0.15 范围内,token 成本变化小于 10%,因此容差选择不会决定结论。
  • E.4 基于执行结果的 level 稳定性: 在 24 个类别-领域单元格中的 19 个单元格里,采用的下限以至少 0.7 的概率被重新选出;不稳定性集中在相邻 level 之间,且这些 level 都能解决该类别;没有任何重采样低于 K2。Liquid I-F-S 展示了影响较小的不稳定性,因为 K3、K4 和 K5 都能解决该任务。
  • E.5 统计检验: Liquid Exec-Lookup 与 Full-K5 在统计上无法区分(Δ=+0.018, 95% CI [−0.022, +0.061]),但 token 成本低 14%;而 Grid 低于 Full-K5(Δ=−0.044),但高于 Lit-Lookup(Δ=+0.098)。在 Grid 上,Full-K5 仍然具有最优准确率;这些比较证实,基于执行结果的策略能够以更低成本实现权衡,并优于文献查找。
  • F.1 Full-K5 / F.2 指令–工具检索 / F.3 LLM-Route 与 LLM+Exp / F.4 AutoMix / F.5 Blind-ESC / F.6 Reflexion 与 ExpeL: 比较对象包括 Full-K5、检索、带或不带经验的 LLM 路由、AutoMix、Blind-ESC、Reflexion 和 ExpeL;类别 oracle 与任务 oracle 则提供不可部署的准确率上限。每个类别中全部十个任务的 K1–K5 各类别完整基准均值均有报告,用以补充构建集划分得分。
  • G.1 K1–K5 汇总扫描: 在所有任务中,Liquid K4 尽管改善了若干类别,仍可能表现不及 K3;而 Grid K5 的准确率最高,且使用的 token 少于 K3 和 K4。这些汇总结果表明,整体平均值可能掩盖类别级行为,并且准确率–成本排序因领域而异。

G.3 构建集与测试集分析 … H.3 替代经验表示

这些分析验证了从构建集到测试集的泛化能力,确定了类级路由是有效粒度,并表明直接 map-guided escalation 优于渐进式升级。绝对成本和替代经验表示进一步阐明了该方法具有领域依赖的权衡。

  • G.3 构建集与测试集分析: 在测试集上重新估计映射,会在 24 个类–领域组合中的 10 个中改变所选 harness 层级,而使用构建集映射得到的平均测试 regret 为 0.036。测试评估使用不相交的数据划分,选择变化主要发生在稳定性较低的类别中。
  • G.4 绝对参考成本: 应用 Full-K5 归一化锚点后,Exec-Lookup 在每个 Liquid 任务上平均使用 ≈14.0k tokens/39 s,在每个 Grid 任务上平均使用 11,829 tokens/8.6 s。Liquid 的锚点为 16,210 tokens 和 47.2 s,Grid 的锚点为 13,409 tokens 和 7.6 s。
  • H.1 路由粒度与构建偏差: 类级 lookup 在 Liquid/Grid 上达到 0.670/0.762 的准确率,高于家族级路由的 0.634/0.704,以及任务级最近邻路由的 0.639/0.690。在 12 个 Liquid 类中的 7 个和 12 个 Grid 类中的 5 个中,不同家族的首选 harness 不同;因此,类级下限平滑了家族级采样噪声,而不是反映某个模板家族。
  • H.2 升级诊断: 直接 K5 escalation 在 Liquid 上达到 0.715 ± 0.014,在 Grid 上达到 0.782 ± 0.010,优于渐进式 escalation 的 0.692 ± 0.009 和 0.762 ± 0.010。渐进式替代方案的 Liquid 成本相同,但会使 Grid 成本增加 5% 的 tokens 和 8% 的 latency。
  • H.3 替代经验表示: 蒸馏后的 playbook 在 Full-K5 下有助于 Grid,准确率为 0.810,而非 0.806;但对 Liquid 无帮助,准确率为 0.648,而非 0.652;仅用于路由时,其表现不优于 free lookup。ExpeL trajectory retrieval 在 Liquid 上最强,达到 0.731,但相比 Map-ESC 多消耗 44% 的 tokens,才能获得相当的增益。

H.4 定性错误分析 … I.3 计算与 API 使用

论文指出了反复出现的 harness 相关失败模式,并说明了为保证可复现性而发布的工件、专有组件限制及所需计算资源。结果表明,过度配置可能在增加执行成本的同时降低准确率。

  • H.4 定性错误分析: 当仿真允许反事实过度使用时,Liquid 准确率从 K3 时的 0.59 降至 K5 时的 0.46,而 Grid A-N-X 从 0.69 降至 0.65。敏感性扫描也可能耗尽迭代预算,说明过度配置会适得其反。
  • H.4 定性错误分析: 在配置不足的水平下,agents 要么拒答,要么根据典型范围进行外推;Liquid I-N-S 在 K1/K2 下的得分为 0.00。该段将其描述为分类法所预测的诚实失败。
  • I 工件可用性与负责任部署: 发布内容将包括两套 120-task corpora、ground-truth specifications 和数据划分、冻结的场景 telemetry、harness manifests、tool schemas、literature data,以及用于复现的代码和记录。执行记录包括得分、token 和延迟计量、模拟器计量以及 tool-call traces;Table 11 报告了每个 harness level 下各类别的平均准确率 ± std。
  • I.2 专有组件: liquid-cooling twin 仍为 proprietary,但冻结轨迹、拓扑 metadata 以及记录的 tool I/O 将支持对所报告结果的复现。在环境开源之前,生成新的 Liquid 轨迹需要访问该 twin。
  • I.2 专有组件: 基于 Grid2Op 和 pandapower 的 Grid 环境完全 fully open-source,而完整的 Liquid 环境计划在开源后发布。这一区分了现有 Liquid 结果的可复现性与新 Liquid 轨迹的生成。
  • I.3 计算与 API 使用: 所报告的实验共消耗约 75M tokens,其中包括 17.1M Liquid executor tokens、17.7M Grid executor tokens,以及约 2.4M judge tokens。Qwen 运行在单节点 vLLM 部署上,模拟器计算开销可以忽略不计,每次求解耗时低于一秒。
Loading 2608.17433v1…