Source-linked AI summary
EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah
TL;DR
LLM agents 可以通过自修改提升能力,但持久化变更在不同状态下可能无法安全逆转。EvoUndo 将可恢复性作为显式约束,并通过反事实验证发现,精确的状态定位与更丰富的恢复语言分别解决不同的恢复瓶颈。
问题
前向能力提升并不保证安全逆转,因为恢复可能依赖于不同于变更创建上下文的信息与状态。
方法
EvoUndo 使用类型化观测等价性,在反事实状态下表示、综合、诊断并独立验证自修改的恢复性。
结果
当 L0 足够时,精确的状态地址定位恢复了 38/48(79.2%)的失败;而 L1 在 S1 中实现了对 142/143(99.3%)失败的恢复。
要点与局限
可靠的自进化需要协同设计验证、状态定位、见证语义与恢复语言表达力。
要点与局限
L0/L1 演算专用于建模的 harness 状态类型,缺乏形式化完备性保证,且尚未测试其向更丰富技术栈的迁移能力。
Abstract
from arXiv · showhide
LLM agents increasingly modify their own prompts, tools, middleware, resources, and execution harnesses at runtime. Such self-evolution can improve capability, but a successful mutation may leave persistent effects that cannot be safely reversed in states different from the one in which it was created. We introduce EvoUndo, a framework for representing, synthesizing, diagnosing, and independently verifying recoverability of model-generated self-modifications across counterfactual states. Across 600 unseen one-shot self-evolution tasks, we identify 197 capability-improving mutations that fail recoverability verification. Under the original recovery representation, conventional repair strategies recover 0/197 of these natural failures. Deterministic oracle analysis recovers 48/197 under the original recovery language L0, while the extended recovery calculus increases empirical oracle recovery to 191/197. A protocol-locked 2x2 grounding-by-expressivity intervention then separates two bottlenecks: exact state-address grounding increases successful recovery from 0/48 to 38/48 (79.2%) when the original language is sufficient, while extending the recovery language enables recovery on 142/143 (99.3%) failures in the oracle-defined S1 stratum. On the primary gpt-oss-120b backbone, adding exact-address diagnostics to the richer language reduces recovery to 133/143 (93.0%); a Qwen3.8-27B replication preserves the grounding and expressivity effects but not this negative interaction, indicating that the latter is model-dependent. These results indicate that reliable agent self-evolution requires co-designing verification, state grounding, witness semantics, and recovery-language expressivity rather than relying on iterative prompting alone.
1 引言
EvoUndo 将自我演化界定为受反事实 harness 状态间可恢复性约束的能力提升。结果表明,精确状态定位与恢复语言表达力分别对应不同失败模式,而诊断交互取决于模型 backbone。
- 动机: 可恢复性要求在反事实状态之间恢复观测等价的变异前状态,而不仅仅是改善前向任务目标。变异可能覆盖配置、重新排序 middleware、遮蔽工具,或泄漏后台资源,因此恢复名义状态并不足够。
- 结果: 在预算为四时,verifier 引导的 typed 诊断可修复 114/120 (95.0%) 个刻意破坏但可恢复的变异,而独立重新生成只能修复 4/120 (3.3%)。这一结果表明,诊断是一种可执行的修复机制,而不仅仅是评估步骤。
- 框架: EvoUndo 将 witness 捕获、反事实验证、typed 诊断和闭环恢复合成结合起来,用于受可恢复性约束的自我演化。只有当恢复后的状态与对应的变异前状态满足 typed 观测等价时,候选方案才会被接纳。
- 结果: 通过精确地址定位,38/48 (79.2%) 个 S0 失败得到恢复,而 L1 可恢复 142/143 (99.3%) 个 S1 失败。协议锁定的 2 × 2 干预将定位瓶颈与表达力瓶颈区分开来。
- 结果: 精确地址反馈会降低 gpt-oss-120b 上的 L1 恢复率,但这一负向交互并未在 Qwen3.8-27B 上复现。因此,诊断粒度与恢复语言容量之间的交互取决于 backbone。
2 问题形式化
EvoUndo 将自我演化建模为对持久化 agent harness 状态的能力提升型变异,并要求通过见证、契约式恢复来保证其可恢复性。可恢复性具有反事实性和关系性:需要在不同状态间达到带阈值的观测恢复;实验固定前向变异,仅修复恢复组件。
- 2.1 自演化 Agent Harness: 一个 harness H = (S, Π) 由持久化状态 S 和执行策略 Π 构成;当 ΔJ(m; S) > 0 时,变异 m 能够提升能力。持久化状态包括 prompts、路由、tools、middleware、listeners、文件和受管理资源。
- 2.1 自演化 Agent Harness: 永久纳入必须具备经过验证的恢复语义,因为持久化修改可能过时,或与未来目标发生冲突。
- 2.2 见证式恢复与运行示例: 由于变异可能覆盖前驱信息,恢复会使用见证 w 捕获变异前状态,并将程序 u 应用于变异后的状态和见证。恢复计算 ŝ = u(m(s), w(s))。
- 2.2 见证式恢复与运行示例: timeout 示例利用其见证恢复先前的标量值,而 middleware 插入则需要超越简单标量逆操作的恢复信息。将 timeout 从 30 设置为 60,需要记录并恢复先前的值 30。
- 2.3 类型化观测等价: 恢复在效应契约 Ce 下使用类型化的观测等价,而不是要求整个环境达到字节级一致。表示会将字典键和易变标识符规范化,而文件内容则通过 SHA-256 哈希进行检查。
- 2.4 反事实可恢复性: 反事实可恢复性评估使用语言 L 时,恢复是否能在从 Q 中抽取的状态上成功,并要求达到概率阈值 τR;因此,它是关系性的,并由变异、表示、契约和 Q 参数化。
- 2.5 受可恢复性约束的目标函数: 目标函数将前向改进与 Pr_s∼Q[u(m(s), w(s)) ≃Ce s] ≥ τR 以及 E(m, s) ⊆ Ce 结合起来;实验固定 m = m0,仅优化 (w, u, Ce)。未评估前向变异的联合优化。
3 EvoUndo
EvoUndo 用不可变的前向突变,以及可修订的 witness、recovery 和 effect contract 组件表示自修改。它在反事实状态上验证往返恢复,诊断残差,在形式语言中合成有界修复,并仅在保守的隐藏状态置信标准下接纳候选方案。
- 表示与修复: 每个候选方案都是由前向突变、witness program、recovery program 和 declared effect contract 构成的 4-tuple,修复期间仅后三者可修订。前向突变在 Turn 0 锁定并逐字执行;contract 必须符合 runtime 的 typed effect constraints。
- 验证: EvoUndo 通过执行 recovery round trip,检查重构状态是否在 declared effect contract 下等价,来验证每个反事实状态。开发状态提供诊断信息,而 fresh-holdout 研究使用完全隔离反馈的 hidden set 进行最终接纳。
- 诊断: 失败的开发 round trip 会产生 residual diagnostics,其范围从受影响子系统和缺陷分类,到精确的 canonical state addresses 与 ordering traces。粗粒度的 D0 诊断不包含精确残差位置;D1 提供 verifier 观测到的 addresses 和 traces。
- 合成语言: Recovery synthesis 对 witness capture、recovery 和 contract 修订设定有界搜索,同时保持不可变突变不变,并在开发状态中通过的 proposals 上测试 hidden states。Witnesses 在突变前记录 typed pre-state values;recovery operations 只能引用这些 captures。L0 覆盖 configuration、prompt、tool-registry 和 routing state,而 L1 进一步加入 middleware、listeners、files、sockets 以及有序的跨表面组合。
- 接纳控制: 接纳要求在 hidden counterfactuals 上的 95% Wilson lower confidence bound 至少为 0.85;对于 syntax errors 和其他 soundness 风险则采用 fail-closed 处理。修复预算为 B ∈ {1, 2, 3, 4},并支持提前停止;hidden-set criterion 为 LCB0.95(k, n) ≥ τR = 0.85。
4 实验设置
实验在 600 个未见过的自我演化任务和一个包含 197 个自然失败的冻结库上评估可恢复性,采用受控 oracle 审计和 protocol-locked 2 × 2 factorial design。该设置在开发状态和隐藏状态上区分 recovery language 的表达能力与精确 state-address grounding。
- 基准: 自然基准包含六个架构家族的 600 个任务,而 Multi-Surface 任务结合了影响至少两个持久状态目标的突变。这些家族包括 Configuration、Tools、Middleware、Listeners、Resources 和 Multi-Surface;prompt state 与 routing state 也纳入建模。
- 评估协议: 候选方案在 10 个开发状态和 40 个隐藏状态上接受评估,其中包括 IID 与 OOD 扰动;使用 gpt-oss-120b,temperature 为 0.2,reasoning effort 为 medium。模型在 8 块 NVIDIA H200 GPU 上以原生 MXFP4 precision 运行;结果采用 Rescue@B、带 95% bootstrap CIs 的 paired risk differences,以及校正后的 McNemar tests。
- 评估队列: 在抽样的 600 个突变中,197 个虽能提升能力却未通过 recovery verification,构成冻结的主要评估队列;此外还有 120 个受控 defect-injected mutations。其余自然候选方案包括 281 个 admissible mutations 和 122 个 capability-inadequate mutations;抽样时每个任务选取一个候选方案,且不重新抽样。
- Oracle 审计: 在 L0 下,oracle recoverability 为 48/197;在 L1 下为 191/197,并据此按照已实现的 language 是否能够构造 recovery program 对失败进行分层。L1 oracle 未恢复的 6 个任务不纳入分层对比;该 oracle 是事后且享有特权的机制,部署的 synthesizers 无法使用它。
- Factorial design: 主要 factorial study 将 diagnostic granularity {D0, D1} 与 recovery language {L0, L1} 交叉组合,分别检验 L0 下的 grounding、S1 上的 expressivity,以及基于 L1 的 grounding。三个 protocol-locked 对比分别为 S0 上的 C1 D1L0 vs. D0L0、S1 上的 C2 D0L1 vs. D0L0,以及 S1 上的 C3 D1L1 vs. D0L1。
5 受控与自然恢复结果
在受控缺陷上,闭环验证器反馈可实现较高恢复率,但在基础表示下,这一成功在自然自演化失败上完全崩溃。在完整的 600 任务统计中,更丰富的 D0L1 恢复设置挽救了大多数恢复缺陷突变,并显著提高了可纳入基准的产出率。
- 受控恢复: 在受控基准上,指令性提示恢复了 117/120 (97.5%) 个缺陷,而类型化诊断恢复了 114/120 (95.0%) 个,独立重新生成恢复了 4/120 (3.3%) 个。在预算 B = 4 下,通用反馈恢复了 104/120 (86.7%) 个,原始验证器轨迹恢复了 101/120 (84.2%) 个。
- 自然恢复: 在 L0 下的 197 个自然失败中,各种验证器引导修复模式均恢复了 0/197 (0.0%) 个,而独立重新生成恢复了 6/197 (3.0%) 个。180/197 个自然失败涉及预定义受控缺陷分类体系之外的结构化状态变换。
- 端到端统计: 在 D0L1 下,180/197 (91.37%) 个恢复缺陷突变得到挽救,产生了 461/478 (96.44%) 个可纳入的能力正向突变,以及 461/600 (76.83%) 的总体基准产出率。相较于最初可纳入的 281/600 (46.83%),绝对提升了 +30.00 pp。
6 Grounding–Expressivity 因子实验结果
因子实验表明,在受限 recovery language 下,精确 state-address grounding 能解决恢复失败;而更丰富的 recovery primitives 能解决需要更强表达力的失败。在更丰富的 language 下,向主 backbone 提供 exact-address feedback 会损害性能,但这一交互在 replication 中取决于模型。
- 因子实验结果: 在 S0 上,exact addresses 使 recovery 从 D0L0 下的 0/48 提升至 D1L0 下的 38/48 (79.2%);在 S1 上,L1 使 recovery 从 0/143 提升至 142/143 (99.3%)。这些结果将 grounding 与 expressivity 区分为两个独立瓶颈:exact addresses 定位受影响的 state surfaces,而更丰富的 primitives 使有效的 recovery programs 成为可能。
- 因子实验结果: 在 S1 上,将 exact-address feedback 加入 L1 后,recovery 从 D0L1 下的 142/143 (99.3%) 降至 D1L1 下的 133/143 (93.0%)。Trace review 将这些不一致案例归因于 D1L1 下的过度分解、序列反转和过度捕获冲突。
- Synthesis efficiency: Synthesis efficiency 在 D1L0 下达到 79.2%,在 D0L1 下达到 94.2%,但在 D1L1 下降至 87.4%,而 D0L0 下为 0.0%。效率分母仅包括 deterministic oracle 确认可由所分配 recovery language 表达的任务。
- 因子实验结果: gpt-oss-120b 上的全队列交互为 I = −25.89 pp,表明 exact grounding 在受限 language 下有益,但与更丰富的 primitives 不具有加性。这一交互支持将 diagnostic granularity 视为 model–representation design choice。
- 跨模型 replication: 在 Qwen3.8-27B replication 中,grounding 与 expressivity effects 仍然存在;而 L1 下的 exact-address diagnosis 使 recovery 改变 +6.25 pp,而非显著下降。这些反复出现的瓶颈可跨 backbone 迁移,但负向的 grounding–expressivity interaction 似乎取决于模型。
7 新鲜留出验证与稳健性
新鲜留出验证表明,冻结的 L1 可泛化至 300 个未见任务,而更严格的验证以端到端产出率降低为代价,减少了假阳性。稳健性扫描保持了反事实验证的定性行为,同时带来了可测量的推理与修复开销。
- 新鲜留出验证: 开发集到隐藏集的假阳性率从 16.8% → 0.0%,而严格验证使 Rescue@4100 从 49.7% 降至 35.0%(∆ = −14.67 pp, p = 5.76 ×)。这些结果来自使用冻结 L1 的 300 个全新未见任务,以及包含 100 个状态的隐藏评估套件;在固定 B = 4 下,将开发反事实数量从 Q2 增加到 Q20 消除了假阳性。
- 敏感性与稳健性分析: 在合成预算、接纳阈值、开发配置和隐藏样本量的扫描中,反事实验证保持了稳定的定性行为。评估范围包括 B ∈ {1, 2, 3, 4}、τR ∈ {0.75, 0.80, 0.85, 0.90, 0.95}、五种开发配置,以及 nhid ∈ {10, 20, 30, 50, 100}。
- 推理与验证开销: 每个新鲜留出任务需调用模型 2.39–3.09 次,并生成约 3.37k–4.30k 个 token;验证严格度越高,成本越高。在包含 197 个任务的 factorial 队列中,闭环修复在 D0L1 中平均每个任务调用 1.78 次,在 D1L1 中为 1.95 次,在 D1L0 中为 2.40 次;在 H200 GPU 上,平均延迟为 5.25–5.85 秒。
8 讨论与局限
EvoUndo 的有效性取决于充分的状态定位与恢复原语,而诊断的具体程度可能与语言表达能力产生非单调交互。其保证与适用范围受到与快照恢复的比较、经验性而非演绎式验证、专用演算,以及尚未在更丰富 harness stack 上测试的迁移能力所限制。
- 讨论: 在缺乏充分状态地址或恢复原语的情况下,迭代式修复恢复了 0/197 个失败案例,表明仅靠 prompting 或推理投入并不足够。在主模型上,诊断反馈还与恢复语言的表达能力产生了非单调交互,因此最大化诊断具体程度并非普遍更优。
- 快照与事务式恢复: 按效果限定的快照在选择性恢复任务中恢复了 300/300 (100.0%),而 EvoUndo 恢复了 243/300 (81.0%);但在相同表面并发条件下,两者分别降至 159/300 (53.0%) 和 131/300 (43.7%)。在两种条件下,完整快照均恢复了 0/300,因为它们覆盖了后续状态。
- 基于证明的验证与运行时强制执行: EvoUndo 针对异构的建模 harness 状态提供了经验性的 typed round-trip 证据,不同于 Astrogator 在指定 automation calculus 内进行的演绎式验证。这种经验性方法覆盖了恢复属性,但不声称具备证明级完备性。
- 局限与数据治理: L0/L1 calculi 针对建模 harness 的状态类型进行了专门化,缺乏形式完备性保证,并且尚未验证向更丰富 stack 的迁移。其他局限包括在修复期间保持 m 不可变、未评估 m 的联合优化或事务式重设计,以及 typed equivalence 与 effect tracking 带来的覆盖范围有限。
9 结论 … D.3 效果契约覆盖审计
EvoUndo认为,安全且可审计的自我演化需要联合设计验证、状态定位、见证语义和恢复语言表达能力。该原则通过类型化 harness 状态、规范地址、反事实验证、观测等价性和动态检查的效果契约实现。
- 9 结论: EvoUndo表明,安全的自我演化需要协同设计验证、状态定位、见证语义和恢复语言表达能力。当恢复表示保持对齐时,语言模型能够为可审计的自我演化 agent 合成依赖状态的恢复程序。
- 可复现性声明;伦理声明;AI 使用声明: 发布的实现包括代码、任务定义、反事实生成器、协议锁和评估轨迹;实验使用隔离沙箱,在线部署还需要额外的授权与审计控制。生成式 AI 工具协助了代码编写和草稿编辑。
- A 扩展相关工作: EvoUndo通过将能力验证与可恢复性验证分离,补充了既有的自我改进、可逆运行时、可逆编程和运行时强制执行工作。SEVerA提供更强的演绎保证,而EvoUndo采用经验性反事实验证;两者关注互补的性质。
- B EvoUndo 实现细节;B.1 Harness 状态表示;B.2 候选表示;D.2 类型化观测等价性: 该 harness 被建模为具有规范地址的类型化持久状态,并在配置、提示词、路由、工具、中间件、监听器、文件和资源之间采用类型特定的观测等价性。候选突变冻结前向变更,同时允许捕获见证、执行恢复和修复效果契约。
- B.3 规范状态地址: 规范化验证器诊断会暴露语义位置,例如 tools["tool id"]、config["key"]、middleware["middleware id"]、files["path"]和resources["resource id"]。地址会在残余提取和渲染过程中规范化,并且仅源自验证器可见的开发执行。
- C 恢复语言;C.1 基础恢复语言 L0;C.2 扩展恢复语言 L1: L1在L0基础上扩展了带索引的序列、监听器、文件前状态、资源描述符和有序多表面恢复操作。运行时会拒绝L0条件中不受支持的L1原语,将其视为无效模型输出,而不是形式语言完备性的证据。
- D 反事实验证与审计基线;D.1 往返评估与反事实生成分类;D.2 类型化观测等价性: 恢复在反事实状态上使用类型特定的语义等价性进行测试,而不是对整个 harness 进行字节级相等性比较。效果契约选择相关目标;中间件要求成员关系和顺序,工具要求绑定关系与实现状态,监听器要求恢复注册状态,文件要求恢复此前状态。
- D.3 效果契约覆盖审计: 动态效果跟踪会拒绝任何观测效果未被纳入其声明契约的突变。审计针对涵盖全部六类 harness 的300个突变构造不完整契约,使用 E(m, s) = SnapshotDiff(s, m(s)) ∪ ExecutionTraceEffects(m, s),并要求 E(m, s) ⊆ Ce。
D.4 Snapshot-Restore 基线
在 300 个多步变异任务中,EvoUndo 与 Full Snapshot 和 Effect-Scoped Snapshot 恢复方案进行了比较,涵盖不同表面与同一表面两种设置。Full Snapshot 在选择性恢复下失败;当存在精确可恢复的前置状态时,Effect-Scoped Snapshot 表现最强;EvoUndo 则针对需要合成逆语义的情形。
- 运行时开销: Full Snapshot、Effect-Scoped Snapshot 和 EvoUndo 的平均值/中位数存储量分别为 1165.0/1165.0 B、177.8/145.0 B 和 393.6/350.5 B。存储量统计完整 harness 状态、被触及的前置状态值,或 EvoUndo 的 witness store 加 recovery AST 所对应的 UTF-8 编码 JSON 字节数。
- 运行时开销: 对应的捕获、回滚和验证延迟的平均值/中位数分别为 0.084/0.083 ms、0.039/0.037 ms 和 0.050/0.047 ms。延迟通过在捕获、回滚和验证过程中使用 wall-clock time.perf counter() 进行测量。
- 恢复结果: Full Snapshot 恢复成功率为 0/300,因为恢复完整状态会覆盖后续所有状态变化。比较涵盖 300 个任务,涉及不同表面的选择性恢复和同一表面的并发恢复设置。
- 恢复结果: 当精确的受影响前置状态已知、可序列化且可直接恢复时,Effect-Scoped Snapshot 表现最强;但对于同一结构化表面内的变异,两种选择性方案的性能都会下降。EvoUndo 处理逆语义缺失、依赖状态、具有结构化特征或必须合成的情形。
E 受控可恢复性基准 … I 新保留集反事实敏感性
在受控基准和自然失败基准中,更丰富的诊断与恢复表达能力显著提升经验可恢复性,而确定性 oracle 审计则区分合成失败与语言限制。在固定实验条件下,因子实验、跨模型实验和新保留集评估检验状态定位、表达能力、反事实稳定性与协议敏感性。
- E 受控可恢复性基准: 在 B = 4 时,117/120 (97.5%) 个能力为正的受控缺陷通过规定性指导得到恢复,而严格重新生成下仅恢复 4/120 (3.3%)。Typed 诊断恢复了 114/120 (95.0%),generic 反馈恢复了 104/120 (86.7%),raw verifier traces 恢复了 101/120 (84.2%)。
- F 自然失败库: 600 个自然候选中有 197 个能力为正但恢复存在缺陷;在原始表示下,Generic、Raw、Typed 和 Prescriptive 修复均恢复了 0/197。B = 4 时,严格重新生成恢复了 6/197;这些缺陷候选随后被冻结用于后续分析。
- G.1 确定性构造原则;G.2 Oracle 输入与构造算法;G.4 Oracle 可解性的接纳标准: 确定性 constructive oracle 按 LIFO order 构造 witness captures 和 inverse operations,并仅在通过编译、能力正向变化、开发集完美恢复、隐藏状态置信度和 typed equivalence 检查后接纳候选。其结果是已实现 oracle 下的经验可恢复性,而非语言理论完备性的形式证明。
- G.6 Oracle 分层重采样稳定性扫描: 在 10 组独立重采样的反事实套件中,oracle 分层保持不变:|S0| = 48、|S1| = 143,未恢复案例数为 6,且 Jaccard = 1。该审计使用相同的生成式状态分布,仅将反事实种子改为 1000 至 10000。
- H.4 不一致轨迹分析(D1L1 vs. D0L1);H.5 使用 Qwen3.8-27B 的跨模型复现(Step 24B): Qwen3.8-27B 在受限解码下复现了状态定位和表达能力效应,但未复现 gpt-oss-120b 在 D1-on-L1 上的负交互;详细 D1 诊断还产生了 10.2% truncation rate。该复现实验使用冻结的 96 任务子集,而不一致的 gpt-oss-120b 任务则通过 Table 6 中经认证的轨迹指标进行分析。
- I 新保留集反事实敏感性: 新保留集研究在统一诊断、预算和包含 100 个状态的隐藏集下,评估 300 unseen tasks 上冻结的 L1 恢复;各表涵盖假阳性、样本量、阈值、成本和架构家族敏感性。保留集从六个架构家族中各取 50 个任务,与原始 600-task 队列完全不重叠;τR = 0.85 仍是协议锁定的主要阈值。
J 统计分析 … K.2 执行完整性与协议锁定
确认性对比显示,C1 和 C2 具有显著正向效应,但 C3 具有显著负向效应;在留一族分析中,这些方向仍然稳健。研究采用精确配对检验、fail-closed 执行机制和经密码学哈希的工件,以保障协议完整性。
- J 统计分析: 这些对比采用配对双侧精确 McNemar 检验,并结合联合 Holm–Bonferroni 校正和 100,000 次配对 bootstrap 重采样计算风险差区间。
- J 统计分析: C1 的 Δ= +79.17 pp,95% CI [+66.67, +89.58],p_raw = 7.28×10−12,p_Holm = 1.46×10−11。
- J 统计分析: C2 的 Δ= +99.30 pp,95% CI [+97.90, +100.00],p_raw = 3.59 × 10−43,p_Holm = 1.08 × 10−42。
- J 统计分析: C3 的 Δ= −6.29 pp,95% CI [−11.19, −2.10],且 p_raw = p_Holm = 0.01171875。
- K.1 按族留一敏感性分析: 留一族估计显示,C1 和 C2 始终保持强正向效应,而 C3 在每个划分中均保持负向。探索性的全队列析因交互同样为负:I = −25.89 pp,95% CI [−34.01, −18.27]。
- K.2 执行完整性与协议锁定: 执行采用 fail-closed 机制:服务故障会中止运行,格式错误的输出会消耗尝试次数,语言外恢复原语则在执行前被拒绝。
- K.2 执行完整性与协议锁定: 结果工件、清单、协议配置、成功向量和分析脚本均经过密码学哈希,以区分经认证的结果与已被替代的运行。