Agent 的自我修改正在从论文概念变成产品现实:让模型在长会话里沉淀经验、把踩过的坑写成自己的操作守则,听上去很美好。但一个被低估的问题随之而来——Agent 改写自己行为规则的时候,谁来决定这次改动能不能留下来?9 月 21 日提交的 arXiv 论文 Self-Healing Harness for Runtime Oversight of Agent Self-Modification(2609.24130)给出了一个工程上相当干净的答案:准入控制。本文速读它的核心设计与实验发现。
问题建模:从「能不能改」到「该不该留」
论文的出发点是一个控制论式的观察:LLM Agent 可以改变自己未来的行为,那么哪些自我生成的改动应该被允许持久化?作者把这个决策形式化为自我修改的准入控制(admission control for self-modification):
- Agent 可以提议对其运行指令的修改;
- 但一个外部运行时闸门控制这些修改的持久化。
这个分权结构是全文最重要的设计决策。修改的「创作权」在 Agent 手里,「立法权」在外部闸门手里。Agent 不是被禁止自我改进,而是它的每一条自我约定都要先过一道审查。
方法:包在 Agent 外面的四步循环
具体实现是一个模型无关的自愈外壳(self-healing harness),以 Detect、Notice、Heal、Validate 四步循环包裹一个完全未经修改的 Agent:
Detect 运行时发现失败(任务失败、异常、质量下降)
Notice 归因 + 触发修复提案
Heal Agent 在外部工作区撰写候选行为规则
Validate 检验:修复触发故障 + 不伤及正常用例
关键机制在权限的时间维度上。Agent 撰写的候选规则存放在一个外部工作区,先只拿到临时执行权——在评估期间生效,用于观察它是否真的有效。只有当度量显示它在触发失败上有改进、且在一组受保护的用例上退化不超过固定边际时,才授予跨会话的持久权限。
验证证据分三个强度层级:有历史数据时用重放(replay)提供匹配的证据;没有重放时用前向试跑(forward trials)做弱化兜底;另有一个语料级守卫定期对累计生效的全部规则集做整体重测,防止「每条规则单独看都没问题、叠在一起互相打架」的组合退化。
实验:55% 的「修复」会伤及无辜
实验横跨 AppWorld、Terminal-Bench、τ2-Bench 三个基准,跑了 16 组匹配的 Baseline 与 Harness 对照。两个结果最值得记住:
其一,局部收益与全局安全经常背离。 闸门拒绝了 383 个能用重放证据裁决的提案,其中 211 个(55%)虽然改善了自己的触发故障,却让一个此前正常的用例发生了退化。换句话说,如果按「Agent 自己觉得有用就保留」的朴素策略运行,超过一半的自我修改会引入附带回归。这为外部准入控制提供了直接的实证动机。
其二,准入控制带来的一致性收益是全面正面的。 16 组对照中任务完成得分全部是 Harness 一侧更高(其中两组的配对 bootstrap 区间排除了零);重复尝试的可靠性在 12 组更高、4 组持平、0 组更低。一个不降低下限、抬高上限的机制,在工程上已经很难得。
工程视角:为什么这个方案值得抄
三个特性让它比「微调让模型变强」的路线更适合当下的生产环境:
- 权重不动,闭源可用。适应发生在「诱导策略的上下文」层,也就是外置规则文本,OpenAI、Anthropic 的闭源 API 模型都能直接套。
- 可检查、可回滚。被采纳的规则是普通文本,审计员能直接阅读 Agent 目前自我约定了哪些行为,出问题一键清空。这与当下 agent 治理强调的可审计性完全对齐。
- 成本结构清晰。四步循环是提示词工程加外部脚本,没有训练作业,也不需要梯度级别的干预。
局限与延伸阅读
论文自己承认的边界包括:固定边际的选择是个超参数,保护用例集的质量直接决定闸门的判别力;前向试跑的证据强度弱于重放,冷启动阶段的误放行风险更高。另外,准入控制只约束「持久化」,不约束临时执行期间的行为——临时权限窗口内的破坏仍是潜在的。
结合近一个月的相关工作看,这条「agent 自我约束」的脉络正在快速成形:从运行时行为监控、CoT 监控规避研究,到这篇的修改准入控制,方向一致地指向同一个结论——Agent 的自我改进必须伴随独立于 Agent 本身的外部治理层。对正在生产环境跑自进化 agent 的团队来说,这篇论文提供的不是一个可以直接落地的框架,而是一份经过量化验证的设计清单:临时权限、回归校验、语料级守卫,三者缺一不可。
还有一个视角值得放在结尾:这套机制本质上把「信任的建立」从一次性的事前审计,变成了持续的事后账本。每条被采纳的规则都携带它的出身记录——什么故障触发、什么证据支持、哪次回归放行——出问题时可以沿账本回溯到具体的准入决策。对于正在被「agent 行为不可解释」困扰的运维团队,这个账本视角可能比闸门本身更有迁移价值。
顺带一提,这篇论文与同期出现的 Harness-Zero 等工作一起,把「harness」从一个工程术语推成了研究对象:外壳不再是模型的外围配件,而是承载安全、适应与治理能力的核心组件。谁先把这个认识落进架构,谁就在下一轮 agent 竞赛里少踩一半的坑。