如果你最近在看代理模型的评测榜单,这篇论文值得单独读一遍。它做了一件评测圈不常做的事:把一个被广泛使用、但几乎没人验证过的评估假设拿出来做实验检验。
那个假设是——「在给定正确历史的前提下预测下一个动作,这个准确率能代表代理的自主工作能力」。
arXiv 2609.21187 的答案是否定的,而且否得相当彻底。
被默认接受的那个假设
先看业内主流做法。评估一个代理模型,最常见的协议是:拿一段真实或合成的多轮轨迹,把到第 k-1 轮为止的正确历史交给模型,让它预测第 k 轮的动作,再和参考答案比对。文本轮用词法重叠或裁判打分,工具轮用函数名与参数精确匹配。
这套协议有几个明显的工程优点:可并行、可复现、单次评估成本低、不依赖真实工具环境。它也因此成了大量论文里「代理能力」的主要证据来源。
但它悄悄引入了两个假设。第一,历史永远是对的——模型从不会遇到自己造成的错误状态。第二,局部最优可加——每一步都做对,整条轨迹就对。
这篇论文要检验的就是第二条。
实验设置:一条完整的客服工作流
作者构造的场景是客服多轮工作流,来源是一家厂商的专有数据,覆盖 130 个客户支持流程。数据构建链路是:先用 GPT-5 生成 1800 段对话,再经 Claude-4.5-Opus 与 Gemini-2.5-Pro 双重验证过滤,保留 1027 段合规对话,平均 13 轮。
切分后的样本规模如下:
| 用途 | 样本数 | 构成 |
|---|---|---|
| 训练 | 5834 | 4093 文本响应 + 1741 工具调用 |
| 验证 | 664 | 466 文本 + 198 工具 |
| 测试 | 542 | 376 文本 + 166 工具(来自 84 段对话) |
被测模型四个:Qwen3-4B、Qwen3-14B、Gemma 3-4B、Gemma 3-12B,每个都有微调前(记为 ZS)与监督微调后两个版本,使用同一套 5 轮训练配方和数据。控制变量做得比较干净——同数据、同配方,只比较微调前后,排除了数据质量差异带来的干扰。
五种协议,两类世界观
论文定义了五种评估协议,可以清晰归成两大类。
第一类依赖正确历史,可称为开卷考试:
- 文本相似度:ROUGE-1,确定性指标,只评自然语言决策
- gold-history 轮成功率:全轮、文本轮、工具轮三个口径,由 Gemini-2.5-Pro 在温度零下判二值标签
- 严格工具正确性:精确调用准确率与参数 F1,要求函数名和归一化参数精确匹配,不给部分分
第二类是被测模型只能用自己的历史,可称为闭卷实操:
- 闭环重放:用模型自己生成的历史重放 84 段对话,配确定性用户模拟器,工具调用匹配才给状态结果,最多重试两次,无未解决工具错误才算完成
- 整体工作流判定:对闭环重放的整体结果再判一次,要求用户目标达成、且无策略违规与工具错误
同一批模型、同一批任务,两类协议给出的结论会差到什么程度,是这篇论文的核心看点。
结果:文本大涨,工具躺平,闭环归零
先看逐模型的完整数据(百分比,闭环两项记为通过数除以需要工具的 77 段对话):
| 指标 | Qwen3-4B ZS | Qwen3-4B SFT | Qwen3-14B ZS | Qwen3-14B SFT | Gemma3-4B ZS | Gemma3-4B SFT | Gemma3-12B ZS | Gemma3-12B SFT |
|---|---|---|---|---|---|---|---|---|
| ROUGE-1 | 30.6 | 49.8 | 12.9 | 50.5 | 25.6 | 46.9 | 30.0 | 49.4 |
| 全轮成功率 | 29.2 | 50.7 | 37.1 | 54.6 | 20.1 | 41.1 | 27.5 | 44.5 |
| 文本轮成功率 | 32.4 | 61.4 | 41.8 | 64.4 | 24.7 | 50.8 | 33.8 | 56.9 |
| 工具轮成功率 | 21.7 | 26.5 | 26.5 | 32.5 | 9.6 | 19.3 | 13.3 | 16.3 |
| 精确调用准确率 | 3.6 | 13.9 | 5.4 | 18.1 | 3.0 | 0.0 | 1.8 | 1.8 |
| 参数 F1 | 6.3 | 24.8 | 10.7 | 29.0 | 5.1 | 0.5 | 4.5 | 2.9 |
| 闭环完成 | 0/77 | 3/77 | 0/77 | 8/77 | 0/77 | 0/77 | 0/77 | 0/77 |
| 整体判定 | 0/77 | 0/77 | 0/77 | 0/77 | 0/77 | 0/77 | 0/77 | 0/77 |
把微调前后的均值拉出来看趋势:
- 文本侧暴涨:ROUGE-1 从 24.8 到 49.2(涨 24.4 点),文本轮成功率从 33.2% 到 58.4%(涨 25.2 点),全轮成功率从 28.5% 到 47.7%(涨 19.3 点)
- 工具侧几乎不动:工具轮成功率从 17.8% 到 23.7%,只涨 5.9 点;精确调用准确率从 3.5% 到 8.5%;参数 F1 从 6.7% 到 14.3%
- Gemma 家族甚至倒退:Gemma 3-4B 的精确调用准确率从 3.0% 掉到 0.0%,参数 F1 从 5.1% 掉到 0.5%;Gemma 3-12B 的参数 F1 也从 4.5% 降到 2.9%
如果只看第一组数字,结论会是「微调效果显著」。但把后两行接上,画面就变了:闭卷实操下,四个微调模型里只有 Qwen3-14B 把 77 段需要工具的对话做完了 8 段,也就是 10.4%;整体目标达成率是 0。
错位是怎么发生的
为什么步骤正确率能到 58%,端到端却是零?论文没有直接给因果分解,但数据本身指向几个机制。
第一,错误会累积,而单轮协议不做积分。 单轮评估每次都给正确历史,等于把错误率重新归零;闭环执行时错误会留在历史里,后续每一步都在污染状态下决策。文本生成对历史噪声比较宽容(措辞不同但意思对,仍能往下走),工具调用则极度敏感——参数错一个字段,后续状态就全歪了。
第二,工具正确性是稀疏且离散的,微调难以平滑改善。 精确调用准确率在微调前普遍只有个位数(3.0% 到 5.4%),这说明模型在微调前几乎不具备可靠的工具调用能力。微调能把它推到 13% 到 18%(Qwen3 家族),但仍然远不足以支撑自主执行。从 5% 到 18% 是四倍增长,看起来漂亮,但没跨过可用门槛。
第三,文本能力与工具能力可能互相挤占。 Gemma 家族是反例的核心证据:文本侧同样有大幅提升(Gemma 3-4B 的 ROUGE-1 从 25.6 到 46.9),但工具侧的精确调用准确率反而归零。这暗示在有限容量下,微调把模型推向了「把话说好」的方向,代价是结构化输出能力退化。
第四,工具轮的成功判定本身很宽松,但仍然不高。 工具轮成功率用大模型裁判判二值,容忍度比精确匹配高得多——即便按这个宽松口径,最好的模型也只有 32.5%。
作者给出的改进方向
论文的建议集中在报告方式上,我认为这是全文最可落地的部分。
核心主张是分层报告,四个维度各自单列,不允许用一个聚合分数代表端到端能力:
- 文本质量
- 局部动作正确性
- 工具执行正确性
- 端到端任务完成
作者提出一个「最小报告框架」:把轮级分数、端到端成功率、轨迹级错误分析三者结合起来。第三项是关键——轨迹级错误分析能回答「在哪一步开始崩、崩在哪个环节」,而这恰恰是单轮指标在结构上无法提供的信息。
对未来工作,作者把方向指向了训练侧:需要显式针对错误恢复、状态维护、端到端任务完成的训练方法,而不是继续在单轮监督信号上加大投入。这个判断挺重——如果单轮指标与端到端能力不相关,那用单轮数据做主要监督信号的整套流程都需要重新审视。
外部效度与需要警惕的部分
结论方向可信,但边界要说清。
实验集中在单一领域——客服多轮工作流。不同领域的错误代价结构差别很大,比如代码代理的一次语法错误往往可以回滚,而涉及支付或数据写入的动作几乎没有重试余地。所以「文本涨、工具不涨」这个模式换到别的领域,两个分支的相对幅度很可能不同。
数据来自一家厂商的专有数据集,评测集只有 84 段对话、542 个动作样本。这个规模下,8/77 与 3/77 的差异在统计上是否稳健,论文没有给出置信区间。按二项分布粗略估算,两者都处在小样本区间,不宜过度解读排名。
评测依赖 Gemini-2.5-Pro 作为裁判模型,温度设为零。裁判模型自身的偏好会进入结论,尤其是工具轮成功率这类需要理解上下文的判定。换一个裁判,数值可能漂移。
另外,论文是 EMNLP 2026 的 REALM 研讨会论文,篇幅有限,很多机制层面的解释是推断而非实验验证。它证明的是「错位存在且很大」,不是「错位由哪些因素按什么比例造成」。
对做代理工程的人意味着什么
抛开学术语境,这篇论文对生产环境的直接意义有三条。
第一,别用单轮分数做上线决策。 如果一个代理模型在「给定正确历史预测下步」上表现很好,你只能推断它有基本的动作理解力,不能推断它能独立跑完流程。要判断后者,必须有闭环评测——哪怕规模小,也要有。
第二,把工具正确性单独作为一个门槛指标。 论文里精确调用准确率从个位数涨到 18% 仍不足以工作,这个数字很有参考价值:它说明结构化工具调用的可用门槛远高于直觉。评估时把「函数名对、参数全对」作为独立指标单列,比看聚合成功率更能提前发现隐患。
第三,做轨迹级失败归因。 端到端成功率为零时,最有价值的信息不是「失败了」,而是「在第七步的参数校验上开始崩」。这类分析需要保留完整执行轨迹,而多数评测流水线为了省存储并不保留。为观测性付出的存储成本,比反复跑无效评测划算。
顺带说一句方法论上的收获:这篇论文的结论其实是对整个评测习惯的提醒——凡是把「正确中间状态」当输入的协议,都要警惕它是否在替被测系统承担了它实际承担不了的责任。这个问题不只存在于代理评估里。