~/yomxxx/posts/2026-09-22-next-turn-vs-workflow-success-agent-eval-gap-long-form.mdx
Long-form

$ cat 更好的单轮表现不等于更好的代理:一次评估错位的诊断

-- 8 min read ·

如果你最近在看代理模型的评测榜单,这篇论文值得单独读一遍。它做了一件评测圈不常做的事:把一个被广泛使用、但几乎没人验证过的评估假设拿出来做实验检验

那个假设是——「在给定正确历史的前提下预测下一个动作,这个准确率能代表代理的自主工作能力」。

arXiv 2609.21187 的答案是否定的,而且否得相当彻底。

被默认接受的那个假设

先看业内主流做法。评估一个代理模型,最常见的协议是:拿一段真实或合成的多轮轨迹,把到第 k-1 轮为止的正确历史交给模型,让它预测第 k 轮的动作,再和参考答案比对。文本轮用词法重叠或裁判打分,工具轮用函数名与参数精确匹配。

这套协议有几个明显的工程优点:可并行、可复现、单次评估成本低、不依赖真实工具环境。它也因此成了大量论文里「代理能力」的主要证据来源。

但它悄悄引入了两个假设。第一,历史永远是对的——模型从不会遇到自己造成的错误状态。第二,局部最优可加——每一步都做对,整条轨迹就对。

这篇论文要检验的就是第二条。

实验设置:一条完整的客服工作流

作者构造的场景是客服多轮工作流,来源是一家厂商的专有数据,覆盖 130 个客户支持流程。数据构建链路是:先用 GPT-5 生成 1800 段对话,再经 Claude-4.5-Opus 与 Gemini-2.5-Pro 双重验证过滤,保留 1027 段合规对话,平均 13 轮。

切分后的样本规模如下:

用途样本数构成
训练58344093 文本响应 + 1741 工具调用
验证664466 文本 + 198 工具
测试542376 文本 + 166 工具(来自 84 段对话)

被测模型四个:Qwen3-4B、Qwen3-14B、Gemma 3-4B、Gemma 3-12B,每个都有微调前(记为 ZS)与监督微调后两个版本,使用同一套 5 轮训练配方和数据。控制变量做得比较干净——同数据、同配方,只比较微调前后,排除了数据质量差异带来的干扰。

五种协议,两类世界观

论文定义了五种评估协议,可以清晰归成两大类。

第一类依赖正确历史,可称为开卷考试

  • 文本相似度:ROUGE-1,确定性指标,只评自然语言决策
  • gold-history 轮成功率:全轮、文本轮、工具轮三个口径,由 Gemini-2.5-Pro 在温度零下判二值标签
  • 严格工具正确性:精确调用准确率与参数 F1,要求函数名和归一化参数精确匹配,不给部分分

第二类是被测模型只能用自己的历史,可称为闭卷实操

  • 闭环重放:用模型自己生成的历史重放 84 段对话,配确定性用户模拟器,工具调用匹配才给状态结果,最多重试两次,无未解决工具错误才算完成
  • 整体工作流判定:对闭环重放的整体结果再判一次,要求用户目标达成、且无策略违规与工具错误

同一批模型、同一批任务,两类协议给出的结论会差到什么程度,是这篇论文的核心看点。

结果:文本大涨,工具躺平,闭环归零

先看逐模型的完整数据(百分比,闭环两项记为通过数除以需要工具的 77 段对话):

指标Qwen3-4B ZSQwen3-4B SFTQwen3-14B ZSQwen3-14B SFTGemma3-4B ZSGemma3-4B SFTGemma3-12B ZSGemma3-12B SFT
ROUGE-130.649.812.950.525.646.930.049.4
全轮成功率29.250.737.154.620.141.127.544.5
文本轮成功率32.461.441.864.424.750.833.856.9
工具轮成功率21.726.526.532.59.619.313.316.3
精确调用准确率3.613.95.418.13.00.01.81.8
参数 F16.324.810.729.05.10.54.52.9
闭环完成0/773/770/778/770/770/770/770/77
整体判定0/770/770/770/770/770/770/770/77

把微调前后的均值拉出来看趋势:

  • 文本侧暴涨:ROUGE-1 从 24.8 到 49.2(涨 24.4 点),文本轮成功率从 33.2% 到 58.4%(涨 25.2 点),全轮成功率从 28.5% 到 47.7%(涨 19.3 点)
  • 工具侧几乎不动:工具轮成功率从 17.8% 到 23.7%,只涨 5.9 点;精确调用准确率从 3.5% 到 8.5%;参数 F1 从 6.7% 到 14.3%
  • Gemma 家族甚至倒退:Gemma 3-4B 的精确调用准确率从 3.0% 掉到 0.0%,参数 F1 从 5.1% 掉到 0.5%;Gemma 3-12B 的参数 F1 也从 4.5% 降到 2.9%

如果只看第一组数字,结论会是「微调效果显著」。但把后两行接上,画面就变了:闭卷实操下,四个微调模型里只有 Qwen3-14B 把 77 段需要工具的对话做完了 8 段,也就是 10.4%;整体目标达成率是 0

错位是怎么发生的

为什么步骤正确率能到 58%,端到端却是零?论文没有直接给因果分解,但数据本身指向几个机制。

第一,错误会累积,而单轮协议不做积分。 单轮评估每次都给正确历史,等于把错误率重新归零;闭环执行时错误会留在历史里,后续每一步都在污染状态下决策。文本生成对历史噪声比较宽容(措辞不同但意思对,仍能往下走),工具调用则极度敏感——参数错一个字段,后续状态就全歪了。

第二,工具正确性是稀疏且离散的,微调难以平滑改善。 精确调用准确率在微调前普遍只有个位数(3.0% 到 5.4%),这说明模型在微调前几乎不具备可靠的工具调用能力。微调能把它推到 13% 到 18%(Qwen3 家族),但仍然远不足以支撑自主执行。从 5% 到 18% 是四倍增长,看起来漂亮,但没跨过可用门槛。

第三,文本能力与工具能力可能互相挤占。 Gemma 家族是反例的核心证据:文本侧同样有大幅提升(Gemma 3-4B 的 ROUGE-1 从 25.6 到 46.9),但工具侧的精确调用准确率反而归零。这暗示在有限容量下,微调把模型推向了「把话说好」的方向,代价是结构化输出能力退化。

第四,工具轮的成功判定本身很宽松,但仍然不高。 工具轮成功率用大模型裁判判二值,容忍度比精确匹配高得多——即便按这个宽松口径,最好的模型也只有 32.5%。

作者给出的改进方向

论文的建议集中在报告方式上,我认为这是全文最可落地的部分。

核心主张是分层报告,四个维度各自单列,不允许用一个聚合分数代表端到端能力:

  1. 文本质量
  2. 局部动作正确性
  3. 工具执行正确性
  4. 端到端任务完成

作者提出一个「最小报告框架」:把轮级分数、端到端成功率、轨迹级错误分析三者结合起来。第三项是关键——轨迹级错误分析能回答「在哪一步开始崩、崩在哪个环节」,而这恰恰是单轮指标在结构上无法提供的信息。

对未来工作,作者把方向指向了训练侧:需要显式针对错误恢复、状态维护、端到端任务完成的训练方法,而不是继续在单轮监督信号上加大投入。这个判断挺重——如果单轮指标与端到端能力不相关,那用单轮数据做主要监督信号的整套流程都需要重新审视。

外部效度与需要警惕的部分

结论方向可信,但边界要说清。

实验集中在单一领域——客服多轮工作流。不同领域的错误代价结构差别很大,比如代码代理的一次语法错误往往可以回滚,而涉及支付或数据写入的动作几乎没有重试余地。所以「文本涨、工具不涨」这个模式换到别的领域,两个分支的相对幅度很可能不同。

数据来自一家厂商的专有数据集,评测集只有 84 段对话、542 个动作样本。这个规模下,8/773/77 的差异在统计上是否稳健,论文没有给出置信区间。按二项分布粗略估算,两者都处在小样本区间,不宜过度解读排名。

评测依赖 Gemini-2.5-Pro 作为裁判模型,温度设为零。裁判模型自身的偏好会进入结论,尤其是工具轮成功率这类需要理解上下文的判定。换一个裁判,数值可能漂移。

另外,论文是 EMNLP 2026 的 REALM 研讨会论文,篇幅有限,很多机制层面的解释是推断而非实验验证。它证明的是「错位存在且很大」,不是「错位由哪些因素按什么比例造成」。

对做代理工程的人意味着什么

抛开学术语境,这篇论文对生产环境的直接意义有三条。

第一,别用单轮分数做上线决策。 如果一个代理模型在「给定正确历史预测下步」上表现很好,你只能推断它有基本的动作理解力,不能推断它能独立跑完流程。要判断后者,必须有闭环评测——哪怕规模小,也要有。

第二,把工具正确性单独作为一个门槛指标。 论文里精确调用准确率从个位数涨到 18% 仍不足以工作,这个数字很有参考价值:它说明结构化工具调用的可用门槛远高于直觉。评估时把「函数名对、参数全对」作为独立指标单列,比看聚合成功率更能提前发现隐患。

第三,做轨迹级失败归因。 端到端成功率为零时,最有价值的信息不是「失败了」,而是「在第七步的参数校验上开始崩」。这类分析需要保留完整执行轨迹,而多数评测流水线为了省存储并不保留。为观测性付出的存储成本,比反复跑无效评测划算。

顺带说一句方法论上的收获:这篇论文的结论其实是对整个评测习惯的提醒——凡是把「正确中间状态」当输入的协议,都要警惕它是否在替被测系统承担了它实际承担不了的责任。这个问题不只存在于代理评估里。

Frequently asked questions

为什么单轮评估会高估代理的真实能力?
因为单轮协议把正确历史直接喂给模型,模型只需要在「已知前面每一步都对」的假设下预测下一动作。这个假设在实际自主执行时根本不成立:一旦模型自己产生的历史里出现一次错误调用,后续每一步都建立在错误状态上,误差会累积发散。单轮协议系统性地绕开了这个累积过程。
实验里 SFT 带来了多大提升,为什么说提升是虚的?
文本侧提升确实显著:ROUGE-1 平均从 24.8 涨到 49.2,文本轮成功率从 33.2% 涨到 58.4%,全轮成功率涨 19.3 个百分点。但工具侧增益微弱,工具轮成功率只涨 5.9 个百分点;而闭环评测下四个模型工具工作流完成率最好只有 10.4%,整体目标达成率是零。文本能力的提升没有传导到端到端任务。
holistic workflow success 为零是什么意思?
这是最严格的评测:用模型自己生成的历史重放整段对话,由大模型裁判判定用户目标是否达成、且过程中没有策略违规或工具错误。四个微调后的模型在 77 段需要工具的对话上全部零通过。也就是说,即便动作局部看起来不错,没有一次能真正把任务闭环做完。
作者建议怎么改评估方式?
核心是分层报告,把四个维度拆开单列:文本质量、局部动作正确性、工具执行正确性、端到端任务完成。不许可用一个聚合的单轮分数当作端到端能力的证据。作者还建议采用最小报告框架,把轮级分数、端到端成功率与轨迹级错误分析三者结合。
这个结论的适用范围有限制吗?
有。实验集中在单一领域——客服多轮工作流,数据来自一家厂商的专有数据集,评测集只有 84 段对话、542 个动作样本,规模不大。评测依赖 Gemini-2.5-Pro 作为裁判模型,裁判本身的偏好会进入结论。所以「单轮指标不可靠」这个结论方向可信,但具体数值换领域换裁判未必复现。
// next.txt ›

Some outbound links in this post are affiliate links — see disclosure.