Paper

DUMA-Bench 论文速读:当用户也能搅局,Agent 安全还剩几成

4 min read ·

Agent 安全面正在经历一次静默的范式转移。过去一年的评测与防御大多围绕一个简化假设展开:用户是被动的提问者,环境是静态的数据源,攻击就是一段埋伏好的提示注入。但真实部署里用户不是木偶——他们会改文件、传附件、改配置、追加指令,而 Agent 就在这些「环境正在被别人动」的状态下工作。9 月 21 日提交的 DUMA-Bench(arXiv 2609.24662)把这个被普遍忽略的维度形式化成了可复现的基准,并用 14 个模型的实测给出了一个不太好听的结论:引入用户可控交互后,攻击成功率从 26.9% 跳到 41.1%

核心设计:给 τ2-bench 装上「第二只手」

DUMA-Bench 的名字来自 dual-control multi-agent——双控制多智能体。它在成熟的 τ2-bench 任务框架之上做了一层关键扩展:Agent 与用户都能影响共享的环境状态。评测协议在两种模式间切换,静态模式下环境只有 Agent 可以改动;双控制模式下用户侧获得了真实的环境操作能力,攻击者可以借这条通道布局。

对抗环境覆盖八类漏洞,选择上明显对准了当下 Agent 架构的真实软肋:

1  RAG 投毒          向检索源注入恶意内容
2  跨 Agent 操纵     借一个 Agent 影响另一个
3  不安全输出处理    不可信内容流向下游执行
4  - 8  其余漏洞类别  覆盖数据层 / 工具层 / 协作层

八个业务域、多种用户行为模式(配合型、对抗型、摇摆型)的组合,让这套基准能测出「同一个模型在不同交互节奏下安全性如何漂移」——这是静态基准在结构上做不到的。

实验结果:41.1% 意味着什么

实验横跨 OpenAI、Anthropic、DeepSeek、Qwen、Z.ai 五个模型家族的 14 个模型。最重要的一个数字:双控制交互让攻击成功率从 26.9% 上升到 41.1%,相对增幅超过五成。

三点解读。第一,这不是长尾现象,是跨家族的系统性结果——五个家族没有任何一家在双控制下保持静态评测水平,说明脆弱点不在某家的实现对齐瑕疵,而在当前 Agent 范式本身:模型对「共享状态正在被谁、以什么权限、往什么方向修改」缺乏成体系的怀疑与校验机制。第二,26.9% 的静态基线本身已经不低,叠加交互后接近「每两次攻击成功一次」的量级,对生产环境而言这个数字足以否掉「默认信任环境」的架构假设。第三,用户行为模式的调节作用显著——同样的模型在配合型用户下安全得多,说明安全表现是交互动力学的函数,脱离交互场景谈「这个模型安不安全」会得到系统性偏乐观的答案。

论文的结论句值得原样记住:Agent 安全是模型、用户与环境三者交互的涌现属性,而非模型单独的固有性质。

对工程团队的四个落地动作

作为论文速读,更关心的是它能改写什么实践:

  1. 评测口径升级。采购或自建 Agent 系统时,把「对抗环境成功率」与「任务完成率」并列作为一级指标,只看后者的选型报告在真实威胁面前没有意义。
  2. 红队剧本更新。内部安全测试应加入双控制剧本:模拟用户在 Agent 会话中途修改共享文档、替换检索源、追加冲突指令,观察系统是否越权执行或泄露信息。
  3. 架构层防御。对关键环境状态变更设置确认门禁;给检索内容与工具输出打上来源与信任等级标签;限制单个 Agent 会话的横向影响半径,确保单点被攻破时不至于波及全局。
  4. 会话级监控。既然风险随交互动态漂移,监控就不该只看单轮输入输出,而要追踪整个会话中环境状态的变更链,对「高频修改 + 高权限操作」的组合模式告警。

补充一条团队协作层面的建议:把双控制场景写进 Agent 的系统提示词并非无用——明确告知模型「环境状态可能被第三方修改,执行敏感操作前先复核状态来源与时间戳」,实测类提示对低烈度攻击有一定缓解作用。但论文的跨家族结果提醒我们,提示词防御的上限不高,它只能作为纵深防御的最后一层,不能替代门禁、标注与半径限制这些结构性措施。

局限与位置

基准的边界也要说清楚:八类漏洞不可能穷尽真实攻击面,用户模拟的行为空间是有限采样的,攻击强度上限受限于基准作者设计的剧本。另外它测的是「成功率」,对攻击成本、隐蔽性、持久性等真实威胁维度覆盖有限。

但放到近几个月的时间线里看,DUMA-Bench 补上的正是缺失的一环:多 Agent 系统评测、工具调用安全、提示注入防御各自都有基准,而「用户参与的动态交互」这块一直只有定性讨论。现在它有了可复现的协议和跨五家族的基线数字。对于所有「Agent 即员工」叙事的信徒,这篇论文传递的信息朴素而重要——你的 Agent 不只面对攻击者的数据,还面对一个随时可能被搅局的环境,而测试它的方式必须还原这一点。下一次有人拿着漂亮的静态安全评测报告推销 Agent 方案时,第一个该问的问题就是:双控制模式下跑出来是多少。

Frequently asked questions

「双控制」交互是什么意思?
传统 Agent 安全评测大多假设用户是被动的、环境是静态的:攻击载荷埋在数据里,模型要么中招要么防住。双控制指的是 Agent 和用户双方都能主动影响共享的环境状态——用户可以修改文档、追加指令、调整工具配置,Agent 随后再行动。这更接近真实部署:客服场景里用户会传新文件,办公场景里同事会改共享表格。交互本身成了一类新的攻击面。
DUMA-Bench 覆盖了哪些漏洞类型?
它在 τ2-bench 的任务框架上扩展出八类漏洞的对抗环境,包括 RAG 投毒(往检索库里埋恶意内容)、跨 Agent 操纵(一个 Agent 被用来影响另一个)、不安全输出处理(把不可信内容直接交给下游执行)等。覆盖八个业务域和多种用户行为模式,攻击面横跨数据层、工具层与 Agent 之间的协作层,比单点提示注入测试的覆盖面宽得多。
26.9% 到 41.1% 这个跃升该怎么理解?
同一批模型在静态评测里攻击成功率是 26.9%,一旦引入双控制交互就涨到 41.1%,相对增幅超过一半。这说明只做静态测试会系统性低估真实风险:模型在「用户只提问」的设定下表现合格,不代表在「用户会不断改环境」的真实会话里同样安全。安全团队做威胁建模时应把交互动态性列为一级风险源,而不是边缘情况。
实测覆盖了哪些模型?结论有什么共性?
评测覆盖 OpenAI、Anthropic、DeepSeek、Qwen、Z.ai 五个家族的 14 个模型,跨八个域和多种用户行为模式。论文的核心结论是共性的:没有任何家族能在双控制下免疫,攻击成功率的上升是跨家族现象。换句话说,这不是某家的实现 bug,而是当前 Agent 范式的结构性弱点——模型对「环境状态在被谁、以什么权限修改」缺乏细粒度的感知与怀疑机制。
这个基准对工程团队的实际价值是什么?
三方面:一是选型时把「对抗环境下的成功率」纳入评估维度,而不是只看任务完成率;二是把双控制的思想搬进内部红队测试,在预发布环境模拟「用户与 Agent 交替修改状态」的攻击剧本;三是架构上补防御——对共享环境的关键状态变更做确认门禁,对检索内容与工具输出做来源标注,限制单个 Agent 的横向影响半径。基准本身开源协议化,可以直接对齐。
// next.txt ›

Some outbound links in this post are affiliate links — see disclosure.