Agent 安全面正在经历一次静默的范式转移。过去一年的评测与防御大多围绕一个简化假设展开:用户是被动的提问者,环境是静态的数据源,攻击就是一段埋伏好的提示注入。但真实部署里用户不是木偶——他们会改文件、传附件、改配置、追加指令,而 Agent 就在这些「环境正在被别人动」的状态下工作。9 月 21 日提交的 DUMA-Bench(arXiv 2609.24662)把这个被普遍忽略的维度形式化成了可复现的基准,并用 14 个模型的实测给出了一个不太好听的结论:引入用户可控交互后,攻击成功率从 26.9% 跳到 41.1%。
核心设计:给 τ2-bench 装上「第二只手」
DUMA-Bench 的名字来自 dual-control multi-agent——双控制多智能体。它在成熟的 τ2-bench 任务框架之上做了一层关键扩展:Agent 与用户都能影响共享的环境状态。评测协议在两种模式间切换,静态模式下环境只有 Agent 可以改动;双控制模式下用户侧获得了真实的环境操作能力,攻击者可以借这条通道布局。
对抗环境覆盖八类漏洞,选择上明显对准了当下 Agent 架构的真实软肋:
1 RAG 投毒 向检索源注入恶意内容
2 跨 Agent 操纵 借一个 Agent 影响另一个
3 不安全输出处理 不可信内容流向下游执行
4 - 8 其余漏洞类别 覆盖数据层 / 工具层 / 协作层
八个业务域、多种用户行为模式(配合型、对抗型、摇摆型)的组合,让这套基准能测出「同一个模型在不同交互节奏下安全性如何漂移」——这是静态基准在结构上做不到的。
实验结果:41.1% 意味着什么
实验横跨 OpenAI、Anthropic、DeepSeek、Qwen、Z.ai 五个模型家族的 14 个模型。最重要的一个数字:双控制交互让攻击成功率从 26.9% 上升到 41.1%,相对增幅超过五成。
三点解读。第一,这不是长尾现象,是跨家族的系统性结果——五个家族没有任何一家在双控制下保持静态评测水平,说明脆弱点不在某家的实现对齐瑕疵,而在当前 Agent 范式本身:模型对「共享状态正在被谁、以什么权限、往什么方向修改」缺乏成体系的怀疑与校验机制。第二,26.9% 的静态基线本身已经不低,叠加交互后接近「每两次攻击成功一次」的量级,对生产环境而言这个数字足以否掉「默认信任环境」的架构假设。第三,用户行为模式的调节作用显著——同样的模型在配合型用户下安全得多,说明安全表现是交互动力学的函数,脱离交互场景谈「这个模型安不安全」会得到系统性偏乐观的答案。
论文的结论句值得原样记住:Agent 安全是模型、用户与环境三者交互的涌现属性,而非模型单独的固有性质。
对工程团队的四个落地动作
作为论文速读,更关心的是它能改写什么实践:
- 评测口径升级。采购或自建 Agent 系统时,把「对抗环境成功率」与「任务完成率」并列作为一级指标,只看后者的选型报告在真实威胁面前没有意义。
- 红队剧本更新。内部安全测试应加入双控制剧本:模拟用户在 Agent 会话中途修改共享文档、替换检索源、追加冲突指令,观察系统是否越权执行或泄露信息。
- 架构层防御。对关键环境状态变更设置确认门禁;给检索内容与工具输出打上来源与信任等级标签;限制单个 Agent 会话的横向影响半径,确保单点被攻破时不至于波及全局。
- 会话级监控。既然风险随交互动态漂移,监控就不该只看单轮输入输出,而要追踪整个会话中环境状态的变更链,对「高频修改 + 高权限操作」的组合模式告警。
补充一条团队协作层面的建议:把双控制场景写进 Agent 的系统提示词并非无用——明确告知模型「环境状态可能被第三方修改,执行敏感操作前先复核状态来源与时间戳」,实测类提示对低烈度攻击有一定缓解作用。但论文的跨家族结果提醒我们,提示词防御的上限不高,它只能作为纵深防御的最后一层,不能替代门禁、标注与半径限制这些结构性措施。
局限与位置
基准的边界也要说清楚:八类漏洞不可能穷尽真实攻击面,用户模拟的行为空间是有限采样的,攻击强度上限受限于基准作者设计的剧本。另外它测的是「成功率」,对攻击成本、隐蔽性、持久性等真实威胁维度覆盖有限。
但放到近几个月的时间线里看,DUMA-Bench 补上的正是缺失的一环:多 Agent 系统评测、工具调用安全、提示注入防御各自都有基准,而「用户参与的动态交互」这块一直只有定性讨论。现在它有了可复现的协议和跨五家族的基线数字。对于所有「Agent 即员工」叙事的信徒,这篇论文传递的信息朴素而重要——你的 Agent 不只面对攻击者的数据,还面对一个随时可能被搅局的环境,而测试它的方式必须还原这一点。下一次有人拿着漂亮的静态安全评测报告推销 Agent 方案时,第一个该问的问题就是:双控制模式下跑出来是多少。