Paper

论文速读:ReWorld 用长程记忆改造交互式世界模型

6 min read ·

ReWorld: An Interactive World Model with Long-Horizon Memory 是 2026 年 8 月 24 日提交到 arXiv cs.AI 的论文。它研究的不是又一个文本到视频模型,而是更难的交互式世界模型:用户按下动作,模型要实时生成下一段视觉世界;用户走远后再回头,模型还要记得之前看过的地方。

这个方向和 agent 很近。现在很多 LLM agent 评测仍停留在网页、代码、文本工具或离散环境里。真正的物理世界和 3D 环境成本高、不可重复、风险大。世界模型如果能提供可交互、可回访、长程一致的模拟环境,就可能成为视觉 agent、具身 agent 和游戏 agent 的训练场。

但交互式世界模型有一个结构性矛盾:控制需要短窗口,记忆需要长窗口。你按下向左转,模型必须立刻响应最近动作;你一分钟后回到原点,模型又必须记得原点长什么样。全历史 attention 太贵,滑动窗口会忘记历史。ReWorld 的设计就是围绕这个矛盾展开。

核心思路

论文摘要里有一句很关键:control wants a short horizon, memory wants an unbounded one。ReWorld 的方法不是让所有 token 都看所有历史,而是在训练和推理里拆分控制与记忆。

训练阶段,它使用 mixed per-head attention windows。多数 attention head 被限制在最近历史里,负责动作跟随和局部连续性;少数 global head 可以看完整历史,负责长程记忆。为了避免某些能力固定绑定到某些 head,论文还使用 random head routing;为了让模型习惯稀疏历史,又使用 random chunk dropping。

推理阶段,它不保留无限 KV cache,而是使用固定预算:bounded KV cache 加 pose-indexed landmark bank。简单说,模型把过去见过的关键视觉证据按相机位姿存成地标。当用户移动到某个位置附近,就检索相关 landmarks,补回滑动窗口已经忘掉的证据。

这个设计的工程意义很清楚:长程记忆不能只靠把 context 拉长。你需要一个可检索、可预算、和任务状态对齐的外部记忆结构。

为什么位姿索引重要

文本 agent 的记忆可以按语义检索,比如“用户喜欢什么”“上次讨论了哪个函数”。世界模型的记忆还要解决空间问题。用户回到同一个房间,模型应该找回“这个位姿附近曾看过什么”,而不是只找语义相似画面。

pose-indexed landmark bank 的价值在这里。它把历史视觉证据和物理动作尺度绑定起来。论文还提到一个 metric-scale-aligned data engine,把 Unreal 渲染、游戏漫游和真实世界视频放到同一物理动作尺度上,让同一个按键在不同数据源里对应相同距离的相机运动。

这一步容易被忽略,但对交互非常重要。如果不同数据源里的“前进一步”尺度不一致,模型学到的控制就会混乱。用户按一次向前,有时像走 10 厘米,有时像飞 2 米,长程回访自然也难以稳定。

Palindrome trajectories

论文使用 palindrome trajectories 来提供 revisit evidence。可以理解为来回路径:走出去,再沿某种方式回到原点。这类轨迹为模型提供了“同一个地方在不同时间再次出现”的训练证据。

世界模型如果只看单向漫游视频,很难学会回访一致性。它可能生成漂亮画面,但没有机会被惩罚“回头以后原地变了”。回文轨迹让训练数据显式包含回访,从而支持长程记忆学习。

这对 agent 仿真也有启发。很多环境数据集只收集向前推进的成功轨迹,缺少撤退、绕路、回访、检查和纠错。真正的 agent 需要这些行为,因为长任务不是一直往前走,而是反复观察、行动、验证和修正。

四步蒸馏与实时性

ReWorld 还用 distribution-matching distillation 把采样压缩到四步,并把能力放进 LoRA adapter。论文称一个 backbone 可以同时服务高保真多步模式和实时交互模式,输出 704x1280 视频,覆盖照片级、游戏风和风格化世界。

这说明交互式世界模型不只是质量问题,也是延迟问题。离线视频生成可以慢慢采样,交互系统不行。用户按键后必须快速看到结果,否则控制感消失。四步采样是为了把模型从“能生成”推向“能互动”。

不过开发者要保持谨慎。论文里的实时性取决于硬件、实现、分辨率、batch、缓存和模型大小。没有开放代码和可复现实测前,不能直接推断普通开发机可以流畅运行。

评测维度

论文使用三轴协议:action following、long-horizon recall、video quality。这个评测选择很合理。

action following 看模型是否听动作。如果用户向左转,画面应该产生对应相机变化。

long-horizon recall 看模型是否记得远处历史。用户经过长 rollout 后回到原点,模型是否还能恢复起始视图。

video quality 看画面本身是否清晰、稳定、有合理细节。

这三者经常互相冲突。一个模型可以画质很好但不听控制;也可以短期动作准但一回访就忘;也可以记忆强但生成慢或画面差。ReWorld 的贡献在于把这三者放到同一系统里平衡。

对 Agent 的意义

对 LLM agent 开发者来说,ReWorld 最值得关注的不是视频质量,而是“长期任务环境”的可能性。

当前 agent 训练和评测有几个短板。网页环境更新快,难以复现;真实机器人昂贵且危险;游戏环境需要手工制作;文本环境缺少视觉和空间连续性。交互式世界模型如果足够稳定,可以生成大量可控场景,让 agent 练习导航、搜索、记忆、回访、规划和纠错。

更重要的是,它提供了可预算记忆设计的范例。LLM agent 也有类似问题:短期上下文用于当前工具调用,长期记忆用于过去任务证据。ReWorld 的 mixed local-global attention 与外部 landmark bank,可以类比到 agent 的短上下文加结构化记忆。

风险与局限

世界模型最大风险是 hallucinated physics。画面连续不代表物理正确,回访一致不代表可执行动作真实。agent 如果在错误世界模型里训练,可能学到对真实环境无效的策略。

第二个风险是评测覆盖。action following、recall、quality 很重要,但还不等于任务成功。一个导航 agent 需要目标寻找、障碍处理、语义理解和安全约束。

第三个风险是记忆污染。landmark bank 保存的是模型认为重要的视觉证据,如果索引错误或检索错误,回访可能变得更糟。长期记忆系统一定有写入、检索和遗忘策略,不能只看容量。

第四个风险是成本。实时视频世界模型比文本 agent 昂贵得多。即使研究上可行,产品上也要算单位交互成本。

结论

ReWorld 是一篇值得 agent 开发者读的世界模型论文,因为它把长程记忆、动作控制和实时生成放在同一个系统里处理。它的核心启发是:长任务智能不能只靠无限上下文,必须把短期控制和长期记忆拆开,并用可检索、可预算的外部结构连接二者。

如果你做视觉 agent、游戏 agent、机器人仿真或长程记忆架构,ReWorld 都提供了有价值的设计语言。今天它还不是普通应用可以直接替换的基础设施,但它指向了下一代 agent 评测环境的一个方向:可交互、可回访、可控制的生成式世界。

参考来源:ReWorld arXivReWorld project pagearXiv cs.AI recent submissions

Frequently asked questions

ReWorld 研究的是什么问题?
它研究交互式世界模型如何在用户控制下实时生成视频,同时记住长时间之前看过的场景,避免回访时完全忘记起点。
它和普通视频生成模型有什么区别?
普通视频生成更关注从文本或短条件生成片段;ReWorld 强调用户动作跟随、长时序记忆和可交互 rollout。
landmark bank 有什么作用?
它把历史场景按相机位姿索引成可检索地标,让模型在固定缓存预算下回忆当前位置附近曾经见过的视觉证据。
这对 LLM Agent 有什么关系?
如果世界模型能稳定模拟可交互环境,agent 训练和评测就能获得更长、更可控、更接近现实的视觉行动闭环。
开发者现在能直接用它做产品吗?
还需要看代码、权重、延迟和硬件要求。当前更适合作为世界模型架构参考,而不是立即替代游戏引擎或机器人仿真器。
// next.txt ›

Some outbound links in this post are affiliate links — see disclosure.