材料截至 2026-10-09
一、它和语言模型差在哪
语言模型预测”下一个 token”,世界模型预测”下一个状态”:
- 输入:当前观测(画面、传感器读数)+ 一个动作
- 输出:未来的观测或未来的潜表征,也就是”这么做的后果”
- 关键差别:它必须理解我的动作会改变世界,而且能回答反事实——如果我换个动作,会变成什么样

要预测的其实不只是画面。真正难的是分清三件事:哪些东西受我控制、哪些不受我控制、哪些跟奖励有关。这三件事分不清,世界模型就只能拿来看,不能拿来决策。
二、起点是 2018 年那篇《World Models》
Ha 和 Schmidhuber 在 2018 年给了这套三件套(arXiv:1803.10122):
- V(Vision):一个 VAE,把每帧画面压成很小的潜向量
- M(Memory):一个 RNN,根据当前潜向量和动作,预测下一时刻的潜向量
- C(Controller):一个小小的策略网络,只吃潜向量
最有名的是它的一个实验:完全在模型自己”幻觉出来的梦”里训练 agent,再把学到的策略迁移回真实环境——不用真实环境就能学开车、玩游戏。这句话基本定下了这个方向此后八年的目标。
三、四条技术路线
| 路线 | 思路 | 代表工作 |
|---|---|---|
| 潜空间循环式 | 在压缩后的潜空间里预测未来,再在里面用 RL 训策略 | Dreamer 系列,最新是 Dreamer 4(arXiv:2509.24527):在 Minecraft 里能准确预测物体交互,并直接在世界模型内部做强化学习 |
| 视频生成式 | 直接生成未来的视频帧,并且可交互 | Genie(arXiv:2402.15391):从无标注互联网视频里学出”可以被动作控制的可交互环境”,11B 参数,作者称其为 foundation world model;多人版本见 WorldCast(arXiv:2610.12412) |
| 表征预测式(JEPA) | 不预测像素,只预测表征,绕开无关细节 | JEPA 线在 2026 年 10 月一周内出了好几篇:LeWAM(arXiv:2610.12407)、H-JEPA(arXiv:2610.06805,分层规划)、Atom-JEPA(arXiv:2610.08400,3D 原子体系) |
| 语言模型当世界模型 | 用语言模型预测”某个动作/实验会产生什么结果” | RWMs(arXiv:2610.12235):预测候选干预的结果,用来省掉真实实验,服务于自改进 agent |
四、用在哪:几个具体到能记住的例子
- 机器人与 VLA 策略:DreamTrue(arXiv:2610.12468)做”动作忠实”的机器人世界模型,多视角、跨本体;PLaW-VLA(arXiv:2610.12285)在预训练的预测性表征空间里建模任务相关的未来状态
- 视觉导航:LiteNWM(arXiv:2610.12368)面向机载设备,一次编码多个候选轨迹再打分挑选
- 交通与自动驾驶:CosmosAlign(arXiv:2608.07693)基于预训练的 Cosmos3-Nano 世界基础模型做长时交通视频预测
- GUI agent 的安全监控:这个例子我特别喜欢——《Right Screen, Wrong Transition》(arXiv:2610.11942)指出,同一个登录页,点”登录”之后出现是正常的,点”查看订单”之后出现就是攻击。安全性是”转移”的性质,不是”屏幕”的性质,所以需要一个能预测”本该出现什么”的模型来当监控器
- 连聚变装置也有:IGNITE(arXiv:2610.02515)用 DIII-D 装置十多年的无标注实验数据训练世界模型,能根据文本提示生成执行器轨迹、模拟放电过程
五、产业侧:谁在造世界模型
论文之外,几家公司推的是”产品化”这一步:
- World Labs(李飞飞的团队):产品 Marble 生成空间一致、高保真、可持久的 3D 世界,支持文本/图像/视频/360 全景输入,可交互编辑、扩展合并、导出 2D 与 3D 资产。官网 2026-07 的访谈把这套路线叫”空间智能”;9 月 28 日宣布并入 AMD。
- NVIDIA Cosmos 3:官方定位是首个原生融合推理、世界生成与动作生成的 omni-model(Mixture-of-Transformers 架构),面向机器人学习与自动驾驶训练;配套 Cosmos Curator(数据策管)、Cosmos Evaluator(评估)和 tokenizer,以及 NIM 微服务与 DGX Cloud。权重按 OpenMDW1.1 许可(Linux Foundation)开放,Hugging Face 上有模型库、GitHub 上有代码和 Cookbook。它自称的 World Action Model,正是上一节几条论文路线在工业界的名字。
- AgentGarten(2610.12374,2026-10):把”模拟器管规则与状态、神经渲染器管画面”拆开——代码定义物理规则保证一致性,渲染器(从预训练视频模型蒸馏而来,用作者提出的 Adversarial Forcing 优化到实时)负责真实感。好处是新世界可以直接写成代码,于是环境的数量和难度能跟着 agent 一起扩张。
六、现在的真实瓶颈(这节比上面都重要)
- 物体保真度上不去。《What 30,000 Hours of Ego-centric Video Does Not Teach》(arXiv:2610.12464)做了个很诚实的实验:用 3 万小时第一视角人类视频训练,把数据量再放大 100 倍后,”agent”本身建模得不错,但物体交互的保真度依然明显偏低、且提升缓慢。结论是世界模型离实际部署还很远。
- 动作忠实性:预测得好看不等于听动作的话。DreamTrue 专门处理这个问题——标定不精确、失败样本覆盖不足,都会让模型偏向预测”成功”的结果。
- 潜空间里分不清可控与不可控。CausalDreamer(arXiv:2610.12016)指出 Dreamer 4 这类模型的 tokenizer 只有重建目标、没有动作和奖励监督,所以它的潜空间并没有把可控、不可控、与奖励相关这三类信息分开。
- 评估本身没有共识:多人世界模型 WorldCast 要保证每个玩家的独立视图和共享环境一致;而”怎么评判一个世界模型好不好”至今没有公认指标,有的工作干脆换个用法——拿它当验证器来用(2610.11942 的思路)。
七、和”递归自我改进”的咬合点
世界模型是 agent 自我改进的环境接口:要自我改进就得大量低成本试错,而”试错的场地”要么是想象出来的(Dreamer 4 就是直接在模型内部做 RL),要么是用模型预测结果来省掉真实实验(RWMs、以及上篇提到的 Memento 3)。
所以这两条线是配套的:一条管”怎么改自己”,一条管”怎么知道改了会怎样”。
参考
- 1803.10122 — World Models
- 2402.15391 — Genie: Generative Interactive Environments
- 2509.24527 — Training Agents Inside of Scalable World Models(Dreamer 4)
- 2608.07693 — CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting
- 2610.02515 — IGNITE Tokamak World Model Architecture
- 2610.06805 — H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
- 2610.08400 — Atom-JEPA: Joint-Embedding Predictive Architecture for 3D Atomistic Systems
- 2610.11942 — Right Screen, Wrong Transition: World Models as Verifiers for GUI Agents
- 2610.12016 — CausalDreamer: Learning Predictive World Models with Latent Disentanglement
- 2610.12235 — Language Models as AI Research World Models
- 2610.12285 — PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies
- 2610.12368 — LiteNWM: Efficient Latent World Models for Onboard Visual Navigation in the Wild
- 2610.12407 — LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC
- 2610.12412 — WorldCast: Distributed Multiplayer World Models
- 2610.12464 — What 30,000 Hours of Ego-centric Video Does Not Teach
- 2610.12468 — DreamTrue: Action-Faithful Robot World Model with Counterfactual Post-Training
- 2610.12374 — AgentGarten: Code Worlds for Evolving Agents