世界模型(World Models):它是什么、用来干什么、现在到哪一步


材料截至 2026-10-09

一、它和语言模型差在哪

语言模型预测”下一个 token”,世界模型预测”下一个状态”:

  • 输入:当前观测(画面、传感器读数)+ 一个动作
  • 输出:未来的观测或未来的潜表征,也就是”这么做的后果”
  • 关键差别:它必须理解我的动作会改变世界,而且能回答反事实——如果我换个动作,会变成什么样

要预测的其实不只是画面。真正难的是分清三件事:哪些东西受我控制、哪些不受我控制、哪些跟奖励有关。这三件事分不清,世界模型就只能拿来看,不能拿来决策。

二、起点是 2018 年那篇《World Models》

Ha 和 Schmidhuber 在 2018 年给了这套三件套(arXiv:1803.10122):

  • V(Vision):一个 VAE,把每帧画面压成很小的潜向量
  • M(Memory):一个 RNN,根据当前潜向量和动作,预测下一时刻的潜向量
  • C(Controller):一个小小的策略网络,只吃潜向量

最有名的是它的一个实验:完全在模型自己”幻觉出来的梦”里训练 agent,再把学到的策略迁移回真实环境——不用真实环境就能学开车、玩游戏。这句话基本定下了这个方向此后八年的目标。

三、四条技术路线

路线 思路 代表工作
潜空间循环式 在压缩后的潜空间里预测未来,再在里面用 RL 训策略 Dreamer 系列,最新是 Dreamer 4(arXiv:2509.24527):在 Minecraft 里能准确预测物体交互,并直接在世界模型内部做强化学习
视频生成式 直接生成未来的视频帧,并且可交互 Genie(arXiv:2402.15391):从无标注互联网视频里学出”可以被动作控制的可交互环境”,11B 参数,作者称其为 foundation world model;多人版本见 WorldCast(arXiv:2610.12412)
表征预测式(JEPA) 不预测像素,只预测表征,绕开无关细节 JEPA 线在 2026 年 10 月一周内出了好几篇:LeWAM(arXiv:2610.12407)、H-JEPA(arXiv:2610.06805,分层规划)、Atom-JEPA(arXiv:2610.08400,3D 原子体系)
语言模型当世界模型 用语言模型预测”某个动作/实验会产生什么结果” RWMs(arXiv:2610.12235):预测候选干预的结果,用来省掉真实实验,服务于自改进 agent

四、用在哪:几个具体到能记住的例子

  • 机器人与 VLA 策略:DreamTrue(arXiv:2610.12468)做”动作忠实”的机器人世界模型,多视角、跨本体;PLaW-VLA(arXiv:2610.12285)在预训练的预测性表征空间里建模任务相关的未来状态
  • 视觉导航:LiteNWM(arXiv:2610.12368)面向机载设备,一次编码多个候选轨迹再打分挑选
  • 交通与自动驾驶:CosmosAlign(arXiv:2608.07693)基于预训练的 Cosmos3-Nano 世界基础模型做长时交通视频预测
  • GUI agent 的安全监控:这个例子我特别喜欢——《Right Screen, Wrong Transition》(arXiv:2610.11942)指出,同一个登录页,点”登录”之后出现是正常的,点”查看订单”之后出现就是攻击。安全性是”转移”的性质,不是”屏幕”的性质,所以需要一个能预测”本该出现什么”的模型来当监控器
  • 连聚变装置也有:IGNITE(arXiv:2610.02515)用 DIII-D 装置十多年的无标注实验数据训练世界模型,能根据文本提示生成执行器轨迹、模拟放电过程

五、产业侧:谁在造世界模型

论文之外,几家公司推的是”产品化”这一步:

  • World Labs(李飞飞的团队):产品 Marble 生成空间一致、高保真、可持久的 3D 世界,支持文本/图像/视频/360 全景输入,可交互编辑、扩展合并、导出 2D 与 3D 资产。官网 2026-07 的访谈把这套路线叫”空间智能”;9 月 28 日宣布并入 AMD。
  • NVIDIA Cosmos 3:官方定位是首个原生融合推理、世界生成与动作生成的 omni-model(Mixture-of-Transformers 架构),面向机器人学习与自动驾驶训练;配套 Cosmos Curator(数据策管)、Cosmos Evaluator(评估)和 tokenizer,以及 NIM 微服务与 DGX Cloud。权重按 OpenMDW1.1 许可(Linux Foundation)开放,Hugging Face 上有模型库、GitHub 上有代码和 Cookbook。它自称的 World Action Model,正是上一节几条论文路线在工业界的名字。
  • AgentGarten(2610.12374,2026-10):把”模拟器管规则与状态、神经渲染器管画面”拆开——代码定义物理规则保证一致性,渲染器(从预训练视频模型蒸馏而来,用作者提出的 Adversarial Forcing 优化到实时)负责真实感。好处是新世界可以直接写成代码,于是环境的数量和难度能跟着 agent 一起扩张。

六、现在的真实瓶颈(这节比上面都重要)

  1. 物体保真度上不去。《What 30,000 Hours of Ego-centric Video Does Not Teach》(arXiv:2610.12464)做了个很诚实的实验:用 3 万小时第一视角人类视频训练,把数据量再放大 100 倍后,”agent”本身建模得不错,但物体交互的保真度依然明显偏低、且提升缓慢。结论是世界模型离实际部署还很远。
  2. 动作忠实性:预测得好看不等于听动作的话。DreamTrue 专门处理这个问题——标定不精确、失败样本覆盖不足,都会让模型偏向预测”成功”的结果。
  3. 潜空间里分不清可控与不可控。CausalDreamer(arXiv:2610.12016)指出 Dreamer 4 这类模型的 tokenizer 只有重建目标、没有动作和奖励监督,所以它的潜空间并没有把可控、不可控、与奖励相关这三类信息分开。
  4. 评估本身没有共识:多人世界模型 WorldCast 要保证每个玩家的独立视图和共享环境一致;而”怎么评判一个世界模型好不好”至今没有公认指标,有的工作干脆换个用法——拿它当验证器来用(2610.11942 的思路)。

七、和”递归自我改进”的咬合点

世界模型是 agent 自我改进的环境接口:要自我改进就得大量低成本试错,而”试错的场地”要么是想象出来的(Dreamer 4 就是直接在模型内部做 RL),要么是用模型预测结果来省掉真实实验(RWMs、以及上篇提到的 Memento 3)。

所以这两条线是配套的:一条管”怎么改自己”,一条管”怎么知道改了会怎样”。

参考

  • 1803.10122 — World Models
  • 2402.15391 — Genie: Generative Interactive Environments
  • 2509.24527 — Training Agents Inside of Scalable World Models(Dreamer 4)
  • 2608.07693 — CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting
  • 2610.02515 — IGNITE Tokamak World Model Architecture
  • 2610.06805 — H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
  • 2610.08400 — Atom-JEPA: Joint-Embedding Predictive Architecture for 3D Atomistic Systems
  • 2610.11942 — Right Screen, Wrong Transition: World Models as Verifiers for GUI Agents
  • 2610.12016 — CausalDreamer: Learning Predictive World Models with Latent Disentanglement
  • 2610.12235 — Language Models as AI Research World Models
  • 2610.12285 — PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies
  • 2610.12368 — LiteNWM: Efficient Latent World Models for Onboard Visual Navigation in the Wild
  • 2610.12407 — LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC
  • 2610.12412 — WorldCast: Distributed Multiplayer World Models
  • 2610.12464 — What 30,000 Hours of Ego-centric Video Does Not Teach
  • 2610.12468 — DreamTrue: Action-Faithful Robot World Model with Counterfactual Post-Training
  • 2610.12374 — AgentGarten: Code Worlds for Evolving Agents

文章作者: Halensea
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 Halensea !
 本篇
世界模型(World Models):它是什么、用来干什么、现在到哪一步 世界模型(World Models):它是什么、用来干什么、现在到哪一步
世界模型想让模型学会"如果我这么做,世界接下来会变成什么样"。它是机器人与自动驾驶里最被看重的一块,这篇按四条技术路线梳理它是什么、用在哪,以及现在的真实瓶颈。
2026-10-09
下一篇 
递归自我改进(RSI):这个方向现在到哪一步了 递归自我改进(RSI):这个方向现在到哪一步了
RSI 已经不只是哲学思辨——2025 年出现了能改写自己代码并在基准上涨分的 agent,2026 年 10 月又集中出现了一批"造自改进环境"的流水线和专门测"进化会不会跑偏"的基准。
2026-10-09
  目录