世界模型技术调研报告

面向零基础读者的通用技术综述 更新日期:2026-07-17

5 分钟速读

一句话定义

世界模型是系统内部用来表示环境状态、预测环境如何变化,并可进一步支持行动选择的模型。

这个定义故意不绑定某种网络。世界模型可以预测像素,也可以只预测潜在状态、奖励或价值;可以用 RNN、Transformer、自回归或扩散实现;可以服务规划,也可以只是学习表征。真正需要问的是:它建模什么、如何学习、怎样展开未来、动作是否进入模型、预测最后拿来做什么。

最小闭环

观察 o_t
  ↓
内部状态 z_t:压缩当前观察与历史
  ↓
未来预测:若采取动作 a,会发生什么?
  ↓
行动选择:搜索、优化动作序列,或调用已训练策略
  ↓
真实世界给出新观察 o_{t+1},重新校正内部状态

缺少的接口决定模型能做什么:

预测什么 × 怎么使用:二维定位

先看纵轴“模型预测什么”,再看横轴“预测如何被消费”。同一个方法可以跨格,但不同格的成功标准不同。

预测对象只学习表征/被动预测供外部主体控制或回放直接进入智能体决策
可观察内容(像素/视频)Sora:条件视频生成GameNGen:动作条件可玩模拟DIAMOND:视觉梦境训练策略
生成式潜状态部分自监督动力学Genie:潜动作控制生成PlaNet:在线 CEM;Dreamer:想象 actor-critic
决策充分量(reward/value/policy)通常不以被动展示为目标可作为外部评估器MuZero:MCTS;TD-MPC:短潜模型 + terminal Q
抽象嵌入I-JEPA、V-JEPA原始工作无此接口需另接动作模型和决策器,原论文未证明

这张表比“用 Transformer 还是扩散”更接近选型本质:预测空间决定保留什么信息,下游用途决定什么误差最重要。 RSSM、JEPA、token、自回归和扩散仍值得学习,但属于下一层的状态结构、训练目标或生成方式。

第三条正交轴:时间接口

二维定位还不能区分“怎样在时间上调用预测”。以下边界案例用于压力测试,而不是给方法贴唯一标签。

方法时间接口状态如何承载可支持的下游不能从该接口推出
DreamerV3潜状态逐步递推,自由 imaginationrecurrent state + stochastic latent模型内 actor/value 学习无限长稳定或概率已校准
MuZero只在搜索树边上递归展开value-equivalent latentMCTS 的 reward/value/policy backup可重建观察或忠实模拟物理
TD-MPC每个真实步内做短 horizon rollout任务导向 latent + terminal Q滚动时域连续规划短模型消除了 value 外推误差
Sora一次生成一个时空 latent 片段spacetime patches条件视频续写/编辑通用逐步 step(action) 或规划闭环
V-JEPA固定视频窗口内预测被遮挡表征,不递归解码抽象时空 embedding表征迁移因果自由 rollout
Genie以潜动作逐帧递归生成离散视频 token + 潜动作外部用户逐步控制潜动作等于真实干预变量

框架的“裂缝”应保留:MuZero 的树上抽象展开、Sora 的长段生成和 V-JEPA 的不展开预测都叫“预测”,但其时间语义不相同,不能互换评测标准。

30 秒三步速选

  1. 要不要让模型参与控制? 不要:选表征学习或观察生成;要:继续。
  2. 需要看得见的未来画面吗? 需要:接受 token/像素重建和生成成本;不需要:优先紧凑 latent 或价值等价模型。
  3. 部署能否承担在线搜索? 能:PlaNet、MuZero、TD-MPC 类;不能:Dreamer 类把计算摊销到训练期 actor。

四种“模型语义”

  1. 生成式潜动力学/观察重建模型:压缩观察,在潜空间预测,并可重建观察。代表:World Models、PlaNet、Dreamer。
  2. 决策充分或价值等价模型:不追求还原全部世界,只保留奖励、价值和规划所需信息。代表:MuZero、TD-MPC。
  3. 非生成预测表征模型:预测抽象特征而非像素,主要学习可迁移表示。代表:I-JEPA、V-JEPA。
  4. 生成式观察或轨迹模型:生成视频、下一帧或整段轨迹;动作接口和闭环程度差异很大。代表:Sora、Genie、DIAMOND、Diffuser。

它们不是互斥家族。比如 Dreamer 同时具有生成式潜动力学和决策用途;“扩散”只是生成/推断方式,既可做轨迹规划器,也可做环境转移模型。

最重要的路线差异

你真正关心的问题更匹配的路线核心代价
需要每一步临场搜索和目标修正PlaNet、MuZero、TD-MPC 类在线规划部署计算高,规划器会利用模型误差
部署必须低延迟Dreamer 类模型内 actor-critic模型偏差可能固化进策略/价值
目标固定,只在乎控制回报MuZero、TD-MPC 类决策充分潜状态不保证完整世界知识或换任务复用
主要需要自监督视觉表征I/V-JEPA原始方法不提供动作 rollout 或规划闭环
需要高保真、多模态的未来画面视频扩散/生成式观察模型推理昂贵;画面逼真不等于物理正确
需要外部主体逐步交互Genie、DIAMOND、GameNGen 等动作/潜动作环境模型潜动作未必有真实因果语义,长时稳定有限
数据固定离线且不能再交互MOPO/MOReL 式悲观模型使用不确定性代理可能失效,也可能过度保守

三条不能混淆的结论

简短选型建议


1. 定义、边界与基本原理

1.1 狭义、操作性与广义定义

“世界模型”在不同文献中至少有三层含义。

狭义:模型式强化学习中的环境模型。 模型学习状态和动作如何产生下一状态、奖励或终止信号,再用模拟经验更新价值或规划。Dyna 是经典代表:真实经验和模型生成经验可以共享同一价值更新机制 [1][2]。

操作性:自主系统的内部预测模型。 它不一定重建像素,但应形成可用于预测、干预或决策的内部状态。MuZero 只学习对奖励、策略和价值足够的潜动力学,说明“完整重建观察”不是必要条件 [8]。

广义:认知中的内部世界表征。 Craik 早期提出生物体携带现实的“小尺度模型”,可用来预见结果 [1]。按这个宽定义,无动作的预测表征也可被称为世界模型组件。

本文采用分层口径:讨论广义谱系,但做技术选型时使用操作性问题——

  1. 建模对象是什么?
  2. 输入、内部状态和输出是什么?
  3. 训练信号和数据从哪里来?
  4. 预测是否支持动作干预、rollout 或决策?

1.2 世界模型通常由什么组成

一个较完整系统常含以下模块,但并非每项都必需:

1.3 为什么潜空间预测有效

像素包含纹理、光照和背景等大量信息。直接在像素中长时预测很昂贵,且任务未必需要每个细节。潜空间模型先压缩观察,再预测低维状态,可降低 rollout 和规划成本。

代价是信息瓶颈:重建目标倾向保存视觉细节;奖励/价值目标倾向只保存当前任务所需信息;JEPA 目标主动忽略难以预测的像素细节。没有一种表示对所有用途都“最完整”。[3][8][9][11]

1.4 训练与推理的共同信息流

训练阶段通常从真实轨迹中取观察、动作、奖励和终止信号。模型可能学习:

推理阶段则可能:

训练目标相似并不代表推理误差相同。因果自回归、掩码预测、固定窗口和整段扩散必须分别分析。


2. 主流路线一:生成式潜动力学与观察重建

2.1 World Models:VAE + MDN-RNN + 小控制器

World Models 先用 VAE 把单帧图像编码为随机潜变量 z_t,再由 MDN-RNN 根据历史、潜变量和动作预测下一潜变量分布;控制器读取 z_t 与 RNN 隐状态选择动作 [3]。

训练分三段:图像重建与 KL 训练 VAE;下一潜变量似然训练 MDN-RNN;最后按任务回报优化控制器。模型还可生成“梦境”,让控制器在其中训练。

为什么有效:高维视觉被压缩,时间模型与控制器变轻,真实交互可被模型计算替代。

主要风险:分阶段表示未必保留长期控制细节;模型递归误差会改变后续输入;控制器还可能主动发现并利用梦境漏洞。论文专门讨论了“cheating the world model” [3, §4.2]。

2.2 PlaNet:RSSM belief + 在线 CEM

PlaNet 的 RSSM 同时包含确定性递归状态和随机潜状态。看到真实图像时,posterior 将观察注入 belief;预测候选未来时只能沿 dynamics prior 展开。训练目标包含观察似然、奖励似然以及 posterior 与 prior 的 KL,并用 latent overshooting 加强多步一致性 [4, Fig.2, §2.2]。

部署时,CEM 反复采样动作序列,在潜空间 rollout 并累加预测奖励,保留高分样本更新动作分布;只执行第一步,收到新观察后重新规划 [4, §2.4]。

优点:真实观察可每步纠偏;潜空间规划比像素规划便宜。

缺点:每步都要运行“候选数 × horizon × CEM 迭代”次模型;CEM 会主动选择奖励预测过高的序列。

2.3 Dreamer:在 RSSM 想象中训练 actor-critic

Dreamer 原始架构图:从经验数据学习潜在动力学,并在潜在想象中学习价值与动作
Dreamer 原始架构图:从经验数据学习潜在动力学,并在潜在想象中学习价值与动作

原图信息:Hafner et al., Dream to Control: Learning Behaviors by Latent ImaginationFigure 1;来源:arXiv:1912.01603 官方 PDF,第 1 页。上图为官方 PDF 原图的高分辨率裁切,保留原始图注,未重绘或改写图内内容。

逐模块解读

  1. Dataset of Experience:真实环境轨迹提供图像、动作与奖励,构成世界模型和行为学习的数据源。
  2. Learned Latent Dynamics:观察被编码为潜状态;潜动力学依据状态与动作展开未来,并预测与控制相关的量。看到真实观察时可校正状态,纯想象阶段则沿 learned prior 前进。
  3. Value and Action Learned by Latent Imagination:actor 和 value 不必反复访问真实环境,而是在模型生成的潜在轨迹上学习;价值估计把 imagination horizon 之外的远期收益带回当前更新。
  4. 训练—推理关系:训练期同时学习世界模型与 imagined actor-critic;部署期真实观察更新 belief,actor 直接给动作。图中从数据到 latent dynamics、再到 value/action 的方向,正是 Dreamer 把模型计算摊销到策略参数的关键。

Dreamer 与 PlaNet 使用相近的潜动力学,但不在部署时运行 CEM。它从 replay 中的 posterior 状态出发,让 actor 与 prior 生成想象轨迹;reward 和 value 构成 λ-return,再更新 actor 与 value [5, Fig.2, Eq.(1)–(6)]。

部署时,新观察更新 belief,actor 一次前向给出动作。

核心差异:PlaNet 把大量计算放在部署期搜索;Dreamer 把未来计算摊销到训练期策略参数。后者部署快,但模型偏差可能被固化进 actor/value。

DreamerV3 延续这一思路,并用归一化、symlog/two-hot 等稳健化设计跨域训练;这证明统一配置在作者所测任务上具有广泛适用性,不等于所有环境或预算下普遍最优 [6]。

3. 主流路线二:决策充分或价值等价潜模型

3.1 MuZero:不重建世界,只预测规划需要的量

MuZero 用 representation 将真实历史映射为潜状态,recurrent dynamics 接收潜状态与动作,产生下一潜状态和奖励;prediction head 输出 policy 与 value。MCTS 在这个潜空间中搜索 [8, Fig.1]。

训练信号来自真实奖励、搜索改进后的策略和回报/价值目标,而不是图像重建。因此潜状态只需对当前任务的决策足够。

为什么有效:容量聚焦于奖励、价值和动作排序,不必准确生成棋盘纹理或 Atari 像素。

边界:高控制成绩不能证明潜状态包含完整物理、对象或观察细节。换奖励、做观察查询或迁移新任务时,原任务充分状态可能丢失所需信息。

3.2 TD-MPC/TD-MPC2:短模型、长价值

TD-MPC 将观察编码为潜状态,以确定性 latent dynamics 预测短期状态,用 reward head 评估视野内收益,并以 Q 值在 horizon 末端补上更远回报 [9, Fig.2, §3–4]:

候选回报 ≈ H 步预测奖励之和 + H 步后的 terminal Q

训练含 reward、TD-Q 和 latent consistency:预测下一潜状态要对齐下一真实观察的 target-encoder 表示。部署时使用 MPPI/CEM 类连续轨迹优化,只执行首动作并重新规划。

TD-MPC2 加入 SimNorm、稳健的 reward/value 分布式回归、多 Q heads 和多任务条件化,提高作者所测连续控制任务中的稳定性 [10]。论文报告的 104-task 评估和约 317M 参数模型联合训练 80 个任务是不同实验,不能合并为“一个模型完成 104 个任务”,也不等于未知任务零样本泛化。

核心权衡:短 horizon 减少动力学复合误差,却把长时预测负担转给 bootstrapped Q;在线规划仍可能利用错误 reward、dynamics 或 Q。

3.3 与生成式潜模型的关系

维度PlaNetDreamerMuZeroTD-MPC
状态随机 RSSM belief随机 RSSM belief决策充分潜状态任务导向短潜状态
观察重建
训练信号观察/奖励/KL观察/奖励/KL + imagined returnreward/value/policyreward/Q/consistency
动作选择CEMactorMCTS连续 MPC
长时处理horizon 内奖励value/λ-return叶 valueterminal Q
部署计算
主要风险搜索利用模型误差偏差固化进 actor任务充分而非世界完整bootstrap 与规划双重利用

这张表不是绝对性能排名。不同论文的环境、预算、action repeat、评测 episode、代码库和硬件不统一,绝对分数不可横比。


4. 主流路线三:非生成预测表征(JEPA)

4.1 I-JEPA:预测被遮挡区域的抽象表征

I-JEPA 包含 context encoder、由 EMA 更新且停止梯度的 target encoder,以及 predictor。Context 分支只看未遮挡区域,predictor 结合位置 token 预测目标区域的 latent representation,以特征距离训练,而不是恢复 RGB [11, Fig.2, Eq.(1)]。

为什么有效:损失不要求复原纹理和像素相位等难预测细节,促使模型保留跨区域可预测的对象与语义结构;EMA target 提供缓慢变化的训练目标。

边界:I-JEPA 没有时间轴、动作、递归 rollout 或 planner。它是世界表征学习组件,不是完整动力学世界模型。

4.2 V-JEPA:视频窗口中的时空特征预测

V-JEPA 将同一思想扩展到固定长度视频 clip:context encoder 看未遮挡时空 tubelets,predictor 恢复被遮挡位置的 target features [12, Fig.1, Eq.(1)]。

大范围结构化 mask 限制局部复制捷径,迫使模型利用运动与场景结构。但其目标并不要求只从过去预测未来,也不把输出递归反馈。原论文没有真实动作接口、反事实干预或规划闭环。

引用纠错:V-JEPA 的正确编号是 arXiv:2404.084712402.08446 与该工作无关。

4.3 JEPA 与世界模型的边界

能力I-JEPAV-JEPA动作世界模型通常需要
latent 预测可选但常有用
时间信息固定窗口内有因果状态更新
动作条件控制任务需要
自由多步 rollout未训练/未验证规划通常需要
多模态未来分布无显式机制无显式机制随机潜变量、token 或生成分布等
决策闭环操作性定义要求

JEPA 是表示与训练目标原则,不是“完整世界模型”的同义词。LeCun 的自主智能架构愿景还包含动作候选、世界状态预测和成本评估;不能把 I/V-JEPA 已展示的表征实验当作整套架构已实现 [13]。


5. 主流路线四:离散 token 自回归环境模型

5.1 基本机制

这类方法先用 tokenizer 将视频帧压成离散 token,再用序列模型根据历史 token 与动作预测下一 token/帧,并可同时预测奖励与终止。它把视觉环境转换为类似语言建模的离散序列问题。

优点:可复用成熟的 Transformer 与离散似然训练;可生成可观看的未来。

代价:tokenizer 可能丢失小而关键的视觉细节;长序列计算昂贵;自由运行时预测成为后续输入,分布可能逐步偏移。

5.2 IRIS 与游戏环境模拟

IRIS 使用离散图像 token 与 Transformer 学习 Atari 环境,在模型生成轨迹中训练 agent [14]。它证明 token 环境模型能直接服务控制,但证据来自特定游戏和交互预算,不应外推为通用物理模拟。

GameNGen 展示单游戏动作条件的实时神经模拟器 [20]。其窄域交互能力与开放世界通用性是不同问题。

5.3 Genie:从无动作标签视频发现潜动作

Genie 由时空视频 tokenizer、latent action model(LAM)和自回归 dynamics 组成 [15]。LAM 从相邻帧变化中提取低带宽离散代码,dynamics 再以这些潜动作条件预测后续视频 token。推理时,用户反复选择潜动作 ID,模型生成下一帧。

为什么有效:互联网视频没有按键标签,LAM 让模型从帧间变化中发现可用于控制生成的代码。

关键边界:潜动作具有预测力,不保证恢复真实干预变量;它可能混合角色动作、镜头、碰撞结果或动画阶段。Genie 是可控生成环境,但没有奖励、策略或 planner,不能被描述为自主决策者。

Google DeepMind 对 Genie 2 的官方博客展示更复杂的可交互 3D 样例 [21],但完整架构、数据、损失、动作编码和标准失败率未公开,因此只作为官方演示级证据。


6. 主流路线五:扩散式观察、环境与轨迹模型

“扩散式世界模型”不是一条统一路线。必须说明:扩散的随机变量是什么、动作在哪里、单次生成多长、闭环发生在哪里。

6.1 Diffuser:扩散即轨迹规划器

Diffuser 在离线状态—动作轨迹分布上训练去噪模型;规划时从噪声反向生成满足回报或约束的整段轨迹,再执行动作 [16, §3, Algorithm 1]。

它主要是条件轨迹分布上的推断式规划器,不是标准的单步 z,a→z' 环境转移核。将其称作世界模型采用的是宽定义:“对未来轨迹建模并用于行动”。

6.2 Diffusion Forcing:扩散作为序列训练/解码范式

Diffusion Forcing 让序列中不同 token 处于不同噪声水平,结合因果依赖与去噪训练,可支持多种历史/未来条件组合 [17]。它是一种序列建模范式,不自动规定状态表示、动作接口或决策器。

6.3 DIAMOND:扩散作为动作条件视觉转移模型

DIAMOND 使用扩散模型生成动作条件的下一视觉帧,并预测奖励与终止;策略在生成梦境中训练 [18]。与 Diffuser 不同,扩散位于环境的逐步转移位置。

其 Atari 分析还表明,视觉重建可能保存小而决策关键的细节;这构成“决策模型永远不需要像素”的反例。代价是高保真去噪比紧凑 latent rollout 更昂贵。

6.4 Sora:时空 latent 扩散的观察生成模型

OpenAI 官方技术页面披露:视频先压入低维 latent,再切分为 spacetime patches;diffusion transformer 从带噪 patches 和文本/视觉条件预测干净 patches [19]。

Sora 支持不同时长、分辨率和宽高比的条件视频生成。官方也展示三维一致性、对象持续等现象,并明确列出物理交互、对象状态和长视频一致性失败。

公开主机制没有通用的逐步 step(action)、reward、reset 或 planner 接口。Minecraft basic-policy 样例缺少训练与评测细节,不能据此认定 Sora 是通用动作世界模型。

引用纠错:arXiv:2402.17177 是第三方 Sora 综述,不是 OpenAI 原始技术报告;本报告仅引用 OpenAI 官方页面 [19] 支持披露机制。

7. 决策接口:模型究竟如何改变动作

7.0 生成、可交互与用于决策是三种成功标准

所以“可玩”不等于“模型已帮助 agent 学会玩”。GameNGen 证明窄域动作条件模拟可供主体交互 [20];MuZero 反过来不生成可观看观察,却能通过 reward/value/policy 充分量服务搜索 [7]。两者的成功判据正交,不能按画面质量或游戏分数放在同一排名中。

7.1 三种决策语义与误差责任

这里是面向选型的汇总,不是新的互斥分类;Dreamer 同时含观察预测和决策训练,TD-MPC 同时含短模型与价值函数。

决策语义模型需要保留什么代表方法错误如何表现下游如何放大主要纠偏
Observation-predictive观察或可解码潜状态的条件分布,并可选 reward/continuationWorld Models、Dreamer、DIAMOND;Sora 仅属观察生成而无决策接口画面/潜状态漂移、对象状态错误、reward/continuation 偏差递归 rollout;actor 可利用想象中的乐观错误真实 posterior 重置、KL/多步目标、短 imagination、真实数据迭代
Value-equivalent足以预测 reward、value、policy 并支持搜索的统计量MuZero不是画面变糊,而是动作排序、回报或叶价值偏离真实结果MCTS 反复选择和备份高估分支真实结果/replay 刷新、搜索与价值目标更新
Control-oriented latent短期动作响应、reward 与 terminal value 所需状态TD-MPC;PlaNet 属于更生成式的在线规划近邻短 rollout 漂移、reward 偏差或 OOD 叶节点 Q 误差优化器主动寻找高估动作序列;terminal value 承担远期误差短 horizon、每步重规划、Q/模型 ensemble 与保守评分

观察生成模型只有在预测被 planner、policy learning 或控制器消费并产生相应任务证据时,才升级为“用于决策的世界模型”。Sora 的公开主机制不满足这一接口;Dreamer、MuZero 和 TD-MPC 则以三种不同方式满足。

比较决策型世界模型时,统一问五个问题:视野内奖励由谁给?叶节点由谁估值?动作由谁提出?每个真实动作前调用模型多少次?新观察能否纠偏?

方法视野内奖励terminal value动作选择计算位置新观察纠偏
Dyna模型生成转移供 TD backup价值函数本身由更新后的策略训练/交互期通过真实经验持续更新
PlaNetreward head 累加原始方法主要靠 horizon 内奖励CEM部署期大量 rollout每步 posterior + 重规划
Dreamerimagined rewardvalue 构造 λ-returnactor训练期大量想象;部署轻posterior 更新,但不在线搜索
MuZero树边 rewardleaf valuepolicy prior + MCTS训练与部署每个真实决策重建/扩展树
TD-MPC短 horizon rewardQ(z_H,π(z_H))policy prior + 连续 MPC训练与部署每步编码观察并重规划
Diffuser轨迹条件/回报 guidance通常无独立 terminal value反向扩散生成轨迹部署期多步采样滚动时域实例可重新条件化

7.2 规划视野为什么不是越长越好

长 horizon 少依赖 terminal value,却积累更多 dynamics/reward 误差并增加搜索成本;短 horizon 降低模型复合误差,却依赖 value 对叶状态的外推。每步重规划能用真实观察截断跨步漂移,但不能撤销已执行动作,也不能修复单次视野内的模型漏洞 [9][23]。

所以 PlaNet、Dreamer、MuZero、TD-MPC 的差异,不只是“谁预测更准”,而是谁承担未来:动力学、价值函数、搜索预算还是策略参数。


8. 不确定性、多模态未来与长时误差

8.1 多模态未来

同一当前状态可能对应多个合理未来。确定性 MSE 回归常趋向条件均值;在像素空间中,这可能表现为模糊,在任务潜空间中则可能把不同未来压成一个决策不充分的状态。

这些随机性机制不能互换,也不能仅凭“可采样”推出校准。

8.2 四类序列机制的误差不能共用一套叙事

机制训练—推理差异长时主要风险典型缓解不应误写为
因果自回归训练可能用真实历史,部署用模型历史模型输出改变后续输入分布learner-state 数据、纠错训练、截短 rollout所有生成模型都有同一种 exposure bias
潜动力学 imagination真实序列用 posterior,未来只能走 priorprior/posterior gap、奖励/价值与策略反馈KL/overshooting、短 rollout、真实状态重启、重规划随机 latent 自动保证长时正确
掩码/迭代预测训练 corruption 与部署填充轨迹可能不同填充顺序和错误 token 影响后续条件对齐 corruption/解码流程、重遮罩标准 teacher forcing
整段扩散训练噪声层级与反向求解轨迹denoiser/score 近似、离散求解、条件 guidance 偏差更佳训练覆盖与求解器;任务特定约束真实前缀与模型前缀失配

Teacher forcing 只描述因果自回归训练使用真实历史的情形。Scheduled Sampling 混合真实和生成前缀,但生成前缀偏离后通常仍沿用原序列标签;它不等于 DAgger 在学习者状态上重新查询专家,并存在统计一致性争议 [27][28][29]。

“一步误差影响下一步输入”是重要机制,但线性、二次或指数增长都不是普遍定律。误差可收缩、相消、饱和,也可能在敏感闭环中迅速放大。DAgger 的常见 O(T²ε) 是特定最坏情况任务代价界;MBPO 中随 rollout 长度出现的模型偏差项也是保守界的一部分,不能当作实际预测误差定律 [23][27]。

8.3 误差如何被下游用途放大或吸收

“预测误差”不是一个可跨路线直接相加的标量。下游只会放大与其成功标准相关的误差,也可能完全忽略另一些误差。

下游用途最致命的误差如何放大哪些误差可被吸收主要缓解
观察/视频生成对象身份、遮挡后状态、跨帧几何与长时一致性递归或长窗口生成让结构矛盾暴露与感知无关的小 latent 坐标变化结构数据、长时评测、多模态生成
外部可控模拟动作响应错误、输入延迟、终止/碰撞错误用户反复操作进入训练外状态不影响可玩性的纹理偏差动作分叉测试、每步重条件化、支持集审计
Dreamer 类 imagined actorreward/continuation 与策略会利用的 latent 转移错误actor/value 在大量想象轨迹上固化偏差不影响奖励的像素细节posterior 校正、短 imagination、真实数据迭代
PlaNet/TD-MPC 在线规划候选动作排序、reward 与 terminal value 的正向误差优化器主动寻找预测最高但错误的序列每个真实步之后的部分状态漂移可被重规划截断短 horizon、悲观评分、每步重规划
MuZero 搜索reward、policy prior、leaf value 的排序误差MCTS 多次备份会集中到高估分支像素级重建误差完全不在目标内搜索校准、价值/策略目标、真实结果更新
JEPA 表征丢失下游任务所需语义或运动线索下游 probe 无法恢复未编码信息不可预测纹理与像素相位可主动忽略mask 设计、多任务迁移评测、辅助目标

这也是为什么 MuZero 不生成像素不是缺陷,而 Sora 的像素/结构错误却直接影响其核心成功标准;同一个“像素误差”在两条路线中的权重可以为零或很高。

8.4 Ensemble 与概率校准

MOPO 用不确定性惩罚降低离线策略对模型漏洞的利用;MOReL 将被判为 unknown 的状态—动作送入带负回报的吸收态 [24][25]。理论解释依赖合格误差上界或可靠 unknown detector,但实际神经 ensemble 只是启发式代理。

高 disagreement 是值得怀疑的信号;低 disagreement 不是正确性证书。所有成员可能因共享数据、架构和优化偏置而在 OOD 区域一致出错。

可信概率预测至少需要可靠性/覆盖率与尖锐度共同评估,并使用 NLL、Brier、CRPS 等适当评分;ID 校准不保证 OOD 校准 [35]。


9. 失败模式:世界模型为什么会“想错”

失败模式信息流中的原因常见缓解仍未解决的问题
长 rollout 漂移预测成为下一输入,状态偏移再改变动作短 rollout、真实状态重启、自纠错训练远期稀疏后果、随机环境配对
规划器/策略利用模型优化器主动选择正向误差悲观惩罚、unknown gate、随机化共同偏差和低估不确定性
离线 OOD 动作行为数据未覆盖新策略访问区域MOPO 软惩罚、MOReL 硬约束真正最优轨迹在支持集外时只能保守
视觉细节丢失压缩或任务目标忽略小物体高保真生成、辅助目标训练与采样成本升高
任务导向表示过拟合只保留当前 reward/value 所需信息多任务、自监督或重建目标新任务需求无法预知
Bootstrap 偏差短视野把远期交给 critic/valuetarget network、Q ensemble、重规划OOD 叶节点过估计
不确定性误用aleatoric/epistemic 混淆,ensemble 共同偏差多信号支持检测、分层校准无通用认证保证
实时成本搜索、整轨迹扩散或逐帧去噪调用多次模型latent、短 horizon、actor 摊销高精度与低延迟难兼得

Talvitie 的 self-correcting models 表明误差并非只能单调累积:在模型自己诱导的状态上训练,有时可以学会返回真实轨迹附近 [22]。但这类保证依赖确定性或可配对轨迹等条件,不能直接推广到任意随机 POMDP。


10. 观察生成、环境模型与可信模拟器

10.1 三个证据等级

  1. 观察分布生成:能产生合理观察;不自动支持动作干预。
  2. 动作条件环境模型:给定动作可逐步预测;不自动具备 OOD 可靠性或校准。
  3. 独立验证的可信模拟器:在声明范围内通过状态充分、闭环、长时、OOD 和概率校准审计。

10.2 视觉结构基准的正确解读

基准/评测实际测量明确没有测量或不能推出
Physion受控合成场景中,指定对象未来是否接触 [31]完整轨迹与状态变量、真实长尾对象、复杂关系与可供性、跨域纹理/光照、开放世界物理
IntPhys受控视频是否违反对象持久、形状恒常和时空连续 [32]从前缀预测未来、动作干预、真实场景关系/可供性、跨视角三维重建
TAP-Vid二维点位置与遮挡状态,含真实/合成视频 [33]对象语义与身份、度量三维几何、动作因果、完整场景动力学
DreamerV3 等控制基准在指定环境、协议和预算下的 return/score 与任务覆盖 [6]完整观察模拟、通用物理、未见真实域迁移、跨 codebase 的绝对优越性

这些基准提供的是局部能力证据,不是“理解世界”的总分。尤其缺少统一、系统覆盖真实长尾对象、长期遮挡后身份、多视角一致性、关系与可供性以及跨域泛化的评测;公开材料未测到的格子应保留为未知,而不是用相邻 benchmark 补齐。

因此,通过某个视觉 benchmark 只能支持它实际测到的结构能力。

10.3 五项可信度审计

维度最低应看什么不能从通过中推出什么
状态充分性加入历史是否仍改善预测;残差是否与过去相关因果变量、可解释性或新任务充分
闭环交互多初态/动作扰动下的回报、失败率和恢复所有策略与控制频率都稳定
长时误差无中间真值注入的 horizon 曲线和灾难尾部测到 H 步稳定即可无限外推
OOD 干预近/远/组合干预下的退化与拒绝能力有限干预覆盖开放世界
不确定性校准按时域/场景/OOD 分层的可靠性、proper score 和尖锐度校准等于准确,或 ID 校准推广 OOD

守恒律只在有明确物理量的领域作为约束;游戏、社会环境或开放视觉可标“不适用/未知”,不是通用定义门槛。

11. 路线横向对比

路线原型预测对象与表示数据/训练信号推理与闭环优点局限与成本典型适用场景
潜动力学 + 在线规划z,a→z',r;可含 belief轨迹、动作、奖励;可重建观察CEM/MCTS/MPC 每步搜索临场目标修正、动作反事实明确部署计算高,搜索利用误差可承担规划的控制
潜动力学 + imagined actor模型生成潜转移观察/奖励/KL + actor/value训练期想象,部署 actor样本复用高、部署低延迟偏差固化进策略,模型变化需继续训练高频控制、部署预算紧
决策充分/价值等价reward/value/policy 相关 latent任务回报、价值、策略、consistencyMCTS 或短 MPC不浪费容量还原无关细节换任务或观察查询能力弱目标固定、回报优先
JEPA 预测表征context→目标 latentmask + EMA target 特征回归通常保留 encoder语义高效,避免难预测细节无原生动作、自由 rollout、规划自监督预训练、感知前端
离散 token 环境历史 token+动作→未来 tokentokenizer 重建 + token likelihood逐步生成环境/训练 agent可观看、序列模型成熟token 丢细节,长序列昂贵游戏、交互视频模拟
扩散观察/环境/轨迹噪声→视频帧或整段轨迹去噪,可加文本/动作/回报条件视频生成、逐帧环境或轨迹规划多模态、视觉锐利、约束灵活多步采样贵;闭环位置因方法而异多未来、视觉模拟、离线规划

11.1 数据依赖

11.2 复现难度

相对难度常见路线主要障碍
低到中小型状态空间模型、JEPA 表征基线数据预处理、mask 与下游协议
PlaNet/Dreamer/TD-MPCreplay、稳定训练、规划/价值超参数、环境协议
MuZero、token 视频环境模型搜索系统、大规模交互、tokenizer 与序列长度
很高大规模视频扩散/通用环境生成数据治理、训练算力、长视频、采样延迟、未公开细节

这是机制层相对判断,不是统一硬件基准。

11.3 端到端系统成本的主导项

“主导/显著/较低”是机制级定性判断,不是跨论文测得的统一数值;实际结果取决于分辨率、horizon、模型规模、硬件、缓存和并行实现。

路线数据管线与标注训练计算部署 rollout / 推理延迟Checkpoint 与迭代成本常被低估的系统瓶颈
Dreamer / 潜动力学 actor显著:需同步观察、动作、奖励、终止与 replay显著:模型、actor、value 联合迭代较低:部署通常一次 actor 前向;状态更新持续发生中等:多模块状态与 replay 影响重启/复现实验环境采集吞吐、replay I/O、actor-learner 同步
PlaNet / TD-MPC 在线规划显著:动作与奖励时序对齐显著主导:每个真实动作前执行候选数×horizon×迭代的模型调用中等实时延迟尾部、批量候选规划的内存和调度
MuZero / 树搜索显著:自博弈或交互轨迹、搜索目标与 replay主导:表示/动力学/预测网络加大规模搜索主导:每步多次树节点展开显著:网络与搜索配置耦合,actor/replay 版本一致性重要搜索服务吞吐、replay 新鲜度、分布式 actor 同步
JEPA 表征预训练显著:大规模视频解码、采样、mask;通常不需动作/奖励标注主导:高吞吐 encoder 预训练较低:下游通常只保留 encoder;原方法无 rollout显著:大 encoder、EMA target 与下游多次适配视频解码、随机访问、数据增强和 host→device 供给
Token 自回归环境主导:视频切片、tokenizer 训练/离线编码、动作对齐主导:长 token 序列主导:逐 token/帧生成,延迟随 horizon 累积显著:tokenizer 与 dynamics 两套版本需一致token 缓存、序列长度、KV cache/采样调度
视频扩散 / 生成模拟主导:视频清洗、切片、时空桶化、条件/动作对齐主导:高维时空去噪训练主导:多步去噪×帧/片段;闭环逐步调用更贵主导:大 checkpoint、优化器状态、恢复与验证周期数据治理、checkpoint I/O、采样服务与长视频显存

选型时应同时预算“每个真实动作前模型调用多少次”和“数据每秒能否持续喂满训练”。参数量或单次 FLOPs 无法替代这两个端到端指标。


12. 按任务形状选型

12.1 决策树

  1. 最终目标只是学习可迁移视觉表征吗?
  1. 必须生成可观看、可编辑的未来观察吗?
  1. 任务目标固定,主要追求控制回报吗?
  1. 部署能承担每步搜索吗?
  1. 环境部分可观测或未来高度随机吗?
  1. 数据是否固定离线?
  1. horizon 很长吗?
  1. 硬件和延迟严格吗?

12.2 典型场景建议

任务形状优先考虑为什么特别警惕
可观测、连续控制、可在线交互TD-MPC/PlaNet/Dreamer动作条件明确、样本复用高在线规划延迟或 actor 偏差
离散动作、搜索收益大MuZero 类policy/value 引导树搜索搜索成本与任务充分表示
部分可观测RSSM/belief 型潜动力学posterior 融合历史观察belief 校准和长时 prior 漂移
被动视频预训练V-JEPA、视频生成无需动作标签不能直接声称干预/规划
无动作标签但需交互原型Genie 式潜动作从视频发现控制代码潜动作不可辨识、语义漂移
视觉小细节决定行为DIAMOND/token/高保真观察模型保存可见细节采样与训练成本
固定离线控制数据MOPO/MOReL + 短 rollout限制策略利用 OOD 模型ensemble 低分歧仍可能错
科学/安全模拟领域模型 + 独立验证必须测试约束、残差、干预和校准通用视频模型不能替代认证

13. 证据边界与尚未解决的问题

13.1 高风险术语的使用口径

为避免把行为证据升级成机制结论,本文统一采用以下口径:

- 因果:仅在否定越级推断、说明术语边界,或明确指“因果自回归”的时间因子化时使用。仅有 `p(o_{t+1}o_t,a_t)` 条件预测时称“动作条件动力学”,不称已识别因果机制。

已有较强证据

仍不能普遍声称

图示说明

本报告嵌入 Dreamer Figure 1,因为该图可从官方 arXiv PDF 可靠、清晰获取,并直接解释“经验数据 → 潜在动力学 → 在想象中学习价值与动作”的核心闭环;正文已标明论文、图号、官方来源并逐模块解释。其他论文图未逐张完成同等清晰度与来源核验,因此不为凑数量而加入低清截图,也不自动重绘后冒充论文原图。


14. 结论

世界模型不是某一种神经网络,而是一套“内部状态—未来预测—行动用途”的设计空间。四个最有用的判断轴是:

  1. 预测什么:像素、潜状态、token、奖励/价值还是抽象表征;
  2. 如何展开未来:递归、自回归、固定窗口、搜索或扩散;
  3. 动作与不确定性如何进入:无动作、潜动作、真实动作;确定性、随机 latent、token 分布或生成分布;
  4. 预测拿来做什么:表示迁移、观察生成、可控模拟、在线规划或策略学习。

对控制任务,最重要的路线分叉往往不是网络骨干,而是模型进入决策的位置:PlaNet 在部署期搜索,Dreamer 在训练期想象,MuZero 用价值等价潜状态搜索,TD-MPC 用短模型加 terminal Q。对视觉生成任务,逼真度和多模态能力更重要,但不能替代动作干预和闭环证据。对科学或安全用途,则必须把状态充分、长时误差、OOD 干预和概率校准作为独立验收项。

因此,最稳妥的选型原则是:从任务查询和闭环需求出发,再选择表示、生成方式与决策接口;不要从流行架构名称倒推能力。


参考文献

  1. Craik, The Nature of Explanation, 1943;世界内部模型历史来源。
  2. Sutton, “Integrated Architectures for Learning, Planning, and Reacting Based on Approximating Dynamic Programming,” 1990;Sutton & Barto, Reinforcement Learning, Ch.8(Dyna)。
  3. Ha & Schmidhuber, “World Models,” arXiv:1803.10122. https://arxiv.org/abs/1803.10122
  4. Hafner et al., “Learning Latent Dynamics for Planning from Pixels” (PlaNet), arXiv:1811.04551. https://arxiv.org/abs/1811.04551
  5. Hafner et al., “Dream to Control” (Dreamer), arXiv:1912.01603. https://arxiv.org/abs/1912.01603
  6. Hafner et al., “Mastering Diverse Domains through World Models” (DreamerV3), arXiv:2301.04104. https://arxiv.org/abs/2301.04104
  7. Schrittwieser et al., “Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model,” Nature 2020, arXiv:1911.08265. https://arxiv.org/abs/1911.08265
  8. 同 [7],MuZero 的 representation/dynamics/prediction 与 MCTS。
  9. Hansen et al., “Temporal Difference Learning for Model Predictive Control,” arXiv:2203.04955. https://arxiv.org/abs/2203.04955
  10. Hansen et al., “TD-MPC2: Scalable, Robust World Models for Continuous Control,” arXiv:2310.16828. https://arxiv.org/abs/2310.16828
  11. Assran et al., “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture,” arXiv:2301.08243. https://arxiv.org/abs/2301.08243
  12. Bardes et al., “Revisiting Feature Prediction for Learning Visual Representations from Video,” arXiv:2404.08471. https://arxiv.org/abs/2404.08471
  13. LeCun, “A Path Towards Autonomous Machine Intelligence,” OpenReview, 2022. https://openreview.net/forum?id=BZ5a1r-kVsf
  14. Micheli et al., “Transformers are Sample-Efficient World Models” (IRIS), arXiv:2209.00588. https://arxiv.org/abs/2209.00588
  15. Bruce et al., “Genie: Generative Interactive Environments,” arXiv:2402.15391. https://arxiv.org/abs/2402.15391
  16. Janner et al., “Planning with Diffusion for Flexible Behavior Synthesis” (Diffuser), arXiv:2205.09991. https://arxiv.org/abs/2205.09991
  17. Chen et al., “Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion,” arXiv:2407.01392. https://arxiv.org/abs/2407.01392
  18. Alonso et al., “Diffusion for World Modeling: Visual Details Matter in Atari” (DIAMOND), arXiv:2405.12399. https://arxiv.org/abs/2405.12399
  19. OpenAI, “Video generation models as world simulators,” 2024. https://openai.com/index/video-generation-models-as-world-simulators/
  20. Valevski et al., “Diffusion Models Are Real-Time Game Engines” (GameNGen), arXiv:2408.14837. https://arxiv.org/abs/2408.14837
  21. Google DeepMind, “Genie 2: A large-scale foundation world model,” 2024. https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model/
  22. Talvitie, “Self-Correcting Models for Model-Based Reinforcement Learning,” arXiv:1612.06018. https://arxiv.org/abs/1612.06018
  23. Janner et al., “When to Trust Your Model: Model-Based Policy Optimization,” arXiv:1906.08253. https://arxiv.org/abs/1906.08253
  24. Yu et al., “MOPO: Model-based Offline Policy Optimization,” arXiv:2005.13239. https://arxiv.org/abs/2005.13239
  25. Kidambi et al., “MOReL: Model-Based Offline Reinforcement Learning,” arXiv:2005.05951. https://arxiv.org/abs/2005.05951
  26. Talvitie, “Model Regularization for Stable Sample Rollouts,” UAI 2014. 注意:该文不是 arXiv:1406.3649。
  27. Ross et al., “A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning” (DAgger), arXiv:1011.0686. https://arxiv.org/abs/1011.0686
  28. Bengio et al., “Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks,” arXiv:1506.03099. https://arxiv.org/abs/1506.03099
  29. Huszár, “How (not) to Train your Generative Model: Scheduled Sampling, Likelihood, Adversary?” arXiv:1511.05101. https://arxiv.org/abs/1511.05101
  30. Ljung, System Identification: Theory for the User, 2nd ed., 1999,Ch.3/9/12。
  31. Bear et al., “Physion: Evaluating Physical Prediction from Vision in Humans and Machines,” arXiv:2106.08261. https://arxiv.org/abs/2106.08261
  32. Riochet et al., “IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning,” arXiv:1803.07616. https://arxiv.org/abs/1803.07616
  33. Doersch et al., “TAP-Vid: A Benchmark for Tracking Any Point in a Video,” arXiv:2211.03726. https://arxiv.org/abs/2211.03726
  34. Gneiting & Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation,” JASA 2007. https://doi.org/10.1198/016214506000001437
  35. 同 [34],用于校准、尖锐度与 proper scoring 的证据边界。

阅读提示