世界模型技术调研报告
面向零基础读者的通用技术综述 更新日期:2026-07-17
5 分钟速读
一句话定义
世界模型是系统内部用来表示环境状态、预测环境如何变化,并可进一步支持行动选择的模型。
这个定义故意不绑定某种网络。世界模型可以预测像素,也可以只预测潜在状态、奖励或价值;可以用 RNN、Transformer、自回归或扩散实现;可以服务规划,也可以只是学习表征。真正需要问的是:它建模什么、如何学习、怎样展开未来、动作是否进入模型、预测最后拿来做什么。
最小闭环
观察 o_t
↓
内部状态 z_t:压缩当前观察与历史
↓
未来预测:若采取动作 a,会发生什么?
↓
行动选择:搜索、优化动作序列,或调用已训练策略
↓
真实世界给出新观察 o_{t+1},重新校正内部状态缺少的接口决定模型能做什么:
- 只有内部状态:更像表征学习模型;
- 能预测未来但没有动作:可做观察预测,不能比较干预;
- 有动作条件但不选择动作:是可控环境模型,可供外部主体使用;
- 预测实际进入搜索、策略训练或控制:形成决策型世界模型闭环。
预测什么 × 怎么使用:二维定位
先看纵轴“模型预测什么”,再看横轴“预测如何被消费”。同一个方法可以跨格,但不同格的成功标准不同。
| 预测对象 | 只学习表征/被动预测 | 供外部主体控制或回放 | 直接进入智能体决策 |
|---|---|---|---|
| 可观察内容(像素/视频) | Sora:条件视频生成 | GameNGen:动作条件可玩模拟 | DIAMOND:视觉梦境训练策略 |
| 生成式潜状态 | 部分自监督动力学 | Genie:潜动作控制生成 | PlaNet:在线 CEM;Dreamer:想象 actor-critic |
| 决策充分量(reward/value/policy) | 通常不以被动展示为目标 | 可作为外部评估器 | MuZero:MCTS;TD-MPC:短潜模型 + terminal Q |
| 抽象嵌入 | I-JEPA、V-JEPA | 原始工作无此接口 | 需另接动作模型和决策器,原论文未证明 |
这张表比“用 Transformer 还是扩散”更接近选型本质:预测空间决定保留什么信息,下游用途决定什么误差最重要。 RSSM、JEPA、token、自回归和扩散仍值得学习,但属于下一层的状态结构、训练目标或生成方式。
第三条正交轴:时间接口
二维定位还不能区分“怎样在时间上调用预测”。以下边界案例用于压力测试,而不是给方法贴唯一标签。
| 方法 | 时间接口 | 状态如何承载 | 可支持的下游 | 不能从该接口推出 |
|---|---|---|---|---|
| DreamerV3 | 潜状态逐步递推,自由 imagination | recurrent state + stochastic latent | 模型内 actor/value 学习 | 无限长稳定或概率已校准 |
| MuZero | 只在搜索树边上递归展开 | value-equivalent latent | MCTS 的 reward/value/policy backup | 可重建观察或忠实模拟物理 |
| TD-MPC | 每个真实步内做短 horizon rollout | 任务导向 latent + terminal Q | 滚动时域连续规划 | 短模型消除了 value 外推误差 |
| Sora | 一次生成一个时空 latent 片段 | spacetime patches | 条件视频续写/编辑 | 通用逐步 step(action) 或规划闭环 |
| V-JEPA | 固定视频窗口内预测被遮挡表征,不递归解码 | 抽象时空 embedding | 表征迁移 | 因果自由 rollout |
| Genie | 以潜动作逐帧递归生成 | 离散视频 token + 潜动作 | 外部用户逐步控制 | 潜动作等于真实干预变量 |
框架的“裂缝”应保留:MuZero 的树上抽象展开、Sora 的长段生成和 V-JEPA 的不展开预测都叫“预测”,但其时间语义不相同,不能互换评测标准。
30 秒三步速选
- 要不要让模型参与控制? 不要:选表征学习或观察生成;要:继续。
- 需要看得见的未来画面吗? 需要:接受 token/像素重建和生成成本;不需要:优先紧凑 latent 或价值等价模型。
- 部署能否承担在线搜索? 能:PlaNet、MuZero、TD-MPC 类;不能:Dreamer 类把计算摊销到训练期 actor。
四种“模型语义”
- 生成式潜动力学/观察重建模型:压缩观察,在潜空间预测,并可重建观察。代表:World Models、PlaNet、Dreamer。
- 决策充分或价值等价模型:不追求还原全部世界,只保留奖励、价值和规划所需信息。代表:MuZero、TD-MPC。
- 非生成预测表征模型:预测抽象特征而非像素,主要学习可迁移表示。代表:I-JEPA、V-JEPA。
- 生成式观察或轨迹模型:生成视频、下一帧或整段轨迹;动作接口和闭环程度差异很大。代表:Sora、Genie、DIAMOND、Diffuser。
它们不是互斥家族。比如 Dreamer 同时具有生成式潜动力学和决策用途;“扩散”只是生成/推断方式,既可做轨迹规划器,也可做环境转移模型。
最重要的路线差异
| 你真正关心的问题 | 更匹配的路线 | 核心代价 |
|---|---|---|
| 需要每一步临场搜索和目标修正 | PlaNet、MuZero、TD-MPC 类在线规划 | 部署计算高,规划器会利用模型误差 |
| 部署必须低延迟 | Dreamer 类模型内 actor-critic | 模型偏差可能固化进策略/价值 |
| 目标固定,只在乎控制回报 | MuZero、TD-MPC 类决策充分潜状态 | 不保证完整世界知识或换任务复用 |
| 主要需要自监督视觉表征 | I/V-JEPA | 原始方法不提供动作 rollout 或规划闭环 |
| 需要高保真、多模态的未来画面 | 视频扩散/生成式观察模型 | 推理昂贵;画面逼真不等于物理正确 |
| 需要外部主体逐步交互 | Genie、DIAMOND、GameNGen 等动作/潜动作环境模型 | 潜动作未必有真实因果语义,长时稳定有限 |
| 数据固定离线且不能再交互 | MOPO/MOReL 式悲观模型使用 | 不确定性代理可能失效,也可能过度保守 |
三条不能混淆的结论
- 生成逼真视频 ≠ 学到因果物理 ≠ 能做规划。
- 动作条件 ≠ 自主决策。 模型可以接受动作,却没有策略、奖励或规划器。
- 随机输出 ≠ 不确定性已校准。 多样样本和 ensemble 分歧都不是正确性证书。
简短选型建议
- 先问最终用途,不要先问“该选 Transformer 还是扩散”。
- 控制优先:按是否可承担在线规划,在 PlaNet/MuZero/TD-MPC 与 Dreamer 型方法之间选。
- 表征优先:JEPA 类更直接,但不要把固定窗口表征预测写成完整世界模拟。
- 视觉模拟优先:token 或扩散模型更能表达多模态细节,但要单独检查动作接口、递归稳定和成本。
- 没有统一环境、预算、action repeat、评测 episode、硬件与模型调用口径时,不要横向排名论文中的绝对分数或成本。
1. 定义、边界与基本原理
1.1 狭义、操作性与广义定义
“世界模型”在不同文献中至少有三层含义。
狭义:模型式强化学习中的环境模型。 模型学习状态和动作如何产生下一状态、奖励或终止信号,再用模拟经验更新价值或规划。Dyna 是经典代表:真实经验和模型生成经验可以共享同一价值更新机制 [1][2]。
操作性:自主系统的内部预测模型。 它不一定重建像素,但应形成可用于预测、干预或决策的内部状态。MuZero 只学习对奖励、策略和价值足够的潜动力学,说明“完整重建观察”不是必要条件 [8]。
广义:认知中的内部世界表征。 Craik 早期提出生物体携带现实的“小尺度模型”,可用来预见结果 [1]。按这个宽定义,无动作的预测表征也可被称为世界模型组件。
本文采用分层口径:讨论广义谱系,但做技术选型时使用操作性问题——
- 建模对象是什么?
- 输入、内部状态和输出是什么?
- 训练信号和数据从哪里来?
- 预测是否支持动作干预、rollout 或决策?
1.2 世界模型通常由什么组成
一个较完整系统常含以下模块,但并非每项都必需:
- 编码器/状态估计器:把像素、传感器和历史压缩为状态
z_t;部分可观测环境中还要维护 belief。 - 转移模型:根据当前状态和可选动作预测未来状态。
- 观察模型/解码器:把潜状态映射回图像或其他观测;MuZero、TD-MPC 可省略。
- 奖励、成本、终止模型:告诉决策器候选未来是否有用。
- 不确定性表示:随机潜变量、离散 token、生成分布、ensemble 等;它们表达的对象不同。
- 决策器:在线搜索、动作序列优化、actor-critic 或其他策略学习模块。
1.3 为什么潜空间预测有效
像素包含纹理、光照和背景等大量信息。直接在像素中长时预测很昂贵,且任务未必需要每个细节。潜空间模型先压缩观察,再预测低维状态,可降低 rollout 和规划成本。
代价是信息瓶颈:重建目标倾向保存视觉细节;奖励/价值目标倾向只保存当前任务所需信息;JEPA 目标主动忽略难以预测的像素细节。没有一种表示对所有用途都“最完整”。[3][8][9][11]
1.4 训练与推理的共同信息流
训练阶段通常从真实轨迹中取观察、动作、奖励和终止信号。模型可能学习:
- 下一观察或下一潜状态的似然;
- 观察重建和 posterior/prior 的 KL;
- reward、value、policy 等决策目标;
- 被遮挡位置的目标表征;
- 噪声条件下的去噪目标。
推理阶段则可能:
- 单步预测;
- 将预测反馈为输入,递归 rollout;
- 一次生成整个未来窗口或轨迹;
- 在许多候选动作未来中搜索;
- 直接运行已在想象中训练好的 actor。
训练目标相似并不代表推理误差相同。因果自回归、掩码预测、固定窗口和整段扩散必须分别分析。
2. 主流路线一:生成式潜动力学与观察重建
2.1 World Models:VAE + MDN-RNN + 小控制器
World Models 先用 VAE 把单帧图像编码为随机潜变量 z_t,再由 MDN-RNN 根据历史、潜变量和动作预测下一潜变量分布;控制器读取 z_t 与 RNN 隐状态选择动作 [3]。
训练分三段:图像重建与 KL 训练 VAE;下一潜变量似然训练 MDN-RNN;最后按任务回报优化控制器。模型还可生成“梦境”,让控制器在其中训练。
为什么有效:高维视觉被压缩,时间模型与控制器变轻,真实交互可被模型计算替代。
主要风险:分阶段表示未必保留长期控制细节;模型递归误差会改变后续输入;控制器还可能主动发现并利用梦境漏洞。论文专门讨论了“cheating the world model” [3, §4.2]。
2.2 PlaNet:RSSM belief + 在线 CEM
PlaNet 的 RSSM 同时包含确定性递归状态和随机潜状态。看到真实图像时,posterior 将观察注入 belief;预测候选未来时只能沿 dynamics prior 展开。训练目标包含观察似然、奖励似然以及 posterior 与 prior 的 KL,并用 latent overshooting 加强多步一致性 [4, Fig.2, §2.2]。
部署时,CEM 反复采样动作序列,在潜空间 rollout 并累加预测奖励,保留高分样本更新动作分布;只执行第一步,收到新观察后重新规划 [4, §2.4]。
优点:真实观察可每步纠偏;潜空间规划比像素规划便宜。
缺点:每步都要运行“候选数 × horizon × CEM 迭代”次模型;CEM 会主动选择奖励预测过高的序列。
2.3 Dreamer:在 RSSM 想象中训练 actor-critic
原图信息:Hafner et al., Dream to Control: Learning Behaviors by Latent Imagination,Figure 1;来源:arXiv:1912.01603 官方 PDF,第 1 页。上图为官方 PDF 原图的高分辨率裁切,保留原始图注,未重绘或改写图内内容。
逐模块解读:
- Dataset of Experience:真实环境轨迹提供图像、动作与奖励,构成世界模型和行为学习的数据源。
- Learned Latent Dynamics:观察被编码为潜状态;潜动力学依据状态与动作展开未来,并预测与控制相关的量。看到真实观察时可校正状态,纯想象阶段则沿 learned prior 前进。
- Value and Action Learned by Latent Imagination:actor 和 value 不必反复访问真实环境,而是在模型生成的潜在轨迹上学习;价值估计把 imagination horizon 之外的远期收益带回当前更新。
- 训练—推理关系:训练期同时学习世界模型与 imagined actor-critic;部署期真实观察更新 belief,actor 直接给动作。图中从数据到 latent dynamics、再到 value/action 的方向,正是 Dreamer 把模型计算摊销到策略参数的关键。
Dreamer 与 PlaNet 使用相近的潜动力学,但不在部署时运行 CEM。它从 replay 中的 posterior 状态出发,让 actor 与 prior 生成想象轨迹;reward 和 value 构成 λ-return,再更新 actor 与 value [5, Fig.2, Eq.(1)–(6)]。
部署时,新观察更新 belief,actor 一次前向给出动作。
核心差异:PlaNet 把大量计算放在部署期搜索;Dreamer 把未来计算摊销到训练期策略参数。后者部署快,但模型偏差可能被固化进 actor/value。
DreamerV3 延续这一思路,并用归一化、symlog/two-hot 等稳健化设计跨域训练;这证明统一配置在作者所测任务上具有广泛适用性,不等于所有环境或预算下普遍最优 [6]。
3. 主流路线二:决策充分或价值等价潜模型
3.1 MuZero:不重建世界,只预测规划需要的量
MuZero 用 representation 将真实历史映射为潜状态,recurrent dynamics 接收潜状态与动作,产生下一潜状态和奖励;prediction head 输出 policy 与 value。MCTS 在这个潜空间中搜索 [8, Fig.1]。
训练信号来自真实奖励、搜索改进后的策略和回报/价值目标,而不是图像重建。因此潜状态只需对当前任务的决策足够。
为什么有效:容量聚焦于奖励、价值和动作排序,不必准确生成棋盘纹理或 Atari 像素。
边界:高控制成绩不能证明潜状态包含完整物理、对象或观察细节。换奖励、做观察查询或迁移新任务时,原任务充分状态可能丢失所需信息。
3.2 TD-MPC/TD-MPC2:短模型、长价值
TD-MPC 将观察编码为潜状态,以确定性 latent dynamics 预测短期状态,用 reward head 评估视野内收益,并以 Q 值在 horizon 末端补上更远回报 [9, Fig.2, §3–4]:
候选回报 ≈ H 步预测奖励之和 + H 步后的 terminal Q训练含 reward、TD-Q 和 latent consistency:预测下一潜状态要对齐下一真实观察的 target-encoder 表示。部署时使用 MPPI/CEM 类连续轨迹优化,只执行首动作并重新规划。
TD-MPC2 加入 SimNorm、稳健的 reward/value 分布式回归、多 Q heads 和多任务条件化,提高作者所测连续控制任务中的稳定性 [10]。论文报告的 104-task 评估和约 317M 参数模型联合训练 80 个任务是不同实验,不能合并为“一个模型完成 104 个任务”,也不等于未知任务零样本泛化。
核心权衡:短 horizon 减少动力学复合误差,却把长时预测负担转给 bootstrapped Q;在线规划仍可能利用错误 reward、dynamics 或 Q。
3.3 与生成式潜模型的关系
| 维度 | PlaNet | Dreamer | MuZero | TD-MPC |
|---|---|---|---|---|
| 状态 | 随机 RSSM belief | 随机 RSSM belief | 决策充分潜状态 | 任务导向短潜状态 |
| 观察重建 | 是 | 是 | 否 | 否 |
| 训练信号 | 观察/奖励/KL | 观察/奖励/KL + imagined return | reward/value/policy | reward/Q/consistency |
| 动作选择 | CEM | actor | MCTS | 连续 MPC |
| 长时处理 | horizon 内奖励 | value/λ-return | 叶 value | terminal Q |
| 部署计算 | 高 | 低 | 高 | 高 |
| 主要风险 | 搜索利用模型误差 | 偏差固化进 actor | 任务充分而非世界完整 | bootstrap 与规划双重利用 |
这张表不是绝对性能排名。不同论文的环境、预算、action repeat、评测 episode、代码库和硬件不统一,绝对分数不可横比。
4. 主流路线三:非生成预测表征(JEPA)
4.1 I-JEPA:预测被遮挡区域的抽象表征
I-JEPA 包含 context encoder、由 EMA 更新且停止梯度的 target encoder,以及 predictor。Context 分支只看未遮挡区域,predictor 结合位置 token 预测目标区域的 latent representation,以特征距离训练,而不是恢复 RGB [11, Fig.2, Eq.(1)]。
为什么有效:损失不要求复原纹理和像素相位等难预测细节,促使模型保留跨区域可预测的对象与语义结构;EMA target 提供缓慢变化的训练目标。
边界:I-JEPA 没有时间轴、动作、递归 rollout 或 planner。它是世界表征学习组件,不是完整动力学世界模型。
4.2 V-JEPA:视频窗口中的时空特征预测
V-JEPA 将同一思想扩展到固定长度视频 clip:context encoder 看未遮挡时空 tubelets,predictor 恢复被遮挡位置的 target features [12, Fig.1, Eq.(1)]。
大范围结构化 mask 限制局部复制捷径,迫使模型利用运动与场景结构。但其目标并不要求只从过去预测未来,也不把输出递归反馈。原论文没有真实动作接口、反事实干预或规划闭环。
引用纠错:V-JEPA 的正确编号是 arXiv:2404.08471;2402.08446 与该工作无关。4.3 JEPA 与世界模型的边界
| 能力 | I-JEPA | V-JEPA | 动作世界模型通常需要 |
|---|---|---|---|
| latent 预测 | 是 | 是 | 可选但常有用 |
| 时间信息 | 否 | 固定窗口内有 | 因果状态更新 |
| 动作条件 | 否 | 否 | 控制任务需要 |
| 自由多步 rollout | 否 | 未训练/未验证 | 规划通常需要 |
| 多模态未来分布 | 无显式机制 | 无显式机制 | 随机潜变量、token 或生成分布等 |
| 决策闭环 | 否 | 否 | 操作性定义要求 |
JEPA 是表示与训练目标原则,不是“完整世界模型”的同义词。LeCun 的自主智能架构愿景还包含动作候选、世界状态预测和成本评估;不能把 I/V-JEPA 已展示的表征实验当作整套架构已实现 [13]。
5. 主流路线四:离散 token 自回归环境模型
5.1 基本机制
这类方法先用 tokenizer 将视频帧压成离散 token,再用序列模型根据历史 token 与动作预测下一 token/帧,并可同时预测奖励与终止。它把视觉环境转换为类似语言建模的离散序列问题。
优点:可复用成熟的 Transformer 与离散似然训练;可生成可观看的未来。
代价:tokenizer 可能丢失小而关键的视觉细节;长序列计算昂贵;自由运行时预测成为后续输入,分布可能逐步偏移。
5.2 IRIS 与游戏环境模拟
IRIS 使用离散图像 token 与 Transformer 学习 Atari 环境,在模型生成轨迹中训练 agent [14]。它证明 token 环境模型能直接服务控制,但证据来自特定游戏和交互预算,不应外推为通用物理模拟。
GameNGen 展示单游戏动作条件的实时神经模拟器 [20]。其窄域交互能力与开放世界通用性是不同问题。
5.3 Genie:从无动作标签视频发现潜动作
Genie 由时空视频 tokenizer、latent action model(LAM)和自回归 dynamics 组成 [15]。LAM 从相邻帧变化中提取低带宽离散代码,dynamics 再以这些潜动作条件预测后续视频 token。推理时,用户反复选择潜动作 ID,模型生成下一帧。
为什么有效:互联网视频没有按键标签,LAM 让模型从帧间变化中发现可用于控制生成的代码。
关键边界:潜动作具有预测力,不保证恢复真实干预变量;它可能混合角色动作、镜头、碰撞结果或动画阶段。Genie 是可控生成环境,但没有奖励、策略或 planner,不能被描述为自主决策者。
Google DeepMind 对 Genie 2 的官方博客展示更复杂的可交互 3D 样例 [21],但完整架构、数据、损失、动作编码和标准失败率未公开,因此只作为官方演示级证据。
6. 主流路线五:扩散式观察、环境与轨迹模型
“扩散式世界模型”不是一条统一路线。必须说明:扩散的随机变量是什么、动作在哪里、单次生成多长、闭环发生在哪里。
6.1 Diffuser:扩散即轨迹规划器
Diffuser 在离线状态—动作轨迹分布上训练去噪模型;规划时从噪声反向生成满足回报或约束的整段轨迹,再执行动作 [16, §3, Algorithm 1]。
它主要是条件轨迹分布上的推断式规划器,不是标准的单步 z,a→z' 环境转移核。将其称作世界模型采用的是宽定义:“对未来轨迹建模并用于行动”。
6.2 Diffusion Forcing:扩散作为序列训练/解码范式
Diffusion Forcing 让序列中不同 token 处于不同噪声水平,结合因果依赖与去噪训练,可支持多种历史/未来条件组合 [17]。它是一种序列建模范式,不自动规定状态表示、动作接口或决策器。
6.3 DIAMOND:扩散作为动作条件视觉转移模型
DIAMOND 使用扩散模型生成动作条件的下一视觉帧,并预测奖励与终止;策略在生成梦境中训练 [18]。与 Diffuser 不同,扩散位于环境的逐步转移位置。
其 Atari 分析还表明,视觉重建可能保存小而决策关键的细节;这构成“决策模型永远不需要像素”的反例。代价是高保真去噪比紧凑 latent rollout 更昂贵。
6.4 Sora:时空 latent 扩散的观察生成模型
OpenAI 官方技术页面披露:视频先压入低维 latent,再切分为 spacetime patches;diffusion transformer 从带噪 patches 和文本/视觉条件预测干净 patches [19]。
Sora 支持不同时长、分辨率和宽高比的条件视频生成。官方也展示三维一致性、对象持续等现象,并明确列出物理交互、对象状态和长视频一致性失败。
公开主机制没有通用的逐步 step(action)、reward、reset 或 planner 接口。Minecraft basic-policy 样例缺少训练与评测细节,不能据此认定 Sora 是通用动作世界模型。
引用纠错:arXiv:2402.17177 是第三方 Sora 综述,不是 OpenAI 原始技术报告;本报告仅引用 OpenAI 官方页面 [19] 支持披露机制。7. 决策接口:模型究竟如何改变动作
7.0 生成、可交互与用于决策是三种成功标准
- 观察生成成功:模型产生连贯、逼真的视频;Sora 属于这一证据层。
- 外部动作条件交互成功:人或另一个 agent 能给动作并获得连续观察;GameNGen、Genie 属于这一层,但它们自身未必有 reward、policy 或 planner。这里的“可交互”只指接口行为,不表示模型具备自主性,也不等于动作具有已验证的因果语义。
- 决策世界模型成功:模型预测被搜索、策略学习或控制算法消费,并在论文指定任务与协议下产生决策证据;PlaNet、Dreamer、MuZero、TD-MPC、DIAMOND 以不同方式属于这一层。跨任务的普遍收益仍需另证。
所以“可玩”不等于“模型已帮助 agent 学会玩”。GameNGen 证明窄域动作条件模拟可供主体交互 [20];MuZero 反过来不生成可观看观察,却能通过 reward/value/policy 充分量服务搜索 [7]。两者的成功判据正交,不能按画面质量或游戏分数放在同一排名中。
7.1 三种决策语义与误差责任
这里是面向选型的汇总,不是新的互斥分类;Dreamer 同时含观察预测和决策训练,TD-MPC 同时含短模型与价值函数。
| 决策语义 | 模型需要保留什么 | 代表方法 | 错误如何表现 | 下游如何放大 | 主要纠偏 |
|---|---|---|---|---|---|
| Observation-predictive | 观察或可解码潜状态的条件分布,并可选 reward/continuation | World Models、Dreamer、DIAMOND;Sora 仅属观察生成而无决策接口 | 画面/潜状态漂移、对象状态错误、reward/continuation 偏差 | 递归 rollout;actor 可利用想象中的乐观错误 | 真实 posterior 重置、KL/多步目标、短 imagination、真实数据迭代 |
| Value-equivalent | 足以预测 reward、value、policy 并支持搜索的统计量 | MuZero | 不是画面变糊,而是动作排序、回报或叶价值偏离真实结果 | MCTS 反复选择和备份高估分支 | 真实结果/replay 刷新、搜索与价值目标更新 |
| Control-oriented latent | 短期动作响应、reward 与 terminal value 所需状态 | TD-MPC;PlaNet 属于更生成式的在线规划近邻 | 短 rollout 漂移、reward 偏差或 OOD 叶节点 Q 误差 | 优化器主动寻找高估动作序列;terminal value 承担远期误差 | 短 horizon、每步重规划、Q/模型 ensemble 与保守评分 |
观察生成模型只有在预测被 planner、policy learning 或控制器消费并产生相应任务证据时,才升级为“用于决策的世界模型”。Sora 的公开主机制不满足这一接口;Dreamer、MuZero 和 TD-MPC 则以三种不同方式满足。
比较决策型世界模型时,统一问五个问题:视野内奖励由谁给?叶节点由谁估值?动作由谁提出?每个真实动作前调用模型多少次?新观察能否纠偏?
| 方法 | 视野内奖励 | terminal value | 动作选择 | 计算位置 | 新观察纠偏 |
|---|---|---|---|---|---|
| Dyna | 模型生成转移供 TD backup | 价值函数本身 | 由更新后的策略 | 训练/交互期 | 通过真实经验持续更新 |
| PlaNet | reward head 累加 | 原始方法主要靠 horizon 内奖励 | CEM | 部署期大量 rollout | 每步 posterior + 重规划 |
| Dreamer | imagined reward | value 构造 λ-return | actor | 训练期大量想象;部署轻 | posterior 更新,但不在线搜索 |
| MuZero | 树边 reward | leaf value | policy prior + MCTS | 训练与部署 | 每个真实决策重建/扩展树 |
| TD-MPC | 短 horizon reward | Q(z_H,π(z_H)) | policy prior + 连续 MPC | 训练与部署 | 每步编码观察并重规划 |
| Diffuser | 轨迹条件/回报 guidance | 通常无独立 terminal value | 反向扩散生成轨迹 | 部署期多步采样 | 滚动时域实例可重新条件化 |
7.2 规划视野为什么不是越长越好
长 horizon 少依赖 terminal value,却积累更多 dynamics/reward 误差并增加搜索成本;短 horizon 降低模型复合误差,却依赖 value 对叶状态的外推。每步重规划能用真实观察截断跨步漂移,但不能撤销已执行动作,也不能修复单次视野内的模型漏洞 [9][23]。
所以 PlaNet、Dreamer、MuZero、TD-MPC 的差异,不只是“谁预测更准”,而是谁承担未来:动力学、价值函数、搜索预算还是策略参数。
8. 不确定性、多模态未来与长时误差
8.1 多模态未来
同一当前状态可能对应多个合理未来。确定性 MSE 回归常趋向条件均值;在像素空间中,这可能表现为模糊,在任务潜空间中则可能把不同未来压成一个决策不充分的状态。
- 随机 latent 用潜变量表达未观测因素或转移随机性;
- 离散 token 自回归通过条件 token 概率逐步采样;
- 扩散通过整段或局部变量的生成分布表达多种样本;
- JEPA 则可选择不预测不可预测细节,只对抽象表征负责。
这些随机性机制不能互换,也不能仅凭“可采样”推出校准。
8.2 四类序列机制的误差不能共用一套叙事
| 机制 | 训练—推理差异 | 长时主要风险 | 典型缓解 | 不应误写为 |
|---|---|---|---|---|
| 因果自回归 | 训练可能用真实历史,部署用模型历史 | 模型输出改变后续输入分布 | learner-state 数据、纠错训练、截短 rollout | 所有生成模型都有同一种 exposure bias |
| 潜动力学 imagination | 真实序列用 posterior,未来只能走 prior | prior/posterior gap、奖励/价值与策略反馈 | KL/overshooting、短 rollout、真实状态重启、重规划 | 随机 latent 自动保证长时正确 |
| 掩码/迭代预测 | 训练 corruption 与部署填充轨迹可能不同 | 填充顺序和错误 token 影响后续条件 | 对齐 corruption/解码流程、重遮罩 | 标准 teacher forcing |
| 整段扩散 | 训练噪声层级与反向求解轨迹 | denoiser/score 近似、离散求解、条件 guidance 偏差 | 更佳训练覆盖与求解器;任务特定约束 | 真实前缀与模型前缀失配 |
Teacher forcing 只描述因果自回归训练使用真实历史的情形。Scheduled Sampling 混合真实和生成前缀,但生成前缀偏离后通常仍沿用原序列标签;它不等于 DAgger 在学习者状态上重新查询专家,并存在统计一致性争议 [27][28][29]。
“一步误差影响下一步输入”是重要机制,但线性、二次或指数增长都不是普遍定律。误差可收缩、相消、饱和,也可能在敏感闭环中迅速放大。DAgger 的常见 O(T²ε) 是特定最坏情况任务代价界;MBPO 中随 rollout 长度出现的模型偏差项也是保守界的一部分,不能当作实际预测误差定律 [23][27]。
8.3 误差如何被下游用途放大或吸收
“预测误差”不是一个可跨路线直接相加的标量。下游只会放大与其成功标准相关的误差,也可能完全忽略另一些误差。
| 下游用途 | 最致命的误差 | 如何放大 | 哪些误差可被吸收 | 主要缓解 |
|---|---|---|---|---|
| 观察/视频生成 | 对象身份、遮挡后状态、跨帧几何与长时一致性 | 递归或长窗口生成让结构矛盾暴露 | 与感知无关的小 latent 坐标变化 | 结构数据、长时评测、多模态生成 |
| 外部可控模拟 | 动作响应错误、输入延迟、终止/碰撞错误 | 用户反复操作进入训练外状态 | 不影响可玩性的纹理偏差 | 动作分叉测试、每步重条件化、支持集审计 |
| Dreamer 类 imagined actor | reward/continuation 与策略会利用的 latent 转移错误 | actor/value 在大量想象轨迹上固化偏差 | 不影响奖励的像素细节 | posterior 校正、短 imagination、真实数据迭代 |
| PlaNet/TD-MPC 在线规划 | 候选动作排序、reward 与 terminal value 的正向误差 | 优化器主动寻找预测最高但错误的序列 | 每个真实步之后的部分状态漂移可被重规划截断 | 短 horizon、悲观评分、每步重规划 |
| MuZero 搜索 | reward、policy prior、leaf value 的排序误差 | MCTS 多次备份会集中到高估分支 | 像素级重建误差完全不在目标内 | 搜索校准、价值/策略目标、真实结果更新 |
| JEPA 表征 | 丢失下游任务所需语义或运动线索 | 下游 probe 无法恢复未编码信息 | 不可预测纹理与像素相位可主动忽略 | mask 设计、多任务迁移评测、辅助目标 |
这也是为什么 MuZero 不生成像素不是缺陷,而 Sora 的像素/结构错误却直接影响其核心成功标准;同一个“像素误差”在两条路线中的权重可以为零或很高。
8.4 Ensemble 与概率校准
MOPO 用不确定性惩罚降低离线策略对模型漏洞的利用;MOReL 将被判为 unknown 的状态—动作送入带负回报的吸收态 [24][25]。理论解释依赖合格误差上界或可靠 unknown detector,但实际神经 ensemble 只是启发式代理。
高 disagreement 是值得怀疑的信号;低 disagreement 不是正确性证书。所有成员可能因共享数据、架构和优化偏置而在 OOD 区域一致出错。
可信概率预测至少需要可靠性/覆盖率与尖锐度共同评估,并使用 NLL、Brier、CRPS 等适当评分;ID 校准不保证 OOD 校准 [35]。
9. 失败模式:世界模型为什么会“想错”
| 失败模式 | 信息流中的原因 | 常见缓解 | 仍未解决的问题 |
|---|---|---|---|
| 长 rollout 漂移 | 预测成为下一输入,状态偏移再改变动作 | 短 rollout、真实状态重启、自纠错训练 | 远期稀疏后果、随机环境配对 |
| 规划器/策略利用模型 | 优化器主动选择正向误差 | 悲观惩罚、unknown gate、随机化 | 共同偏差和低估不确定性 |
| 离线 OOD 动作 | 行为数据未覆盖新策略访问区域 | MOPO 软惩罚、MOReL 硬约束 | 真正最优轨迹在支持集外时只能保守 |
| 视觉细节丢失 | 压缩或任务目标忽略小物体 | 高保真生成、辅助目标 | 训练与采样成本升高 |
| 任务导向表示过拟合 | 只保留当前 reward/value 所需信息 | 多任务、自监督或重建目标 | 新任务需求无法预知 |
| Bootstrap 偏差 | 短视野把远期交给 critic/value | target network、Q ensemble、重规划 | OOD 叶节点过估计 |
| 不确定性误用 | aleatoric/epistemic 混淆,ensemble 共同偏差 | 多信号支持检测、分层校准 | 无通用认证保证 |
| 实时成本 | 搜索、整轨迹扩散或逐帧去噪调用多次模型 | latent、短 horizon、actor 摊销 | 高精度与低延迟难兼得 |
Talvitie 的 self-correcting models 表明误差并非只能单调累积:在模型自己诱导的状态上训练,有时可以学会返回真实轨迹附近 [22]。但这类保证依赖确定性或可配对轨迹等条件,不能直接推广到任意随机 POMDP。
10. 观察生成、环境模型与可信模拟器
10.1 三个证据等级
- 观察分布生成:能产生合理观察;不自动支持动作干预。
- 动作条件环境模型:给定动作可逐步预测;不自动具备 OOD 可靠性或校准。
- 独立验证的可信模拟器:在声明范围内通过状态充分、闭环、长时、OOD 和概率校准审计。
10.2 视觉结构基准的正确解读
| 基准/评测 | 实际测量 | 明确没有测量或不能推出 |
|---|---|---|
| Physion | 受控合成场景中,指定对象未来是否接触 [31] | 完整轨迹与状态变量、真实长尾对象、复杂关系与可供性、跨域纹理/光照、开放世界物理 |
| IntPhys | 受控视频是否违反对象持久、形状恒常和时空连续 [32] | 从前缀预测未来、动作干预、真实场景关系/可供性、跨视角三维重建 |
| TAP-Vid | 二维点位置与遮挡状态,含真实/合成视频 [33] | 对象语义与身份、度量三维几何、动作因果、完整场景动力学 |
| DreamerV3 等控制基准 | 在指定环境、协议和预算下的 return/score 与任务覆盖 [6] | 完整观察模拟、通用物理、未见真实域迁移、跨 codebase 的绝对优越性 |
这些基准提供的是局部能力证据,不是“理解世界”的总分。尤其缺少统一、系统覆盖真实长尾对象、长期遮挡后身份、多视角一致性、关系与可供性以及跨域泛化的评测;公开材料未测到的格子应保留为未知,而不是用相邻 benchmark 补齐。
因此,通过某个视觉 benchmark 只能支持它实际测到的结构能力。
10.3 五项可信度审计
| 维度 | 最低应看什么 | 不能从通过中推出什么 |
|---|---|---|
| 状态充分性 | 加入历史是否仍改善预测;残差是否与过去相关 | 因果变量、可解释性或新任务充分 |
| 闭环交互 | 多初态/动作扰动下的回报、失败率和恢复 | 所有策略与控制频率都稳定 |
| 长时误差 | 无中间真值注入的 horizon 曲线和灾难尾部 | 测到 H 步稳定即可无限外推 |
| OOD 干预 | 近/远/组合干预下的退化与拒绝能力 | 有限干预覆盖开放世界 |
| 不确定性校准 | 按时域/场景/OOD 分层的可靠性、proper score 和尖锐度 | 校准等于准确,或 ID 校准推广 OOD |
守恒律只在有明确物理量的领域作为约束;游戏、社会环境或开放视觉可标“不适用/未知”,不是通用定义门槛。
11. 路线横向对比
| 路线原型 | 预测对象与表示 | 数据/训练信号 | 推理与闭环 | 优点 | 局限与成本 | 典型适用场景 |
|---|---|---|---|---|---|---|
| 潜动力学 + 在线规划 | z,a→z',r;可含 belief | 轨迹、动作、奖励;可重建观察 | CEM/MCTS/MPC 每步搜索 | 临场目标修正、动作反事实明确 | 部署计算高,搜索利用误差 | 可承担规划的控制 |
| 潜动力学 + imagined actor | 模型生成潜转移 | 观察/奖励/KL + actor/value | 训练期想象,部署 actor | 样本复用高、部署低延迟 | 偏差固化进策略,模型变化需继续训练 | 高频控制、部署预算紧 |
| 决策充分/价值等价 | reward/value/policy 相关 latent | 任务回报、价值、策略、consistency | MCTS 或短 MPC | 不浪费容量还原无关细节 | 换任务或观察查询能力弱 | 目标固定、回报优先 |
| JEPA 预测表征 | context→目标 latent | mask + EMA target 特征回归 | 通常保留 encoder | 语义高效,避免难预测细节 | 无原生动作、自由 rollout、规划 | 自监督预训练、感知前端 |
| 离散 token 环境 | 历史 token+动作→未来 token | tokenizer 重建 + token likelihood | 逐步生成环境/训练 agent | 可观看、序列模型成熟 | token 丢细节,长序列昂贵 | 游戏、交互视频模拟 |
| 扩散观察/环境/轨迹 | 噪声→视频帧或整段轨迹 | 去噪,可加文本/动作/回报条件 | 视频生成、逐帧环境或轨迹规划 | 多模态、视觉锐利、约束灵活 | 多步采样贵;闭环位置因方法而异 | 多未来、视觉模拟、离线规划 |
11.1 数据依赖
- 有真实动作/奖励:可训练动作条件动力学和控制闭环。
- 只有被动视频:可学观察分布、表征或潜动作,但真实干预语义不可识别。
- 固定离线日志:模型不能通过新交互纠错,必须审计行为支持集和策略 OOD。
- 多任务数据:可改善表示复用,但单一模型、多任务联合训练不等于未见任务零样本泛化。
11.2 复现难度
| 相对难度 | 常见路线 | 主要障碍 |
|---|---|---|
| 低到中 | 小型状态空间模型、JEPA 表征基线 | 数据预处理、mask 与下游协议 |
| 中 | PlaNet/Dreamer/TD-MPC | replay、稳定训练、规划/价值超参数、环境协议 |
| 高 | MuZero、token 视频环境模型 | 搜索系统、大规模交互、tokenizer 与序列长度 |
| 很高 | 大规模视频扩散/通用环境生成 | 数据治理、训练算力、长视频、采样延迟、未公开细节 |
这是机制层相对判断,不是统一硬件基准。
11.3 端到端系统成本的主导项
“主导/显著/较低”是机制级定性判断,不是跨论文测得的统一数值;实际结果取决于分辨率、horizon、模型规模、硬件、缓存和并行实现。
| 路线 | 数据管线与标注 | 训练计算 | 部署 rollout / 推理延迟 | Checkpoint 与迭代成本 | 常被低估的系统瓶颈 |
|---|---|---|---|---|---|
| Dreamer / 潜动力学 actor | 显著:需同步观察、动作、奖励、终止与 replay | 显著:模型、actor、value 联合迭代 | 较低:部署通常一次 actor 前向;状态更新持续发生 | 中等:多模块状态与 replay 影响重启/复现实验 | 环境采集吞吐、replay I/O、actor-learner 同步 |
| PlaNet / TD-MPC 在线规划 | 显著:动作与奖励时序对齐 | 显著 | 主导:每个真实动作前执行候选数×horizon×迭代的模型调用 | 中等 | 实时延迟尾部、批量候选规划的内存和调度 |
| MuZero / 树搜索 | 显著:自博弈或交互轨迹、搜索目标与 replay | 主导:表示/动力学/预测网络加大规模搜索 | 主导:每步多次树节点展开 | 显著:网络与搜索配置耦合,actor/replay 版本一致性重要 | 搜索服务吞吐、replay 新鲜度、分布式 actor 同步 |
| JEPA 表征预训练 | 显著:大规模视频解码、采样、mask;通常不需动作/奖励标注 | 主导:高吞吐 encoder 预训练 | 较低:下游通常只保留 encoder;原方法无 rollout | 显著:大 encoder、EMA target 与下游多次适配 | 视频解码、随机访问、数据增强和 host→device 供给 |
| Token 自回归环境 | 主导:视频切片、tokenizer 训练/离线编码、动作对齐 | 主导:长 token 序列 | 主导:逐 token/帧生成,延迟随 horizon 累积 | 显著:tokenizer 与 dynamics 两套版本需一致 | token 缓存、序列长度、KV cache/采样调度 |
| 视频扩散 / 生成模拟 | 主导:视频清洗、切片、时空桶化、条件/动作对齐 | 主导:高维时空去噪训练 | 主导:多步去噪×帧/片段;闭环逐步调用更贵 | 主导:大 checkpoint、优化器状态、恢复与验证周期 | 数据治理、checkpoint I/O、采样服务与长视频显存 |
选型时应同时预算“每个真实动作前模型调用多少次”和“数据每秒能否持续喂满训练”。参数量或单次 FLOPs 无法替代这两个端到端指标。
12. 按任务形状选型
12.1 决策树
- 最终目标只是学习可迁移视觉表征吗?
- 是:优先 JEPA/遮挡表征预测;不要把它当作动作模拟器。
- 否:继续。
- 必须生成可观看、可编辑的未来观察吗?
- 需要,但不需逐步动作:视频扩散/观察生成。
- 需要逐步控制:动作条件 token 或扩散环境模型;确认动作是真实标签还是潜动作。
- 不需要:继续。
- 任务目标固定,主要追求控制回报吗?
- 是:MuZero/TD-MPC 类决策充分 latent 可省去观察重建。
- 否,需换任务或观察查询:保留更一般的生成或自监督目标。
- 部署能承担每步搜索吗?
- 能:PlaNet、MuZero、TD-MPC 类在线规划,提供 test-time 修正。
- 不能:Dreamer 类把计算前移到训练期。
- 环境部分可观测或未来高度随机吗?
- 是:优先带 belief/随机状态估计的模型,并明确测试多模态与校准。
- 数据是否固定离线?
- 是:加入支持约束/悲观目标,缩短 rollout,并验证 uncertainty proxy。
- horizon 很长吗?
- 是:不要盲目延长模型 rollout;比较重规划、terminal value、层级状态与长期事件指标。
- 硬件和延迟严格吗?
- 是:优先紧凑 latent 和 actor 摊销;避免部署期大规模搜索/多步去噪。
12.2 典型场景建议
| 任务形状 | 优先考虑 | 为什么 | 特别警惕 |
|---|---|---|---|
| 可观测、连续控制、可在线交互 | TD-MPC/PlaNet/Dreamer | 动作条件明确、样本复用高 | 在线规划延迟或 actor 偏差 |
| 离散动作、搜索收益大 | MuZero 类 | policy/value 引导树搜索 | 搜索成本与任务充分表示 |
| 部分可观测 | RSSM/belief 型潜动力学 | posterior 融合历史观察 | belief 校准和长时 prior 漂移 |
| 被动视频预训练 | V-JEPA、视频生成 | 无需动作标签 | 不能直接声称干预/规划 |
| 无动作标签但需交互原型 | Genie 式潜动作 | 从视频发现控制代码 | 潜动作不可辨识、语义漂移 |
| 视觉小细节决定行为 | DIAMOND/token/高保真观察模型 | 保存可见细节 | 采样与训练成本 |
| 固定离线控制数据 | MOPO/MOReL + 短 rollout | 限制策略利用 OOD 模型 | ensemble 低分歧仍可能错 |
| 科学/安全模拟 | 领域模型 + 独立验证 | 必须测试约束、残差、干预和校准 | 通用视频模型不能替代认证 |
13. 证据边界与尚未解决的问题
13.1 高风险术语的使用口径
为避免把行为证据升级成机制结论,本文统一采用以下口径:
| - 因果:仅在否定越级推断、说明术语边界,或明确指“因果自回归”的时间因子化时使用。仅有 `p(o_{t+1} | o_t,a_t)` 条件预测时称“动作条件动力学”,不称已识别因果机制。 |
|---|
- 校准:专指预测概率/区间与事件频率或覆盖率的对应,并结合尖锐度和 proper scoring;不把样本多样性、ensemble 分歧或主观信心称作已校准。
- 可交互:只表示外部主体可输入动作并连续获得输出;不表示模型拥有 policy、planner、自主目标或经验证的决策增益。
已有较强证据
- 潜空间模型可显著减少图像控制中的模型计算,并通过在线规划或想象策略学习服务决策 [4][5][9]。
- 不重建观察的任务导向潜状态也能支持强规划和控制 [8][9]。
- JEPA 式 latent prediction 能学习有用视觉/视频表征 [11][12]。
- Token 与扩散模型可生成可观看、动作条件或多模态的环境未来 [14][15][18]。
仍不能普遍声称
- 高保真视频生成已经学到通用物理或因果世界模型;
- 潜动作等价于真实可控变量;
- 某一 benchmark 回报证明完整世界状态;
- Ensemble uncertainty 是经认证的误差上界;
- 短片或一分钟演示证明稳定的长期 rollout;
- 某路线在跨论文不同协议下绝对更省算力或更高效;
- 单一世界模型路线在表征、生成、规划和科学模拟上全面优胜。
图示说明
本报告嵌入 Dreamer Figure 1,因为该图可从官方 arXiv PDF 可靠、清晰获取,并直接解释“经验数据 → 潜在动力学 → 在想象中学习价值与动作”的核心闭环;正文已标明论文、图号、官方来源并逐模块解释。其他论文图未逐张完成同等清晰度与来源核验,因此不为凑数量而加入低清截图,也不自动重绘后冒充论文原图。
14. 结论
世界模型不是某一种神经网络,而是一套“内部状态—未来预测—行动用途”的设计空间。四个最有用的判断轴是:
- 预测什么:像素、潜状态、token、奖励/价值还是抽象表征;
- 如何展开未来:递归、自回归、固定窗口、搜索或扩散;
- 动作与不确定性如何进入:无动作、潜动作、真实动作;确定性、随机 latent、token 分布或生成分布;
- 预测拿来做什么:表示迁移、观察生成、可控模拟、在线规划或策略学习。
对控制任务,最重要的路线分叉往往不是网络骨干,而是模型进入决策的位置:PlaNet 在部署期搜索,Dreamer 在训练期想象,MuZero 用价值等价潜状态搜索,TD-MPC 用短模型加 terminal Q。对视觉生成任务,逼真度和多模态能力更重要,但不能替代动作干预和闭环证据。对科学或安全用途,则必须把状态充分、长时误差、OOD 干预和概率校准作为独立验收项。
因此,最稳妥的选型原则是:从任务查询和闭环需求出发,再选择表示、生成方式与决策接口;不要从流行架构名称倒推能力。
参考文献
- Craik, The Nature of Explanation, 1943;世界内部模型历史来源。
- Sutton, “Integrated Architectures for Learning, Planning, and Reacting Based on Approximating Dynamic Programming,” 1990;Sutton & Barto, Reinforcement Learning, Ch.8(Dyna)。
- Ha & Schmidhuber, “World Models,” arXiv:1803.10122. https://arxiv.org/abs/1803.10122
- Hafner et al., “Learning Latent Dynamics for Planning from Pixels” (PlaNet), arXiv:1811.04551. https://arxiv.org/abs/1811.04551
- Hafner et al., “Dream to Control” (Dreamer), arXiv:1912.01603. https://arxiv.org/abs/1912.01603
- Hafner et al., “Mastering Diverse Domains through World Models” (DreamerV3), arXiv:2301.04104. https://arxiv.org/abs/2301.04104
- Schrittwieser et al., “Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model,” Nature 2020, arXiv:1911.08265. https://arxiv.org/abs/1911.08265
- 同 [7],MuZero 的 representation/dynamics/prediction 与 MCTS。
- Hansen et al., “Temporal Difference Learning for Model Predictive Control,” arXiv:2203.04955. https://arxiv.org/abs/2203.04955
- Hansen et al., “TD-MPC2: Scalable, Robust World Models for Continuous Control,” arXiv:2310.16828. https://arxiv.org/abs/2310.16828
- Assran et al., “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture,” arXiv:2301.08243. https://arxiv.org/abs/2301.08243
- Bardes et al., “Revisiting Feature Prediction for Learning Visual Representations from Video,” arXiv:2404.08471. https://arxiv.org/abs/2404.08471
- LeCun, “A Path Towards Autonomous Machine Intelligence,” OpenReview, 2022. https://openreview.net/forum?id=BZ5a1r-kVsf
- Micheli et al., “Transformers are Sample-Efficient World Models” (IRIS), arXiv:2209.00588. https://arxiv.org/abs/2209.00588
- Bruce et al., “Genie: Generative Interactive Environments,” arXiv:2402.15391. https://arxiv.org/abs/2402.15391
- Janner et al., “Planning with Diffusion for Flexible Behavior Synthesis” (Diffuser), arXiv:2205.09991. https://arxiv.org/abs/2205.09991
- Chen et al., “Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion,” arXiv:2407.01392. https://arxiv.org/abs/2407.01392
- Alonso et al., “Diffusion for World Modeling: Visual Details Matter in Atari” (DIAMOND), arXiv:2405.12399. https://arxiv.org/abs/2405.12399
- OpenAI, “Video generation models as world simulators,” 2024. https://openai.com/index/video-generation-models-as-world-simulators/
- Valevski et al., “Diffusion Models Are Real-Time Game Engines” (GameNGen), arXiv:2408.14837. https://arxiv.org/abs/2408.14837
- Google DeepMind, “Genie 2: A large-scale foundation world model,” 2024. https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model/
- Talvitie, “Self-Correcting Models for Model-Based Reinforcement Learning,” arXiv:1612.06018. https://arxiv.org/abs/1612.06018
- Janner et al., “When to Trust Your Model: Model-Based Policy Optimization,” arXiv:1906.08253. https://arxiv.org/abs/1906.08253
- Yu et al., “MOPO: Model-based Offline Policy Optimization,” arXiv:2005.13239. https://arxiv.org/abs/2005.13239
- Kidambi et al., “MOReL: Model-Based Offline Reinforcement Learning,” arXiv:2005.05951. https://arxiv.org/abs/2005.05951
- Talvitie, “Model Regularization for Stable Sample Rollouts,” UAI 2014. 注意:该文不是 arXiv:1406.3649。
- Ross et al., “A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning” (DAgger), arXiv:1011.0686. https://arxiv.org/abs/1011.0686
- Bengio et al., “Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks,” arXiv:1506.03099. https://arxiv.org/abs/1506.03099
- Huszár, “How (not) to Train your Generative Model: Scheduled Sampling, Likelihood, Adversary?” arXiv:1511.05101. https://arxiv.org/abs/1511.05101
- Ljung, System Identification: Theory for the User, 2nd ed., 1999,Ch.3/9/12。
- Bear et al., “Physion: Evaluating Physical Prediction from Vision in Humans and Machines,” arXiv:2106.08261. https://arxiv.org/abs/2106.08261
- Riochet et al., “IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning,” arXiv:1803.07616. https://arxiv.org/abs/1803.07616
- Doersch et al., “TAP-Vid: A Benchmark for Tracking Any Point in a Video,” arXiv:2211.03726. https://arxiv.org/abs/2211.03726
- Gneiting & Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation,” JASA 2007. https://doi.org/10.1198/016214506000001437
- 同 [34],用于校准、尖锐度与 proper scoring 的证据边界。
阅读提示
- 论文与官方页面支持的是其公开方法和评测范围;表中的跨方法结论属于本报告的机制归纳。
[D]/[A]/[S]/[U]证据标签保留在研究底稿中;主文用“论文显示 / 作者提出 / 综合归纳 / 尚未证明”等自然语言呈现。- 截至本报告日期,不同系统公开程度差异显著;对未公开训练数据、规模、失败分布和接口均不作补写。