连续潜在思维与 AR 统一架构:从持续世界状态到可审计表达
面向研究人员的机制级综述与学术 proposal。本文讨论的不是“把文本思维链压成向量”,而是能持续更新、保持不确定性、接受局部干预,并通过语言、动作或视觉接口外化的潜在工作状态。
摘要
连续 latent reasoning 正处在一个容易被概念混淆拖累的阶段。Coconut、CODI 等工作说明语言模型可以在词表之外继续计算;PlaNet、Dreamer、V-JEPA 2 等说明潜状态可以支持预测或控制;Perceiver、Slot Attention、Universal Transformer、DEQ 和 diffusion/flow 则分别提供有限带宽、结构绑定、迭代计算、平衡态或全局修订机制。然而,这些结果并没有共同证明一个统一的“非语言思维空间”已经存在。预测准确不等于 belief/filtering 充分,控制成功不等于完整世界状态,probe 可解码不等于模型自然使用该信息,AR 解释流畅更不等于它忠实披露内部计算。
本文提出一个更窄也更可检验的研究方向:把系统的承重结构定义为持续、动作条件、可递归更新的潜在工作状态,以自回归模型承担精确离散执行和交流,而不是把 AR 完全替代。层内通信瓶颈 K、有限步/定点/摊销推断日程和多假设参数化不再捆绑为一个架构,而是在固定预算下分别评价;状态则分别接受受控预测、belief/filtering、control/value 三类充分性审计。最后,以行为反事实与多种支持集内干预共同审计内部使用,再以条件披露、跨 readout grounding 和隐藏审计集检查 AR 接口。
核心判断是:这个方向值得投入,但目前属于“证据链可构建、中心结论尚未被现有论文证明”的高潜力研究,而不是已经成熟的统一范式。
1. 五分钟结论
1.1 我怎么看这个方向
如果把“连续 dLLM”理解为用连续向量替换几个 CoT token,我并不认为它足以形成长期研究壁垒:这一路线容易退化为压缩、蒸馏或私有码,而且很难说明中间状态为何具有任务语义。
如果把问题改写为:
能否训练一个持续、动作条件、可干预、跨模态的 latent world workspace,并分别检验有限通信、更新日程和多假设表示的增量价值,再由 AR 模型将内部状态转化为语言、工具调用和动作?
那么它连接了 POMDP 状态估计、PSR、世界模型、连续推理、迭代生成、mechanistic interpretability 与可验证语言接口,具有明确而尚未闭合的研究缺口。
1.2 三条最重要的判断
- AR 不应被消灭。 更合理的系统分工是“连续维护状态,离散执行,AR 交流”:
think continuously, act discretely, communicate autoregressively。 - Diffusion 只是候选动力学。 它可能擅长多假设、受扰恢复和全局修订,但现有公开证据没有在同数据、同状态容量、同 FLOPs 下证明它优于 recurrent、untied depth、DEQ 或 energy dynamics。
- 最大的科学风险是暗码而非不可读。 即使 latent 可被 probe 或多个 decoder 读取,它仍可能只是任务特定答案码;必须分开验证预测/控制充分性、内部自然因果使用和外部忠实表达。
1.3 投资决策
| 决策 | 建议 |
|---|---|
| 是否值得做 | 值得,但应按“状态充分性 + 因果可干预性 + 接口忠实性”的联合问题立项,不以“continuous CoT”命名中心贡献 |
| 最小架构 | 持续、动作条件、可递归更新的内部状态 + AR/action readout;K瓶颈、多假设、共享迭代、DEQ、diffusion和对象slots均作为彼此独立的机制变量 |
| 第一优先级 | 在可完全求解的 POMDP/DFA 中建立无歧义评测协议,再上视觉控制和语言 |
| 暂不声称 | 类脑;完整世界模型;消灭 token;diffusion 天生更会推理;跨 decoder 一致即忠实 |
| 扩大投入的门槛 | 在同预算下,状态同时改善至少两类充分性,并通过支持集内因果干预与隐藏 readout 审计;若只提高最终答案,不扩大投入 |
2. 概念边界:连续不等于非语言,潜在不等于世界状态
2.1 四个容易混淆的对象
- 文本 CoT 的连续压缩:把已有推理文本映射到 hidden/soft embeddings;主要减少 token 或蒸馏过程。
- 自由 latent computation:模型把 hidden state 回灌或插入 pause slots,在没有中间词的情况下继续变换表示。
- 持续世界状态:状态跨时间更新,能对动作条件未来、不确定性或任务价值提供足够统计量。
- AR readout:把内部状态转成文本、程序、动作 token 或工具调用;这是接口,不是内部状态本体。
Coconut(arXiv:2412.06769)属于第二类,其 curriculum 将显式 CoT 步骤逐步替换为连续 hidden states;CODI(arXiv:2502.21074)更接近 CoT 自蒸馏。它们证明“词表不是唯一计算介质”,但公开实验不足以证明形成了跨任务、对象持续、可局部干预的世界状态。
2.2 两种“瓶颈”必须分名
- Representational bottleneck:单层或模块间只有 K 个 latent、低秩子空间或固定消息带宽;它首先是计算与通信约束。
- Predictive-state bottleneck:把整个历史压缩成可递归更新、足以回答声明未来或支持声明任务的状态;它是时间维充分统计问题。
Perceiver IO 的 K latents 直接支持第一种,不直接证明第二种。PSR 和 belief state 讨论第二种,不要求实现一定是 K 个 slots。把两者都叫“latent bottleneck”会把效率证据误写成世界状态证据。
3. 三种充分性:统一架构不能靠统一术语偷换
令历史为 h_t,状态为 z_t=φ(h_t)。
3.1 受控预测充分性
强定义要求:若两个历史映射到同一状态,则在声明 action sequence、horizon 和 test family 下,未来 observation 与 reward 的联合分布相同。动作必须是干预语义,而不是只在 behavior policy 下做条件预测。
PSR 用 core tests 的受控预测表示状态;core tests 必须能重构全部声明 tests。经典来源是 Littman, Sutton & Singh(NeurIPS 2001)及 Singh, James & Rudary(arXiv:1207.4167)。仅预测下一帧、只预测 observation、不包含 reward,或只覆盖数据策略,都不足以推出控制相容的预测充分性。
3.2 Belief/filtering 充分性
对一个明确 latent-state model,belief 是 b_t(x)=P(X_t=x|H_t)。若 z_t 可恢复 belief,并存在 z_{t+1}=F(z_t,a_t,o_{t+1},r_t) 的递归更新,它才是该模型的 filter state。完整 belief 可能保留与当前控制无关的 nuisance,因此不一定是最小控制状态。
3.3 Control/value 充分性
必须声明 reward、discount、horizon 与 policy class。至少应使 Q*(h,a) factor through z;只保持 V* 不够,因为相同 V* 可对应不同最优动作。Value Equivalence(arXiv:2011.03506)还明确依赖策略集和函数集。
在正确 POMDP、预测包含 reward、覆盖全部候选动作干预等条件下,可以写:
完整 belief ⇒ 完整受控预测 ⇒ 全策略 value 充分 ⇒ 最优控制充分。
反方向通常不成立。控制状态可丢弃与 reward 无关的未来;预测状态可能只是 belief 的可观测等价商;有限预测 horizon 也不能自动支持长期控制。
3.4 AIS 与 bisimulation 提供的边界
Approximate Information State(Subramanian et al., arXiv:2010.08843)以“当前 reward 只依赖状态”和“下一状态分布只依赖当前状态/动作”支持近似动态规划,但它不要求预测全部未来 observation。其误差界依赖所选 IPM 函数类及 ρ_F(V),不能被简写为无条件的 (ε+δ)/(1-γ)。
Bisimulation 要求逐动作 reward 相同、向各等价类的 transition probability 相同。它给出行为模型接近推向 value 接近的单向保证;value 接近不能反推 dynamics 或 bisimulation 接近。
3.5 五轴三态:充分性是算子级承诺
记号:✓=在论文定义与显式假设下承诺;△=只在训练/behavior support或指定子类内承诺;—=不承诺。三态描述理论/方法的保证范围,不代表任何实现已经从有限数据识别出该对象。
| 理论对象 | Action support | Test/observation family | Reward family | Horizon | Policy class | 一手出处与最窄主张 |
|---|---|---|---|---|---|---|
| PSR/core tests | △ 可执行且被数据识别的tests;support外不保证 | △ 仅声明test family及其core closure | — 原定义主要表征observation tests;除非把reward并入测试 | △ 由有限/无限test定义及可实现性限定 | △ 表示不必等于behavior policy,但离线识别依赖探索/覆盖 | Littman, Sutton & Singh 2001;Singh, James & Rudary 2012:受控test预测,不是环境内禀状态 |
| 完整POMDP belief | ✓ 对模型动作转移可更新 | ✓ 对给定正确latent model与observation kernel | — belief更新本身可不依赖reward,控制用途依赖reward | ✓ 递归filter;控制结论另依赖horizon/discount | ✓ 作为模型后验可服务多策略,但前提是模型正确 | Smallwood & Sondik 1973:给定模型的后验充分统计,不是最小控制状态 |
| AIS | △ 对定义中的action与近似kernel | △ 保持即时reward与next-AIS所需信息,不是全部未来观测 | △ 仅指定reward/近似类 | △ 误差累计依赖discount/horizon与ρ_F(V) | △ 保证面向声明控制问题/策略优化,不是任意策略族 | Subramanian et al. 2022:近似动态规划状态,不是belief替代或完整预测状态 |
| Bisimulation/metric | ✓ 对声明action set逐动作比较 | ✓ 对向等价类的transition行为 | △ 固定reward或明确reward family | ✓ 在discounted/finite设定及metric假设下给value界 | ✓ 若逐动作条件成立可服务该MDP策略,但不跨reward重定义 | Givan et al. 2003;Ferns et al. 2012:reward-and-transition等价,value接近不反推bisimulation |
| Value equivalence | △ 只对指定Bellman/planning operators涉及的动作 | — 不要求重建完整observation/dynamics | △ 指定value/function family内 | △ 指定backup/planning depth与discount | △ 仅声明policy class Π | Grimm et al. 2020/2021:within-Π/function-class的value计算一致,不是“学到任务相关内禀状态” |
| 离线世界模型 | △ 仅behavior-support内有经验识别基础 | △ 训练/评估observation family内 | △ 仅已观测或明确relabel且同transition的数据 | △ 随rollout horizon增加误差与coverage风险 | △ 评估occupancy须与数据occupancy重叠 | D4RL(arXiv:2004.07219)只提供分布压力测试;高return不证明support外模型正确 |
因此,本文中的“世界状态”一律指明 action support × test family × reward family × horizon × policy class。On-policy、off-policy但within-support、环境可执行的paired intervention和support外OOD必须分栏;只有动作可执行且具有识别覆盖的干预才可称受控反事实,模型自由rollout只能称预测或外推。
4. 现有技术路线:它们分别解决了哪一段
4.1 连续语言推理:越过词表,但未建立世界状态
Coconut、CODI、pause-token/implicit reasoning 路线的共同信息流是:输入 token 经 Transformer 编码后,不立即生成可读 CoT,而把 hidden state 作为后续计算输入,最终再回到答案 token。训练常用答案交叉熵、显式 CoT curriculum 或自蒸馏。
优势是降低固定语言表面的约束,并允许一个连续状态承载多个潜在后续。局限是监督仍可能只要求输出正确答案;latent 因而可以学习答案暗码,而非可迁移过程变量。仅凭准确率或 t-SNE 结构不能排除这一点。
4.2 Diffusion/flow 与全局修订
Diffusion of Thoughts(arXiv:2402.07754)把噪声—去噪用于推理轨迹;Diffusion Forcing(arXiv:2407.01392)把不同时间位置置于不同噪声水平,统一 next-token 与 full-sequence diffusion 的训练视角。扩散式状态允许反复更新全部变量、从随机初态保留多个候选,并可用 guidance 加入约束。
但这些能力分解后是三项原子机制:迭代 refinement、全局修订、随机多假设。Mask-Predict、MaskGIT、recurrent refinement 或粒子方法也可以实现其中一部分。现有跨论文比较同时改变数据、骨干、目标和采样预算,因此不能把任何收益因果归于 diffusion。
4.3 潜在世界模型:预测与控制的强先例
PlaNet(arXiv:1811.04551)从像素学习 recurrent state-space model,并在 latent imagination 中规划;Dreamer(arXiv:1912.01603)在 latent rollout 上学习 actor/critic。V-JEPA 2(arXiv:2506.09985)以视频表征预测为核心,并在动作条件变体中展示规划。
这些工作证明 latent rollout 可以成为有效决策工具,但其语义是 coverage-conditioned 的:状态由训练策略访问的数据流形塑造。控制回报不能证明完整 belief、PSR core-test closure、OOD 动作可靠性或可解释世界变量。
4.4 对象化状态:局部干预的有力偏置,但非通用必要条件
SAVi(arXiv:2111.12594)、SlotFormer(arXiv:2210.05861)及 C-SWM 将视觉场景分为可交换 slots/对象节点,并预测其时间演化。它们在对象明确、运动线索充分的环境中提供身份持续、组合 dynamics 和局部替换接口。
其证据主要来自合成或受控多对象场景;真实视频中的纹理预训练、光流、首帧提示、背景处理和 decoder 容量常与对象拓扑共同变化。对象 slots 因此适合作为结构匹配任务的扩展假设,而非统一 workspace 的硬前提。
4.5 有限 latent 工作集:计算接口强,语义证据弱
Perceiver IO(arXiv:2107.14795)用 K 个 latent queries 读取 N 个输入,在 K latents 上进行深处理,再由输出 queries 写出,注意力主项约为 O(NK + LK² + OK)。它可靠支持的是内部计算与输入/输出长度解耦,而不是 latent 具有推理语义。
Set Transformer(arXiv:1810.00825)的 ISAB 每层执行 N→m→N,复杂度 O(Nm);它与 Perceiver 的“一次读入、内部长期处理”并非同一计算图。两者的 K/m sweep 都不足以证明存在跨任务最佳瓶颈。
4.6 三种迭代谱系不能合并
归属判据不是“代码里有循环”,而是模型语义中什么对象被定义、训练和比较:
- 若训练目标定义一个显式T步展开图、梯度穿过这些步骤,T改变模型的计算路径,则归入有限步unrolled recurrence;权重可共享也可不共享。
- 若模型输出定义为方程的解
z*=f(z*,x),迭代仅是数值solver实现,主要报告residual、容差与隐式梯度,则归入fixed-point solve。 - 若每一步是对后验/样本/候选分布的学习更新,步数或粒子数改变近似质量与采样预算,则归入amortized iterative inference。
Perceiver/Set Transformer属于K控制的信息读写/通信瓶颈,不因内部有多层处理就归入时间递归;UT/ALBERT属于depth-tied展开,不因共享权重就成为DEQ;DEQ不因solver多步就等同diffusion或particle inference。
有限步共享递归(unrolled recurrence)
Universal Transformer(arXiv:1807.03819)重复共享 attention/transition,并可用 ACT 对位置动态停机;ALBERT(arXiv:1909.11942)以跨层共享提高参数效率。它们展开有限计算图,用普通反向传播训练,不要求 W^{j+1}=W^j,也不承诺测试时收敛。ALBERT观察到深层表示振荡,UT的time encoding还使每一步算子依赖步数。其主要动机是参数复用和可调计算,而不是固定点语义。
定点求解(fixed-point solve)
DEQ(arXiv:1909.01377)显式寻找 z*=f(z*,x),通过隐式微分避免保存全部展开激活。其证据主要关于有效深度和激活内存;代价是求根次数、Jacobian条件、收敛容差和批内最慢样本。Jacobian Regularization(arXiv:2106.14342)直接说明稳定性不是自动获得的。DEQ是机制对照,不是共享递归的别名。
摊销迭代推断(amortized iterative inference)
Diffusion/flow、粒子滤波与重采样、迭代masked refinement通过一系列学习更新近似后验或候选分布。其主要动机是多模态、不确定性和全局修订;性能与采样数/NFE、noise schedule、proposal质量和particle degeneracy纠缠。它们不要求固定点唯一,也不等价于参数共享。多假设是否有效必须报告expected指标、校准和有效样本,而非只看best-of-M。
这三条谱系都“多步更新”,但分别改变参数复用、求解语义和状态分布。终稿因此不再使用单一“迭代轴”承载三者;比较时分别控制T steps、solver tolerance/NFE和M hypotheses/总采样预算。
4.7 路线比较
| 路线 | 内部状态 | 主要动机 | 推理日程 | 最强证据 | 主要不足 |
|---|---|---|---|---|---|
| 连续CoT/hidden回灌 | LM hidden states | 越过词表、减少中间token | 有限latent steps→AR | 可越过词表计算 | 易退化为答案暗码;缺跨任务状态语义 |
| 摊销迭代推断 | 带噪轨迹/particles/候选 | 多模态、修订与后验近似 | denoise/resample/refine | 多样性、guidance与全局修订 | 与NFE、采样预算、退化混杂 |
| RSSM/world model | deterministic+stochastic latent | 递归过滤与控制 | filter→rollout→plan/actor | 闭环控制价值 | coverage与模型漏洞;非完整belief证明 |
| Object-centric dynamics | slots/图节点 | 结构绑定 | 绑定→对象更新→readout | 局部结构与组合 | 任务特化,真实场景证据弱 |
| Representational bottleneck | K latents | I/O/通信复杂度 | read→process→write | 计算与I/O解耦 | K的能力作用与FLOPs未解耦 |
| 有限步共享递归 | 共享状态 | 参数复用、可调test-time compute | T步或动态停止 | 参数效率、部分算法外推 | 无收敛承诺;优化与额外步数成本 |
| DEQ/energy | 平衡态/能量变量 | 定点/约束求解、低激活内存 | solver到容差 | 隐式深度与内存优势 | 收敛、唯一性和运行时风险 |
5. Readout:信息存在、被使用、被说出是三件事
5.1 Probe 只回答可恢复性
Alain & Bengio(arXiv:1610.01644)的线性 probe 能显示类别信息在哪些层可线性读出。Hewitt & Liang(arXiv:1909.03368)用随机标签 control tasks 说明高 probe accuracy 可能来自 probe 自身记忆能力。故报告必须绑定 probe 类、样本量和 control;不能写“模型在该层使用了概念”。
5.2 Patching 与 causal abstraction 更强,但仍有旁路问题
Geiger et al.(arXiv:2106.02997)要求 low-level interchange intervention 复现预指定高层因果模型的反事实;DAS(arXiv:2303.02536)进一步搜索分布式子空间。这比 probe 更接近因果使用。
Makelov et al.(arXiv:2311.17030)却展示 subspace patching 可激活 dormant parallel pathway,使行为“看似概念被替换”,而该路径并非自然前向机制。Zhang & Nanda(arXiv:2309.16042)也显示 corruption、metric 和 patch 方向会改变归因图。可靠结论必须限定高层模型、干预族、支持集和替代路径,并验证自然激活、必要性、充分性与跨干预一致性。
5.3 CoT/AR 可以有用而不忠实
Turpin et al.(arXiv:2305.04388)显示偏置线索可改变答案,而 CoT 不披露线索并为错误合理化。Lanham et al.(arXiv:2307.13702)通过截断、错误注入和改写说明 CoT 对答案的因果作用随任务而变;修改文本前缀仍不等于恢复生成前的全部内部计算。
Baker et al.(arXiv:2503.11926)发现 CoT monitor 有助于检测 reward hacking,但将 monitor 强力纳入优化会诱发 obfuscation。Chen et al.(arXiv:2505.05410)先由行为确认 hint 被使用,再测 CoT 是否披露,发现 silent use 广泛存在。结论不是“CoT无用”,而是它是有增益、召回不完备、且可被优化破坏的监控通道。
5.4 方法配置决定证据强度
| 方法 + 实验配置 | 关联/可读性 | 干预下功能 | 自然路径必要性 | AR忠实披露 | 关键边界 |
|---|---|---|---|---|---|
| 高容量probe,无control | △ 测得可解码,但可能记忆标签 | — | — | — | 不能区分representation与probe能力 |
| Probe + 随机标签/selectivity control | ✓ 给定probe类下更可信的可恢复性 | — | — | — | Hewitt & Liang 2019;仍不证明模型使用 |
| MDL/online coding或互信息probe | ✓ 给定编码/估计器下的样本效率或信息量 | — | — | — | Pimentel 2020;Voita & Titov 2020;依赖编码器与估计假设 |
| Patching,单一corruption/metric | — | △ 该配置下的行为敏感性 | — | — | 结果可能随corruption、metric、方向改变 |
| Patching,多corruption + 支持集 + dose/necessity control | — | ✓ 对注册干预族更稳健的功能证据 | 空格:仍无干净充分证据 | — | 支持集外激活与旁路仍可能存在 |
| DAS/interchange,对齐预注册高层模型 | — | ✓ 给定任务与干预分布下,子空间足以传递高层因果信号 | 空格:不能单独证明自然路径 | — | Makelov 2023展示illusory alignment/dormant pathway |
| Activation steering + dose/副作用扫描 | — | ✓ 对选定方向的可控性 | — | — | Turner 2023;可控方向不等于自然表征或路径 |
| Knowledge editing + locality/ripple评估 | — | ✓ 参数干预能改变目标行为 | — | — | Hase 2023:localization不预测editing成功;不说明事实存储位置 |
| CoT截断/错误注入/改写 | — | △ 已生成文本对后续答案的作用 | — | △ 可证伪“总是忠实”,不能证实完整披露 | Turpin是行为级反事实;Lanham结论依任务而变 |
| 独立行为use test + 多内部干预 + hidden disclosure audit | — | ✓ 若多证据一致 | △ 只在注册任务/路径/干预族内 | △ 只对已确认use的因素估计conditional disclosure | 当前仍没有单一方法同时证明全局自然路径必要性与完整AR忠实性 |
✓/△/—分别表示该配置可直接支持、只能有限支持或不支持该主张。表中的空格是综述结论,而不是待用另一个指标补满:现有公开方法没有在开放任务中干净证明某高层变量沿自然前向路径既必要又充分,更没有同时证明AR完整披露这条路径。
这些方法不是可独立打勾的复选框。Probe偏向observability,steering/patching偏向controllability,bisimulation/causal abstraction约束跨层行为关系;从“可观察/可控制”跨到“自然路径使用”,还需必要性、支持集、路径特异性与替代机制排除。知识编辑只作为干预—定位错位的反例,不作为忠实披露证据。
5.5 Proposal 的忠实性定义
对某内部因素 c,先以支持集内行为反事实确认 c 影响决策,再以多种内部干预检验预注册高层因果模型;只有二者一致时,才评价 AR 是否披露该因素。任何单次 causal abstraction 或 patching 都不单独等同“自然计算使用”。核心量包括:
- use rate:c实际改变决策的比例;
- conditional disclosure:已使用c的样本中,AR正确披露的比例;
- silent-use rate:使用但不披露;
- rationalization rate:披露另一个与真实影响不符的理由;
- cross-readout coherence:文本、动作、对象表和未来预测对同一干预的一致性;
- external grounding:readout 与真实未来或工具执行相符。
跨 decoder transfer 最多证明 decoder-agnostic 可提取信号。还要加入同形不同义 counterfactual latent、adversarial/private-channel decoder、跨模板/任务和隐藏审计集;即便通过,也只宜称“降低私码风险”,不是忠实性保证。
6. 研究 Proposal
6.1 题目
可持续潜在工作状态:受控预测、递归滤波、决策充分性与 AR 忠实外化的统一研究
6.2 研究问题与中心假设
中心问题不是“continuous latent 是否比 token 更好”,而是:
在固定训练数据、参数量和推理预算下,能否学习一个持续、动作条件、可递归更新的内部状态,分别支持受控预测、递归滤波和指定任务族的决策价值?层内通信瓶颈、更新日程和多假设参数化各自贡献什么,什么审计约束能让 AR readout 披露自然计算实际使用的信息?
持续递归状态是唯一承重假设;其余三项彼此独立、均可失败:
- H1 状态目标:受控 observation+reward 预测、递归 self-prediction 与不确定性校准的联合目标,比 outcome-only latent 更接近声明范围内的 predictive/filtering state。
- H2a 通信假设:K/N只先验地改变I/O复杂度与通信容量;其是否带来能力正则必须由dense、不同K和iso-FLOPs比较决定。
- H2b 计算日程假设:有限步共享递归、定点求解和摊销迭代推断是不同机制;T、solver tolerance/NFE和M hypotheses分别扫描,不能合并成“更多思考”。
- H3 接口假设:多readout、随机decoder替换、支持集内干预和隐藏审计只能降低私码/合理化风险;只有先由独立行为反事实和多种内部干预共同确认使用,conditional disclosure才有忠实性含义。
6.3 最小系统与独立研究变量
承重结构
在时间 t,系统读取 observation o_t、上一动作 a_{t-1}、上一 reward/feedback r_{t-1} 与持续状态 W_{t-1},并用有限、显式的递归更新产生 W_t:
W_t = F_θ(W_{t-1}, o_t, a_{t-1}, r_{t-1})
这一定义只要求状态持续、动作条件、可递归更新;不要求K个slots、对象绑定、多假设、共享权重、fixed point或自然语言命题。
这里的“最小”仅相对于本文的持续部分可观测决策问题,而非架构普适最小性。它已经携带四项任务先验:环境按时间产生可区分的observation;action会改变未来分布;历史信息需要跨步保留;任务允许以递归状态作为预测/决策接口。若任务是静态QA、无动作视频表征或对象交换等变问题,这些先验分别可能多余、错误或不足。对象slots还额外假设近似可交换实体及slot—对象对应,不能以“更结构化”代替任务匹配证据。
独立研究变量
- 通信形式:dense state 对比 K communication latents;K首先是效率/容量变量。
- 计算日程:untied finite depth、T步共享递归/ACT、DEQ solver、diffusion/flow refinement分别比较。
- 不确定性形式:deterministic、parametric distribution、particles/M随机候选;固定总采样预算并检查particle degeneracy。
- 结构偏置:无结构latents对比对象slots/graph;只在匹配任务中解释。
最先执行的系统采用dense或足够宽的单一递归状态与普通有限步更新,因为它最少混入I/O瓶颈、solver和采样假设。K瓶颈、多假设、DEQ和diffusion是必要机制对照,而不是架构定义或可随意省略的装饰变体。
四类接口
- predictive head:动作条件 observation/reward distribution;
- filter head:下一状态分布与 uncertainty/calibration;
- policy/value head:声明 reward 和 policy class 下的 action/Q/value;
- AR/action readout:文本、程序、动作 token 或工具调用。
Readout 可访问 W,但训练时随机改变 decoder、输出表面形式或任务 query,避免状态只适配单一解码器。AR 保留精确序列生成、外部通信和工具协议职责。
6.4 防止答案暗码的训练课程
没有单一正则可以“保证非暗码”。建议采用逐层约束,每项对应一个替代解释。
阶段A:受控预测与递归闭合
- 预测未来 observation 与 reward,而非只预测答案;
- 对训练支持内的多个未来 action sequences 进行条件预测;
- 训练
W_{t+1}的递归更新,使相同 W 在相同 action/observation 下具有相同 next-W law; - 用 proper scoring rules 评价概率,不把样本多样性当校准。
这建立 predictive/filtering 候选,但不证明控制充分或语义可解释。
阶段B:多假设与覆盖
- 对 POMDP 采用显式分布、粒子或随机 latent;
- 报告 expected quality、NLL/Brier、coverage 与 calibration,而非只报 best-of-K;
- 固定总采样预算,防止候选越多自然提高 oracle 指标;
- 对 behavior support 外动作单独标记,不能以插值结果称反事实。
阶段C:高层变量的支持集内干预
在有 oracle 中间状态的 POMDP/DFA 中定义高层 causal model,执行 interchange intervention。要求:
- 干预样本仍在训练/环境支持内;
- 替换变量后,预测、动作和 readout 按高层模型共同变化;
- 检查自然激活、必要性、充分性和 dormant pathway;
- 更换 corruption、metric 和 patch 方向,结果仍稳定。
阶段D:多接口 grounding
- 从同一 W 预测文本、动作、未来观测或结构化状态;
- 随机冻结/替换 decoder,测跨 decoder transfer;
- 训练 adversarial decoder 寻找能预测答案、却不能被任务语义解释的副信道;
- 设置不参与训练的 hidden audit split;
- readout monitor 不直接成为唯一训练目标,避免 Goodhart。
阶段E:AR 忠实披露
先以行为或内部干预确认某因素被使用,再计算 conditional disclosure、silent-use 和 rationalization。开放域语言只做外部效度;主结论来自有唯一状态/命题真值的结构化任务。
6.5 基线与公平比较
| 问题 | 必需基线 | 控制变量 |
|---|---|---|
| latent是否优于文本中间过程 | outcome-only AR、显式CoT、Coconut式hidden回灌 | 同训练token、同backbone、同答案监督 |
| K瓶颈是否有能力作用 | dense tokens、不同K、同FLOPs下调整宽度/深度 | 输入相同;同时报告参数、FLOPs、内存和墙钟 |
| 迭代是否优于额外深度 | J步共享、J层untied、宽浅同FLOPs | 同参数与同FLOPs需分别报告,不能混为一个对照 |
| 动力学形式 | recurrent、untied、ACT/Ponder、DEQ、diffusion/flow | 同状态容量、训练数据、NFE/迭代预算和readout |
| 多假设价值 | deterministic、stochastic、fixed-total-budget particles | expected指标、校准、coverage,不只best-of-K |
| 对象结构增量 | 无结构latents、slots/graph、oracle objects | 同状态维度与decoder;只在对象匹配任务声称增益 |
| readout忠实性 | 单decoder、decoder swap、adversarial decoder、oracle readout | 先固定内部use,再比较披露;hidden audit不参与训练 |
不能仅用 iso-FLOPs 一个数字判断表达力:共享迭代、DEQ solver 和 diffusion 的优化难度不同。因此需同时给训练成功率、有效 function evaluations、收敛残差和多 seed 分布。
6.6 最小诊断任务族
任务选择遵循“共享系统、单变量切换”,而不是堆 benchmark。
任务1:完全可解的 POMDP
以 Tiger 或公开完整 T,O,R,γ,H 的参数化任务为原型,扫描 cue reliability、query cost、memory distance 和 reward delay。比较 observation-only、history、oracle state 与 oracle belief。它能把 history→belief 的滤波误差、belief→action 的控制误差和主动 sensing 的价值误差分开。
任务2:可验证 DFA rollout
每个 prefix 都有唯一 automaton state q_t。测试 seen/unseen automata、长度外推、held-out transitions 和 state-label permutation。它提供低成本的 causal abstraction 与 readout ground truth,但不外推为一般世界建模能力。
任务3:Paired-render 控制
对同一 simulator trajectory 生成 clean、background-only、color-only 与 camera-only observation。背景/颜色主要测 nuisance sensitivity;camera 单列,因为会改变几何与可观测性。加入 simulator-state oracle 与 mask oracle,避免把视觉不可恢复误作状态压缩失败。
任务4:因子化 offline navigation
固定 maze、transition pool 与低层 controller,分别改变 coverage、trajectory fragmentation、behavior mixture 和 reward visibility;在相同 transition IDs 上做 goal/reward relabel。D4RL AntMaze只作为外部压力测试,不能把 play/diverse 当单因素对照。
任务5:固定动力学 reward family
固定 XML、transition kernel、初始分布和 observation/action map,只替换会诱导不同最优动作的 reward。分别给显式 goal descriptor、需从交互推断 task 和 oracle descriptor。Meta-World跨 task families 作为联合 shift,不承担 pure-reward 结论。
| 任务 | 主要诊断 | Oracle | 明确不能推出 |
|---|---|---|---|
| Tabular POMDP | belief/filter、主动感知、control | exact belief/Q | 开放视觉与长记忆通用能力 |
| DFA rollout | 递归state、长度外推、因果readout | prefix state | 唯一内部算法或真实世界状态 |
| Paired-render control | nuisance不变性与观察过滤 | simulator state | dynamics/reward shift鲁棒性 |
| Factorial offline navigation | coverage、policy support、stitching | reachability/transition IDs | 一般OOD因果泛化 |
| Fixed-dynamics reward family | reward重定义下control sufficiency | reward/Q/policy disagreement | 跨对象/动力学迁移 |
6.7 指标与判定逻辑
三类充分性分别报告
- 预测:interventional NLL/proper score、不同 action sequences 与 horizons、reward prediction;
- filtering:belief KL/TV 或 state-distribution calibration、递归闭合误差、history aliasing;
- control:Q/action preservation、regret、reward redefinition、policy/data support shift。
不得以最终 task return 替代前两类,也不得以 reconstruction loss 替代 control。
Readout 审计
报告 probe selectivity、interchange intervention accuracy、自然路径/旁路检查、use-conditioned disclosure、silent use、rationalization、跨 readout一致性和外部grounding。每个指标都注明它排除了什么、仍未排除什么。
成本
同时报告训练token/transition、参数、训练FLOPs、推理FLOPs/NFE、峰值内存、墙钟、采样数、solver residual和多seed失败率。共享参数不等于算力更少,DEQ低激活内存也不等于推理更快。
6.8 分阶段 Go/No-Go 门
- 协议门:在 tabular POMDP/DFA 上,指标必须能复现已知分离反例;否则停止扩展。
- 状态门:相对 outcome-only 与 dense baseline,至少两种充分性在同预算下改善,且第三种不发生不可接受退化。
- 覆盖门:收益必须在 behavior policy变化或 reward重定义时仍有部分保留;若只在训练流形有效,只称分布内压缩。
- 因果门:关键高层变量通过多种支持集内 intervention,且排除明显 dormant pathway;否则只称可读/可控接口。
- 表达门:AR 在已确认use的样本上提高conditional disclosure并降低silent-use,同时hidden audit不恶化;否则readout只作为任务decoder。
- 规模门:若新增动力学只以更多NFE换来收益,或对seed/solver高度敏感,不扩大模型规模。
6.9 预期贡献
- 一个严格区分 representational bottleneck 与 predictive-state bottleneck 的统一问题定义;
- 一个把预测、belief/filtering、control/value 分开评估的持续 latent workspace;
- 一套不依赖开放域语言命题的 causal abstraction 与 readout 审计;
- 一个将通信容量K、有限步数T、solver/NFE与候选数M分开控制的同预算比较框架;
- 对 diffusion/flow、recurrent、DEQ/energy 的条件性路线裁决,而非预设冠军;
- 关于何时 AR 是忠实接口、何时只是合理化 decoder 的经验边界。
6.10 风险与失败解释
| 失败 | 可能原因 | 正确结论 |
|---|---|---|
| K越小效果越差 | 信息容量不足或优化变难 | 不说明latent workspace无效,只否定该K/预算 |
| 更多有限步递归无收益 | 额外步数未学会修订、共享欠参数、训练T过拟合 | 不说明DEQ或摊销迭代推断无效 |
| diffusion更好 | 可能来自更多NFE、噪声正则或多样采样 | 需同预算分解,不能直接归因全局修订 |
| probe高、patch低 | 信息存在但未被自然使用,或干预不匹配 | 不称因果变量 |
| patch高、自然路径证据弱 | 可能激活旁路 | 只称可操控子空间 |
| 多decoder都成功 | 可能共享shortcut/private protocol | 只称decoder-agnostic可提取性 |
| CoT披露提高但行为不变 | 可能学会更像解释的文本 | 不称忠实性提高 |
| 控制回报高但预测差 | 任务定向control quotient | 可是成功的控制状态,不是完整世界模型 |
7. 应用场景与路线选择
- 需要流式交互和部分可观测决策:优先 recurrent stochastic state + AR/action heads;先解决filter与coverage。
- 需要精确结构化交流/工具调用:保留强AR decoder,latent只承担状态与候选计划。
- 需要多未来与约束修订:再比较particles、diffusion/flow与全局masked refinement;固定总采样预算。
- 对象边界明确的机器人/视频:对象slots可作为扩展,但必须有无结构同容量baseline。
- 静态QA或短数学题:continuous latent可能只是更省token的计算介质,不应包装为world workspace。
- 高风险可审计系统:不要只依赖CoT monitor;并行保留行为审计、环境grounding和隐藏测试。
8. 证据边界与尚未解决的问题
公开事实支持
现有研究分别证明了词表外计算、latent rollout控制、有限latent计算接口、对象化预测、共享迭代、固定点求解、局部causal alignment和CoT不忠实等组件事实。
综合推断
以持续递归状态为核心、让AR成为读写接口在机制上可行;K瓶颈、多假设、对象结构与不同迭代谱系也都能与之组合。但任何组合是否改善迁移、是否形成任务充分状态,仍需proposal中的独立因子控制。
仍未知
- 什么约束在大规模开放任务中真正抑制私码,而非只让私码更稳健?
- 有限带宽在iso-FLOPs下是能力正则还是纯效率折中?
- 共享迭代是否在自然任务中产生算法外推,还是主要增加优化难度?
- 多假设latent能否在固定采样成本下改善决策,而非只提高best-of-K?
- causal alignment能否跨任务、跨模型和跨训练阶段稳定?
- AR disclosure在被直接优化后能否保持审计有效性?
9. 结论
连续 dLLM 最值得研究的版本,不是“把思维链藏起来”,而是建立一个持续、带不确定性、可被动作与观察更新的内部状态,并让语言成为可验证的外部接口。该方向的科学核心也不在某个热门生成器,而在四条可分离证据链:状态对未来是否充分、对部分可观测历史是否能递归过滤、对声明决策是否保值,以及外显语言是否忠实反映自然计算。
因此,推荐路线是先在可完全求解的任务上建立严格审计,再进入视觉控制和开放语言;先比较瓶颈与迭代,再决定是否引入对象拓扑、diffusion或外部memory;保留AR用于离散执行与沟通,但拒绝把流畅解释当作内部机制证明。如果这些门槛能够跨任务成立,这一方向可能成为从“生成文本”走向“维护可操作世界状态”的关键桥梁;如果只能提高答案准确率或压缩CoT,它更可能是一种有用但有限的推理加速技术。
参考文献
以下均为本文实际使用的稳定入口;日期以本文检索截止日 2026-07-21 可得版本为准。
- Coconut — *Training Large Language Models to Reason in a Continuous Latent Space*. arXiv:2412.06769
- CODI — *Compressing Chain-of-Thought into Continuous Space via Self-Distillation*. arXiv:2502.21074
- Diffusion of Thoughts. arXiv:2402.07754
- Diffusion Forcing. arXiv:2407.01392
- Large Concept Models. arXiv:2412.08821
- PlaNet — *Learning Latent Dynamics for Planning from Pixels*. arXiv:1811.04551
- Dreamer — *Dream to Control*. arXiv:1912.01603
- V-JEPA 2. arXiv:2506.09985
- SAVi — *Conditional Object-Centric Learning from Video*. arXiv:2111.12594
- SlotFormer. arXiv:2210.05861
- C-SWM — *Contrastive Learning of Structured World Models*. arXiv:1911.12247
- Perceiver IO. arXiv:2107.14795
- Set Transformer. arXiv:1810.00825
- Universal Transformers. arXiv:1807.03819
- ALBERT. arXiv:1909.11942
- Deep Equilibrium Models. arXiv:1909.01377
- *Stabilizing Equilibrium Models by Jacobian Regularization*. arXiv:2106.14342
- Energy Transformer. arXiv:2302.07253
- Littman, Sutton & Singh — *Predictive Representations of State*. NeurIPS 2001
- Singh, James & Rudary — *Predictive State Representations*. arXiv:1207.4167
- Smallwood & Sondik — *Optimal Control of Partially Observable Markov Processes*. DOI:10.1287/opre.21.5.1071
- Subramanian et al. — *Approximate Information State*. JMLR 23(12), arXiv:2010.08843
- Givan, Dean & Greig — *Equivalence Notions and Model Minimization in MDPs*. DOI00002-0)
- Ferns, Panangaden & Precup — *Metrics for Finite MDPs*. arXiv:1207.4114
- Grimm et al. — *The Value Equivalence Principle*. arXiv:2011.03506
- Grimm et al. — *Proper Value Equivalence*. arXiv:2106.10316
- Alain & Bengio — *Understanding Intermediate Layers Using Linear Classifier Probes*. arXiv:1610.01644
- Hewitt & Liang — *Designing and Interpreting Probes with Control Tasks*. arXiv:1909.03368
- Belinkov — *Probing Classifiers: Promises, Shortcomings, and Advances*. arXiv:2102.12452
- Geiger et al. — *Causal Abstractions of Neural Networks*. arXiv:2106.02997
- Geiger et al. — *Finding Alignments...* (DAS). arXiv:2303.02536
- Makelov et al. — *An Interpretability Illusion for Subspace Activation Patching*. arXiv:2311.17030
- Zhang & Nanda — *Best Practices of Activation Patching*. arXiv:2309.16042
- Turpin et al. — *Language Models Don't Always Say What They Think*. arXiv:2305.04388
- Lanham et al. — *Measuring Faithfulness in Chain-of-Thought Reasoning*. arXiv:2307.13702
- Baker et al. — *Monitoring Reasoning Models for Misbehavior...*. arXiv:2503.11926
- Chen et al. — *Reasoning Models Don't Always Say What They Think*. arXiv:2505.05410
- Meng et al. — ROME. arXiv:2202.05262
- Hase et al. — *Does Localization Inform Editing?* arXiv:2301.04213
- Cassandra, Kaelbling & Littman — *Acting Optimally in Partially Observable Stochastic Domains*. AAAI 1994 PDF
- Stone et al. — *The Distracting Control Suite*. arXiv:2101.02722
- Fu et al. — D4RL. arXiv:2004.07219
- Yu et al. — Meta-World. arXiv:1910.10897
- Power et al. — Grokking. arXiv:2201.02177
- Zhong et al. — *The Clock and the Pizza*. arXiv:2306.17844
- Delétang et al. — *Neural Networks and the Chomsky Hierarchy*. arXiv:2207.02098
- Zhou et al. — *What Algorithms can Transformers Learn?* arXiv:2310.16028
- Pimentel et al. — *Information-Theoretic Probing for Linguistic Structure*. ACL 2020
- Voita & Titov — *Information-Theoretic Probing with Minimum Description Length*. EMNLP 2020
- Turner et al. — *Steering Language Models With Activation Engineering*. arXiv:2308.10248
- Gordon, Salmond & Smith — *Novel Approach to Nonlinear/Non-Gaussian Bayesian State Estimation*. DOI:10.1049/ip-f-2.1993.0015
- Kong, Liu & Wong — *Sequential Imputations and Bayesian Missing Data Problems*. DOI:10.1080/01621459.1994.10476469
- Doucet, Godsill & Andrieu — *On Sequential Monte Carlo Sampling Methods for Bayesian Filtering*. DOI:10.1023/A:1008935410038