连续潜在思维与 AR 统一架构:从持续世界状态到可审计表达

面向研究人员的机制级综述与学术 proposal。本文讨论的不是“把文本思维链压成向量”,而是能持续更新、保持不确定性、接受局部干预,并通过语言、动作或视觉接口外化的潜在工作状态。

摘要

连续 latent reasoning 正处在一个容易被概念混淆拖累的阶段。Coconut、CODI 等工作说明语言模型可以在词表之外继续计算;PlaNet、Dreamer、V-JEPA 2 等说明潜状态可以支持预测或控制;Perceiver、Slot Attention、Universal Transformer、DEQ 和 diffusion/flow 则分别提供有限带宽、结构绑定、迭代计算、平衡态或全局修订机制。然而,这些结果并没有共同证明一个统一的“非语言思维空间”已经存在。预测准确不等于 belief/filtering 充分,控制成功不等于完整世界状态,probe 可解码不等于模型自然使用该信息,AR 解释流畅更不等于它忠实披露内部计算。

本文提出一个更窄也更可检验的研究方向:把系统的承重结构定义为持续、动作条件、可递归更新的潜在工作状态,以自回归模型承担精确离散执行和交流,而不是把 AR 完全替代。层内通信瓶颈 K、有限步/定点/摊销推断日程和多假设参数化不再捆绑为一个架构,而是在固定预算下分别评价;状态则分别接受受控预测、belief/filtering、control/value 三类充分性审计。最后,以行为反事实与多种支持集内干预共同审计内部使用,再以条件披露、跨 readout grounding 和隐藏审计集检查 AR 接口。

核心判断是:这个方向值得投入,但目前属于“证据链可构建、中心结论尚未被现有论文证明”的高潜力研究,而不是已经成熟的统一范式。

1. 五分钟结论

1.1 我怎么看这个方向

如果把“连续 dLLM”理解为用连续向量替换几个 CoT token,我并不认为它足以形成长期研究壁垒:这一路线容易退化为压缩、蒸馏或私有码,而且很难说明中间状态为何具有任务语义。

如果把问题改写为:

能否训练一个持续、动作条件、可干预、跨模态的 latent world workspace,并分别检验有限通信、更新日程和多假设表示的增量价值,再由 AR 模型将内部状态转化为语言、工具调用和动作?

那么它连接了 POMDP 状态估计、PSR、世界模型、连续推理、迭代生成、mechanistic interpretability 与可验证语言接口,具有明确而尚未闭合的研究缺口。

1.2 三条最重要的判断

  1. AR 不应被消灭。 更合理的系统分工是“连续维护状态,离散执行,AR 交流”:think continuously, act discretely, communicate autoregressively
  2. Diffusion 只是候选动力学。 它可能擅长多假设、受扰恢复和全局修订,但现有公开证据没有在同数据、同状态容量、同 FLOPs 下证明它优于 recurrent、untied depth、DEQ 或 energy dynamics。
  3. 最大的科学风险是暗码而非不可读。 即使 latent 可被 probe 或多个 decoder 读取,它仍可能只是任务特定答案码;必须分开验证预测/控制充分性、内部自然因果使用和外部忠实表达。

1.3 投资决策

决策建议
是否值得做值得,但应按“状态充分性 + 因果可干预性 + 接口忠实性”的联合问题立项,不以“continuous CoT”命名中心贡献
最小架构持续、动作条件、可递归更新的内部状态 + AR/action readout;K瓶颈、多假设、共享迭代、DEQ、diffusion和对象slots均作为彼此独立的机制变量
第一优先级在可完全求解的 POMDP/DFA 中建立无歧义评测协议,再上视觉控制和语言
暂不声称类脑;完整世界模型;消灭 token;diffusion 天生更会推理;跨 decoder 一致即忠实
扩大投入的门槛在同预算下,状态同时改善至少两类充分性,并通过支持集内因果干预与隐藏 readout 审计;若只提高最终答案,不扩大投入

2. 概念边界:连续不等于非语言,潜在不等于世界状态

2.1 四个容易混淆的对象

  1. 文本 CoT 的连续压缩:把已有推理文本映射到 hidden/soft embeddings;主要减少 token 或蒸馏过程。
  2. 自由 latent computation:模型把 hidden state 回灌或插入 pause slots,在没有中间词的情况下继续变换表示。
  3. 持续世界状态:状态跨时间更新,能对动作条件未来、不确定性或任务价值提供足够统计量。
  4. AR readout:把内部状态转成文本、程序、动作 token 或工具调用;这是接口,不是内部状态本体。

Coconut(arXiv:2412.06769)属于第二类,其 curriculum 将显式 CoT 步骤逐步替换为连续 hidden states;CODI(arXiv:2502.21074)更接近 CoT 自蒸馏。它们证明“词表不是唯一计算介质”,但公开实验不足以证明形成了跨任务、对象持续、可局部干预的世界状态。

2.2 两种“瓶颈”必须分名

Perceiver IO 的 K latents 直接支持第一种,不直接证明第二种。PSR 和 belief state 讨论第二种,不要求实现一定是 K 个 slots。把两者都叫“latent bottleneck”会把效率证据误写成世界状态证据。

3. 三种充分性:统一架构不能靠统一术语偷换

令历史为 h_t,状态为 z_t=φ(h_t)

3.1 受控预测充分性

强定义要求:若两个历史映射到同一状态,则在声明 action sequence、horizon 和 test family 下,未来 observation 与 reward 的联合分布相同。动作必须是干预语义,而不是只在 behavior policy 下做条件预测。

PSR 用 core tests 的受控预测表示状态;core tests 必须能重构全部声明 tests。经典来源是 Littman, Sutton & Singh(NeurIPS 2001)及 Singh, James & Rudary(arXiv:1207.4167)。仅预测下一帧、只预测 observation、不包含 reward,或只覆盖数据策略,都不足以推出控制相容的预测充分性。

3.2 Belief/filtering 充分性

对一个明确 latent-state model,belief 是 b_t(x)=P(X_t=x|H_t)。若 z_t 可恢复 belief,并存在 z_{t+1}=F(z_t,a_t,o_{t+1},r_t) 的递归更新,它才是该模型的 filter state。完整 belief 可能保留与当前控制无关的 nuisance,因此不一定是最小控制状态。

3.3 Control/value 充分性

必须声明 reward、discount、horizon 与 policy class。至少应使 Q*(h,a) factor through z;只保持 V* 不够,因为相同 V* 可对应不同最优动作。Value Equivalence(arXiv:2011.03506)还明确依赖策略集和函数集。

在正确 POMDP、预测包含 reward、覆盖全部候选动作干预等条件下,可以写:

完整 belief ⇒ 完整受控预测 ⇒ 全策略 value 充分 ⇒ 最优控制充分

反方向通常不成立。控制状态可丢弃与 reward 无关的未来;预测状态可能只是 belief 的可观测等价商;有限预测 horizon 也不能自动支持长期控制。

3.4 AIS 与 bisimulation 提供的边界

Approximate Information State(Subramanian et al., arXiv:2010.08843)以“当前 reward 只依赖状态”和“下一状态分布只依赖当前状态/动作”支持近似动态规划,但它不要求预测全部未来 observation。其误差界依赖所选 IPM 函数类及 ρ_F(V),不能被简写为无条件的 (ε+δ)/(1-γ)

Bisimulation 要求逐动作 reward 相同、向各等价类的 transition probability 相同。它给出行为模型接近推向 value 接近的单向保证;value 接近不能反推 dynamics 或 bisimulation 接近。

3.5 五轴三态:充分性是算子级承诺

记号:=在论文定义与显式假设下承诺;=只在训练/behavior support或指定子类内承诺;=不承诺。三态描述理论/方法的保证范围,不代表任何实现已经从有限数据识别出该对象。

理论对象Action supportTest/observation familyReward familyHorizonPolicy class一手出处与最窄主张
PSR/core tests 可执行且被数据识别的tests;support外不保证 仅声明test family及其core closure 原定义主要表征observation tests;除非把reward并入测试 由有限/无限test定义及可实现性限定 表示不必等于behavior policy,但离线识别依赖探索/覆盖Littman, Sutton & Singh 2001;Singh, James & Rudary 2012:受控test预测,不是环境内禀状态
完整POMDP belief 对模型动作转移可更新 对给定正确latent model与observation kernel belief更新本身可不依赖reward,控制用途依赖reward 递归filter;控制结论另依赖horizon/discount 作为模型后验可服务多策略,但前提是模型正确Smallwood & Sondik 1973:给定模型的后验充分统计,不是最小控制状态
AIS 对定义中的action与近似kernel 保持即时reward与next-AIS所需信息,不是全部未来观测 仅指定reward/近似类 误差累计依赖discount/horizon与ρ_F(V) 保证面向声明控制问题/策略优化,不是任意策略族Subramanian et al. 2022:近似动态规划状态,不是belief替代或完整预测状态
Bisimulation/metric 对声明action set逐动作比较 对向等价类的transition行为 固定reward或明确reward family 在discounted/finite设定及metric假设下给value界 若逐动作条件成立可服务该MDP策略,但不跨reward重定义Givan et al. 2003;Ferns et al. 2012:reward-and-transition等价,value接近不反推bisimulation
Value equivalence 只对指定Bellman/planning operators涉及的动作 不要求重建完整observation/dynamics 指定value/function family内 指定backup/planning depth与discount 仅声明policy class ΠGrimm et al. 2020/2021:within-Π/function-class的value计算一致,不是“学到任务相关内禀状态”
离线世界模型 仅behavior-support内有经验识别基础 训练/评估observation family内 仅已观测或明确relabel且同transition的数据 随rollout horizon增加误差与coverage风险 评估occupancy须与数据occupancy重叠D4RL(arXiv:2004.07219)只提供分布压力测试;高return不证明support外模型正确

因此,本文中的“世界状态”一律指明 action support × test family × reward family × horizon × policy class。On-policy、off-policy但within-support、环境可执行的paired intervention和support外OOD必须分栏;只有动作可执行且具有识别覆盖的干预才可称受控反事实,模型自由rollout只能称预测或外推。

4. 现有技术路线:它们分别解决了哪一段

4.1 连续语言推理:越过词表,但未建立世界状态

Coconut、CODI、pause-token/implicit reasoning 路线的共同信息流是:输入 token 经 Transformer 编码后,不立即生成可读 CoT,而把 hidden state 作为后续计算输入,最终再回到答案 token。训练常用答案交叉熵、显式 CoT curriculum 或自蒸馏。

优势是降低固定语言表面的约束,并允许一个连续状态承载多个潜在后续。局限是监督仍可能只要求输出正确答案;latent 因而可以学习答案暗码,而非可迁移过程变量。仅凭准确率或 t-SNE 结构不能排除这一点。

4.2 Diffusion/flow 与全局修订

Diffusion of Thoughts(arXiv:2402.07754)把噪声—去噪用于推理轨迹;Diffusion Forcing(arXiv:2407.01392)把不同时间位置置于不同噪声水平,统一 next-token 与 full-sequence diffusion 的训练视角。扩散式状态允许反复更新全部变量、从随机初态保留多个候选,并可用 guidance 加入约束。

但这些能力分解后是三项原子机制:迭代 refinement、全局修订、随机多假设。Mask-Predict、MaskGIT、recurrent refinement 或粒子方法也可以实现其中一部分。现有跨论文比较同时改变数据、骨干、目标和采样预算,因此不能把任何收益因果归于 diffusion。

4.3 潜在世界模型:预测与控制的强先例

PlaNet(arXiv:1811.04551)从像素学习 recurrent state-space model,并在 latent imagination 中规划;Dreamer(arXiv:1912.01603)在 latent rollout 上学习 actor/critic。V-JEPA 2(arXiv:2506.09985)以视频表征预测为核心,并在动作条件变体中展示规划。

这些工作证明 latent rollout 可以成为有效决策工具,但其语义是 coverage-conditioned 的:状态由训练策略访问的数据流形塑造。控制回报不能证明完整 belief、PSR core-test closure、OOD 动作可靠性或可解释世界变量。

4.4 对象化状态:局部干预的有力偏置,但非通用必要条件

SAVi(arXiv:2111.12594)、SlotFormer(arXiv:2210.05861)及 C-SWM 将视觉场景分为可交换 slots/对象节点,并预测其时间演化。它们在对象明确、运动线索充分的环境中提供身份持续、组合 dynamics 和局部替换接口。

其证据主要来自合成或受控多对象场景;真实视频中的纹理预训练、光流、首帧提示、背景处理和 decoder 容量常与对象拓扑共同变化。对象 slots 因此适合作为结构匹配任务的扩展假设,而非统一 workspace 的硬前提。

4.5 有限 latent 工作集:计算接口强,语义证据弱

Perceiver IO(arXiv:2107.14795)用 K 个 latent queries 读取 N 个输入,在 K latents 上进行深处理,再由输出 queries 写出,注意力主项约为 O(NK + LK² + OK)。它可靠支持的是内部计算与输入/输出长度解耦,而不是 latent 具有推理语义。

Set Transformer(arXiv:1810.00825)的 ISAB 每层执行 N→m→N,复杂度 O(Nm);它与 Perceiver 的“一次读入、内部长期处理”并非同一计算图。两者的 K/m sweep 都不足以证明存在跨任务最佳瓶颈。

4.6 三种迭代谱系不能合并

归属判据不是“代码里有循环”,而是模型语义中什么对象被定义、训练和比较

Perceiver/Set Transformer属于K控制的信息读写/通信瓶颈,不因内部有多层处理就归入时间递归;UT/ALBERT属于depth-tied展开,不因共享权重就成为DEQ;DEQ不因solver多步就等同diffusion或particle inference。

有限步共享递归(unrolled recurrence)

Universal Transformer(arXiv:1807.03819)重复共享 attention/transition,并可用 ACT 对位置动态停机;ALBERT(arXiv:1909.11942)以跨层共享提高参数效率。它们展开有限计算图,用普通反向传播训练,不要求 W^{j+1}=W^j,也不承诺测试时收敛。ALBERT观察到深层表示振荡,UT的time encoding还使每一步算子依赖步数。其主要动机是参数复用和可调计算,而不是固定点语义。

定点求解(fixed-point solve)

DEQ(arXiv:1909.01377)显式寻找 z*=f(z*,x),通过隐式微分避免保存全部展开激活。其证据主要关于有效深度和激活内存;代价是求根次数、Jacobian条件、收敛容差和批内最慢样本。Jacobian Regularization(arXiv:2106.14342)直接说明稳定性不是自动获得的。DEQ是机制对照,不是共享递归的别名。

摊销迭代推断(amortized iterative inference)

Diffusion/flow、粒子滤波与重采样、迭代masked refinement通过一系列学习更新近似后验或候选分布。其主要动机是多模态、不确定性和全局修订;性能与采样数/NFE、noise schedule、proposal质量和particle degeneracy纠缠。它们不要求固定点唯一,也不等价于参数共享。多假设是否有效必须报告expected指标、校准和有效样本,而非只看best-of-M。

这三条谱系都“多步更新”,但分别改变参数复用、求解语义和状态分布。终稿因此不再使用单一“迭代轴”承载三者;比较时分别控制T steps、solver tolerance/NFE和M hypotheses/总采样预算。

4.7 路线比较

路线内部状态主要动机推理日程最强证据主要不足
连续CoT/hidden回灌LM hidden states越过词表、减少中间token有限latent steps→AR可越过词表计算易退化为答案暗码;缺跨任务状态语义
摊销迭代推断带噪轨迹/particles/候选多模态、修订与后验近似denoise/resample/refine多样性、guidance与全局修订与NFE、采样预算、退化混杂
RSSM/world modeldeterministic+stochastic latent递归过滤与控制filter→rollout→plan/actor闭环控制价值coverage与模型漏洞;非完整belief证明
Object-centric dynamicsslots/图节点结构绑定绑定→对象更新→readout局部结构与组合任务特化,真实场景证据弱
Representational bottleneckK latentsI/O/通信复杂度read→process→write计算与I/O解耦K的能力作用与FLOPs未解耦
有限步共享递归共享状态参数复用、可调test-time computeT步或动态停止参数效率、部分算法外推无收敛承诺;优化与额外步数成本
DEQ/energy平衡态/能量变量定点/约束求解、低激活内存solver到容差隐式深度与内存优势收敛、唯一性和运行时风险

5. Readout:信息存在、被使用、被说出是三件事

5.1 Probe 只回答可恢复性

Alain & Bengio(arXiv:1610.01644)的线性 probe 能显示类别信息在哪些层可线性读出。Hewitt & Liang(arXiv:1909.03368)用随机标签 control tasks 说明高 probe accuracy 可能来自 probe 自身记忆能力。故报告必须绑定 probe 类、样本量和 control;不能写“模型在该层使用了概念”。

5.2 Patching 与 causal abstraction 更强,但仍有旁路问题

Geiger et al.(arXiv:2106.02997)要求 low-level interchange intervention 复现预指定高层因果模型的反事实;DAS(arXiv:2303.02536)进一步搜索分布式子空间。这比 probe 更接近因果使用。

Makelov et al.(arXiv:2311.17030)却展示 subspace patching 可激活 dormant parallel pathway,使行为“看似概念被替换”,而该路径并非自然前向机制。Zhang & Nanda(arXiv:2309.16042)也显示 corruption、metric 和 patch 方向会改变归因图。可靠结论必须限定高层模型、干预族、支持集和替代路径,并验证自然激活、必要性、充分性与跨干预一致性。

5.3 CoT/AR 可以有用而不忠实

Turpin et al.(arXiv:2305.04388)显示偏置线索可改变答案,而 CoT 不披露线索并为错误合理化。Lanham et al.(arXiv:2307.13702)通过截断、错误注入和改写说明 CoT 对答案的因果作用随任务而变;修改文本前缀仍不等于恢复生成前的全部内部计算。

Baker et al.(arXiv:2503.11926)发现 CoT monitor 有助于检测 reward hacking,但将 monitor 强力纳入优化会诱发 obfuscation。Chen et al.(arXiv:2505.05410)先由行为确认 hint 被使用,再测 CoT 是否披露,发现 silent use 广泛存在。结论不是“CoT无用”,而是它是有增益、召回不完备、且可被优化破坏的监控通道。

5.4 方法配置决定证据强度

方法 + 实验配置关联/可读性干预下功能自然路径必要性AR忠实披露关键边界
高容量probe,无control 测得可解码,但可能记忆标签不能区分representation与probe能力
Probe + 随机标签/selectivity control 给定probe类下更可信的可恢复性Hewitt & Liang 2019;仍不证明模型使用
MDL/online coding或互信息probe 给定编码/估计器下的样本效率或信息量Pimentel 2020;Voita & Titov 2020;依赖编码器与估计假设
Patching,单一corruption/metric 该配置下的行为敏感性结果可能随corruption、metric、方向改变
Patching,多corruption + 支持集 + dose/necessity control 对注册干预族更稳健的功能证据空格:仍无干净充分证据支持集外激活与旁路仍可能存在
DAS/interchange,对齐预注册高层模型 给定任务与干预分布下,子空间足以传递高层因果信号空格:不能单独证明自然路径Makelov 2023展示illusory alignment/dormant pathway
Activation steering + dose/副作用扫描 对选定方向的可控性Turner 2023;可控方向不等于自然表征或路径
Knowledge editing + locality/ripple评估 参数干预能改变目标行为Hase 2023:localization不预测editing成功;不说明事实存储位置
CoT截断/错误注入/改写 已生成文本对后续答案的作用 可证伪“总是忠实”,不能证实完整披露Turpin是行为级反事实;Lanham结论依任务而变
独立行为use test + 多内部干预 + hidden disclosure audit 若多证据一致 只在注册任务/路径/干预族内 只对已确认use的因素估计conditional disclosure当前仍没有单一方法同时证明全局自然路径必要性与完整AR忠实性

✓/△/—分别表示该配置可直接支持、只能有限支持或不支持该主张。表中的空格是综述结论,而不是待用另一个指标补满:现有公开方法没有在开放任务中干净证明某高层变量沿自然前向路径既必要又充分,更没有同时证明AR完整披露这条路径。

这些方法不是可独立打勾的复选框。Probe偏向observability,steering/patching偏向controllability,bisimulation/causal abstraction约束跨层行为关系;从“可观察/可控制”跨到“自然路径使用”,还需必要性、支持集、路径特异性与替代机制排除。知识编辑只作为干预—定位错位的反例,不作为忠实披露证据。

5.5 Proposal 的忠实性定义

对某内部因素 c,先以支持集内行为反事实确认 c 影响决策,再以多种内部干预检验预注册高层因果模型;只有二者一致时,才评价 AR 是否披露该因素。任何单次 causal abstraction 或 patching 都不单独等同“自然计算使用”。核心量包括:

跨 decoder transfer 最多证明 decoder-agnostic 可提取信号。还要加入同形不同义 counterfactual latent、adversarial/private-channel decoder、跨模板/任务和隐藏审计集;即便通过,也只宜称“降低私码风险”,不是忠实性保证。

6. 研究 Proposal

6.1 题目

可持续潜在工作状态:受控预测、递归滤波、决策充分性与 AR 忠实外化的统一研究

6.2 研究问题与中心假设

中心问题不是“continuous latent 是否比 token 更好”,而是:

在固定训练数据、参数量和推理预算下,能否学习一个持续、动作条件、可递归更新的内部状态,分别支持受控预测、递归滤波和指定任务族的决策价值?层内通信瓶颈、更新日程和多假设参数化各自贡献什么,什么审计约束能让 AR readout 披露自然计算实际使用的信息?

持续递归状态是唯一承重假设;其余三项彼此独立、均可失败:

6.3 最小系统与独立研究变量

承重结构

在时间 t,系统读取 observation o_t、上一动作 a_{t-1}、上一 reward/feedback r_{t-1} 与持续状态 W_{t-1},并用有限、显式的递归更新产生 W_t

W_t = F_θ(W_{t-1}, o_t, a_{t-1}, r_{t-1})

这一定义只要求状态持续、动作条件、可递归更新;不要求K个slots、对象绑定、多假设、共享权重、fixed point或自然语言命题。

这里的“最小”仅相对于本文的持续部分可观测决策问题,而非架构普适最小性。它已经携带四项任务先验:环境按时间产生可区分的observation;action会改变未来分布;历史信息需要跨步保留;任务允许以递归状态作为预测/决策接口。若任务是静态QA、无动作视频表征或对象交换等变问题,这些先验分别可能多余、错误或不足。对象slots还额外假设近似可交换实体及slot—对象对应,不能以“更结构化”代替任务匹配证据。

独立研究变量

  1. 通信形式:dense state 对比 K communication latents;K首先是效率/容量变量。
  2. 计算日程:untied finite depth、T步共享递归/ACT、DEQ solver、diffusion/flow refinement分别比较。
  3. 不确定性形式:deterministic、parametric distribution、particles/M随机候选;固定总采样预算并检查particle degeneracy。
  4. 结构偏置:无结构latents对比对象slots/graph;只在匹配任务中解释。

最先执行的系统采用dense或足够宽的单一递归状态与普通有限步更新,因为它最少混入I/O瓶颈、solver和采样假设。K瓶颈、多假设、DEQ和diffusion是必要机制对照,而不是架构定义或可随意省略的装饰变体。

四类接口

  1. predictive head:动作条件 observation/reward distribution;
  2. filter head:下一状态分布与 uncertainty/calibration;
  3. policy/value head:声明 reward 和 policy class 下的 action/Q/value;
  4. AR/action readout:文本、程序、动作 token 或工具调用。

Readout 可访问 W,但训练时随机改变 decoder、输出表面形式或任务 query,避免状态只适配单一解码器。AR 保留精确序列生成、外部通信和工具协议职责。

6.4 防止答案暗码的训练课程

没有单一正则可以“保证非暗码”。建议采用逐层约束,每项对应一个替代解释。

阶段A:受控预测与递归闭合

这建立 predictive/filtering 候选,但不证明控制充分或语义可解释。

阶段B:多假设与覆盖

阶段C:高层变量的支持集内干预

在有 oracle 中间状态的 POMDP/DFA 中定义高层 causal model,执行 interchange intervention。要求:

阶段D:多接口 grounding

阶段E:AR 忠实披露

先以行为或内部干预确认某因素被使用,再计算 conditional disclosure、silent-use 和 rationalization。开放域语言只做外部效度;主结论来自有唯一状态/命题真值的结构化任务。

6.5 基线与公平比较

问题必需基线控制变量
latent是否优于文本中间过程outcome-only AR、显式CoT、Coconut式hidden回灌同训练token、同backbone、同答案监督
K瓶颈是否有能力作用dense tokens、不同K、同FLOPs下调整宽度/深度输入相同;同时报告参数、FLOPs、内存和墙钟
迭代是否优于额外深度J步共享、J层untied、宽浅同FLOPs同参数与同FLOPs需分别报告,不能混为一个对照
动力学形式recurrent、untied、ACT/Ponder、DEQ、diffusion/flow同状态容量、训练数据、NFE/迭代预算和readout
多假设价值deterministic、stochastic、fixed-total-budget particlesexpected指标、校准、coverage,不只best-of-K
对象结构增量无结构latents、slots/graph、oracle objects同状态维度与decoder;只在对象匹配任务声称增益
readout忠实性单decoder、decoder swap、adversarial decoder、oracle readout先固定内部use,再比较披露;hidden audit不参与训练

不能仅用 iso-FLOPs 一个数字判断表达力:共享迭代、DEQ solver 和 diffusion 的优化难度不同。因此需同时给训练成功率、有效 function evaluations、收敛残差和多 seed 分布。

6.6 最小诊断任务族

任务选择遵循“共享系统、单变量切换”,而不是堆 benchmark。

任务1:完全可解的 POMDP

以 Tiger 或公开完整 T,O,R,γ,H 的参数化任务为原型,扫描 cue reliability、query cost、memory distance 和 reward delay。比较 observation-only、history、oracle state 与 oracle belief。它能把 history→belief 的滤波误差、belief→action 的控制误差和主动 sensing 的价值误差分开。

任务2:可验证 DFA rollout

每个 prefix 都有唯一 automaton state q_t。测试 seen/unseen automata、长度外推、held-out transitions 和 state-label permutation。它提供低成本的 causal abstraction 与 readout ground truth,但不外推为一般世界建模能力。

任务3:Paired-render 控制

对同一 simulator trajectory 生成 clean、background-only、color-only 与 camera-only observation。背景/颜色主要测 nuisance sensitivity;camera 单列,因为会改变几何与可观测性。加入 simulator-state oracle 与 mask oracle,避免把视觉不可恢复误作状态压缩失败。

任务4:因子化 offline navigation

固定 maze、transition pool 与低层 controller,分别改变 coverage、trajectory fragmentation、behavior mixture 和 reward visibility;在相同 transition IDs 上做 goal/reward relabel。D4RL AntMaze只作为外部压力测试,不能把 play/diverse 当单因素对照。

任务5:固定动力学 reward family

固定 XML、transition kernel、初始分布和 observation/action map,只替换会诱导不同最优动作的 reward。分别给显式 goal descriptor、需从交互推断 task 和 oracle descriptor。Meta-World跨 task families 作为联合 shift,不承担 pure-reward 结论。

任务主要诊断Oracle明确不能推出
Tabular POMDPbelief/filter、主动感知、controlexact belief/Q开放视觉与长记忆通用能力
DFA rollout递归state、长度外推、因果readoutprefix state唯一内部算法或真实世界状态
Paired-render controlnuisance不变性与观察过滤simulator statedynamics/reward shift鲁棒性
Factorial offline navigationcoverage、policy support、stitchingreachability/transition IDs一般OOD因果泛化
Fixed-dynamics reward familyreward重定义下control sufficiencyreward/Q/policy disagreement跨对象/动力学迁移

6.7 指标与判定逻辑

三类充分性分别报告

不得以最终 task return 替代前两类,也不得以 reconstruction loss 替代 control。

Readout 审计

报告 probe selectivity、interchange intervention accuracy、自然路径/旁路检查、use-conditioned disclosure、silent use、rationalization、跨 readout一致性和外部grounding。每个指标都注明它排除了什么、仍未排除什么。

成本

同时报告训练token/transition、参数、训练FLOPs、推理FLOPs/NFE、峰值内存、墙钟、采样数、solver residual和多seed失败率。共享参数不等于算力更少,DEQ低激活内存也不等于推理更快。

6.8 分阶段 Go/No-Go 门

  1. 协议门:在 tabular POMDP/DFA 上,指标必须能复现已知分离反例;否则停止扩展。
  2. 状态门:相对 outcome-only 与 dense baseline,至少两种充分性在同预算下改善,且第三种不发生不可接受退化。
  3. 覆盖门:收益必须在 behavior policy变化或 reward重定义时仍有部分保留;若只在训练流形有效,只称分布内压缩。
  4. 因果门:关键高层变量通过多种支持集内 intervention,且排除明显 dormant pathway;否则只称可读/可控接口。
  5. 表达门:AR 在已确认use的样本上提高conditional disclosure并降低silent-use,同时hidden audit不恶化;否则readout只作为任务decoder。
  6. 规模门:若新增动力学只以更多NFE换来收益,或对seed/solver高度敏感,不扩大模型规模。

6.9 预期贡献

  1. 一个严格区分 representational bottleneck 与 predictive-state bottleneck 的统一问题定义;
  2. 一个把预测、belief/filtering、control/value 分开评估的持续 latent workspace;
  3. 一套不依赖开放域语言命题的 causal abstraction 与 readout 审计;
  4. 一个将通信容量K、有限步数T、solver/NFE与候选数M分开控制的同预算比较框架;
  5. 对 diffusion/flow、recurrent、DEQ/energy 的条件性路线裁决,而非预设冠军;
  6. 关于何时 AR 是忠实接口、何时只是合理化 decoder 的经验边界。

6.10 风险与失败解释

失败可能原因正确结论
K越小效果越差信息容量不足或优化变难不说明latent workspace无效,只否定该K/预算
更多有限步递归无收益额外步数未学会修订、共享欠参数、训练T过拟合不说明DEQ或摊销迭代推断无效
diffusion更好可能来自更多NFE、噪声正则或多样采样需同预算分解,不能直接归因全局修订
probe高、patch低信息存在但未被自然使用,或干预不匹配不称因果变量
patch高、自然路径证据弱可能激活旁路只称可操控子空间
多decoder都成功可能共享shortcut/private protocol只称decoder-agnostic可提取性
CoT披露提高但行为不变可能学会更像解释的文本不称忠实性提高
控制回报高但预测差任务定向control quotient可是成功的控制状态,不是完整世界模型

7. 应用场景与路线选择

8. 证据边界与尚未解决的问题

公开事实支持

现有研究分别证明了词表外计算、latent rollout控制、有限latent计算接口、对象化预测、共享迭代、固定点求解、局部causal alignment和CoT不忠实等组件事实。

综合推断

以持续递归状态为核心、让AR成为读写接口在机制上可行;K瓶颈、多假设、对象结构与不同迭代谱系也都能与之组合。但任何组合是否改善迁移、是否形成任务充分状态,仍需proposal中的独立因子控制。

仍未知

9. 结论

连续 dLLM 最值得研究的版本,不是“把思维链藏起来”,而是建立一个持续、带不确定性、可被动作与观察更新的内部状态,并让语言成为可验证的外部接口。该方向的科学核心也不在某个热门生成器,而在四条可分离证据链:状态对未来是否充分、对部分可观测历史是否能递归过滤、对声明决策是否保值,以及外显语言是否忠实反映自然计算。

因此,推荐路线是先在可完全求解的任务上建立严格审计,再进入视觉控制和开放语言;先比较瓶颈与迭代,再决定是否引入对象拓扑、diffusion或外部memory;保留AR用于离散执行与沟通,但拒绝把流畅解释当作内部机制证明。如果这些门槛能够跨任务成立,这一方向可能成为从“生成文本”走向“维护可操作世界状态”的关键桥梁;如果只能提高答案准确率或压缩CoT,它更可能是一种有用但有限的推理加速技术。

参考文献

以下均为本文实际使用的稳定入口;日期以本文检索截止日 2026-07-21 可得版本为准。

  1. Coconut — *Training Large Language Models to Reason in a Continuous Latent Space*. arXiv:2412.06769
  2. CODI — *Compressing Chain-of-Thought into Continuous Space via Self-Distillation*. arXiv:2502.21074
  3. Diffusion of Thoughts. arXiv:2402.07754
  4. Diffusion Forcing. arXiv:2407.01392
  5. Large Concept Models. arXiv:2412.08821
  6. PlaNet — *Learning Latent Dynamics for Planning from Pixels*. arXiv:1811.04551
  7. Dreamer — *Dream to Control*. arXiv:1912.01603
  8. V-JEPA 2. arXiv:2506.09985
  9. SAVi — *Conditional Object-Centric Learning from Video*. arXiv:2111.12594
  10. SlotFormer. arXiv:2210.05861
  11. C-SWM — *Contrastive Learning of Structured World Models*. arXiv:1911.12247
  12. Perceiver IO. arXiv:2107.14795
  13. Set Transformer. arXiv:1810.00825
  14. Universal Transformers. arXiv:1807.03819
  15. ALBERT. arXiv:1909.11942
  16. Deep Equilibrium Models. arXiv:1909.01377
  17. *Stabilizing Equilibrium Models by Jacobian Regularization*. arXiv:2106.14342
  18. Energy Transformer. arXiv:2302.07253
  19. Littman, Sutton & Singh — *Predictive Representations of State*. NeurIPS 2001
  20. Singh, James & Rudary — *Predictive State Representations*. arXiv:1207.4167
  21. Smallwood & Sondik — *Optimal Control of Partially Observable Markov Processes*. DOI:10.1287/opre.21.5.1071
  22. Subramanian et al. — *Approximate Information State*. JMLR 23(12), arXiv:2010.08843
  23. Givan, Dean & Greig — *Equivalence Notions and Model Minimization in MDPs*. DOI00002-0)
  24. Ferns, Panangaden & Precup — *Metrics for Finite MDPs*. arXiv:1207.4114
  25. Grimm et al. — *The Value Equivalence Principle*. arXiv:2011.03506
  26. Grimm et al. — *Proper Value Equivalence*. arXiv:2106.10316
  27. Alain & Bengio — *Understanding Intermediate Layers Using Linear Classifier Probes*. arXiv:1610.01644
  28. Hewitt & Liang — *Designing and Interpreting Probes with Control Tasks*. arXiv:1909.03368
  29. Belinkov — *Probing Classifiers: Promises, Shortcomings, and Advances*. arXiv:2102.12452
  30. Geiger et al. — *Causal Abstractions of Neural Networks*. arXiv:2106.02997
  31. Geiger et al. — *Finding Alignments...* (DAS). arXiv:2303.02536
  32. Makelov et al. — *An Interpretability Illusion for Subspace Activation Patching*. arXiv:2311.17030
  33. Zhang & Nanda — *Best Practices of Activation Patching*. arXiv:2309.16042
  34. Turpin et al. — *Language Models Don't Always Say What They Think*. arXiv:2305.04388
  35. Lanham et al. — *Measuring Faithfulness in Chain-of-Thought Reasoning*. arXiv:2307.13702
  36. Baker et al. — *Monitoring Reasoning Models for Misbehavior...*. arXiv:2503.11926
  37. Chen et al. — *Reasoning Models Don't Always Say What They Think*. arXiv:2505.05410
  38. Meng et al. — ROME. arXiv:2202.05262
  39. Hase et al. — *Does Localization Inform Editing?* arXiv:2301.04213
  40. Cassandra, Kaelbling & Littman — *Acting Optimally in Partially Observable Stochastic Domains*. AAAI 1994 PDF
  41. Stone et al. — *The Distracting Control Suite*. arXiv:2101.02722
  42. Fu et al. — D4RL. arXiv:2004.07219
  43. Yu et al. — Meta-World. arXiv:1910.10897
  44. Power et al. — Grokking. arXiv:2201.02177
  45. Zhong et al. — *The Clock and the Pizza*. arXiv:2306.17844
  46. Delétang et al. — *Neural Networks and the Chomsky Hierarchy*. arXiv:2207.02098
  47. Zhou et al. — *What Algorithms can Transformers Learn?* arXiv:2310.16028
  48. Pimentel et al. — *Information-Theoretic Probing for Linguistic Structure*. ACL 2020
  49. Voita & Titov — *Information-Theoretic Probing with Minimum Description Length*. EMNLP 2020
  50. Turner et al. — *Steering Language Models With Activation Engineering*. arXiv:2308.10248
  51. Gordon, Salmond & Smith — *Novel Approach to Nonlinear/Non-Gaussian Bayesian State Estimation*. DOI:10.1049/ip-f-2.1993.0015
  52. Kong, Liu & Wong — *Sequential Imputations and Bayesian Missing Data Problems*. DOI:10.1080/01621459.1994.10476469
  53. Doucet, Godsill & Andrieu — *On Sequential Monte Carlo Sampling Methods for Bayesian Filtering*. DOI:10.1023/A:1008935410038