MECHANISM-LEVEL SURVEY · 2026-07-17

实时双全工语音交互模型:
架构、训练与证据边界

以 OpenAI GPT‑4o/Realtime API 的体验为参照,但不从体验反推闭源架构。报告回答三个问题:模型如何一边听一边说,何种训练信号维持楼层与打断,以及不同路线为何在延迟、状态稳定性和复现难度上取舍不同。

43 条来源14+ 系统审计16 维比较无 JavaScript
E1 代码/公式E2 论文陈述E3 行为/APIE0 未披露/不可识别
EXECUTIVE SYNTHESIS

全双工不是一个开关,而是三层证据命题

最强结论:真正区分路线的不是“能否中断”,而是用户流在助手发声期间是否持续更新模型状态,以及这个新状态如何改变尚未生成的助手未来。

① 接口级并发

服务同时收音和发音,客户端可取消播放。OpenAI、Gemini、Nova 的公开材料足以支持这一层。

② 模型级持续监听

用户音频在助手输出期间继续进入模型状态。Moshi 官方代码提供强锚点;外置 VAD 流水线也可做到系统级持续监听。

③ 神经级并发生成

同一生成过程在共享时钟上同时建模用户条件与助手输出。公开系统有多种因子化;闭源商业模型目前不可由行为唯一辨识。

注意:低首包延迟、流式 TTS、可中断 UI 都不自动证明模型级全双工。反之,模型级双工也不要求像 dGSLM 那样对称预测双方未来;Moshi 是非对称的“用户观测 → 助手预测”。

REFERENCE EXPERIENCE, NOT ARCHITECTURE

OpenAI:公开事实止于产品与 API 行为

Realtime API 支持双向事件与低延迟语音交互

E3

证据:OpenAI Realtime API 指南与官方 Realtime Console;Full‑Duplex‑Bench v1.5 的黑盒测试记录 GPT‑4o Realtime 在用户中断任务中 Respond 0.78、停止约 0.23 秒。

能说明:服务在对话期间接收音频,并能快速终止可观察输出。

边界/兼容机制集合 E0若系统由后台 ASR 缓存、VAD 命中和 server‑side cancel 驱动,同样可产生快停与重叠后连贯行为;原生条件多流、独立 listening memory、外置 VAD/FSM、并发 cascade 与 chunk rollback 均与现有行为兼容且可组合。因此不能据此断言 GPT‑4o 采用其中任一机制,更不能断言其 tokenizer、训练 loss 或神经级楼层控制。

? 仍为 E0:audio tokenizer、连续/离散表示、序列因子化、用户流路由、训练数据与 loss、自听训练、floor‑state 所在位置、真实 commitment horizon。这里既有“未披露”,也有“仅凭外部行为结构不可识别”。

商业参照不止 OpenAI

Google Gemini Live E3

官方资料支持持续多模态流、随时打断与 proactive audio;不披露内部 tokenizer、并发神经流或楼层控制位置。

Amazon Nova Sonic E3

官方明确 API 层 concurrent speech processing/generation 与统一 S2S 定位;不能据此确认单一神经模型联合生成。

Alibaba Qwen2.5‑Omni E2

公开报告披露 Thinker–Talker、dual‑track AR 与流式 DiT;但发声期新用户输入如何改写 Talker 的强双工 stop path 仍未充分披露。

StepFun Step‑Audio 2 E2

商业团队公开技术报告提供端到端语音模型与工具调用路线;它是架构披露参照,不等于 GPT‑4o 内部证据,强双工状态机制仍按论文披露边界理解。

TIME × STATE · CLASSIFICATION ONLY

时间推进粒度与状态载体

同样叫“实时”,模型可能每 20–80 ms 更新隐状态,也可能按 chunk、语义片段或整轮提交输出。更新时钟只是推理接口,不等于不可撤回的承诺点。本图仅是分类示意:点位之间的距离、角度、象限和横向先后均无度量含义,不用于比较延迟或能力高低。

公开系统按时间推进粒度与状态载体分类,商业内部机制位于不可识别区;点位距离无度量含义
原创分类示意。实线 E1、虚线 E2、点划线 E3、灰色问号 E0。Moshi 的 80 ms 是 token 更新时钟;公开材料未证明其所有行为承诺都以 80 ms 不可回退。节点依据:Moshi arXiv:2410.00037 §3.3–3.4 与官方代码 moshi/models/lm.py:679–850;dGSLM TACL 2023 Fig.2/Eq.(1);其余 E2 节点见来源区对应论文。
USER-STREAM ROUTING

用户流进入生成状态的三种方式

Interleaving
交错单序列
信息流
用户 speech/text chunk 与助手 token 串接在一条自回归序列。OmniFlatten、BayLing 是代表。
权衡
实现简单、复用 LLM;但序列变长,同一时刻的并发关系被线性化,block 边界决定反应粒度。
Channel fusion
同帧融合
信息流
当前用户表征与 speaking/monologue 状态在同一 AR step 融合。FLM‑Audio、CF‑Duplex 是代表。
权衡
整合强、QA grounding 好;但用户噪声可直接污染当前生成状态,中断后旧上下文更难隔离。
External memory
交叉注意力
信息流
用户流写入独立 KV/memory,生成主序列按层或门控读取。dGSLM 的双塔 cross‑attention、XA‑Duplex 是参照。
权衡
输入状态与生成 KV 隔离,中断稳定;但若门控或训练不足,用户 grounding 可能弱于融合。上述结论只适用于相应论文协议。
ARCHITECTURE FAMILIES

七条一级路线,而非互斥标签

Moshi 论文 Figure 1 原始架构图:Mimi、用户音频流、助手音频流、Inner Monologue、Temporal Transformer 与 Depth Transformer
论文原始架构图:Défossez et al., Moshi: a speech-text foundation model for real-time dialogue, Figure 1,来源:arXiv:2410.00037,由正式 PDF 第 7 页清晰裁取。中文解读:左侧用户 24 kHz 音频经 Mimi 编码为 12.5 Hz token 流;Temporal Transformer 沿共享时间轴吸收用户观测并维护历史,Depth Transformer 在单步内分解多层语义/声学 codebook;助手音频与 Inner Monologue 文本按 delay pattern 对齐后生成,助手音频再由 Mimi 解码。该图说明表示与生成的连接,但不应被读成“模型对称预测用户未来”——公开推理代码显示用户流是观测条件。
原生条件多流 E1

Moshi:用户 codec token 持续作为观测条件写入 temporal state,模型并不预测用户未来;随后采样 assistant text,再由 DepFormer 帧内逐 codebook 生成 assistant audio。固定审计 commit e6a55d2moshi/models/lm.py:679–726,736–783,809–850;运行循环 moshi_mlx/run_inference.py:142–158。代码蕴含的研究者形式化为 p(text_t|H_t)×∏q p(a_t,q|H_t,text_t,a_t,<q),不是论文原式。

对称双塔生成

dGSLM:共享权重、独立自回归状态、逐层 cross‑attention;edge unit CE 建内容变化,delayed duration L1 建状态惯性。

交错单序列

OmniFlatten/BayLing:把多声道、文本、沉默与状态 token 压到一条序列,以课程学习或 SFT/DPO 学 timing。

同帧 channel fusion

FLM‑Audio/CF‑Duplex:每一步融合 listening、speaking、monologue;强整合换取状态污染风险。

显式控制与级联

Freeze‑Omni/DuplexMamba:VAD、三状态分类、分支 state 或固定 recurrent state 控制 ignore/respond/interrupt。

Thinker–Talker

Qwen2.5‑Omni/Fun‑Audio‑Chat:语义推理与声学发声分工并流式协作;但仍须另证发声期间新用户输入如何停止或改写 Talker。

浅共享—深分离

Lychee‑FD:浅层共享语音基础,深层 semantic/acoustic/control heads 分离,并用 dense semantic channel 补足低频语义监督。

TRAINING SIGNALS

模型如何学会听、继续说、停与反馈

归因顺序:对方音频是否持续可观测、何时写入生成状态、floor signal 由何种变量承载,是能力的架构/监督基础;交互 RL 与 timing DPO 在此基础上调整响应阈值和行为偏好。现有证据不支持把 turn-taking 主要归因于奖励从零“学出”。

术语冻结:行为标签不等于模型状态

术语观测层定义可能的机制载体成立所需证据/当前边界
Full‑duplex接口层:同时收发;模型层:发声期用户输入持续更新同一生成过程;行为层:可重叠、反馈、被打断条件多流、双塔、交错序列、external memory 或服务编排接口行为只能到 E3;模型层需论文/代码 E1–E2,不能由体验补写
Overlap双方可观察语音在时间上重叠双声道数据、并发流或播放/输入并行波形/协议可证行为;不自动证明神经级联合生成
Backchannel不夺取话轮的短反馈,如“嗯”“对”隐式序列分布、显式状态、外部策略均可能需标注任务与对话语境;短音频本身不充分
Interruption一方插入并改变另一方可观察输出或后续行为播放停止、响应流取消、模型状态更新是三种独立事件每层需独立证据;快停不证明理解或内部生成终止
Floor‑holding系统在停顿或反馈下继续保持话轮speech/silence 条件分布、duration、state token/head、VAD/FSM行为评测证明能力;只有 token/head/logit/代码才能定位内部载体

表征层并发与策略层 turn-taking

表征/生成层回答“如何同时听和说”:用户流是否持续可见、如何写入状态、assistant future 如何因子化。策略层回答“何时开始、继续、停止或响应插话”:它可由隐式 speech/silence 分布、显式 start/end/state token、duration 状态、分类头或外置 VAD/FSM 承载。两层可组合,端到端音频模型也不排除 API 侧 endpointing。

OpenAI Realtime 控制面 E3turn_detection 提供 server VAD / semantic VAD 等会话配置(OpenAI Realtime VAD 官方指南),证明服务暴露外显 turn detection。它既不证明 GPT‑4o 内部没有学习 turn-taking,也不证明内部依赖该控制层;内部 tokenizer、floor-state 与策略耦合仍为 E0
路线监听态继续说态停止态Backchannel
Moshi用户 Mimi token 写 delay cache;12.5 Hz 双声道 CEtemporal state + text/DepFormer;逐 codebook CE静音 codec 模式与文本 PAD/EPAD;并非已证实的专用 silence state token来自自然 overlap 的短 text/audio 序列;交互 RL 可后加
dGSLM双塔各自状态 + 对方 cross-attention;50 Hzedge unit 与 duration 分解silence/nonvoice unit 及持续时间Fisher 双声道 overlap 联合似然
SALMONN‑omniblock encoder + thinking token<start_speak> 后连续 speech embedding<end_speak> 的显式 CE自听与合成全双工数据
Freeze‑Omnistream encoder 持续对齐冻结 LLM hidden → speech decoder外部 acoustic VAD + chunk 三状态头未披露专用机制
BayLingspeech/text block 写入单 AR contextassistant speech positions四个 dialogue-state tokens + silence waveform400K full-duplex SFT + timing DPO
Thinker–Talkerblock encoder 更新 ThinkerTalker 读取 hidden 并生成 audio强双工 stop path 未公开持续 listening 下机制未充分披露

↔ 宽表可横向滚动;首列固定。将鼠标悬停在行上可辅助跨列追踪。

目标冲突不能用一个“模态干扰”概括

Mimi:codec 表示层 E1

24 kHz→12.5 Hz(80 ms),cardinality 2048;WavLM 50 Hz/1024 维教师经非因果 pooling 对齐。关键不是“普通 RVQ 第一层语义、其余层声学”的串行残差:Mimi 将 1 个 semantic VQ 与 7 层 acoustic RVQ 并联,embedding 相加重建,以隔离语义蒸馏和波形/对抗音质冲突;Moshi 生成时才由 DepFormer 串行条件化 text/semantic/acoustic。证据:Moshi arXiv:2410.00037 §3.3、Fig.2;commit e6a55d2quantization/vq.py:170–203,238–251,274–286models/loaders.py:81–86

Lychee‑FD:深层参数层

semantic/acoustic 梯度在深层趋于正交或负相关;约 3 Hz 文本对 25 Hz 音频还造成监督密度失衡。head separation 与 dense alignment 分别处理方向和幅值。

dGSLM:时间变量层

50 Hz unit 把内容变化和重复持续时间纠缠;edge CE + delayed-duration L1 是时间因子化,不是声学—语义梯度冲突。

INTERRUPTION SEMANTICS

停止播放不等于停止生成,更不等于理解用户

一次用户插话在客户端播放、API响应流和模型语义状态三个独立层的时序
原创时序图。三层没有共享可量化横轴:客户端层对应 wall-clock 播放时刻,API 层对应 event/token 顺序,语义层只表示因果先后;任何横向距离都不能跨层比较延迟。闭源服务可观察快停,但内部推理是否终止、用户语义是否进入后续状态通常仍是 E0。

评测也必须同时看 responsiveness 与 floor‑holding:停止越快不必然越好,过度敏感会把 backchannel 或旁人语音误判为打断。Full‑Duplex‑Bench 的价值在于把用户中断、backchannel、旁人语音、背景语音拆开,而不是只报一个延迟。可以把“何时开口”解释为随时间积累对方已结束的证据并越过停止阈值;这是 sequential evidence accumulation / optimal stopping 的研究者类比,不代表受审系统实现了显式 POMDP belief 或 SPRT。

策略退化与评测空白:公开工作很少报告固定 checkpoint/league 式对手分布评测,也少有系统覆盖慢说话者、频繁 backchannel、抢话者及旁人语音的联合鲁棒性。RL/DPO 若对手分布单一,可能向“永不让 floor”或“一触发就停”偏移;现有文献不足以给出跨系统退化率。
DECISION MATRIX

路线比较:16 个决策维度中的核心 12 维

不可直接横比:各论文的数据集、采样链路、输入时钟、首包/停止测量起点和 barge-in 定义不同;本表比较机制与披露状态,不把 80 ms frame、chunk 决策或 API 快停数字排成统一延迟榜。

系统/路线角色对称性训练输入→推理输入分布差并发层用户路由对方音频可观测粒度/延迟floor-control 信号来源时间粒度状态载体表示文本角色楼层位置训练数据/目标打断证据推理成本复现难度证据
Moshi非对称:user 条件→assistant 预测训练为对齐/clean 双声道 teacher forcing;推理 user 为实时 codec 输入、assistant 为自回归输出;存在潜在分布差模型级持续双工共享时钟条件流用户 codec 帧按 12.5 Hz 写入;7B 多数 acoustic stream 延迟 1 帧,2B 配置多数延迟 2 帧;这是 checkpoint 建模超参数,不是统一承诺时长(lm_utils.py:9–40models/loaders.py:118;commit e6a55d2双声道下一 token 监督 + 隐式 speech/silence 分布;RL 非基础条件12.5 Hz 更新hidden + tokenMimi split RVQinner monologue隐式 speech/silence 分布双声道 CE;自然对话官方代码持续输入/输出temporal LM + 帧内 DepFormer高;代码/权重公开E1
dGSLM对称:双方未来联合生成训练/生成均为双 HuBERT unit 流;但离线生成不等于在线助手服务离线对称双声道双塔 cross-attn对方历史以 50 Hz 单元经逐层 cross-attention 可见双声道联合似然 + silence unit + delayed duration 监督50 Hz双 hidden + duration500 HuBERT units无显式文本unit/silence + durationFisher;edge CE + L1双声道生成,不是在线助手两塔共享权重高;旧研究栈E1
BayLing非对称助手条件SFT/DPO 的构造 block 序列→推理实时 block;真实噪声与用户节奏存在分布差block 模型级interleaving用户语音按 block 进入单 AR context;延迟受 block 边界约束四个 dialogue-state tokens 的 SFT,timing DPO 后调12.5 Hz / blockstate tokensspeech + text对齐/语义四个显式状态 token400K SFT + DPO论文 barge-in单 AR 序列变长中高E2
SALMONN‑omni非对称助手条件合成/构造全双工样本→实时 block embedding;自听与真实声学回路未必同分布block 流水线continuous embedding固定 Δt block 的新听觉 embedding;具体端到端承诺延迟未等同披露start/end speak CE + 多目标监督;合成全双工数据固定 Δtstart/end + hiddencodec-free embeddingthinking scaffold显式 start/end多目标 + 合成 FD论文自听/barge-inencoder+LLM+synthE1/E2
Freeze‑Omni非对称助手条件分阶段状态监督→在线 VAD/chunk;错误可在模块间传播模块级stream encoder持续 encoder 输入,决策在 chunk/FIFO 粒度;先经外置 VADacoustic VAD + chunk 三状态分类监督chunk/FIFOVAD + classifierencoder hidden + codec冻结 LLM 中介外部 VAD/三状态头分阶段、多任务状态监督论文自述级联多模块E2
Thinker–Talker非对称助手条件多阶段语义/声学训练→流式 Thinker/Talker;发声期新用户输入分布与路径未充分披露模块并发/流式Thinker hidden输入按 block 更新 Thinker;Talker 发声期新输入延迟/路径未充分披露语义/声学监督已披露;强双工 floor-control 来源为 E0block/semantic span双模块 hiddensemantic + audio核心规划强双工 stop 未知多阶段多模态/音频目标流式不等于持续双工双模块 + diffusion/codecE2/E0
GPT‑4o Realtime产品角色非对称;内部因子化未知训练输入、teacher forcing、自听与在线输入关系均未披露服务/API 层已证未知API 持续收音可观察;写入神经状态的粒度与延迟未知服务 cancel/VAD/模型内状态/奖励均兼容,来源不可识别神经承诺未知未知未知未知未知未披露快停与双向事件托管服务不可见不可复现内部E3/E0

↔ 决策矩阵可横向滚动;首列固定,悬停行可辅助比较。表中“潜在分布差”是研究风险,不表示已有论文测得性能下降;“未知”不是负面评分。最后一列是证据来源坐标而非质量等级,E1 与 E3 不可换算。打断列在无共同协议时只描述各自证据,不构成跨系统排名。

承诺/回滚披露矩阵

只记录公开材料实际披露了什么。未披露 rollback/lookahead 不等于系统不可回滚;输出更新时钟也不等于对用户可见的提交层。

系统内部更新时钟(已披露)可观察提交层rollback / lookahead 披露证据锚点
Moshi12.5 Hz Mimi/temporal step;codec delay流式音频帧;播放器提交策略不由模型论文统一规定生成缓存/因果步骤有代码;用户可见输出回滚协议未披露arXiv:2410.00037 §3.3–3.4;moshi/models/lm.py:679–850
dGSLM50 Hz HuBERT units;duration 分解离线双声道 waveform,不是在线 API 提交在线 rollback/lookahead 不适用或未定义TACL 2023 Fig.2、Eq.(1) 与 edge/duration 段
BayLing12.5 Hz token / blockblock/音频输出;实现提交边界未完整公开未披露arXiv:2606.14528 架构与 dialogue-state token 段
SALMONN‑omni固定 Δt blockstart/end speak 控制的连续语音输出未披露arXiv:2411.18138 §3、Fig.2
Freeze‑Omniencoder chunk / FIFO模块化 speech decoder 流VAD/状态切换已披露;已播放音频回滚未披露arXiv:2411.00774 Fig.1–2、三状态头段
Thinker–Talkerblock/semantic/audio streamTalker 流式音频发声期强双工 rollback/stop path 未充分披露Qwen2.5‑Omni arXiv:2503.20215 §3、Fig.2
GPT‑4o Realtime神经更新时钟未知API response audio/event;客户端可截断播放服务取消事件可见;模型内部 rollback/lookahead 未披露且行为不可辨识OpenAI Realtime guide / official console;Full‑Duplex‑Bench v1.5(E3)

↔ 披露矩阵可横向滚动。每格是公开事实、适用性边界或明确未知,不由 frame rate 推断回滚能力。

DISCLOSURE × IDENTIFIABILITY

读浅、未披露与结构不可识别清单

证据坐标系不可换算:E1(代码/公式)、E2(一手论文陈述)、E3(官方产品/API 行为)描述的是证据来源与可回答问题,不是系统质量分数,不存在 E1>E2>E3 的统一权重。有代码的开源系统更容易获得 E1,这种“可见度”与能力本身混杂;闭源 E3-only 也不等于能力较弱。未披露≠未采用;E3 行为≠唯一内部结构;没有共同数据、时钟、测量点和任务定义时不得统一排序。
资料未披露

OpenAI、Gemini、Nova 的内部表示、loss、用户路由、floor‑state。未来技术报告或代码可能消除这一不确定性。

行为不可唯一辨识

快停可由原生多流、独立 listening memory、外置 VAD/FSM、并发 cascade 或 rollback 产生,且这些机制可组合。

论文陈述未达代码级

FLM‑Audio、BayLing、SALMONN、Freeze‑Omni、Lychee‑FD 等目前主要是 E1 公式/图或 E2 正文;这表示可核查粒度不同,不是系统优劣。

数据来源与真实任务外推边界

公开双声道研究常受成人、双人、英语/特定语言、电话或近场信道、角色对称性以及合成全双工数据约束。non-native、儿童、口音、噪声、多方、laughter/呼吸/filler、grounding silence 和纠错式 barge-in 的覆盖通常不足或协议不统一。因此某系统在既有 backchannel/interruption 测试中的表现,不能脱离语料与用户分布归因成“架构更优”;闭源训练分布未披露时尤其只能保留 E0。

兼容机制集合,而非后验概率

本报告不为闭源系统分配“70% 多流/30% 级联”之类数字:没有统一黑盒协议、似然模型与内部标签,这会制造虚假精确性。行为只映射到兼容机制集合。

PRIMARY SOURCES

核心来源与可核查锚点

  1. OpenAI Realtime Console — 官方双向事件客户端;不支持内部神经机制。
  2. OpenAI Realtime API guide — 会话与输入输出行为。
  3. Hello GPT‑4o — 原生多模态产品定位。
  4. GPT‑4o System Card — 能力、安全和评测边界。
  5. Moshi / Mimi, arXiv:2410.00037 — Fig.1–2、§3.3–3.4。
  6. Kyutai Moshi 官方代码 — 固定审计 commit e6a55d2;moshi/models/lm.py:679–850
  7. dGSLM, TACL 2023 — Fig.2、Eq.(1)、edge/duration。
  8. SALMONN‑omni — Fig.2、Eq.(1)、start/end speak。
  9. DuplexMamba — Mamba state 与分支控制。
  10. OmniFlatten — flatten 单序列与课程训练。
  11. FLM‑Audio — channel fusion 与 dual training。
  12. BayLing‑Duplex — block、多通道、state token、SFT+DPO。
  13. How Should LLMs Listen While Speaking? — channel fusion vs external memory。
  14. Freeze‑Omni — VAD、chunk 三状态头、冻结 LLM。
  15. Lychee‑FD — Fig.2–3、Eq.(5–7)、梯度冲突。
  16. Qwen2.5‑Omni — Thinker–Talker、dual-track AR、DiT。
  17. Fun‑Audio‑Chat — 5/25 Hz 分辨率、训练阶段与 DPO。
  18. Multi‑Faceted Interactivity Alignment — pause/turn/backchannel/interruption GRPO。
  19. Full‑Duplex‑Bench v1.5 — 中断、backchannel、旁人及背景语音。
  20. Gemini Live API — 持续流、interrupt、proactive 行为。
  21. Amazon Nova Sonic guide — API 层 concurrent processing/generation。
  22. Spirit LM — speech/text interleaving 表示基础。
  23. AudioLM — semantic/acoustic token 层次基础。
  24. VITA‑Audio — MCTP 与 TTFA;不等于持续监听。
  25. Step‑Audio 2 — 商业团队公开的端到端语音模型、工具调用与训练路线;强双工机制按披露边界理解。

来源索引共 43 条;此前抽查 27 个唯一 URL,其中 21 个直接 HTTP 200,5 个 OpenAI 页面受 Cloudflare 403 反自动化影响,另 1 个 Qwen 博客 SSL 失败并由 arXiv 技术报告替代。403 不被误记为来源失效。