五分钟速读
最稳妥的结论不是“GPT-LIVE 使用了某种架构”,而是从公开系统中确定一组可复现的机制设计空间。
可核查的 L1 训练披露
当前材料不能确认 GPT-LIVE 的 codec、token、双流结构、损失函数或训练阶段。
最小功能部分
流式表示、联合生成、floor-control、部署前的后训练与对齐共同形成体验,但它们不是四个串联网络层。
公开候选路线
从 Moshi 式双流,到低资源 Speech Encoder + LLM,再到 codec-free 与状态空间流式方案。
复现成熟度
低资源 S2S、事件增强 S2S、研究级双流 full-duplex,应分阶段验证且分别声明能力边界。
证据边界:四个等级不能混写
GPT-LIVE 官方训练证据
要求官方论文、系统卡或技术报告直接披露训练机制。当前调研中此类证据为零。
OpenAI 产品与 API
能证明低延迟语音、打断等外显能力或工程接口;不能证明模型使用双流、Mimi、SNAC 或 Fisher 微调。
相邻论文与代码
Moshi、DuplexChat、AudioLM、LLaMA-Omni 等支持具体机制事实,但事实只属于对应系统。
公开条件下复现路线
把 L3 机制组合成训练方案,并明确哪些能力可验证、哪些仍不能声称。
先拆开四个常被粘在一起的词
端到端
训练端到端、推理端到端、表示端到端和产品链路端到端不是同一件事。用户直接说话并听到回复,不足以证明训练主路径没有文本瓶颈或外部模块。
实时
实时描述延迟和增量处理,不自动意味着系统能在输出期间持续消费用户语音。
双全工
需要输入与输出并行,并能表达 overlap、barge-in、backchannel、silence/hold 与中断恢复;“UI 可打断”不是充分训练证据。
Speech-to-Speech
可包含 codec tokens、speech embeddings、text tokens 或 inner monologue。S2S 不等于纯语音语义通路。
双全工的核心:生成什么,与何时生成
运行时主链完成语音理解与生成;floor-control 并行决定说、听、保持、让行和短反馈;后训练只在部署前塑造模型与策略。
双全工不是“更快的 S2S”
模型必须持续生成时间步上的语音或沉默,同时让用户流在助手发声时继续进入系统。
数据能表达什么,模型才可能学会什么
研究级 full-duplex 最小数据字段
| 字段 | 用途 | 缺失后果 |
|---|---|---|
user_audio + assistant_audio | 说话人分离的同步双流 | 无法可靠学习并行听说 |
start_ms / end_ms | 毫秒级时序与事件对齐 | 无法训练 overlap 与接话时机 |
overlap / barge_in | 重叠与打断监督 | 只能靠偶然模式学习 |
backchannel / silence_hold | 短反馈和主动沉默 | 容易抢话或对沉默处理僵硬 |
codec_token_span | 音频 token 与事件时间轴对齐 | 辅助目标难以落到正确区间 |
floor_control_action | listen / speak / hold / yield / repair | 没有显式交互策略监督 |
低资源 S2S 的可执行格式
source_wav、source_text、target_token、target_text 足以建立 speech input → speech output 闭环,但通常没有双说话人同步流和交互事件,因此只能作为半双工或弱双工近似。
训练不是一步到位,而是能力逐层注入
基座与表示
文本 LM 或 speech-text backbone;训练流式 codec / speech encoder;混合文本、语音或音频 token 预训练。
多流与自然对话
基于 diarization 构造 simulated multi-stream,再用 Fisher 或自然双人对话学习 overlap、interruptions 与 turn-taking。
交互脚本与偏好
合成交互脚本覆盖稀有事件;再对抢话、延迟、礼貌、安全和风格做偏好或策略对齐。
五条公开技术路线
它们不是互斥“门派”:一个系统可能同时使用 codec tokens、inner monologue、speech encoder 和独立 floor-control。
A · Codec-token 双流 AR
用户流与助手流联合自回归,配合 delay pattern 和 speech-or-silence token。机制最接近真双全工,数据与算力门槛最高。
B · Speech-text Interleaving
用文本或语义单元支撑长程语义,再生成声学表示。语言能力强,但 floor-control 仍取决于双流时序数据。
C · Encoder + LLM + Decoder
开源代码与数据格式最清楚,适合作为短期 baseline;通常不具备完整 timing policy。
D · Codec-free Embedding
连续表示避免离散 codec 的部分量化限制,但公开训练细节较少,暂不适合第一复现路线。
E · Duplex / State-space
聚焦增量状态更新、解码效率和长流式上下文;公开证据更偏 streaming 或 speech-to-text。
横向比较:先看训练信号,再看模型名字
| ID | 路线 | 代表系统 | 表示 / 时间展开 | Floor-control | 复现难度 | 证据边界 |
|---|---|---|---|---|---|---|
| A | Codec-token 双流自回归 | Moshi | Codec tokens;显式双流 | 高 | 最高 | L3 强;映射 GPT-LIVE 仅 L4 |
| B | Speech-text Interleaving / Inner Monologue | Moshi、Spirit LM、AudioPaLM | Speech units + Text + Audio tokens | 取决于是否双流 | 高 | L3 中—强 |
| C | Speech Encoder + LLM + Speech Decoder | LLaMA-Omni、Mini-Omni、SLAM-Omni | Speech embeddings + Target tokens | 通常较弱 | 中 | L3 中—强;full-duplex 推断弱 |
| D | Codec-free / Embedding Full-duplex | SALMONN-omni | Continuous speech embeddings | 公开主张较强 | 高 | L3 中;细节不足 |
| E | Duplex Decoding / 状态空间流式 | DuplexMamba | Frames / Hidden states | 偏流式解码 | 中—高 | L3 中;与 S2S 距离较远 |
复现路线:三阶段,不越级声称
低资源 S2S
验证:语音输入到语音输出闭环。
不能声称:持续监听、overlap policy 或自然全双工。
事件增强 S2S
新增:双说话人时间轴、事件标签和 floor-control action。
验证:事件分类和条件响应。
研究级双流
新增:流式 codec、多流 AR、delay pattern、自然对话与合成脚本。
不能声称:等同 GPT-LIVE 产品体验。
局限、争议与公开未知
- 闭源内部未知:GPT-LIVE 是否使用离散 codec、连续 embedding、inner monologue、双流 AR 或独立 floor-control,均无 L1 训练证据。
- 产品行为存在替代解释:低延迟、可打断和自然语音也可能由混合模块或产品层控制实现。
- 数据比骨干更关键:没有 speaker-separated timing 与事件标签,换成更大模型也不等于学会双全工策略。
- 公开损失不完整:部分系统只披露主任务或摘要级能力,不能把合理辅助损失写成论文事实。
- 图像是解释性重绘:本页四图由 gpt-image-2 生成并经机制审校,不是论文原图,也不是任何公司的内部文档。
主要公开来源
以下链接用于身份核查与机制追溯。具体 claim 仍应回到论文正文、技术报告或代码。
- Moshi: a speech-text foundation model for real-time dialogue
- Kyutai Moshi 开源项目
- Spirit LM: Interleaved Spoken and Written Language Model
- AudioLM: a Language Modeling Approach to Audio Generation
- AudioPaLM: A Large Language Model That Can Speak and Listen
- SpeechGPT: Intrinsic Cross-Modal Conversational Abilities
- Mini-Omni: Hear, Talk While Thinking in Streaming
- LLaMA-Omni: Seamless Speech Interaction with LLMs
- SALMONN-omni: Codec-free Full-duplex Speech
- DuplexMamba: Duplex and Streaming Speech Conversations
- Full-Duplex-Bench v1.5
- DuplexChat: Speaker-Separated Full-Duplex Dialogue Speech
- SLAM-LLM 开源框架
- OpenAI Realtime Console(仅作产品/API 边界证据)
gpt-image-2(provider: glink)生成。发布日期:2026-07-17。