执行摘要

核心结论:2023 年 VALL-E 开创「语音 = 离散 token 上的语言建模」范式后,LLM-based TTS 三年内完成了从「零样本克隆可行」到「流式/全双工可用」再到「规模化+可控」的三级跳。截至 2026 年 8 月,四条技术路线并存且趋同:①音频码本+自回归解码(VALL-E 系、CosyVoice 1/2/3、Seed-TTS、MiniMax Speech 02、Fish Audio S2、Qwen3-TTS);②非自回归生成式(Voicebox、F5-TTS/E2-TTS、NaturalSpeech 3、MegaTTS 3、VibeVoice);③统一多模态语音 LLM(Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、PersonaPlex、Sesame CSM);④流式/双流式 TTS 专项(LLMVoX、SpeakStream、StreamMel、CTC-TTS)。

四条路线架构全景(事实图示)
在这里插入图片描述

关键趋势

  1. 对齐方式演进:MFA(GMM-HMM)→ CTC 对齐 → 端到端隐式/免对齐,CTC-TTS 证明「神经对齐器 + 结构化训练序列」可在延迟与质量之间取得更优折中(推断:这是流式 TTS 走向实用的关键拼图)。
  2. 听说闭环与 ASR/TTS 统一:Moshi 的 inner-monologue、CTC-TTS 用 ASR 的 CTC 对齐反哺 TTS、Qwen3-TTS 与 Qwen-Audio 共享编码器,语音「理解-生成」正走向同一模型。
  3. 低延迟军备竞赛:首包延迟从秒级压到 250ms(MiniMax Speech 2.6)乃至 97ms(Qwen3-TTS-12Hz);全双工对话(Moshi 系)实现 160–200ms 理论延迟。
  4. 开源生态大爆发:Qwen3-TTS(Apache 2.0)、CosyVoice 3、Fish Audio S2、VibeVoice、GLM-TTS 等 2025–2026 开源模型在 Seed-TTS 基准上 CER/WER 逼近甚至超越闭源标杆。

推荐关注清单:Qwen3-TTS(双 tokenizer + 97ms 流式)、CTC-TTS(对齐范式创新)、CosyVoice 3(RL 后训练 + 多语言)、Fish Audio S2(词级情绪控制 + Dual-AR)、Moshi/PersonaPlex(全双工语音对话)、MiniMax Speech 02(TTS Arena 榜首)、F5-TTS(开源零样本标杆)、VibeVoice(长文本合成)。


一、技术路线全景

1.1 音频码本 + 自回归解码路线(Codec LM)

原理:用神经音频编解码器把波形离散化为 token(RVQ/FSQ/单量化器),再用 decoder-only Transformer 以「文本/音素 → 语音 token」的条件语言建模方式自回归生成,最后由声码器重建波形。

VALL-E 式语言建模目标函数(条件 AR 解码):

LAR  =  −∑t=1Tlog⁡Pθ ⁣(st | s<t, x, r)\mathcal{L}_{\mathrm{AR}} \;=\; -\sum_{t=1}^{T} \log P_{\theta}\!\left(s_{t} \,\middle|\, s_{<t},\, \mathbf{x},\, \mathbf{r}\right)LAR=t=1TlogPθ(sts<t,x,r)

其中 x\mathbf{x}x 为文本/音素序列,r\mathbf{r}r 为参考语音(零样本克隆条件),sts_{t}st 为第 ttt 个音频 token;多码本设置下 sts_tst 为向量 (st(1),…,st(K))(s_{t}^{(1)},\dots,s_{t}^{(K)})(st(1),,st(K))。VALL-E 采用 AR+NAR 两级(先 AR 生成第一码本、NAR 补全其余);CosyVoice/Qwen3-TTS/Seed-TTS 采用单/多码本自回归。

残差矢量量化(RVQ):设编码器输出连续潜变量 z∈RT×D\mathbf{z}\in\mathbb{R}^{T\times D}zRT×D,第 kkk 个码本迭代量化残差:

z  =  ∑k=1Kc(k)+ϵ,c^(k)=argminc∈C(k)∥ z−∑i<kc^(i)−c ∥2\mathbf{z} \;=\; \sum_{k=1}^{K} \mathbf{c}^{(k)} + \boldsymbol{\epsilon},\quad \hat{\mathbf{c}}^{(k)} = \mathrm{argmin}_{c \in \mathcal{C}^{(k)}} \left\|\, \mathbf{z} - \sum_{i<k} \hat{\mathbf{c}}^{(i)} - c\,\right\|_{2}z=k=1Kc(k)+ϵ,c^(k)=argmincC(k) zi<kc^(i)c 2

低层码本承载语义/韵律,高层码本承载声学细节(如 MimI/FACodec/Qwen-TTS-Tokenizer-12Hz 的分层设计)。

模型 机构/时间 关键设计 开源
VALL-E 微软 2023.01 EnCodec 8 码本、AR+NAR 两级、3 秒零样本克隆开山之作
VALL-E 2 微软 2024.06 重复感知采样(Repetition-Aware Sampling)修复无限循环 否(研究专用)
CosyVoice 1 阿里 2024.07 FSQ 量化 + 流匹配混合架构、指令控制
CosyVoice 2 阿里 2024.12–2025.01 25Hz 单码本、chunk-aware 因果流匹配,一个模型同时支持流式/非流式(150ms 流式延迟)
CosyVoice 3 阿里 2025 0.5B→1.5B 参数量、1 万→100 万小时数据、可微奖励 RL 后训练,9 语言 + 18 方言 是(Fun-CosyVoice3-0.5B-2512,2025.12)
Seed-TTS 字节 2024.06 高质量闭源标杆,其测试集成为社区事实基准
GPT-SoVITS 开源社区 2024 少样本中文克隆、易用性极强
MiniMax Speech 02 MiniMax 2025.05 可学习说话人编码器(无需参考转写)、32 语言,登顶 TTS Arena/AA Speech Arena
MiniMax Speech 2.6 MiniMax 2025.10 端到端延迟 <250ms、Fluent LoRA 流畅化克隆
Fish Audio S2 Fish Audio 2026.03 Dual-AR(Slow AR 语义 + Fast AR 残差码本)、词级情绪控制(15000+ 标签)、80+ 语言、1000 万小时数据 是(研究许可)
Qwen3-TTS 阿里 2026.01 双轨 LM + 双 tokenizer(25Hz 语义 / 12Hz 多码本)、97ms 首包、3 秒克隆、10 语言 是(Apache 2.0)
Llasa 2025 直接标准 LLaMA + 单 VQ codec,验证 LLM 缩放定律适用于 TTS

1.2 非自回归 / 生成式路线(扩散、flow matching、GAN)

流匹配损失函数(F5-TTS):给定目标 mel 谱 xxx、噪声 ϵ∼N(0,I)\epsilon \sim \mathcal{N}(0,I)ϵN(0,I)、时间 t∼U[0,1]t \sim \mathcal{U}[0,1]tU[0,1],构造线性插值 zt=(1−t)ϵ+t xz_t = (1-t)\epsilon + t\,xzt=(1t)ϵ+tx,训练速度场 vθv_\thetavθ

LFM  =  Et, ϵ, x, c ⁣[ ∥vθ(zt,t,c)−(x−ϵ)∥22]\mathcal{L}_{\mathrm{FM}} \;=\; \mathbb{E}_{t,\,\epsilon,\,x,\,c}\!\left[\, \big\| v_{\theta}(z_{t}, t, c) - (x - \epsilon)\big\|_{2}^{2} \right]LFM=Et,ϵ,x,c[ vθ(zt,t,c)(xϵ) 22]

ccc 为条件(文本 + 声音提示),推理时用 ODE 求解器(如 Euler)从 ϵ\epsilonϵ 积分到 xxx;Sway Sampling 通过调整时间步权重在更少 NFE 下提升质量。

DiT 条件扩散(E2/F5-TTS):用 Diffusion Transformer 替代 U-Net,长度匹配靠填充符(filler):

输入长度  =  pad(字符序列)→Lmel,Lsimple=E ⁣[ ∥ ϵ−ϵθ(zt, t, c)∥22 ]\text{输入长度} \;=\; \mathrm{pad}\bigl(\text{字符序列}\bigr) \to L_{\text{mel}}, \quad \mathcal{L}_{\text{simple}} = \mathbb{E}\!\left[\,\|\,\epsilon - \epsilon_{\theta}(z_{t},\,t,\,c)\|_{2}^{2}\,\right]输入长度=pad(字符序列)Lmel,Lsimple=E[ϵϵθ(zt,t,c)22]

模型 时间 关键设计 备注
Voicebox 2023.06(Meta) 流匹配 + 文本引导,多语言通用生成 未完整开源
NaturalSpeech 3 2024(ICML) FACodec 将语音分解为内容/韵律/音色/声学子空间,各维度可独立提示
E2-TTS 2024 无 duration 模型、无对齐器、无 G2P,填充符匹配长度 是(F5-TTS 前身)
F5-TTS 2024.10 DiT + ConvNeXt 文本细化 + Sway Sampling,RTF 0.15,WER 2.4% 是(开源零样本标杆)
Matcha-TTS 2023 18M 参数,2–10 步,RTF 0.015
MegaTTS 3 2025(字节) 稀疏对齐(sparse alignment)+ 潜空间 DiT,~8 步
LongCat-AudioDiT 2026.03(美团) 波形潜空间扩散,APG 替代 CFG,1B/3.5B 是(MIT)
VibeVoice 2026(微软,ICLR 2026 Oral) next-token diffusion,长文本 ~90 分钟、4 说话人 是(MIT,研究限制商用)
OmniVoice 2026 扩散语言模型实现「全语种」零样本 + 免参考音色设计

1.3 统一多模态 LLM(语音输入输出)端到端路线

inner-monologue 联合概率(Moshi):每个 80ms 帧同时预测文本 token(中间层)与 Mimi 8 码本语音 token:

P(sj, tjmono∣u≤j, s<j)  =  P(tjmono∣⋅) ∏k=18P ⁣(sj(k) | sj(<k), u≤j, s<j)P(s_{j},\,t^{\text{mono}}_{j} \mid \mathbf{u}_{\le j},\,s_{<j}) \;=\; P(t^{\text{mono}}_{j}\mid\cdot)\,\prod_{k=1}^{8} P\!\left(s_{j}^{(k)} \,\middle|\, s_{j}^{(<k)},\, \mathbf{u}_{\le j},\, s_{<j}\right)P(sj,tjmonouj,s<j)=P(tjmono)k=18P(sj(k) sj(<k),uj,s<j)

文本流作为「内心独白」(不直接发音)提供语言推理支架,音频流做语音输出。Temporal Transformer 处理时序,Depth Transformer 处理同帧 8 个码本。

输出

模型

输入

ASR 转写

用户音频
Mimi 12.5Hz

Temporal
Transformer 7B

Helium LLM
7B

文本流
inner monologue

音频流
Mimi 8 码本

免费转写

Mimi 解码
1.1kbps

语音输出
全双工

上图:Moshi 全双工架构(参考 Kyutai 官方与本地部署综述)。用户音频与系统音频并行输入同一个模型,文本 inner monologue 提供语义支架且作为流式 ASR 的副产品。

模型 时间 关键设计 延迟
GPT-4o 2024.05(OpenAI,闭源) 原生多模态,Realtime API ~300ms
Moshi 2024.09(Kyutai) Mimi codec(12.5Hz, 1.1kbps)+ Helium 7B + inner-monologue 文本中间流,全双工 160ms 理论 / 200ms 实测
GLM-4-Voice 2024.12(智谱) 9B 端到端 speech-in/out,情感/方言控制 是(Apache 2.0)
Qwen3-Omni 2025(阿里) 实时语音输入输出多模态,Thinker/Talker 双模块 ~516–702ms
Sesame CSM 2025 Llama-3.2 backbone + Mimi codec head,会话语音「voice presence」 200ms TTFA
PersonaPlex 2026.01(NVIDIA) Moshi 架构 + 文本人格提示 + 语音嵌入双条件,角色扮演客服 205ms
Hibiki / Hibiki-Zero 2026.02(Kyutai) 流式同声传译,免词级对齐 + GRPO 优化延迟 12.5Hz 帧级

适用性对比:该路线延迟最低、交互最自然,但推理质量/工具调用能力受限于模型规模,长上下文记忆弱(推断:2026 年多数生产语音 Agent 仍用管线式架构,见 PersonaPlex 综述)。

1.4 流式 / 双流式(streaming)TTS 专项路线

流式 chunk 因果解码(CosyVoice 2 / Qwen3-TTS):将文本切分为 chunk {Xi}i=1N\{X_i\}_{i=1}^{N}{Xi}i=1N,每个 chunk 对应一段语音 chunk {Si}\{S_i\}{Si},条件于过去上下文自回归:

P(S1:N∣X1:N)  =  ∏i=1NP ⁣(Si | S<i, X≤i)P(S_{1:N} \mid X_{1:N}) \;=\; \prod_{i=1}^{N} P\!\left(S_{i} \,\middle|\, S_{<i},\, X_{\le i}\right)P(S1:NX1:N)=i=1NP(SiS<i,Xi)

首包延迟 LFPLL_{\mathrm{FPL}}LFPL 由首个 chunk 长度决定;质量与延迟由 chunk 大小 ccc 显式权衡(ccc 越大、质量越好但首包越晚)。

CTC-TTS 双流式定义:文本一边到达、语音一边输出,模型在收到每个新词(甚至 token)时即开始更新输出。设流式输入文本序列为 {w1,w2,…,wN}\{w_1, w_2, \dots, w_N\}{w1,w2,,wN},第 iii 步模型接收前缀 X1:iX_{1:i}X1:i 后输出语音 token 流 Sgen(i)S_{\text{gen}}^{(i)}Sgen(i),端到端延迟 = prefill 时间 + 解码时间。

模型 时间 对齐/序列方案 首包延迟 WER
ELLA-V 2024 MFA 对齐 + 局部前移序列 高(MFA 流程重)
LLMVoX 2025.03 固定比例交织 + 特征维堆叠,LLM-agnostic 30M ~480ms 3.7%
StreamSpeech / SyncSpeech 2025.02 双流 + 2-token lookahead 60ms 3.07%
IST-LM 2025.05 固定比例交织(文本块/语音块),统计最优比例
SpeakStream 2025.05 交错数据 + 全流式声码器 VocStream <50ms <5%
StreamMel 2025.06 连续 mel + 文本/声学帧交织(无离散 token) 10–40ms 1.65%
VoXtream 2025.09 单调对齐 + 时长预测 102ms 3.8%
CTC-TTS-F 2026.02 CTC 对齐 + bi-word 特征维堆叠 低于 LLMVoX(论文结论) 1.8%
CTC-TTS-L 2026.02 CTC 对齐 + bi-word 长度维拼接 较高(prefill 需两词) 质量更优(论文结论)
Qwen3-TTS-12Hz 2026.01 全因果 12Hz 多码本 + 分层预测 97ms 零样本 WER 0.77(中文)

CTC-TTS 路线图定位(事实):论文在 LibriSpeech 上训练,单说话人实验对比 LLMVox;多说话人零样本实验设 4 组对照(MFA+ELLA-V / CTC+ELLA-V / MFA+bi-word / CTC-TTS),结论是「同序列下 CTC 对齐优于 MFA 对齐」「同对齐下 bi-word 序列优于 ELLA-V 序列」——两种创新相互独立且可叠加。

1.5 路线横向对比

维度 Codec LM(AR) 生成式(NAR) 统一多模态 LLM 流式专项
韵律/自然度 高(AR 上下文建模) 高(扩散细节好) 中-高 中(上下文受限)
推理速度 慢(逐 token) 快(并行) 快(chunk 化)
零样本克隆 强(天然支持) 中(需额外机制)
流式/全双工 弱(需改造) 基本不支持 强(原生) 强(设计目标)
可控性 中-强(指令/LoRA) 强(自然语言指令)
典型场景 高质量克隆、配音 批量合成、短文本 实时对话、语音 Agent 实时交互、流式助手

二、关键技术与设计要点

2.1 文本-语音对齐:MFA vs CTC vs 隐式

CTC 损失函数(CTC-TTS 核心对齐器):

LCTC(x,y)  =  −ln⁡∑π∈B−1(y)∏t=1Tpt(πt)\mathcal{L}_{\mathrm{CTC}}(\mathbf{x}, \mathbf{y}) \;=\; -\ln \sum_{\boldsymbol{\pi} \in \mathcal{B}^{-1}(\mathbf{y})} \prod_{t=1}^{T} p_{t}(\pi_{t})LCTC(x,y)=lnπB1(y)t=1Tpt(πt)

其中 π=(π1,…,πT)\boldsymbol{\pi}=(\pi_{1},\dots,\pi_{T})π=(π1,,πT) 为含 blank 标签 ∅\varnothing 的对齐路径,B\mathcal{B}B 为折叠去重映射(B(∅aa∅b)=aab\mathcal{B}(\varnothing a a\varnothing b) = aabB(aab)=aab)。CTC-TTS 使用 CTC-ASR 模型以 25 fps 输出音素+blank 概率分布,Viterbi 解码得最优路径,再做 blank 归并后处理(blank 帧归到其后首个音素,末尾 trailing blanks 归到最后一个音素),得到 1:3 的音素↔语音 token 对应。
在这里插入图片描述

方案 原理 优点 缺点
MFA 强制对齐 GMM-HMM 工具包,输出帧级音素边界 精确、成熟、易用 流程重(需 G2P + 外部工具)、灵活性差、对 LLM-based TTS 粒度过细
CTC 对齐 CTC-based ASR + Viterbi 解码,blank 归并后处理 端到端神经对齐、无需外部工具、结构对应即够用(CTC-TTS 论文核心论点);ASR/TTS 共享技术栈 需 G2P 音素化;25fps vs 75tps 存在 1:3 映射需后处理
端到端隐式对齐 填充符(filler)长度匹配(E2-TTS/F5-TTS)或隐式 attention 最简、免对齐标注 收敛慢、鲁棒性依赖数据(F5-TTS 用 ConvNeXt 细化缓解)
单调对齐 单调注意力/时长预测(VoXtream、StreamSpeech) 流式友好、可精确控制 lookahead 需额外组件,韵律建模受限

推断:CTC-TTS 的价值在于把 ASR 领域验证过的 CTC 对齐「物美价廉」地移植到 TTS——它只要求「稳定的结构对应」而非「精确帧边界」,恰好匹配 LLM-based TTS 的建模粒度,未来可能成为流式 TTS 的主流对齐方案。

2.2 训练序列 / token 交织策略

bi-word 块的形式化定义(CTC-TTS 核心贡献之一):

block(wi)  =  [ ph(wi),  sep,  ph(wi+1),  swi ]\mathrm{block}(w_i) \;=\; \bigl[\,\mathrm{ph}(w_i),\;\mathrm{sep},\;\mathrm{ph}(w_{i+1}),\;\mathbf{s}_{w_i}\,\bigr]block(wi)=[ph(wi),sep,ph(wi+1),swi]

其中 ph(⋅)\mathrm{ph}(\cdot)ph() 为词的音素序列,sep\mathrm{sep}sep 为词分隔符,swi\mathbf{s}_{w_i}swi 为对应 wiw_iwi 的语音 token 序列(按 CTC 对齐取若干连续 token)。整段训练序列为:

Ztrain  =  [ cls,  block(w1),  block(w2),  …,  block(wN−1),  eos ]\mathbf{Z}_{\mathrm{train}} \;=\; \bigl[\,\mathrm{cls},\; \mathrm{block}(w_1),\;\mathrm{block}(w_2),\;\dots,\;\mathrm{block}(w_{N-1}),\;\mathrm{eos}\,\bigr]Ztrain=[cls,block(w1),block(w2),,block(wN1),eos]

CTC-TTS-L 在序列长度维拼接 → 自回归 LM 容易建模;CTC-TTS-F 在特征维堆叠音素与语音 embedding → 序列更短、首包更快,但跨说话人/域外场景略弱。
在这里插入图片描述

  • 固定比例交织(LLMVoX、IST-LM):文本块/语音块按固定比例排列,简单但难以捕捉真实语音中「词-音素-声音片段」的对应关系(CTC-TTS 论文对 LLMVox 的批评)。
  • 局部前移(look-ahead)(ELLA-V):把未来词的上下文前移,改善韵律但跨说话人/域外场景不稳定。
  • bi-word 交织(CTC-TTS):「当前词音素 + 分隔符 + 下一词音素 + 当前词语音 token」,向前看一个词,兼顾韵律与延迟。
  • 文本重复 vs 不重复(SpeakStream):重复文本换取更简单的注意力模式,mmm(文本窗口)/nnn(语音跳长)控制延迟-质量权衡。

2.3 音频 tokenizer 对质量的影响

在这里插入图片描述

  • 声学 tokenizer(EnCodec/DAC/WavTokenizer/Stable Codec):以重建保真为目标,PESQ/UTMOS 高,但语义弱;WavTokenizer(单量化器 40/75Hz,ICLR 2025)在压缩率与语义之间取得突破,成为 LLMVoX、CTC-TTS 等的底座。
  • 语义 tokenizer(HuBERT/WavLM):语义强但重建差,适合 ASR/理解任务。
  • 解耦 tokenizer:SpeechTokenizer(语义+声学分层)、Mimi(12.5Hz split-RVQ,1.1kbps)、FACodec(四子空间分解)、X-Codec2(FSQ)、LSCodec —— 在低码率下同时保语义与声学,支撑全双工与低延迟。
  • 趋势(推断):①码率向 12.5–25Hz 下探(Mimi/Qwen3-TTS-12Hz);②语义-声学显式解耦 + 因果解码(流式友好);③FSQ 取代 RVQ 提升码本利用率(CosyVoice 2 接近 100% 利用率)。

2.4 零样本克隆、情感/韵律控制、多语种

  • 零样本克隆:3 秒参考语音即可(VALL-E 开创,Qwen3-TTS 商业化);MiniMax Speech 02 用「可学习说话人编码器」实现免参考转写的「内在零样本」克隆。
  • 情感/韵律控制:从全局标签(StyleTTS)→ 自然语言指令(InstructTTS、VoxInstruct、GPT-4o-mini-tts)→ 词级/内联标签细粒度控制(Fish Audio S2 支持 [laugh]、[whisper] 等 15000+ 标签,标签激活率 93.3%)。
  • 多语种/跨语言:CosyVoice 3 覆盖 9 语言 + 18 方言,跨语言克隆显著改进(日→中字符重叠问题通过假名化解决);Qwen3-TTS 在 zh→ko 跨语言克隆上 MixER 4.82% 大幅优于 CosyVoice 3 的 14.4%;Fish Audio S2 声称 80+ 语言。

2.5 低延迟与实时性优化手段

  • prefill 预填充:CTC-TTS-L 首词需两个词进入模型,F 版读到第一个音素即可开讲。
  • 流式 chunk 解码:CosyVoice 2 chunk-aware 因果流匹配、Qwen3-TTS block-wise DiT + 全因果 ConvNet。
  • 多码本分层预测:depth transformer(Moshi 8 码本 80ms 内顺序预测)、Qwen3-TTS Multi-Token Prediction(先语义码本后细节码本)。
  • 推理加速:KV cache、vLLM + CUDA Graph、RadixAttention 前缀缓存(Fish Audio S2 在 H200 上 RTF 0.195、TTFA 100ms)。
  • 推测解码(PredGen,2025):输入侧推测加速语音 LLM。

三、最新进展与时间线(本报告重点)

3.1 2023—2026 代表模型时间线(事实图示)

在这里插入图片描述

时间 事件 开源
2023.01 VALL-E(微软)——Codec LM 零样本克隆范式开创
2023.05 SoundStorm:并行音频生成;Bark
2023.06 Voicebox(Meta)——流匹配通用语音生成
2024.05 GPT-4o 语音模式(OpenAI)
2024.06 VALL-E 2(重复感知采样);Seed-TTS(字节,闭源标杆)
2024.07 CosyVoice 1(阿里);Emilia 数据集(101k 小时,6 语言);NaturalSpeech 3 ✅/✅/❌
2024.08 WavTokenizer(单量化器 codec,ICLR 2025)
2024.09 Moshi(Kyutai,全双工语音 LLM);CosyVoice-300M
2024.10 F5-TTS(流匹配 + DiT,开源零样本标杆)
2024.12 CosyVoice2-0.5B(25Hz 流式);GLM-4-Voice(智谱 9B)
2025.01–02 CosyVoice 2 论文;StreamSpeech/SyncSpeech(60ms 流式)
2025.03 LLMVoX(30M,LLM-agnostic 流式 TTS)
2025.05 MiniMax Speech 02(TTS Arena 榜首);IST-LM;SpeakStream(<50ms) ❌/✅/✅
2025.06 StreamMel;Sesame CSM(会话语音)
2025.07 Fun-CosyVoice 3.0 评估集(CV3-Eval)
2025.09 VoXtream;CosyVoice 3 论文(1M 小时、RL 后训练)
2025.10 MiniMax Speech 2.6(250ms);Kimi-Audio(Moonshot) ❌/✅
2025.12 Fun-CosyVoice3-0.5B-2512 发布(9 语言 18 方言)
2026.01 Qwen3-TTS(双 tokenizer、97ms 首包、Apache 2.0);PersonaPlex(NVIDIA 全双工人格化)
2026.02 CTC-TTS(arXiv,Interspeech 2026);Hibiki-Zero(免对齐流式同传);VibeVoice(ICLR 2026 Oral)
2026.03 Fish Audio S2(Dual-AR + 词级情绪);LongCat-AudioDiT(美团波形潜空间扩散)
2026(时间未精确到月) OmniVoice(全语种零样本);Llasa(LLaMA 缩放定律);MegaTTS 3(字节稀疏对齐);VoxCPM(免 tokenizer 连续 TTS)

3.2 2025—2026 最新工作要点(检索确认)

  • Qwen3-TTS(2026.01,arXiv:2601.15621,Apache 2.0):5M+ 小时、10 语言;双轨 LM + 双 tokenizer(25Hz 语义单码本 / 12Hz 16 层多码本全因果);12Hz 版首包 97ms(93ms LM + 4ms tokenizer),vLLM + CUDA Graph 下 RTF ≤0.5(6 路并发);3 秒克隆、自然语言音色设计;12Hz 在 LibriSpeech test-clean 上 STOI 0.948 / PESQ 3.52 / UTMOS 3.91 / SIM 0.892。
  • Fish Audio S2(2026.03):Dual-AR(4B Slow AR + 400M Fast AR)+ 10 码本 RVQ + GRPO 对齐;词级情绪控制(15000+ 标签,激活率 93.3%);80+ 语言;Audio Turing 测试 0.515;中文 WER 0.54%。
  • CTC-TTS(2026.02):见执行摘要与 1.4 节;与 LLMVox 相比 F 版首包延迟略低且 WER/CER 均明显下降(论文结论);GitHub 提供完整 5 阶段训练/推理管线(WavTokenizer + GPT-style + SpeechMOS 评测)。
  • PersonaPlex(2026.01,NVIDIA):Moshi 架构 + 文本人格提示 + 语音嵌入,1217h 真实对话 + 2250h 合成客服数据微调,205ms 延迟下支持角色扮演与打断。
  • VibeVoice(ICLR 2026 Oral):next-token diffusion 长文本合成(最长约 90 分钟、4 说话人),MIT 许可但研究用途限制 + 强制水印。
  • LongCat-AudioDiT(2026.03,美团):1B/3.5B 波形潜空间扩散,APG 投影引导替代 CFG,零样本克隆声称超越 Seed-TTS。

3.3 最新趋势专论

① 听说闭环(listen-speak loop)与 ASR/TTS 协同

编码器共享

共享音频编码器

Qwen3-TTS-Tokenizer-25Hz

Qwen-Audio

inner-monologue

并行生成
中间推理层

副产品 ASR 转写

语音 LLM
Moshi / PersonaPlex

文本流

流式 ASR

ASR-TTS 协同

结构对应
音素↔speech token

ASR 模型
CTC 对齐器

TTS 模型
CTC-TTS

上图:三条听说协同路径——CTC-TTS 的 ASR 对齐反哺、Moshi 的 inner-monologue、Qwen 的编码器共享。

推断:下一阶段将出现真正的「语音原生大模型」(speech-native LLM),TTS/ASR 不再是独立任务而是同一模型的输入输出视图。

② 对齐方式演进:MFA(外部工具、流程重)→ CTC(神经、端到端、与 ASR 复用)→ 免对齐(E2/F5 填充符、StreamMel 连续特征)→ 单调对齐(VoXtream)。CTC-TTS 与免对齐路线形成互补:前者适合流式(需要显式结构),后者适合高质量批量合成。

③ 从「合成得对」到「合成得可控」:评测重心从 MOS/WER 转向指令遵循(InstructTTSEval)、情绪标签激活率、跨语言一致性、长文本稳定性;RL 后训练(DPO/GRPO/可微奖励 DiffRO)成为 2025–2026 标配(CosyVoice 3、Fish Audio S2、Qwen3-TTS、Hibiki-Zero)。


四、评测与生态

4.1 主流评测指标

词错误率 WER / 字错率 CER(事实基准):

WER(yref,yhyp)  =  EditDist(yref,yhyp)Nref\mathrm{WER}(\mathbf{y}^{\text{ref}}, \mathbf{y}^{\text{hyp}}) \;=\; \frac{\mathrm{EditDist}(\mathbf{y}^{\text{ref}}, \mathbf{y}^{\text{hyp}})}{N_{\text{ref}}}WER(yref,yhyp)=NrefEditDist(yref,yhyp)

yhyp\mathbf{y}^{\text{hyp}}yhyp 为 ASR 对合成语音转写结果;ASR 模型选择会影响可比性(如 CTC-TTS 论文使用 Whisper/Hubert 等不同模型)。

说话人相似度 SIM(零样本克隆核心指标):

SIM  =  cos⁡ ⁣( EWavLM(ysyn),  EWavLM(yref) )\mathrm{SIM} \;=\; \cos\!\left(\,E_{\text{WavLM}}(\mathbf{y}^{\text{syn}}),\; E_{\text{WavLM}}(\mathbf{y}^{\text{ref}})\,\right)SIM=cos(EWavLM(ysyn),EWavLM(yref))

EWavLME_{\text{WavLM}}EWavLM 为 WavLM-TDCNN 说话人嵌入提取器。

实时因子 RTF 与首包延迟 FPL(实时性核心):

RTF  =  TgenTaudio,FPL  =  Tfirst packet−Ttext arrive\mathrm{RTF} \;=\; \frac{T_{\mathrm{gen}}}{T_{\mathrm{audio}}},\qquad \mathrm{FPL} \;=\; T_{\mathrm{first\,packet}} - T_{\mathrm{text\,arrive}}RTF=TaudioTgen,FPL=TfirstpacketTtextarrive

RTF < 1 表示生成快于实时;FPL 是流式 TTS 的关键体验指标(一般 ≤120ms 视为可交互)。

类别 指标 说明
自然度/主观 MOS、CMOS、SMOS、UTMOS(SpeechMOS)、TTS Arena Elo、AA Speech Arena 主观评测成本高、跨研究不可比,Arena 化是趋势
内容准确性 WER / CER(ASR 转写生成语音)、MixER(跨语言混合错误率) 事实基准;注意 ASR 选择影响可比性
说话人相似度 SIM-o / SIM-S / S-SIM(WavLM / ERes2Net 说话人嵌入余弦) 克隆质量核心指标
音质 PESQ、STOI、DNSMOS、FSD(Fréchet Speech Distance) 重建/降噪质量
实时性 首包延迟(FPL/TTFA)、RTF(实时因子)、端到端延迟 流式与交互场景核心
图灵测试 Audio Turing Test(人机区分率,如 Fish S2 0.515) 逼近真人程度

4.2 公开基准与数据集

  • 基准:LibriSpeech-PC(1127 样本零样本基准)、Seed-TTS 测试集(中/英/困难三档,社区事实标准)、InstructTTSEval(指令控制)、CV3-Eval(CosyVoice 3 多语言克隆/情感基准)、Emilia-Test。
  • 数据集:LibriTTS、LibriSpeech、VCTK、AISHELL-3、GigaSpeech、WenetSpeech4TTS、MLS、Common Voice、Emilia(2024.07,101k 小时、6 语言、in-the-wild 多样化口语,含 Emilia-Pipe 清洗管线)、Emilia-Large。
  • 开源框架生态:FunAudioLLM/CosyVoice(阿里,中文事实标准)、fish-speech(Fish Audio,含 WebUI/API/Docker)、Coqui XTTS、Kokoro-82M(82M 参数轻量标杆)、ChatTTS、ESPnet、Amphion、OpenAudio、Piper、Pipecat / LiveKit Agents(语音 Agent 工程框架)。
  • 现状判断:开源模型已在 Seed-TTS 基准上接近/超越闭源(Fun-CosyVoice3-0.5B-2512_RL:test-zh CER 0.81 vs MiniMax-Speech 0.83 vs 人类 1.26;test-hard CER 5.44 大幅领先其他开源)。推断:2026 年「开源与闭源差距」主要落在长上下文一致性、情感细腻度与规模化推理成本上,而非基础可懂度。
    在这里插入图片描述

五、挑战与开放问题

  1. 流式合成质量退化:流式受限于上下文窗口(lookahead 越小,韵律建模越差),CTC-TTS 论文即针对「流式质量-延迟折中」;多数流式系统在 WER 上仍明显高于非流式(强制流式下传统 TTS WER 可超 60%,SpeakStream 论文)。推断:双流式(文本一边到、语音一边出)是缓解方案,但「首词韵律」「跨句连读」仍是痛点。
  2. 长文本一致性与稳定性:长音频音色漂移、内容错误累积、情感脱节;Qwen3-TTS 支持 32K token(≥10 分钟),VibeVoice 探索 90 分钟级,但开源长文本测试集(Qwen3-TTS 自建)仍不完善。
  3. 情感可控性:文本相关情感(从文字推断)较好,文本无关情感(指定情绪但文本中性)准确率显著下降(CosyVoice 3 评估:悲伤/生气最难);词级控制刚起步(Fish Audio S2)。
  4. 多说话人一致性:会话/多角色场景音色漂移;跨语言克隆中音色保持与发音准确存在矛盾(CosyVoice 3 的日→中字符重叠问题)。
  5. 音色安全、版权与监管(2025–2026 已从论文走向法律):
    • 美国:田纳西 ELVIS Act(2024.07 生效,语音纳入形象权)、加州 AB 2602/AB 1836(数字复制需知情同意、逝者 70 年保护)、FTC 语音克隆规则(同意验证 + 审计追踪)、DEFIANCE Act(非自愿亲密影像/音频刑责)、FCC 机器人电话禁令;
    • 欧盟:AI Act 第 50 条深度伪造披露(2026.08 全面执法);
    • 中国:合成内容标识规定 2025.09.01 生效(音频显式/隐式标识);
    • 技术防护:C2PA 内容凭证、音频水印(压缩/混音下脆弱)、活体检测(FTC Voice Cloning Challenge 获奖方案)、对抗扰动(DeFake)。
  6. 评测标准化缺失:MOS 主观、WER 依赖 ASR 选择、各论文测试集不统一;TTS Arena 虽有 Elo 排名但覆盖模型有限。推断:急需社区统一的「流式延迟 + 质量 + 指令遵循」联合基准。
  7. 规模化成本:5M 小时级数据(Qwen3-TTS)与 1000 万小时(Fish Audio S2)的训练门槛让中小团队难以复现,开源模型多依赖蒸馏/复刻路线。

ASR / 语音理解协同融合趋势判断(推断):方向明确但仍在早期。CTC-TTS 展示了「ASR 对齐反哺 TTS」的可行路径;Moshi/PersonaPlex 展示了「语音原生对话」的交互价值;但「统一语音理解-生成模型」在知识密度、指令跟随、多语言鲁棒性上仍落后于「ASR→LLM→TTS」管线,2026 年生产环境主流仍是管线式(Pipecat/LiveKit 生态佐证)。


六、来源与可信度说明

  • 事实与推断的区分:文中所有模型名称、发布时间、参数量、性能数字均来自本次检索结果(见参考清单),已尽量交叉验证;「推断」字样处为本人基于现有证据的合理推测,非检索结论。
  • 已知不确定性:①部分 2026 年模型(OmniVoice、Llasa、VoxCPM 等)仅见于汇总仓库(ai4s-research/awesome-text-to-speech),未逐一到 arXiv/官网核验,标注为「时间未精确到月」;②「首包延迟」口径因论文而异(LLM 首 token vs 音频首包 vs 端到端),对比时需注意口径;③CTC-TTS 具体延迟/质量数值以论文正式版本为准,本报告采用论文摘要与 demo 页结论(「低于 LLMVox」「错误率显著下降」),量化数值(WER 1.8% / UTMOS 4.15)引自第三方综述(EmergentMind 流式 TTS 页),建议以论文为准。
  • 建议进一步检索清单:①Interspeech 2026 / ICASSP 2026 官方录用列表中的 TTS 论文全文;②Qwen3-TTS 技术报告完整版(arXiv:2601.15621)中的流式评测细节;③CTC-TTS 论文正文(arXiv:2602.19574 PDF)的延迟曲线与消融表;④TTS Arena / AA Speech Arena 最新榜单快照;⑤欧盟 AI Act 第 50 条与 FTC 语音克隆规则的最新执法动态。

参考来源清单

论文(arXiv / 会议)

  1. CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment — arXiv:2602.19574,Interspeech 2026(清华 thu-spmi)
  2. Qwen3-TTS Technical Report — arXiv:2601.15621(2026.01)
  3. LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM — arXiv:2503.04724(2025.03)
  4. F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching — arXiv:2410.06885(2024.10)
  5. Emilia: An Extensive, Multilingual, and Diverse Speech Dataset — arXiv:2407.05361(2024.07)
  6. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer — arXiv:2408.16532(2024.08,ICLR 2025)
  7. Towards Controllable Speech Synthesis in the Era of LLMs: A Systematic Survey — EMNLP 2025(aclanthology.org/2025.emnlp-main.40)
  8. Accelerating Diffusion-based TTS Model Training with Dual Modality Alignment — arXiv:2505.19595
  9. Discrete Audio Tokens: More Than a Survey! — arXiv:2506.10274
  10. SpeakStream: Streaming TTS with Interleaved Data — arXiv:2505.19206;StreamMel — arXiv:2506.xxxx(2025.06,检索自 HF Daily Papers)
  11. Moshi: a speech-text foundation model for real-time dialogue — Kyutai 2024(GitHub kyutai-labs/moshi)

开源项目 / 官方资源

  • thu-spmi/CTC-TTS(GitHub,含 5 阶段训练管线);ctctts.github.io(Demo)
  • QwenAudio/Qwen3-TTS、FunAudioLLM/CosyVoice(CosyVoice 1/2/3 路线图与 Seed-TTS 基准表,gitcode 镜像)、fishaudio/fish-speech(S2 Pro)
  • ai4s-research/awesome-text-to-speech(2023–2026 模型清单)、dubformer/awesome-speech-tokenizers(tokenizer 对比表)
  • kyutai-labs/moshi、NVIDIA/PersonaPlex、minimax.io/news(Speech-02 / Speech 2.6)
  • Microsoft/VibeVoice(ICLR 2026 Oral)、SWivid/F5-TTS、ChatGPT Realtime(OpenAI)

文档与行业资料

  • The 2025 Transparency Rulebook for Voice AI(EU AI Act 第 50 条、各州法律)
  • FTC Voice Cloning Challenge(ftc.gov/node/81974)及 FTC 语音克隆规则报道
  • AI Voice Cloning: Technology, Legal Issues & Best Tools in 2026(trtc.io)
  • Seed-TTS 测试集与 CV3-Eval 评估表(CosyVoice 官方仓库)
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐