【学习笔记】基于大语言模型(LLM)的 TTS 方法最新进展 —— 深度调研报告
执行摘要
核心结论:2023 年 VALL-E 开创「语音 = 离散 token 上的语言建模」范式后,LLM-based TTS 三年内完成了从「零样本克隆可行」到「流式/全双工可用」再到「规模化+可控」的三级跳。截至 2026 年 8 月,四条技术路线并存且趋同:①音频码本+自回归解码(VALL-E 系、CosyVoice 1/2/3、Seed-TTS、MiniMax Speech 02、Fish Audio S2、Qwen3-TTS);②非自回归生成式(Voicebox、F5-TTS/E2-TTS、NaturalSpeech 3、MegaTTS 3、VibeVoice);③统一多模态语音 LLM(Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、PersonaPlex、Sesame CSM);④流式/双流式 TTS 专项(LLMVoX、SpeakStream、StreamMel、CTC-TTS)。
四条路线架构全景(事实图示):
关键趋势:
- 对齐方式演进:MFA(GMM-HMM)→ CTC 对齐 → 端到端隐式/免对齐,CTC-TTS 证明「神经对齐器 + 结构化训练序列」可在延迟与质量之间取得更优折中(推断:这是流式 TTS 走向实用的关键拼图)。
- 听说闭环与 ASR/TTS 统一:Moshi 的 inner-monologue、CTC-TTS 用 ASR 的 CTC 对齐反哺 TTS、Qwen3-TTS 与 Qwen-Audio 共享编码器,语音「理解-生成」正走向同一模型。
- 低延迟军备竞赛:首包延迟从秒级压到 250ms(MiniMax Speech 2.6)乃至 97ms(Qwen3-TTS-12Hz);全双工对话(Moshi 系)实现 160–200ms 理论延迟。
- 开源生态大爆发:Qwen3-TTS(Apache 2.0)、CosyVoice 3、Fish Audio S2、VibeVoice、GLM-TTS 等 2025–2026 开源模型在 Seed-TTS 基准上 CER/WER 逼近甚至超越闭源标杆。
推荐关注清单:Qwen3-TTS(双 tokenizer + 97ms 流式)、CTC-TTS(对齐范式创新)、CosyVoice 3(RL 后训练 + 多语言)、Fish Audio S2(词级情绪控制 + Dual-AR)、Moshi/PersonaPlex(全双工语音对话)、MiniMax Speech 02(TTS Arena 榜首)、F5-TTS(开源零样本标杆)、VibeVoice(长文本合成)。
一、技术路线全景
1.1 音频码本 + 自回归解码路线(Codec LM)
原理:用神经音频编解码器把波形离散化为 token(RVQ/FSQ/单量化器),再用 decoder-only Transformer 以「文本/音素 → 语音 token」的条件语言建模方式自回归生成,最后由声码器重建波形。
VALL-E 式语言建模目标函数(条件 AR 解码):
LAR = −∑t=1TlogPθ (st | s<t, x, r)\mathcal{L}_{\mathrm{AR}} \;=\; -\sum_{t=1}^{T} \log P_{\theta}\!\left(s_{t} \,\middle|\, s_{<t},\, \mathbf{x},\, \mathbf{r}\right)LAR=−t=1∑TlogPθ(st∣s<t,x,r)
其中 x\mathbf{x}x 为文本/音素序列,r\mathbf{r}r 为参考语音(零样本克隆条件),sts_{t}st 为第 ttt 个音频 token;多码本设置下 sts_tst 为向量 (st(1),…,st(K))(s_{t}^{(1)},\dots,s_{t}^{(K)})(st(1),…,st(K))。VALL-E 采用 AR+NAR 两级(先 AR 生成第一码本、NAR 补全其余);CosyVoice/Qwen3-TTS/Seed-TTS 采用单/多码本自回归。
残差矢量量化(RVQ):设编码器输出连续潜变量 z∈RT×D\mathbf{z}\in\mathbb{R}^{T\times D}z∈RT×D,第 kkk 个码本迭代量化残差:
z = ∑k=1Kc(k)+ϵ,c^(k)=argminc∈C(k)∥ z−∑i<kc^(i)−c ∥2\mathbf{z} \;=\; \sum_{k=1}^{K} \mathbf{c}^{(k)} + \boldsymbol{\epsilon},\quad \hat{\mathbf{c}}^{(k)} = \mathrm{argmin}_{c \in \mathcal{C}^{(k)}} \left\|\, \mathbf{z} - \sum_{i<k} \hat{\mathbf{c}}^{(i)} - c\,\right\|_{2}z=k=1∑Kc(k)+ϵ,c^(k)=argminc∈C(k) z−i<k∑c^(i)−c 2
低层码本承载语义/韵律,高层码本承载声学细节(如 MimI/FACodec/Qwen-TTS-Tokenizer-12Hz 的分层设计)。
| 模型 | 机构/时间 | 关键设计 | 开源 |
|---|---|---|---|
| VALL-E | 微软 2023.01 | EnCodec 8 码本、AR+NAR 两级、3 秒零样本克隆开山之作 | 否 |
| VALL-E 2 | 微软 2024.06 | 重复感知采样(Repetition-Aware Sampling)修复无限循环 | 否(研究专用) |
| CosyVoice 1 | 阿里 2024.07 | FSQ 量化 + 流匹配混合架构、指令控制 | 是 |
| CosyVoice 2 | 阿里 2024.12–2025.01 | 25Hz 单码本、chunk-aware 因果流匹配,一个模型同时支持流式/非流式(150ms 流式延迟) | 是 |
| CosyVoice 3 | 阿里 2025 | 0.5B→1.5B 参数量、1 万→100 万小时数据、可微奖励 RL 后训练,9 语言 + 18 方言 | 是(Fun-CosyVoice3-0.5B-2512,2025.12) |
| Seed-TTS | 字节 2024.06 | 高质量闭源标杆,其测试集成为社区事实基准 | 否 |
| GPT-SoVITS | 开源社区 2024 | 少样本中文克隆、易用性极强 | 是 |
| MiniMax Speech 02 | MiniMax 2025.05 | 可学习说话人编码器(无需参考转写)、32 语言,登顶 TTS Arena/AA Speech Arena | 否 |
| MiniMax Speech 2.6 | MiniMax 2025.10 | 端到端延迟 <250ms、Fluent LoRA 流畅化克隆 | 否 |
| Fish Audio S2 | Fish Audio 2026.03 | Dual-AR(Slow AR 语义 + Fast AR 残差码本)、词级情绪控制(15000+ 标签)、80+ 语言、1000 万小时数据 | 是(研究许可) |
| Qwen3-TTS | 阿里 2026.01 | 双轨 LM + 双 tokenizer(25Hz 语义 / 12Hz 多码本)、97ms 首包、3 秒克隆、10 语言 | 是(Apache 2.0) |
| Llasa | 2025 | 直接标准 LLaMA + 单 VQ codec,验证 LLM 缩放定律适用于 TTS | 是 |
1.2 非自回归 / 生成式路线(扩散、flow matching、GAN)
流匹配损失函数(F5-TTS):给定目标 mel 谱 xxx、噪声 ϵ∼N(0,I)\epsilon \sim \mathcal{N}(0,I)ϵ∼N(0,I)、时间 t∼U[0,1]t \sim \mathcal{U}[0,1]t∼U[0,1],构造线性插值 zt=(1−t)ϵ+t xz_t = (1-t)\epsilon + t\,xzt=(1−t)ϵ+tx,训练速度场 vθv_\thetavθ:
LFM = Et, ϵ, x, c [ ∥vθ(zt,t,c)−(x−ϵ)∥22]\mathcal{L}_{\mathrm{FM}} \;=\; \mathbb{E}_{t,\,\epsilon,\,x,\,c}\!\left[\, \big\| v_{\theta}(z_{t}, t, c) - (x - \epsilon)\big\|_{2}^{2} \right]LFM=Et,ϵ,x,c[ vθ(zt,t,c)−(x−ϵ) 22]
ccc 为条件(文本 + 声音提示),推理时用 ODE 求解器(如 Euler)从 ϵ\epsilonϵ 积分到 xxx;Sway Sampling 通过调整时间步权重在更少 NFE 下提升质量。
DiT 条件扩散(E2/F5-TTS):用 Diffusion Transformer 替代 U-Net,长度匹配靠填充符(filler):
输入长度 = pad(字符序列)→Lmel,Lsimple=E [ ∥ ϵ−ϵθ(zt, t, c)∥22 ]\text{输入长度} \;=\; \mathrm{pad}\bigl(\text{字符序列}\bigr) \to L_{\text{mel}}, \quad \mathcal{L}_{\text{simple}} = \mathbb{E}\!\left[\,\|\,\epsilon - \epsilon_{\theta}(z_{t},\,t,\,c)\|_{2}^{2}\,\right]输入长度=pad(字符序列)→Lmel,Lsimple=E[∥ϵ−ϵθ(zt,t,c)∥22]
| 模型 | 时间 | 关键设计 | 备注 |
|---|---|---|---|
| Voicebox | 2023.06(Meta) | 流匹配 + 文本引导,多语言通用生成 | 未完整开源 |
| NaturalSpeech 3 | 2024(ICML) | FACodec 将语音分解为内容/韵律/音色/声学子空间,各维度可独立提示 | 否 |
| E2-TTS | 2024 | 无 duration 模型、无对齐器、无 G2P,填充符匹配长度 | 是(F5-TTS 前身) |
| F5-TTS | 2024.10 | DiT + ConvNeXt 文本细化 + Sway Sampling,RTF 0.15,WER 2.4% | 是(开源零样本标杆) |
| Matcha-TTS | 2023 | 18M 参数,2–10 步,RTF 0.015 | 是 |
| MegaTTS 3 | 2025(字节) | 稀疏对齐(sparse alignment)+ 潜空间 DiT,~8 步 | 是 |
| LongCat-AudioDiT | 2026.03(美团) | 波形潜空间扩散,APG 替代 CFG,1B/3.5B | 是(MIT) |
| VibeVoice | 2026(微软,ICLR 2026 Oral) | next-token diffusion,长文本 ~90 分钟、4 说话人 | 是(MIT,研究限制商用) |
| OmniVoice | 2026 | 扩散语言模型实现「全语种」零样本 + 免参考音色设计 | 是 |
1.3 统一多模态 LLM(语音输入输出)端到端路线
inner-monologue 联合概率(Moshi):每个 80ms 帧同时预测文本 token(中间层)与 Mimi 8 码本语音 token:
P(sj, tjmono∣u≤j, s<j) = P(tjmono∣⋅) ∏k=18P (sj(k) | sj(<k), u≤j, s<j)P(s_{j},\,t^{\text{mono}}_{j} \mid \mathbf{u}_{\le j},\,s_{<j}) \;=\; P(t^{\text{mono}}_{j}\mid\cdot)\,\prod_{k=1}^{8} P\!\left(s_{j}^{(k)} \,\middle|\, s_{j}^{(<k)},\, \mathbf{u}_{\le j},\, s_{<j}\right)P(sj,tjmono∣u≤j,s<j)=P(tjmono∣⋅)k=1∏8P(sj(k) sj(<k),u≤j,s<j)
文本流作为「内心独白」(不直接发音)提供语言推理支架,音频流做语音输出。Temporal Transformer 处理时序,Depth Transformer 处理同帧 8 个码本。
上图:Moshi 全双工架构(参考 Kyutai 官方与本地部署综述)。用户音频与系统音频并行输入同一个模型,文本 inner monologue 提供语义支架且作为流式 ASR 的副产品。
| 模型 | 时间 | 关键设计 | 延迟 |
|---|---|---|---|
| GPT-4o | 2024.05(OpenAI,闭源) | 原生多模态,Realtime API | ~300ms |
| Moshi | 2024.09(Kyutai) | Mimi codec(12.5Hz, 1.1kbps)+ Helium 7B + inner-monologue 文本中间流,全双工 | 160ms 理论 / 200ms 实测 |
| GLM-4-Voice | 2024.12(智谱) | 9B 端到端 speech-in/out,情感/方言控制 | 是(Apache 2.0) |
| Qwen3-Omni | 2025(阿里) | 实时语音输入输出多模态,Thinker/Talker 双模块 | ~516–702ms |
| Sesame CSM | 2025 | Llama-3.2 backbone + Mimi codec head,会话语音「voice presence」 | 200ms TTFA |
| PersonaPlex | 2026.01(NVIDIA) | Moshi 架构 + 文本人格提示 + 语音嵌入双条件,角色扮演客服 | 205ms |
| Hibiki / Hibiki-Zero | 2026.02(Kyutai) | 流式同声传译,免词级对齐 + GRPO 优化延迟 | 12.5Hz 帧级 |
适用性对比:该路线延迟最低、交互最自然,但推理质量/工具调用能力受限于模型规模,长上下文记忆弱(推断:2026 年多数生产语音 Agent 仍用管线式架构,见 PersonaPlex 综述)。
1.4 流式 / 双流式(streaming)TTS 专项路线
流式 chunk 因果解码(CosyVoice 2 / Qwen3-TTS):将文本切分为 chunk {Xi}i=1N\{X_i\}_{i=1}^{N}{Xi}i=1N,每个 chunk 对应一段语音 chunk {Si}\{S_i\}{Si},条件于过去上下文自回归:
P(S1:N∣X1:N) = ∏i=1NP (Si | S<i, X≤i)P(S_{1:N} \mid X_{1:N}) \;=\; \prod_{i=1}^{N} P\!\left(S_{i} \,\middle|\, S_{<i},\, X_{\le i}\right)P(S1:N∣X1:N)=i=1∏NP(Si∣S<i,X≤i)
首包延迟 LFPLL_{\mathrm{FPL}}LFPL 由首个 chunk 长度决定;质量与延迟由 chunk 大小 ccc 显式权衡(ccc 越大、质量越好但首包越晚)。
CTC-TTS 双流式定义:文本一边到达、语音一边输出,模型在收到每个新词(甚至 token)时即开始更新输出。设流式输入文本序列为 {w1,w2,…,wN}\{w_1, w_2, \dots, w_N\}{w1,w2,…,wN},第 iii 步模型接收前缀 X1:iX_{1:i}X1:i 后输出语音 token 流 Sgen(i)S_{\text{gen}}^{(i)}Sgen(i),端到端延迟 = prefill 时间 + 解码时间。
| 模型 | 时间 | 对齐/序列方案 | 首包延迟 | WER |
|---|---|---|---|---|
| ELLA-V | 2024 | MFA 对齐 + 局部前移序列 | 高(MFA 流程重) | — |
| LLMVoX | 2025.03 | 固定比例交织 + 特征维堆叠,LLM-agnostic 30M | ~480ms | 3.7% |
| StreamSpeech / SyncSpeech | 2025.02 | 双流 + 2-token lookahead | 60ms | 3.07% |
| IST-LM | 2025.05 | 固定比例交织(文本块/语音块),统计最优比例 | — | — |
| SpeakStream | 2025.05 | 交错数据 + 全流式声码器 VocStream | <50ms | <5% |
| StreamMel | 2025.06 | 连续 mel + 文本/声学帧交织(无离散 token) | 10–40ms | 1.65% |
| VoXtream | 2025.09 | 单调对齐 + 时长预测 | 102ms | 3.8% |
| CTC-TTS-F | 2026.02 | CTC 对齐 + bi-word 特征维堆叠 | 低于 LLMVoX(论文结论) | 1.8% |
| CTC-TTS-L | 2026.02 | CTC 对齐 + bi-word 长度维拼接 | 较高(prefill 需两词) | 质量更优(论文结论) |
| Qwen3-TTS-12Hz | 2026.01 | 全因果 12Hz 多码本 + 分层预测 | 97ms | 零样本 WER 0.77(中文) |
CTC-TTS 路线图定位(事实):论文在 LibriSpeech 上训练,单说话人实验对比 LLMVox;多说话人零样本实验设 4 组对照(MFA+ELLA-V / CTC+ELLA-V / MFA+bi-word / CTC-TTS),结论是「同序列下 CTC 对齐优于 MFA 对齐」「同对齐下 bi-word 序列优于 ELLA-V 序列」——两种创新相互独立且可叠加。
1.5 路线横向对比
| 维度 | Codec LM(AR) | 生成式(NAR) | 统一多模态 LLM | 流式专项 |
|---|---|---|---|---|
| 韵律/自然度 | 高(AR 上下文建模) | 高(扩散细节好) | 中-高 | 中(上下文受限) |
| 推理速度 | 慢(逐 token) | 快(并行) | 中 | 快(chunk 化) |
| 零样本克隆 | 强(天然支持) | 强 | 中(需额外机制) | 强 |
| 流式/全双工 | 弱(需改造) | 基本不支持 | 强(原生) | 强(设计目标) |
| 可控性 | 中-强(指令/LoRA) | 中 | 强(自然语言指令) | 中 |
| 典型场景 | 高质量克隆、配音 | 批量合成、短文本 | 实时对话、语音 Agent | 实时交互、流式助手 |
二、关键技术与设计要点
2.1 文本-语音对齐:MFA vs CTC vs 隐式
CTC 损失函数(CTC-TTS 核心对齐器):
LCTC(x,y) = −ln∑π∈B−1(y)∏t=1Tpt(πt)\mathcal{L}_{\mathrm{CTC}}(\mathbf{x}, \mathbf{y}) \;=\; -\ln \sum_{\boldsymbol{\pi} \in \mathcal{B}^{-1}(\mathbf{y})} \prod_{t=1}^{T} p_{t}(\pi_{t})LCTC(x,y)=−lnπ∈B−1(y)∑t=1∏Tpt(πt)
其中 π=(π1,…,πT)\boldsymbol{\pi}=(\pi_{1},\dots,\pi_{T})π=(π1,…,πT) 为含 blank 标签 ∅\varnothing∅ 的对齐路径,B\mathcal{B}B 为折叠去重映射(B(∅aa∅b)=aab\mathcal{B}(\varnothing a a\varnothing b) = aabB(∅aa∅b)=aab)。CTC-TTS 使用 CTC-ASR 模型以 25 fps 输出音素+blank 概率分布,Viterbi 解码得最优路径,再做 blank 归并后处理(blank 帧归到其后首个音素,末尾 trailing blanks 归到最后一个音素),得到 1:3 的音素↔语音 token 对应。
| 方案 | 原理 | 优点 | 缺点 |
|---|---|---|---|
| MFA 强制对齐 | GMM-HMM 工具包,输出帧级音素边界 | 精确、成熟、易用 | 流程重(需 G2P + 外部工具)、灵活性差、对 LLM-based TTS 粒度过细 |
| CTC 对齐 | CTC-based ASR + Viterbi 解码,blank 归并后处理 | 端到端神经对齐、无需外部工具、结构对应即够用(CTC-TTS 论文核心论点);ASR/TTS 共享技术栈 | 需 G2P 音素化;25fps vs 75tps 存在 1:3 映射需后处理 |
| 端到端隐式对齐 | 填充符(filler)长度匹配(E2-TTS/F5-TTS)或隐式 attention | 最简、免对齐标注 | 收敛慢、鲁棒性依赖数据(F5-TTS 用 ConvNeXt 细化缓解) |
| 单调对齐 | 单调注意力/时长预测(VoXtream、StreamSpeech) | 流式友好、可精确控制 lookahead | 需额外组件,韵律建模受限 |
推断:CTC-TTS 的价值在于把 ASR 领域验证过的 CTC 对齐「物美价廉」地移植到 TTS——它只要求「稳定的结构对应」而非「精确帧边界」,恰好匹配 LLM-based TTS 的建模粒度,未来可能成为流式 TTS 的主流对齐方案。
2.2 训练序列 / token 交织策略
bi-word 块的形式化定义(CTC-TTS 核心贡献之一):
block(wi) = [ ph(wi), sep, ph(wi+1), swi ]\mathrm{block}(w_i) \;=\; \bigl[\,\mathrm{ph}(w_i),\;\mathrm{sep},\;\mathrm{ph}(w_{i+1}),\;\mathbf{s}_{w_i}\,\bigr]block(wi)=[ph(wi),sep,ph(wi+1),swi]
其中 ph(⋅)\mathrm{ph}(\cdot)ph(⋅) 为词的音素序列,sep\mathrm{sep}sep 为词分隔符,swi\mathbf{s}_{w_i}swi 为对应 wiw_iwi 的语音 token 序列(按 CTC 对齐取若干连续 token)。整段训练序列为:
Ztrain = [ cls, block(w1), block(w2), …, block(wN−1), eos ]\mathbf{Z}_{\mathrm{train}} \;=\; \bigl[\,\mathrm{cls},\; \mathrm{block}(w_1),\;\mathrm{block}(w_2),\;\dots,\;\mathrm{block}(w_{N-1}),\;\mathrm{eos}\,\bigr]Ztrain=[cls,block(w1),block(w2),…,block(wN−1),eos]
CTC-TTS-L 在序列长度维拼接 → 自回归 LM 容易建模;CTC-TTS-F 在特征维堆叠音素与语音 embedding → 序列更短、首包更快,但跨说话人/域外场景略弱。
- 固定比例交织(LLMVoX、IST-LM):文本块/语音块按固定比例排列,简单但难以捕捉真实语音中「词-音素-声音片段」的对应关系(CTC-TTS 论文对 LLMVox 的批评)。
- 局部前移(look-ahead)(ELLA-V):把未来词的上下文前移,改善韵律但跨说话人/域外场景不稳定。
- bi-word 交织(CTC-TTS):「当前词音素 + 分隔符 + 下一词音素 + 当前词语音 token」,向前看一个词,兼顾韵律与延迟。
- 文本重复 vs 不重复(SpeakStream):重复文本换取更简单的注意力模式,mmm(文本窗口)/nnn(语音跳长)控制延迟-质量权衡。
2.3 音频 tokenizer 对质量的影响

- 声学 tokenizer(EnCodec/DAC/WavTokenizer/Stable Codec):以重建保真为目标,PESQ/UTMOS 高,但语义弱;WavTokenizer(单量化器 40/75Hz,ICLR 2025)在压缩率与语义之间取得突破,成为 LLMVoX、CTC-TTS 等的底座。
- 语义 tokenizer(HuBERT/WavLM):语义强但重建差,适合 ASR/理解任务。
- 解耦 tokenizer:SpeechTokenizer(语义+声学分层)、Mimi(12.5Hz split-RVQ,1.1kbps)、FACodec(四子空间分解)、X-Codec2(FSQ)、LSCodec —— 在低码率下同时保语义与声学,支撑全双工与低延迟。
- 趋势(推断):①码率向 12.5–25Hz 下探(Mimi/Qwen3-TTS-12Hz);②语义-声学显式解耦 + 因果解码(流式友好);③FSQ 取代 RVQ 提升码本利用率(CosyVoice 2 接近 100% 利用率)。
2.4 零样本克隆、情感/韵律控制、多语种
- 零样本克隆:3 秒参考语音即可(VALL-E 开创,Qwen3-TTS 商业化);MiniMax Speech 02 用「可学习说话人编码器」实现免参考转写的「内在零样本」克隆。
- 情感/韵律控制:从全局标签(StyleTTS)→ 自然语言指令(InstructTTS、VoxInstruct、GPT-4o-mini-tts)→ 词级/内联标签细粒度控制(Fish Audio S2 支持 [laugh]、[whisper] 等 15000+ 标签,标签激活率 93.3%)。
- 多语种/跨语言:CosyVoice 3 覆盖 9 语言 + 18 方言,跨语言克隆显著改进(日→中字符重叠问题通过假名化解决);Qwen3-TTS 在 zh→ko 跨语言克隆上 MixER 4.82% 大幅优于 CosyVoice 3 的 14.4%;Fish Audio S2 声称 80+ 语言。
2.5 低延迟与实时性优化手段
- prefill 预填充:CTC-TTS-L 首词需两个词进入模型,F 版读到第一个音素即可开讲。
- 流式 chunk 解码:CosyVoice 2 chunk-aware 因果流匹配、Qwen3-TTS block-wise DiT + 全因果 ConvNet。
- 多码本分层预测:depth transformer(Moshi 8 码本 80ms 内顺序预测)、Qwen3-TTS Multi-Token Prediction(先语义码本后细节码本)。
- 推理加速:KV cache、vLLM + CUDA Graph、RadixAttention 前缀缓存(Fish Audio S2 在 H200 上 RTF 0.195、TTFA 100ms)。
- 推测解码(PredGen,2025):输入侧推测加速语音 LLM。
三、最新进展与时间线(本报告重点)
3.1 2023—2026 代表模型时间线(事实图示)

| 时间 | 事件 | 开源 |
|---|---|---|
| 2023.01 | VALL-E(微软)——Codec LM 零样本克隆范式开创 | ❌ |
| 2023.05 | SoundStorm:并行音频生成;Bark | ✅ |
| 2023.06 | Voicebox(Meta)——流匹配通用语音生成 | ❌ |
| 2024.05 | GPT-4o 语音模式(OpenAI) | ❌ |
| 2024.06 | VALL-E 2(重复感知采样);Seed-TTS(字节,闭源标杆) | ❌ |
| 2024.07 | CosyVoice 1(阿里);Emilia 数据集(101k 小时,6 语言);NaturalSpeech 3 | ✅/✅/❌ |
| 2024.08 | WavTokenizer(单量化器 codec,ICLR 2025) | ✅ |
| 2024.09 | Moshi(Kyutai,全双工语音 LLM);CosyVoice-300M | ✅ |
| 2024.10 | F5-TTS(流匹配 + DiT,开源零样本标杆) | ✅ |
| 2024.12 | CosyVoice2-0.5B(25Hz 流式);GLM-4-Voice(智谱 9B) | ✅ |
| 2025.01–02 | CosyVoice 2 论文;StreamSpeech/SyncSpeech(60ms 流式) | ✅ |
| 2025.03 | LLMVoX(30M,LLM-agnostic 流式 TTS) | ✅ |
| 2025.05 | MiniMax Speech 02(TTS Arena 榜首);IST-LM;SpeakStream(<50ms) | ❌/✅/✅ |
| 2025.06 | StreamMel;Sesame CSM(会话语音) | ✅ |
| 2025.07 | Fun-CosyVoice 3.0 评估集(CV3-Eval) | ✅ |
| 2025.09 | VoXtream;CosyVoice 3 论文(1M 小时、RL 后训练) | ✅ |
| 2025.10 | MiniMax Speech 2.6(250ms);Kimi-Audio(Moonshot) | ❌/✅ |
| 2025.12 | Fun-CosyVoice3-0.5B-2512 发布(9 语言 18 方言) | ✅ |
| 2026.01 | Qwen3-TTS(双 tokenizer、97ms 首包、Apache 2.0);PersonaPlex(NVIDIA 全双工人格化) | ✅ |
| 2026.02 | CTC-TTS(arXiv,Interspeech 2026);Hibiki-Zero(免对齐流式同传);VibeVoice(ICLR 2026 Oral) | ✅ |
| 2026.03 | Fish Audio S2(Dual-AR + 词级情绪);LongCat-AudioDiT(美团波形潜空间扩散) | ✅ |
| 2026(时间未精确到月) | OmniVoice(全语种零样本);Llasa(LLaMA 缩放定律);MegaTTS 3(字节稀疏对齐);VoxCPM(免 tokenizer 连续 TTS) | ✅ |
3.2 2025—2026 最新工作要点(检索确认)
- Qwen3-TTS(2026.01,arXiv:2601.15621,Apache 2.0):5M+ 小时、10 语言;双轨 LM + 双 tokenizer(25Hz 语义单码本 / 12Hz 16 层多码本全因果);12Hz 版首包 97ms(93ms LM + 4ms tokenizer),vLLM + CUDA Graph 下 RTF ≤0.5(6 路并发);3 秒克隆、自然语言音色设计;12Hz 在 LibriSpeech test-clean 上 STOI 0.948 / PESQ 3.52 / UTMOS 3.91 / SIM 0.892。
- Fish Audio S2(2026.03):Dual-AR(4B Slow AR + 400M Fast AR)+ 10 码本 RVQ + GRPO 对齐;词级情绪控制(15000+ 标签,激活率 93.3%);80+ 语言;Audio Turing 测试 0.515;中文 WER 0.54%。
- CTC-TTS(2026.02):见执行摘要与 1.4 节;与 LLMVox 相比 F 版首包延迟略低且 WER/CER 均明显下降(论文结论);GitHub 提供完整 5 阶段训练/推理管线(WavTokenizer + GPT-style + SpeechMOS 评测)。
- PersonaPlex(2026.01,NVIDIA):Moshi 架构 + 文本人格提示 + 语音嵌入,1217h 真实对话 + 2250h 合成客服数据微调,205ms 延迟下支持角色扮演与打断。
- VibeVoice(ICLR 2026 Oral):next-token diffusion 长文本合成(最长约 90 分钟、4 说话人),MIT 许可但研究用途限制 + 强制水印。
- LongCat-AudioDiT(2026.03,美团):1B/3.5B 波形潜空间扩散,APG 投影引导替代 CFG,零样本克隆声称超越 Seed-TTS。
3.3 最新趋势专论
① 听说闭环(listen-speak loop)与 ASR/TTS 协同:
上图:三条听说协同路径——CTC-TTS 的 ASR 对齐反哺、Moshi 的 inner-monologue、Qwen 的编码器共享。
推断:下一阶段将出现真正的「语音原生大模型」(speech-native LLM),TTS/ASR 不再是独立任务而是同一模型的输入输出视图。
② 对齐方式演进:MFA(外部工具、流程重)→ CTC(神经、端到端、与 ASR 复用)→ 免对齐(E2/F5 填充符、StreamMel 连续特征)→ 单调对齐(VoXtream)。CTC-TTS 与免对齐路线形成互补:前者适合流式(需要显式结构),后者适合高质量批量合成。
③ 从「合成得对」到「合成得可控」:评测重心从 MOS/WER 转向指令遵循(InstructTTSEval)、情绪标签激活率、跨语言一致性、长文本稳定性;RL 后训练(DPO/GRPO/可微奖励 DiffRO)成为 2025–2026 标配(CosyVoice 3、Fish Audio S2、Qwen3-TTS、Hibiki-Zero)。
四、评测与生态
4.1 主流评测指标
词错误率 WER / 字错率 CER(事实基准):
WER(yref,yhyp) = EditDist(yref,yhyp)Nref\mathrm{WER}(\mathbf{y}^{\text{ref}}, \mathbf{y}^{\text{hyp}}) \;=\; \frac{\mathrm{EditDist}(\mathbf{y}^{\text{ref}}, \mathbf{y}^{\text{hyp}})}{N_{\text{ref}}}WER(yref,yhyp)=NrefEditDist(yref,yhyp)
yhyp\mathbf{y}^{\text{hyp}}yhyp 为 ASR 对合成语音转写结果;ASR 模型选择会影响可比性(如 CTC-TTS 论文使用 Whisper/Hubert 等不同模型)。
说话人相似度 SIM(零样本克隆核心指标):
SIM = cos ( EWavLM(ysyn), EWavLM(yref) )\mathrm{SIM} \;=\; \cos\!\left(\,E_{\text{WavLM}}(\mathbf{y}^{\text{syn}}),\; E_{\text{WavLM}}(\mathbf{y}^{\text{ref}})\,\right)SIM=cos(EWavLM(ysyn),EWavLM(yref))
EWavLME_{\text{WavLM}}EWavLM 为 WavLM-TDCNN 说话人嵌入提取器。
实时因子 RTF 与首包延迟 FPL(实时性核心):
RTF = TgenTaudio,FPL = Tfirst packet−Ttext arrive\mathrm{RTF} \;=\; \frac{T_{\mathrm{gen}}}{T_{\mathrm{audio}}},\qquad \mathrm{FPL} \;=\; T_{\mathrm{first\,packet}} - T_{\mathrm{text\,arrive}}RTF=TaudioTgen,FPL=Tfirstpacket−Ttextarrive
RTF < 1 表示生成快于实时;FPL 是流式 TTS 的关键体验指标(一般 ≤120ms 视为可交互)。
| 类别 | 指标 | 说明 |
|---|---|---|
| 自然度/主观 | MOS、CMOS、SMOS、UTMOS(SpeechMOS)、TTS Arena Elo、AA Speech Arena | 主观评测成本高、跨研究不可比,Arena 化是趋势 |
| 内容准确性 | WER / CER(ASR 转写生成语音)、MixER(跨语言混合错误率) | 事实基准;注意 ASR 选择影响可比性 |
| 说话人相似度 | SIM-o / SIM-S / S-SIM(WavLM / ERes2Net 说话人嵌入余弦) | 克隆质量核心指标 |
| 音质 | PESQ、STOI、DNSMOS、FSD(Fréchet Speech Distance) | 重建/降噪质量 |
| 实时性 | 首包延迟(FPL/TTFA)、RTF(实时因子)、端到端延迟 | 流式与交互场景核心 |
| 图灵测试 | Audio Turing Test(人机区分率,如 Fish S2 0.515) | 逼近真人程度 |
4.2 公开基准与数据集
- 基准:LibriSpeech-PC(1127 样本零样本基准)、Seed-TTS 测试集(中/英/困难三档,社区事实标准)、InstructTTSEval(指令控制)、CV3-Eval(CosyVoice 3 多语言克隆/情感基准)、Emilia-Test。
- 数据集:LibriTTS、LibriSpeech、VCTK、AISHELL-3、GigaSpeech、WenetSpeech4TTS、MLS、Common Voice、Emilia(2024.07,101k 小时、6 语言、in-the-wild 多样化口语,含 Emilia-Pipe 清洗管线)、Emilia-Large。
- 开源框架生态:FunAudioLLM/CosyVoice(阿里,中文事实标准)、fish-speech(Fish Audio,含 WebUI/API/Docker)、Coqui XTTS、Kokoro-82M(82M 参数轻量标杆)、ChatTTS、ESPnet、Amphion、OpenAudio、Piper、Pipecat / LiveKit Agents(语音 Agent 工程框架)。
- 现状判断:开源模型已在 Seed-TTS 基准上接近/超越闭源(Fun-CosyVoice3-0.5B-2512_RL:test-zh CER 0.81 vs MiniMax-Speech 0.83 vs 人类 1.26;test-hard CER 5.44 大幅领先其他开源)。推断:2026 年「开源与闭源差距」主要落在长上下文一致性、情感细腻度与规模化推理成本上,而非基础可懂度。

五、挑战与开放问题
- 流式合成质量退化:流式受限于上下文窗口(lookahead 越小,韵律建模越差),CTC-TTS 论文即针对「流式质量-延迟折中」;多数流式系统在 WER 上仍明显高于非流式(强制流式下传统 TTS WER 可超 60%,SpeakStream 论文)。推断:双流式(文本一边到、语音一边出)是缓解方案,但「首词韵律」「跨句连读」仍是痛点。
- 长文本一致性与稳定性:长音频音色漂移、内容错误累积、情感脱节;Qwen3-TTS 支持 32K token(≥10 分钟),VibeVoice 探索 90 分钟级,但开源长文本测试集(Qwen3-TTS 自建)仍不完善。
- 情感可控性:文本相关情感(从文字推断)较好,文本无关情感(指定情绪但文本中性)准确率显著下降(CosyVoice 3 评估:悲伤/生气最难);词级控制刚起步(Fish Audio S2)。
- 多说话人一致性:会话/多角色场景音色漂移;跨语言克隆中音色保持与发音准确存在矛盾(CosyVoice 3 的日→中字符重叠问题)。
- 音色安全、版权与监管(2025–2026 已从论文走向法律):
- 美国:田纳西 ELVIS Act(2024.07 生效,语音纳入形象权)、加州 AB 2602/AB 1836(数字复制需知情同意、逝者 70 年保护)、FTC 语音克隆规则(同意验证 + 审计追踪)、DEFIANCE Act(非自愿亲密影像/音频刑责)、FCC 机器人电话禁令;
- 欧盟:AI Act 第 50 条深度伪造披露(2026.08 全面执法);
- 中国:合成内容标识规定 2025.09.01 生效(音频显式/隐式标识);
- 技术防护:C2PA 内容凭证、音频水印(压缩/混音下脆弱)、活体检测(FTC Voice Cloning Challenge 获奖方案)、对抗扰动(DeFake)。
- 评测标准化缺失:MOS 主观、WER 依赖 ASR 选择、各论文测试集不统一;TTS Arena 虽有 Elo 排名但覆盖模型有限。推断:急需社区统一的「流式延迟 + 质量 + 指令遵循」联合基准。
- 规模化成本:5M 小时级数据(Qwen3-TTS)与 1000 万小时(Fish Audio S2)的训练门槛让中小团队难以复现,开源模型多依赖蒸馏/复刻路线。
ASR / 语音理解协同融合趋势判断(推断):方向明确但仍在早期。CTC-TTS 展示了「ASR 对齐反哺 TTS」的可行路径;Moshi/PersonaPlex 展示了「语音原生对话」的交互价值;但「统一语音理解-生成模型」在知识密度、指令跟随、多语言鲁棒性上仍落后于「ASR→LLM→TTS」管线,2026 年生产环境主流仍是管线式(Pipecat/LiveKit 生态佐证)。
六、来源与可信度说明
- 事实与推断的区分:文中所有模型名称、发布时间、参数量、性能数字均来自本次检索结果(见参考清单),已尽量交叉验证;「推断」字样处为本人基于现有证据的合理推测,非检索结论。
- 已知不确定性:①部分 2026 年模型(OmniVoice、Llasa、VoxCPM 等)仅见于汇总仓库(ai4s-research/awesome-text-to-speech),未逐一到 arXiv/官网核验,标注为「时间未精确到月」;②「首包延迟」口径因论文而异(LLM 首 token vs 音频首包 vs 端到端),对比时需注意口径;③CTC-TTS 具体延迟/质量数值以论文正式版本为准,本报告采用论文摘要与 demo 页结论(「低于 LLMVox」「错误率显著下降」),量化数值(WER 1.8% / UTMOS 4.15)引自第三方综述(EmergentMind 流式 TTS 页),建议以论文为准。
- 建议进一步检索清单:①Interspeech 2026 / ICASSP 2026 官方录用列表中的 TTS 论文全文;②Qwen3-TTS 技术报告完整版(arXiv:2601.15621)中的流式评测细节;③CTC-TTS 论文正文(arXiv:2602.19574 PDF)的延迟曲线与消融表;④TTS Arena / AA Speech Arena 最新榜单快照;⑤欧盟 AI Act 第 50 条与 FTC 语音克隆规则的最新执法动态。
参考来源清单
论文(arXiv / 会议)
- CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment — arXiv:2602.19574,Interspeech 2026(清华 thu-spmi)
- Qwen3-TTS Technical Report — arXiv:2601.15621(2026.01)
- LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM — arXiv:2503.04724(2025.03)
- F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching — arXiv:2410.06885(2024.10)
- Emilia: An Extensive, Multilingual, and Diverse Speech Dataset — arXiv:2407.05361(2024.07)
- WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer — arXiv:2408.16532(2024.08,ICLR 2025)
- Towards Controllable Speech Synthesis in the Era of LLMs: A Systematic Survey — EMNLP 2025(aclanthology.org/2025.emnlp-main.40)
- Accelerating Diffusion-based TTS Model Training with Dual Modality Alignment — arXiv:2505.19595
- Discrete Audio Tokens: More Than a Survey! — arXiv:2506.10274
- SpeakStream: Streaming TTS with Interleaved Data — arXiv:2505.19206;StreamMel — arXiv:2506.xxxx(2025.06,检索自 HF Daily Papers)
- Moshi: a speech-text foundation model for real-time dialogue — Kyutai 2024(GitHub kyutai-labs/moshi)
开源项目 / 官方资源
- thu-spmi/CTC-TTS(GitHub,含 5 阶段训练管线);ctctts.github.io(Demo)
- QwenAudio/Qwen3-TTS、FunAudioLLM/CosyVoice(CosyVoice 1/2/3 路线图与 Seed-TTS 基准表,gitcode 镜像)、fishaudio/fish-speech(S2 Pro)
- ai4s-research/awesome-text-to-speech(2023–2026 模型清单)、dubformer/awesome-speech-tokenizers(tokenizer 对比表)
- kyutai-labs/moshi、NVIDIA/PersonaPlex、minimax.io/news(Speech-02 / Speech 2.6)
- Microsoft/VibeVoice(ICLR 2026 Oral)、SWivid/F5-TTS、ChatGPT Realtime(OpenAI)
文档与行业资料
- The 2025 Transparency Rulebook for Voice AI(EU AI Act 第 50 条、各州法律)
- FTC Voice Cloning Challenge(ftc.gov/node/81974)及 FTC 语音克隆规则报道
- AI Voice Cloning: Technology, Legal Issues & Best Tools in 2026(trtc.io)
- Seed-TTS 测试集与 CV3-Eval 评估表(CosyVoice 官方仓库)
更多推荐


所有评论(0)