ASR 五代演进(六):Gen 5 · Audio LLM ASR
Gen 5 是最年轻的一代。2024 年 7 月,字节 Seed 团队发布 Seed-ASR 论文(https://arxiv.org/abs/2407.04675),提出用 LLM-based ASR 处理多样语音和上下文信息。本文把它作为 Gen 4 到 Gen 5 的标志性节点:ASR 不再只是“把语音转成文字”的转录系统,而开始进入“语音 + 上下文 + 指令”共同参与的理解框架。
这里先澄清一个术语:ASR(speech recognition)和 speech translation 是两个任务。前者是同语言转写,例如中文音频 → 中文文本;后者才是翻译,例如中文音频 → 英文文本。Whisper 这类多任务模型同时支持 ASR 和 X→English speech translation,但它的 ASR 主线仍是 speech-to-text transcription。Gen 5 的变化不是“把 ASR 变成翻译”,而是让 ASR 进入更广义的 audio understanding 框架。
Gen 5 模型很多,这里只抓三条代表路线:
- Seed-ASR:专注 ASR,把上下文推理显式放进训练和推理。
- Qwen2-Audio:开源通用 audio LLM,代表 audio instruction following 路线。
- GPT-4o:端到端 audio-in / audio-out,代表实时语音对话路线。
一、Gen 5 的核心变化:任务接口和生成侧重心转向 LLM
仍按前端 / 声学模型 / LM + 解码器三段粗略对齐,Gen 5 最大的变化不是多了一个模块,而是能力重心换了位置。
| 位置 | Gen 1-4 的主线 | Gen 5 |
|---|---|---|
| 前端 / encoder | MFCC、CNN、Conformer、Whisper encoder 等,负责把声音变成可识别表征 | 常复用现成 audio encoder,把音频变成 hidden states |
| 对齐 / 连接层 | HMM、CTC、RNN-T、attention 等,负责声学到文字的对齐 | projector / adaptor,把 audio hidden 映射到 LLM embedding space |
| 解码 / 语言侧 | LM 多是辅助:约束搜索、补语言先验、重排序 | LLM decoder 成为主体:理解上下文、跟随指令、生成结构化文本 |
一句话:Gen 1-4 主要在优化“怎么听清并转成字”,Gen 5 开始把问题改写成“怎么把声音交给 LLM 理解和生成”。
二、为什么 Whisper 之后还需要 Gen 5
如果产品目标从逐字稿扩到可直接使用的语义结果,Whisper 这类转录模型会遇到三类边界。
第一堵墙:语义任务——“帮我归纳这封语音邮件的重点”不是单纯转写任务,而是转写 + 意图识别 + 摘要。
第二堵墙:结构化任务——会议纪要需要“谁说了什么、行动项是什么”,Whisper 本体只输出连续文本,说话人区分和结构化要外接系统。
第三堵墙:副语言信息——客服质检关心愤怒、停顿、语调和触发词,但 Whisper 的训练目标主要是文本,很多副语言信息不会进入输出。
这三堵墙指向同一个变化:ASR 输出侧要从“文本”扩到“文本 + 语义 + 元信息”。
从 Gen 4 到 Gen 5,同一能力的实现方式变了:
| 能力 | Gen 4 · Whisper | Gen 5 · Audio LLM | 典型 instruction |
|---|---|---|---|
| 音频转文本 | 原生 · seq2seq 输出 | 原生 · LLM 生成 | 把音频转成文本 |
| 时间戳输出 | 原生 · <ts> token / alignment | 需模型或接口支持 | 转写并输出时间戳 |
| 翻译 | 原生 · X → English | 可指令化 · 取决于训练覆盖 | 把音频翻成英文 |
| 情绪 / 语调 | 需外接 SER 或专门模型 | 可指令化 · 需训练标签支持 | 转录并标注情绪 |
| 说话人区分 | 需外接 diarization | 可指令化 / 产品接口支持 | 转录并区分说话人 |
| 上下文消歧 | 弱 · initial_prompt 有限 | 训练目标显式支持 | 根据上下文修正同音词 |
| 多任务输出 | 需串联多个模块 | 可指令化 · 需任务训练支持 | 转录、摘要并标注情绪 |
| audio out | 无音频生成路径 | 部分模型支持 | 用语音回答 |
本文概括——Gen 5 把 ASR 从逐字转录推进到可指令化音频理解。理想形态下同一底座通过 instruction 切换任务;实际效果取决于训练数据、接口能力和输出约束,不是所有能力都能被 prompt 可靠拉出来。
三、Audio LLM 的通用架构
本文讨论的 LLM-based ASR / audio-in text-out 路线,大多可以抽象成 audio encoder → projector / adaptor → LLM decoder 三段:

数据流为:
音频输入(模型指定采样率 · 常见 16 kHz)
│
↓ Audio Encoder(常复用 Whisper / wav2vec 2.0 / BEST-RQ 类)
音频隐藏表征 (T, d_audio)
│
↓ Audio Projector(MLP 或 Q-Former · 参数最少)
LLM prompt-compatible tokens (T', d_llm)
│
↓ 拼接 text prompt
[<audio_tokens>, "Transcribe this audio in Chinese:", ...]
│
↓ LLM Decoder(自回归)
生成文本 token 序列
三个模块分工:
| 模块 | 参数量量级 | 说明 |
|---|---|---|
| Audio Encoder | 数百 M 级常见 · Seed-ASR 类可到约 2B | 只做声学编码 · 有些 recipe 会冻结或部分冻结 audio encoder |
| Audio Projector | 百万到数千万级 · 通常远小于 encoder 和 LLM | 把 audio hidden 对齐到 LLM embedding 空间 |
| LLM Decoder | 数 B 到数十 B | 主体 · 承担理解和生成 |
参数配比反映了 Gen 5 的工程取向——Gen 5 的任务接口和生成侧重心转向 LLM · 但声学 encoder 仍是关键:通用 Audio LLM(如 Qwen2-Audio)常复用 Whisper-large-v3 这类现成 encoder;专业 ASR(如 Seed-ASR)仍会大规模训练音频表征(近 2B 参数的 LUISE encoder)。计算和参数预算更多转向 LLM decoder 侧 · 但不是说声学侧变得不重要。
接入 LLM 有两种接口——通用架构讲了“三段结构”,但音频进 LLM 时具体以什么形态进入上下文窗口?常见有两条路线。

路线 A · 连续 embedding 接入——audio encoder 输出 [T_audio, d_audio] 的连续向量,projector 把它变成 [T_audio', d_llm],再和 text embeddings 拼接进 LLM。Seed-ASR、Qwen2-Audio 这类 audio-in / text-out ASR 更接近这条路线。优点:声学信息保留更多、方便复用 Whisper / wav2vec 2.0 现成 encoder;代价:连续向量不是 LLM 原生 token · 需要专门训练 projector 让 LLM 学会“读懂”。
路线 B · 离散 audio token 接入——codec / quantizer 先把音频压成 [T_audio_tokens] 的离散 ID · 再像文本 token 一样进入 token 序列;如果要生成语音,LLM 也可以输出 audio token · 再解码回波形。这条路线更适合 audio-in / audio-out 和语音生成。优点:形式最接近文本 LLM · 音频和文本都是 token;代价:离散化损失细粒度声学信息 · codec 质量 / token rate / 词表设计会直接影响自然度、延迟和训练成本。

VALL-E 论文 Fig 1 是路线 B 的直接示意——声学 prompt 和输出语音都走 codec token · 文本 prompt 走 phoneme token:3 秒参考音频进 Audio Codec Encoder 变 discrete token · 文本 prompt 走 Phoneme Conversion 变 phoneme token · 两路一起进 Neural Codec Language Modeling · 输出音频 token 序列 · 再由 Audio Codec Decoder 还原成波形。
这里的 token 和 embedding 不是一回事:token 是离散 ID(整数 · 例如文本 hello → 15339),embedding 是连续向量(token ID 查表后得到 [4096] 维向量)。LLM 真正计算的是 embedding。路线 A 让 audio encoder 的 hidden states 经过 projector 后直接进入 LLM · 一直是连续向量;路线 B 先把音频离散成 audio token · 再像文本 token 一样查表成 embedding。两条路线最后进 LLM 时都变成 [sequence_length, d_llm] 的连续向量序列,差别发生在进入 LLM 之前——A 保留连续声学表征 · B 会受 codec / quantizer 的信息瓶颈影响。
归属对应——Seed-ASR、Qwen2-Audio 这类 LLM-based ASR 通常更接近路线 A;AudioLM、VALL-E 这类语音生成模型更依赖路线 B。GPT-4o Realtime 这类端到端 audio-in / audio-out 系统只适合从产品形态讨论,内部音频表示和生成路径以官方披露为准。
四、三条主线:Seed-ASR / Qwen2-Audio / GPT-4o
4.1 Seed-ASR · 字节旗舰 · 专注 ASR + 上下文推理
Seed-ASR(字节 · 2024-07 · https://arxiv.org/abs/2407.04675 )在架构上沿用前面介绍的 audio encoder + projector + LLM 三段模板,特色在训练范式。先看论文 Fig 2 的框架:

图里 Instruction(如“Transcribe the speech into text:”)· Contexts (optional)(说话人 · 领域 · 前文对话)· Speech Representations(由 Audio Encoder + Converter 生成)三路一起进入 Text LLM——这就是 AcLLM(Audio conditioned LLM)的核心:把音频当成 LLM 的一种可条件输入。有 context 时 instruction 变成“There are relevant contexts, transcribe the speech into text:”,模型学会利用 context 消歧。
论文里的 Stage-wise Training Recipe 把 audio LLM ASR 拆成四段:
| Stage | 数据 | 目标 |
|---|---|---|
| Stage 1 · Audio Encoder SSL | 大规模无标注语音(论文口径:数千万小时) | 通用语音表征 encoder(论文口径:近 2B 参数) |
| Stage 2 · Supervised Fine-Tuning | 大规模 speech-text 对 | 建立 speech → text 的映射 · 学基础转录能力 |
| Stage 3 · Context SFT | 三元组 <context, speech, text> | 学会用上下文(说话人 · 领域 · 前文)辅助识别 |
| Stage 4 · Reinforcement Learning | 高质量数据 + MWER 类 reward | 序列决策优化 · 进一步降低 WER |
Stage 3 + Stage 4 是 Seed-ASR 相对 Whisper 的关键差别——训练时不仅接收音频,还接收上下文提示(说话人身份 · 领域标签 · 前文对话),Stage 4 再用 RL 目标(论文里用 MWER 类 reward)精调决策边界。论文里有一个有代表性的实验:同一段音频,不同 context 给出不同转录。
音频内容(发音接近 "gū nǐang")
context = 无 → 转录:姑娘
context = "他从山上采到了一朵" → 转录:菇娘(一种水果)
context = "村头王大爷家的" → 转录:姑娘
音频内容(发音接近 "ā-me-ri-ka")
context = 语种=英语 → 转录:America
context = 语种=日语 → 转录:アメリカ
Gen 4 的典型离线调用更偏独立分段转录(Whisper 有 initial_prompt / previous text conditioning,但上下文利用不是主要训练目标),Gen 5 Seed-ASR 把上下文当训练目标一部分——Stage 3 直接优化“看得到 context 时的识别效果”,Stage 4 用 RL 目标进一步收紧决策边界。这一步跨过来后,ASR 从“孤立转录器”变成了“带语境的转写系统”。
能拿到红利的场景: - 会议纪要:每人的说话历史作为下一句 context,减少多义词误识 - 客服转录:用之前的对话上下文修正专业名词 / 商品名 - 视频字幕:用视频前后文推理歧义音节 / 同音字
注意——Seed-ASR 是字节内部产品化模型,权重未开源。论文报告了在多个公开英中 benchmark 上相对 Whisper-large-v3 的明显收益,具体数字以论文和后续更新为准。
落地形态——字节侧通过 arkcli +understand 提供多模态音频理解入口,可覆盖 ASR、多说话人、字幕打轴、会议纪要、翻译等任务。具体命令、参数、sub-skill 集合、返回 schema 都以当前 arkcli +understand --help 为准(截至 2026-08 · 底层实现和模型 ID 会随时间演化)。
实测样例——用一段 9.7 秒中英混合音频跑(原文:”Hello world, 欢迎收听 ASR 五代演进, 25 年 WER 从 13% 降到 1.5%, thanks!”)· 模型为 doubao-seed-2-0-lite-260428:
$ arkcli +understand asr --input @demo_mixed.wav
→ hello world 欢迎收听ASR五代眼镜 二十五年WER从百分之十三降到百分之一点五 thanks
$ arkcli +understand asr-speakers --input @demo_mixed.wav
→ [spk0]hello world,欢迎收听asr五代眼镜,二十五年wer从百分之十三降到百分之一点五,thanks。
$ arkcli +understand asr-align --input @demo_mixed.wav
→ 1 00:00:00,150 --> 00:00:00,900 hello world
2 00:00:01,220 --> 00:00:03,660 欢迎收听 ASR 五代眼镜
3 00:00:04,010 --> 00:00:08,420 二十五年 WER 从百分之十三降到百分之一点五
4 00:00:08,570 --> 00:00:09,230 thanks
$ arkcli +understand meeting-minutes --input @demo_mixed.wav
→ - 会议主题:ASR五代眼镜2025年字错误率(WER)优化成果同步
- 参会人:仅识别到1名发言主体,标记为spk0
- 议程与讨论要点(附时间戳):
00:00-00:09 spk0 开场问候 + 同步产品核心性能指标优化进展
关键引述:"欢迎收听ASR五代眼镜,25年WER从百分之十三降到百分之一点五"
- 决议事项 / 待跟进:本次仅性能成果告知 · 无明确落地任务
几个观察: - 同一底座 · 一句 prompt 切任务——纯转录 / 说话人前缀 / SRT 字幕打轴 / 结构化会议纪要 · 全部由同一个 audio LLM 处理 · 不需要外接 diarization / alignment / 摘要模型 - 中英混合识别正常:Hello World / ASR / WER / thanks 全部保留原文 - 谐音错误:”ASR 五代演进” → “ASR 五代眼镜“(yǎn jìn / yǎn jìng)——这类专业词谐音正是 Stage 3 Context SFT 想解决的:如果 prompt 传入 context = "ASR 五代演进博客系列" 或 initial_prompt · 理论上能修正 - 数字规范化:13% → “百分之十三” · 1.5% → “百分之一点五” · 25 年 → “二十五年”——LLM decoder 倾向口语化输出 · 传统 ASR 更常保留原始符号 - asr-align 时间戳:SRT 格式直接可用 · 时间戳精度到毫秒级
4.2 Qwen2-Audio · 开源通用 audio LLM

Qwen2-Audio(阿里 · 2024-07 · https://arxiv.org/abs/2407.10759 )架构走的是“站在 Whisper 肩上”的实用路径:
音频 → Whisper-large-v3 encoder → 投影层 → Qwen2-7B LLM
关键选择:audio encoder 基座采用 Whisper-large-v3,与投影层一起接到 Qwen2-7B 上。具体训练时哪些模块冻结、哪些解冻、哪个阶段解冻,以官方实现和论文附录为准。这条路线在 audio LLM 领域很常见——不用从零训 audio encoder,直接复用 Whisper 已经沉淀的 68 万小时弱监督知识。
训练流程按功能合并——论文 / 项目描述里包含预训练 · 监督微调(SFT)· 直接偏好优化(DPO)等多阶段,按功能大致可以分成两块:
- audio-text 对齐 · 大规模 audio-text 对 · 覆盖 ASR / 翻译 / SER / 音频问答等多任务 · 让 LLM 学会跟随各种 audio-related instructions
- 指令 / 偏好对齐 · SFT + DPO · 高质量人工标注对 · 让模型输出对齐人类偏好
跟 Seed-ASR 的定位差别:
| Seed-ASR | Qwen2-Audio | |
|---|---|---|
| 论文主打 | ASR 精度 + 上下文推理 | 通用 audio instruction following(ASR · Q&A · 分类 · SER 等) |
| 开源 | 未开源 · 通过 arkcli 调用 | 权重开源 · 研究者首选 |
两者不做跨论文直接横比——评测集、评测口径、语种覆盖都不同。Seed-ASR 是专业 ASR 路线;Qwen2-Audio 是通用音频指令模型 · ASR 只是其中一个任务。
Qwen2-Audio-7B-Instruct 实测——同一段 9.7 秒中英混合音频(sot GPU · A100 · fp16 · torch 2.5 · 单卡 · 加载 12.2 s · 推理约 1 s/task):
[prompt] Transcribe the audio into text.
[output] hello world, welcome to asr five generations. twenty five years, weer from
thirteen percent to one point five percent. thanks.
[prompt] Translate the audio content into English text.
[output] Hello world, welcome to listen to ASR 5th generation, 25 years ER from 13%
to 1.5%, thanks.
[prompt] Please transcribe the audio and give a one-sentence summary in Chinese.
[output] hello world, 欢迎收听asr五代演进二十五年weer从百分之十三降到百分之一点五。
跟 arkcli Seed-ASR 商用版对比(同一段音频 · § 4.1 那份): - Seed-ASR 商用版:”ASR 五代眼镜” · hello world / thanks 保留原文 · 数字转中文 - Qwen2-Audio 开源版:转录默认输出全英文 · 甚至把 “WER” 识别成 “weer” · “5th generation” 而不是 “五代”;但中文 prompt 触发摘要时 · 能恢复 “asr 五代演进” 的正确中文
观察:Qwen2-Audio 作为通用 audio instruction 模型 · 转录任务上的中文体感明显弱于专业 ASR(Seed-ASR / Whisper)· 但instruction following 灵活性强——同一模型能做转录 / 翻译 / 摘要 / QA · 且开源可微调。适合研究者复现和二次开发 · 专业中文 ASR 场景仍建议走 Seed-ASR 商用或 Whisper 微调。
4.3 GPT-4o · 端到端 audio in / audio out
GPT-4o 模型 2024-05 发布,Realtime API 2024-10 公测开放。产品形态上把语音助手推到端到端——用户音频输入 → 模型 → 助手音频输出,避免显式的 ASR → LLM → TTS 三段级联。

传统 voice assistant 三段接力(延迟累加 · 说话人风格丢失 · 中间转录暴露误差 · 说完话到听到回复要秒级延迟),GPT-4o 直接把音频输入输出接管。官方 GPT-4o 发布公告里的 audio 响应口径:最短 232 ms · 平均 320 ms(接近人类对话反应时间)。这是官方 demo / 公告口径 · 不等于 Realtime API 生产环境 SLA——具体数字随硬件、网络、提示复杂度、并发情况浮动。
内部实现细节 OpenAI 未完整公开——可理解为端到端 audio-in / audio-out 的产品形态,具体建模方式(是否离散化 audio token · 如何统一 audio 和 text 生成 · 训练数据构造)以官方后续披露为准。从公开产品形态看,它把语音助手从”识别 + 处理 + 合成”的三段级联 · 推向更紧耦合的端到端交互。字节 Seed LiveInterpret 2.0(实时同传 / 语音翻译方向)、Google Gemini Live、阿里 Qwen2.5-Omni Talker 都在实时语音理解 / 翻译方向推进。
五、2025:Audio LLM 的三种工程化走向
到 2025 年,Audio LLM 的新工作大多不是重造 ASR 范式,而是在三条方向上做工程化推进:更自然的实时对话 · 更长的音频上下文 · 更小的端侧模型。

第一条是端到端语音对话。GPT-4o Realtime 把用户音频输入和助手音频输出放进同一个产品闭环后,后续系统开始围绕低延迟、可打断、情绪自然和全双工交互优化。Qwen2.5-Omni 这类模型进一步把 text reasoning 和 speech generation 拆开设计(Talker / Thinker),让模型更接近”边听边想边说”的交互形态。字节 Seed LiveInterpret 2.0(实时同传 / 语音翻译)、Google Gemini 2.0 Flash + Multimodal Live API 都在同一方向推进。
第二条是长音频理解。会议、播客、有声书这类任务不只需要把音频切块转写,还要在长上下文里保持说话人、主题和指代的一致性。NVIDIA Audio Flamingo 3 直接主打长音频 / 长视频音频理解;Moonshot Kimi-Audio 是通用音频理解 / 生成模型 · 对长音频能力也有扩展。目标不是把 Whisper 的 30 秒窗口简单拉长,而是让模型能跨段理解和检索音频内容(长音频能力以论文评测口径为准)。
第三条是端侧化和轻量化。云端 Audio LLM 能力强,但 7B 以上模型的显存、延迟和成本都不适合所有场景。面壁 MiniCPM-o、微软 Phi-4-Multimodal、阿里 FunAudioLLM 团队的轻量方向都在把重点放在更小参数、更低延迟和本地可用上。Whisper-large-v3-turbo 虽然仍属 Gen 4 转录模型(按 OpenAI Whisper 相关说明 · 主要面向转录场景 · 翻译能力不是优化重点),但常被拿来作为”高效转录基线”与 Audio LLM 方案对比。
另有 Sesame CSM(2025-03)代表开源自然语音生成 / 情感对话方向——本身不是 audio-in / text-out ASR · 但在实时对话生态里常被一起讨论。
这三条路线共同说明一件事:Gen 5 之后,ASR 不再只按“识别准确率”演进,而是被放进实时交互、长上下文和端云协同这些产品约束里重新优化。
六、Gen 5 的贡献、代价与下一站
Gen 5 的价值不只是“识别更准”,而是把 ASR 从独立转录任务推向了可指令化的音频理解能力。上下文、指令、说话人、情绪、摘要和结构化输出开始进入同一个 audio LLM 框架里;Seed-ASR 代表上下文推理进入 ASR,GPT-4o Realtime 代表语音交互从“识别 + 处理 + 合成”走向端到端产品形态。
但 Gen 5 拿到这些能力,也付出了清晰代价:
| 代价 / 开放问题 | 具体表现 | 工程缓解方向 |
|---|---|---|
| 算力成本高 | LLM decoder 成为主体 · 7B 级 audio LLM 比 Whisper large-v3 更占显存和延迟 | 量化 · 蒸馏 · 端云协同 · 小模型专用化 |
| 幻觉风险叠加 | Whisper 式自回归幻觉 + LLM prompt-fitting 幻觉 · 可能编造音频中没有的内容 | VAD / no-speech · grounding · 约束输出 · RLHF / 偏好对齐 |
| 长音频一致性 | 跨段说话人 · 主题漂移 · 代词消歧仍是开放问题 | 分段索引 · 层级摘要 · 说话人跟踪 · 记忆压缩 |
| 评测口径失效 | WER 无法评价摘要 · 情绪 · 说话人 · 结构化输出 | Task Completion Rate · Semantic WER · Human Preference |
评测也必须换代。Gen 5 的输出不再限于逐字转录:模型可能删掉 filler、修正口误、加说话人前缀、输出情绪标签或会议行动项。按传统 WER 计算,这些都可能被算成错误,但用户体验未必更差。未来评测会从“字错了多少”转向“任务是否完成”:转录是否可信、摘要是否正确、结构化字段是否可用、情绪和说话人是否标对。
从产品入口看 · ASR 作为独立产品入口会变少 · 但底层转录能力仍会长期存在——“我要一个 ASR 模型”会越来越像今天说“我要一个 OCR 模型”:底层能力仍然重要,但会被嵌进通用多模态系统,成为其中一个感知通道。Gen 5 不是 ASR 的终点,而是 ASR 并入 audio / multimodal LLM 的开始。
参考 · Whisper-large-v3-turbo model card:HuggingFace: openai/whisper-large-v3-turbo
更多推荐



所有评论(0)