Gen 5 是最年轻的一代。2024 年 7 月,字节 Seed 团队发布 Seed-ASR 论文(https://arxiv.org/abs/2407.04675),提出用 LLM-based ASR 处理多样语音和上下文信息。本文把它作为 Gen 4 到 Gen 5 的标志性节点:ASR 不再只是“把语音转成文字”的转录系统,而开始进入“语音 + 上下文 + 指令”共同参与的理解框架。

这里先澄清一个术语:ASR(speech recognition)和 speech translation 是两个任务。前者是同语言转写,例如中文音频 → 中文文本;后者才是翻译,例如中文音频 → 英文文本。Whisper 这类多任务模型同时支持 ASR 和 X→English speech translation,但它的 ASR 主线仍是 speech-to-text transcription。Gen 5 的变化不是“把 ASR 变成翻译”,而是让 ASR 进入更广义的 audio understanding 框架。

Gen 5 模型很多,这里只抓三条代表路线:

  • Seed-ASR:专注 ASR,把上下文推理显式放进训练和推理。
  • Qwen2-Audio:开源通用 audio LLM,代表 audio instruction following 路线。
  • GPT-4o:端到端 audio-in / audio-out,代表实时语音对话路线。

一、Gen 5 的核心变化:任务接口和生成侧重心转向 LLM

仍按前端 / 声学模型 / LM + 解码器三段粗略对齐,Gen 5 最大的变化不是多了一个模块,而是能力重心换了位置

位置Gen 1-4 的主线Gen 5
前端 / encoderMFCC、CNN、Conformer、Whisper encoder 等,负责把声音变成可识别表征常复用现成 audio encoder,把音频变成 hidden states
对齐 / 连接层HMM、CTC、RNN-T、attention 等,负责声学到文字的对齐projector / adaptor,把 audio hidden 映射到 LLM embedding space
解码 / 语言侧LM 多是辅助:约束搜索、补语言先验、重排序LLM decoder 成为主体:理解上下文、跟随指令、生成结构化文本

一句话:Gen 1-4 主要在优化“怎么听清并转成字”,Gen 5 开始把问题改写成“怎么把声音交给 LLM 理解和生成”

二、为什么 Whisper 之后还需要 Gen 5

如果产品目标从逐字稿扩到可直接使用的语义结果,Whisper 这类转录模型会遇到三类边界。

第一堵墙:语义任务——“帮我归纳这封语音邮件的重点”不是单纯转写任务,而是转写 + 意图识别 + 摘要。

第二堵墙:结构化任务——会议纪要需要“谁说了什么、行动项是什么”,Whisper 本体只输出连续文本,说话人区分和结构化要外接系统。

第三堵墙:副语言信息——客服质检关心愤怒、停顿、语调和触发词,但 Whisper 的训练目标主要是文本,很多副语言信息不会进入输出。

这三堵墙指向同一个变化:ASR 输出侧要从“文本”扩到“文本 + 语义 + 元信息”

从 Gen 4 到 Gen 5,同一能力的实现方式变了

能力Gen 4 · WhisperGen 5 · Audio LLM典型 instruction
音频转文本原生 · seq2seq 输出原生 · LLM 生成把音频转成文本
时间戳输出原生 · <ts> token / alignment需模型或接口支持转写并输出时间戳
翻译原生 · X → English可指令化 · 取决于训练覆盖把音频翻成英文
情绪 / 语调需外接 SER 或专门模型可指令化 · 需训练标签支持转录并标注情绪
说话人区分需外接 diarization可指令化 / 产品接口支持转录并区分说话人
上下文消歧弱 · initial_prompt 有限训练目标显式支持根据上下文修正同音词
多任务输出需串联多个模块可指令化 · 需任务训练支持转录、摘要并标注情绪
audio out无音频生成路径部分模型支持用语音回答

本文概括——Gen 5 把 ASR 从逐字转录推进到可指令化音频理解。理想形态下同一底座通过 instruction 切换任务;实际效果取决于训练数据、接口能力和输出约束,不是所有能力都能被 prompt 可靠拉出来。

三、Audio LLM 的通用架构

本文讨论的 LLM-based ASR / audio-in text-out 路线,大多可以抽象成 audio encoder → projector / adaptor → LLM decoder 三段

数据流为:

音频输入(模型指定采样率 · 常见 16 kHz)
   │
   ↓ Audio Encoder(常复用 Whisper / wav2vec 2.0 / BEST-RQ 类)
音频隐藏表征 (T, d_audio)
   │
   ↓ Audio Projector(MLP 或 Q-Former · 参数最少)
LLM prompt-compatible tokens (T', d_llm)
   │
   ↓ 拼接 text prompt
[<audio_tokens>, "Transcribe this audio in Chinese:", ...]
   │
   ↓ LLM Decoder(自回归)
生成文本 token 序列

三个模块分工

模块参数量量级说明
Audio Encoder数百 M 级常见 · Seed-ASR 类可到约 2B只做声学编码 · 有些 recipe 会冻结或部分冻结 audio encoder
Audio Projector百万到数千万级 · 通常远小于 encoder 和 LLM把 audio hidden 对齐到 LLM embedding 空间
LLM Decoder数 B 到数十 B主体 · 承担理解和生成

参数配比反映了 Gen 5 的工程取向——Gen 5 的任务接口和生成侧重心转向 LLM · 但声学 encoder 仍是关键:通用 Audio LLM(如 Qwen2-Audio)常复用 Whisper-large-v3 这类现成 encoder;专业 ASR(如 Seed-ASR)仍会大规模训练音频表征(近 2B 参数的 LUISE encoder)。计算和参数预算更多转向 LLM decoder 侧 · 但不是说声学侧变得不重要

接入 LLM 有两种接口——通用架构讲了“三段结构”,但音频进 LLM 时具体以什么形态进入上下文窗口?常见有两条路线。

路线 A · 连续 embedding 接入——audio encoder 输出 [T_audio, d_audio] 的连续向量,projector 把它变成 [T_audio', d_llm],再和 text embeddings 拼接进 LLM。Seed-ASR、Qwen2-Audio 这类 audio-in / text-out ASR 更接近这条路线。优点:声学信息保留更多、方便复用 Whisper / wav2vec 2.0 现成 encoder;代价:连续向量不是 LLM 原生 token · 需要专门训练 projector 让 LLM 学会“读懂”。

路线 B · 离散 audio token 接入——codec / quantizer 先把音频压成 [T_audio_tokens] 的离散 ID · 再像文本 token 一样进入 token 序列;如果要生成语音,LLM 也可以输出 audio token · 再解码回波形。这条路线更适合 audio-in / audio-out 和语音生成。优点:形式最接近文本 LLM · 音频和文本都是 token;代价:离散化损失细粒度声学信息 · codec 质量 / token rate / 词表设计会直接影响自然度、延迟和训练成本。

VALL-E 论文 Fig 1 是路线 B 的直接示意——声学 prompt 和输出语音都走 codec token · 文本 prompt 走 phoneme token:3 秒参考音频进 Audio Codec Encoder 变 discrete token · 文本 prompt 走 Phoneme Conversion 变 phoneme token · 两路一起进 Neural Codec Language Modeling · 输出音频 token 序列 · 再由 Audio Codec Decoder 还原成波形。

这里的 token 和 embedding 不是一回事:token 是离散 ID(整数 · 例如文本 hello → 15339),embedding 是连续向量(token ID 查表后得到 [4096] 维向量)。LLM 真正计算的是 embedding。路线 A 让 audio encoder 的 hidden states 经过 projector 后直接进入 LLM · 一直是连续向量;路线 B 先把音频离散成 audio token · 再像文本 token 一样查表成 embedding。两条路线最后进 LLM 时都变成 [sequence_length, d_llm] 的连续向量序列,差别发生在进入 LLM 之前——A 保留连续声学表征 · B 会受 codec / quantizer 的信息瓶颈影响。

归属对应——Seed-ASR、Qwen2-Audio 这类 LLM-based ASR 通常更接近路线 A;AudioLM、VALL-E 这类语音生成模型更依赖路线 B。GPT-4o Realtime 这类端到端 audio-in / audio-out 系统只适合从产品形态讨论,内部音频表示和生成路径以官方披露为准。

四、三条主线:Seed-ASR / Qwen2-Audio / GPT-4o

4.1 Seed-ASR · 字节旗舰 · 专注 ASR + 上下文推理

Seed-ASR(字节 · 2024-07 · https://arxiv.org/abs/2407.04675 )在架构上沿用前面介绍的 audio encoder + projector + LLM 三段模板,特色在训练范式。先看论文 Fig 2 的框架:

图里 Instruction(如“Transcribe the speech into text:”)· Contexts (optional)(说话人 · 领域 · 前文对话)· Speech Representations(由 Audio Encoder + Converter 生成)三路一起进入 Text LLM——这就是 AcLLM(Audio conditioned LLM)的核心:把音频当成 LLM 的一种可条件输入。有 context 时 instruction 变成“There are relevant contexts, transcribe the speech into text:”,模型学会利用 context 消歧。

论文里的 Stage-wise Training Recipe 把 audio LLM ASR 拆成四段:

Stage数据目标
Stage 1 · Audio Encoder SSL大规模无标注语音(论文口径:数千万小时)通用语音表征 encoder(论文口径:近 2B 参数)
Stage 2 · Supervised Fine-Tuning大规模 speech-text 对建立 speech → text 的映射 · 学基础转录能力
Stage 3 · Context SFT三元组 <context, speech, text>学会用上下文(说话人 · 领域 · 前文)辅助识别
Stage 4 · Reinforcement Learning高质量数据 + MWER 类 reward序列决策优化 · 进一步降低 WER

Stage 3 + Stage 4 是 Seed-ASR 相对 Whisper 的关键差别——训练时不仅接收音频,还接收上下文提示(说话人身份 · 领域标签 · 前文对话),Stage 4 再用 RL 目标(论文里用 MWER 类 reward)精调决策边界。论文里有一个有代表性的实验:同一段音频,不同 context 给出不同转录

音频内容(发音接近 "gū nǐang")
  context = 无             → 转录:姑娘
  context = "他从山上采到了一朵" → 转录:菇娘(一种水果)
  context = "村头王大爷家的"     → 转录:姑娘

音频内容(发音接近 "ā-me-ri-ka")
  context = 语种=英语 → 转录:America
  context = 语种=日语 → 转录:アメリカ

Gen 4 的典型离线调用更偏独立分段转录(Whisper 有 initial_prompt / previous text conditioning,但上下文利用不是主要训练目标),Gen 5 Seed-ASR 把上下文当训练目标一部分——Stage 3 直接优化“看得到 context 时的识别效果”,Stage 4 用 RL 目标进一步收紧决策边界。这一步跨过来后,ASR 从“孤立转录器”变成了“带语境的转写系统”。

能拿到红利的场景: - 会议纪要:每人的说话历史作为下一句 context,减少多义词误识 - 客服转录:用之前的对话上下文修正专业名词 / 商品名 - 视频字幕:用视频前后文推理歧义音节 / 同音字

注意——Seed-ASR 是字节内部产品化模型,权重未开源。论文报告了在多个公开英中 benchmark 上相对 Whisper-large-v3 的明显收益,具体数字以论文和后续更新为准。

落地形态——字节侧通过 arkcli +understand 提供多模态音频理解入口,可覆盖 ASR、多说话人、字幕打轴、会议纪要、翻译等任务。具体命令、参数、sub-skill 集合、返回 schema 都以当前 arkcli +understand --help 为准(截至 2026-08 · 底层实现和模型 ID 会随时间演化)。

实测样例——用一段 9.7 秒中英混合音频跑(原文:”Hello world, 欢迎收听 ASR 五代演进, 25 年 WER 从 13% 降到 1.5%, thanks!”)· 模型为 doubao-seed-2-0-lite-260428

$ arkcli +understand asr --input @demo_mixed.wav
  → hello world 欢迎收听ASR五代眼镜 二十五年WER从百分之十三降到百分之一点五 thanks

$ arkcli +understand asr-speakers --input @demo_mixed.wav
  → [spk0]hello world,欢迎收听asr五代眼镜,二十五年wer从百分之十三降到百分之一点五,thanks。

$ arkcli +understand asr-align --input @demo_mixed.wav
  → 1  00:00:00,150 --> 00:00:00,900  hello world
    2  00:00:01,220 --> 00:00:03,660  欢迎收听 ASR 五代眼镜
    3  00:00:04,010 --> 00:00:08,420  二十五年 WER 从百分之十三降到百分之一点五
    4  00:00:08,570 --> 00:00:09,230  thanks

$ arkcli +understand meeting-minutes --input @demo_mixed.wav
  → - 会议主题:ASR五代眼镜2025年字错误率(WER)优化成果同步
    - 参会人:仅识别到1名发言主体,标记为spk0
    - 议程与讨论要点(附时间戳):
      00:00-00:09 spk0 开场问候 + 同步产品核心性能指标优化进展
      关键引述:"欢迎收听ASR五代眼镜,25年WER从百分之十三降到百分之一点五"
    - 决议事项 / 待跟进:本次仅性能成果告知 · 无明确落地任务

几个观察: - 同一底座 · 一句 prompt 切任务——纯转录 / 说话人前缀 / SRT 字幕打轴 / 结构化会议纪要 · 全部由同一个 audio LLM 处理 · 不需要外接 diarization / alignment / 摘要模型 - 中英混合识别正常:Hello World / ASR / WER / thanks 全部保留原文 - 谐音错误:”ASR 五代演进” → “ASR 五代眼镜“(yǎn jìn / yǎn jìng)——这类专业词谐音正是 Stage 3 Context SFT 想解决的:如果 prompt 传入 context = "ASR 五代演进博客系列"initial_prompt · 理论上能修正 - 数字规范化:13% → “百分之十三” · 1.5% → “百分之一点五” · 25 年 → “二十五年”——LLM decoder 倾向口语化输出 · 传统 ASR 更常保留原始符号 - asr-align 时间戳:SRT 格式直接可用 · 时间戳精度到毫秒级

4.2 Qwen2-Audio · 开源通用 audio LLM

Qwen2-Audio(阿里 · 2024-07 · https://arxiv.org/abs/2407.10759 )架构走的是“站在 Whisper 肩上”的实用路径:

音频 → Whisper-large-v3 encoder → 投影层 → Qwen2-7B LLM

关键选择audio encoder 基座采用 Whisper-large-v3,与投影层一起接到 Qwen2-7B 上。具体训练时哪些模块冻结、哪些解冻、哪个阶段解冻,以官方实现和论文附录为准。这条路线在 audio LLM 领域很常见——不用从零训 audio encoder,直接复用 Whisper 已经沉淀的 68 万小时弱监督知识。

训练流程按功能合并——论文 / 项目描述里包含预训练 · 监督微调(SFT)· 直接偏好优化(DPO)等多阶段,按功能大致可以分成两块:

  • audio-text 对齐 · 大规模 audio-text 对 · 覆盖 ASR / 翻译 / SER / 音频问答等多任务 · 让 LLM 学会跟随各种 audio-related instructions
  • 指令 / 偏好对齐 · SFT + DPO · 高质量人工标注对 · 让模型输出对齐人类偏好

跟 Seed-ASR 的定位差别

Seed-ASRQwen2-Audio
论文主打ASR 精度 + 上下文推理通用 audio instruction following(ASR · Q&A · 分类 · SER 等)
开源未开源 · 通过 arkcli 调用权重开源 · 研究者首选

两者不做跨论文直接横比——评测集、评测口径、语种覆盖都不同。Seed-ASR 是专业 ASR 路线;Qwen2-Audio 是通用音频指令模型 · ASR 只是其中一个任务

Qwen2-Audio-7B-Instruct 实测——同一段 9.7 秒中英混合音频(sot GPU · A100 · fp16 · torch 2.5 · 单卡 · 加载 12.2 s · 推理约 1 s/task):

[prompt] Transcribe the audio into text.
[output] hello world, welcome to asr five generations. twenty five years, weer from
         thirteen percent to one point five percent. thanks.

[prompt] Translate the audio content into English text.
[output] Hello world, welcome to listen to ASR 5th generation, 25 years ER from 13%
         to 1.5%, thanks.

[prompt] Please transcribe the audio and give a one-sentence summary in Chinese.
[output] hello world, 欢迎收听asr五代演进二十五年weer从百分之十三降到百分之一点五。

跟 arkcli Seed-ASR 商用版对比(同一段音频 · § 4.1 那份): - Seed-ASR 商用版:”ASR 五代眼镜” · hello world / thanks 保留原文 · 数字转中文 - Qwen2-Audio 开源版:转录默认输出全英文 · 甚至把 “WER” 识别成 “weer” · “5th generation” 而不是 “五代”;但中文 prompt 触发摘要时 · 能恢复 “asr 五代演进” 的正确中文

观察:Qwen2-Audio 作为通用 audio instruction 模型 · 转录任务上的中文体感明显弱于专业 ASR(Seed-ASR / Whisper)· 但instruction following 灵活性强——同一模型能做转录 / 翻译 / 摘要 / QA · 且开源可微调。适合研究者复现和二次开发 · 专业中文 ASR 场景仍建议走 Seed-ASR 商用或 Whisper 微调

4.3 GPT-4o · 端到端 audio in / audio out

GPT-4o 模型 2024-05 发布,Realtime API 2024-10 公测开放。产品形态上把语音助手推到端到端——用户音频输入 → 模型 → 助手音频输出,避免显式的 ASR → LLM → TTS 三段级联。

传统 voice assistant 三段接力(延迟累加 · 说话人风格丢失 · 中间转录暴露误差 · 说完话到听到回复要秒级延迟),GPT-4o 直接把音频输入输出接管。官方 GPT-4o 发布公告里的 audio 响应口径:最短 232 ms · 平均 320 ms(接近人类对话反应时间)。这是官方 demo / 公告口径 · 不等于 Realtime API 生产环境 SLA——具体数字随硬件、网络、提示复杂度、并发情况浮动。

内部实现细节 OpenAI 未完整公开——可理解为端到端 audio-in / audio-out 的产品形态,具体建模方式(是否离散化 audio token · 如何统一 audio 和 text 生成 · 训练数据构造)以官方后续披露为准。从公开产品形态看,它把语音助手从”识别 + 处理 + 合成”的三段级联 · 推向更紧耦合的端到端交互。字节 Seed LiveInterpret 2.0(实时同传 / 语音翻译方向)、Google Gemini Live、阿里 Qwen2.5-Omni Talker 都在实时语音理解 / 翻译方向推进。

五、2025:Audio LLM 的三种工程化走向

到 2025 年,Audio LLM 的新工作大多不是重造 ASR 范式,而是在三条方向上做工程化推进:更自然的实时对话 · 更长的音频上下文 · 更小的端侧模型

第一条是端到端语音对话。GPT-4o Realtime 把用户音频输入和助手音频输出放进同一个产品闭环后,后续系统开始围绕低延迟、可打断、情绪自然和全双工交互优化。Qwen2.5-Omni 这类模型进一步把 text reasoning 和 speech generation 拆开设计(Talker / Thinker),让模型更接近”边听边想边说”的交互形态。字节 Seed LiveInterpret 2.0(实时同传 / 语音翻译)、Google Gemini 2.0 Flash + Multimodal Live API 都在同一方向推进。

第二条是长音频理解。会议、播客、有声书这类任务不只需要把音频切块转写,还要在长上下文里保持说话人、主题和指代的一致性。NVIDIA Audio Flamingo 3 直接主打长音频 / 长视频音频理解;Moonshot Kimi-Audio 是通用音频理解 / 生成模型 · 对长音频能力也有扩展。目标不是把 Whisper 的 30 秒窗口简单拉长,而是让模型能跨段理解和检索音频内容(长音频能力以论文评测口径为准)。

第三条是端侧化和轻量化。云端 Audio LLM 能力强,但 7B 以上模型的显存、延迟和成本都不适合所有场景。面壁 MiniCPM-o、微软 Phi-4-Multimodal、阿里 FunAudioLLM 团队的轻量方向都在把重点放在更小参数、更低延迟和本地可用上。Whisper-large-v3-turbo 虽然仍属 Gen 4 转录模型(按 OpenAI Whisper 相关说明 · 主要面向转录场景 · 翻译能力不是优化重点),但常被拿来作为”高效转录基线”与 Audio LLM 方案对比。

另有 Sesame CSM(2025-03)代表开源自然语音生成 / 情感对话方向——本身不是 audio-in / text-out ASR · 但在实时对话生态里常被一起讨论。

这三条路线共同说明一件事:Gen 5 之后,ASR 不再只按“识别准确率”演进,而是被放进实时交互、长上下文和端云协同这些产品约束里重新优化。

六、Gen 5 的贡献、代价与下一站

Gen 5 的价值不只是“识别更准”,而是把 ASR 从独立转录任务推向了可指令化的音频理解能力。上下文、指令、说话人、情绪、摘要和结构化输出开始进入同一个 audio LLM 框架里;Seed-ASR 代表上下文推理进入 ASR,GPT-4o Realtime 代表语音交互从“识别 + 处理 + 合成”走向端到端产品形态。

但 Gen 5 拿到这些能力,也付出了清晰代价

代价 / 开放问题具体表现工程缓解方向
算力成本高LLM decoder 成为主体 · 7B 级 audio LLM 比 Whisper large-v3 更占显存和延迟量化 · 蒸馏 · 端云协同 · 小模型专用化
幻觉风险叠加Whisper 式自回归幻觉 + LLM prompt-fitting 幻觉 · 可能编造音频中没有的内容VAD / no-speech · grounding · 约束输出 · RLHF / 偏好对齐
长音频一致性跨段说话人 · 主题漂移 · 代词消歧仍是开放问题分段索引 · 层级摘要 · 说话人跟踪 · 记忆压缩
评测口径失效WER 无法评价摘要 · 情绪 · 说话人 · 结构化输出Task Completion Rate · Semantic WER · Human Preference

评测也必须换代。Gen 5 的输出不再限于逐字转录:模型可能删掉 filler、修正口误、加说话人前缀、输出情绪标签或会议行动项。按传统 WER 计算,这些都可能被算成错误,但用户体验未必更差。未来评测会从“字错了多少”转向“任务是否完成”:转录是否可信、摘要是否正确、结构化字段是否可用、情绪和说话人是否标对。

从产品入口看 · ASR 作为独立产品入口会变少 · 但底层转录能力仍会长期存在——“我要一个 ASR 模型”会越来越像今天说“我要一个 OCR 模型”:底层能力仍然重要,但会被嵌进通用多模态系统,成为其中一个感知通道。Gen 5 不是 ASR 的终点,而是 ASR 并入 audio / multimodal LLM 的开始

参考 · Whisper-large-v3-turbo model card:HuggingFace: openai/whisper-large-v3-turbo

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐