摘要

语音正在成为人机交互的新主界面,但"能听会说还会干活"的实时语音 Agent 长期被全双工、打断、任务并行这三道工程门槛挡在 demo 之外。2026 年 8 月初,两件事同时把门槛砍低:QwenAudio 团队开源实时语音运行时 qwen-audio-agent(GitHub 星标已突破 2000),阿里推出国内首个一站式 AI 语音生产力平台 CosyVoice Studio。本文拆解两个项目的能力与架构,并给出基于开源运行时快速搭建实时语音 Agent 的实战路线。

1. 背景:语音 Agent 的三道门槛

过去一年语音 Agent 的 demo 很多,但一落到真实任务——查资料、写代码、订机票——体验就崩。传统架构是"录音 → ASR → LLM → TTS → 播放"的串行流水线,每一跳都有延迟;更致命的是 Agent 一旦去调工具、查文档,对话就卡死,用户只能盯着"思考中"转圈。

真实对话要求三件事同时成立:全双工(双方可同时说话、随时打断)、任务并行(Agent 干活时仍保持在场、能继续聊天)、状态透明(用户随时知道任务进行到哪)。这三道门槛,正是本周两个项目共同的解题方向。

2. qwen-audio-agent:开源的实时语音运行时

qwen-audio-agent 是 QwenAudio 团队(阿里 Qwen 语音方向的开源组织)于 2026-07-28 开源的实时语音运行时,官方定位一句话:“A realtime voice runtime that keeps Agents talking, working, and present”——让 Agent 保持说话、工作与在场。仓库 https://github.com/QwenAudio/qwen-audio-agent,截至 2026-08-12 星标 2,082(8 月 9 日时约 1,994,三天涨了近 100),Apache-2.0 协议,主语言 JavaScript(Node.js 22.22.2+ / 24.15.0+,npm 10+),npm 包 qwen-audio-agent 最新 v1.8.3,CLI 命令 qwenaudio

它的核心思路是让"语音前端"和"干活的后端"解耦:语音交互的实时性由专用前端保证,复杂的工具调用、多步任务交给已有的编码 Agent(OpenCode、OpenClaw、Qoder、Qwen Code、Kimi Code、Hermes、CodeBuddy、Codex、Claude Code 等)执行,两者通过 ACP(Agent Client Protocol)连接,互不阻塞。

2.1 三层架构

从官方架构文档可提炼出三层设计:

职责 关键点
实时前端 全双工语音对话、直接回答、打断处理 刻意保持最小工具集(工具少、延迟低、无多步编排),基础工具仅 8 个:spawn_thinkingschedule_remindercancel_agent_taskget_agent_task_statusget_current_timememorynotesrespond_agent_permission
Gateway 路由、队列、权限、状态聚合 非阻塞请求流:能直接回答的立即回答;需要干活的任务通过 spawn_thinking(objective) 抛给后端,永不等待;每个 owner 一个 FIFO 队列,一次只送一个 Work 到后端 Session
后端 Agent 工具、文件、代码、多步任务 固定持久 Session(如 qwen-audio-agent:<owner>:backend),复用用户已装 Agent 的模型、工具、MCP 与 Skills,经 ACP 客户端连接

这套设计的精髓是非阻塞请求流:spawn_thinking 发出后立刻返回,用户继续说话;后端干活期间前端随时可以开口说"正在处理,大概需要一分钟";任务完成后通过安全的双工插入窗口,让 Agent 自然地汇报结果。状态查询走专门的 get_agent_task_status 入口,不打断对话。

2.2 一周五版:迭代速度本身就是信号

从 8 月 7 日到 8 月 12 日,项目连续发布 v1.7.0 → v1.8.3 五个版本(若连同 8 月 7 日的 v1.6.1 则为六个),节奏惊人:

  • v1.7.0(08-07):悬浮球支持自定义皮肤,改进 Windows 后端 Agent 启动;
  • v1.8.0(08-09):新增 Qwen Code 后端,与 OpenCode/OpenClaw 一样走原生 ACP;
  • v1.8.1/v1.8.2(08-11):更清晰的 persona 与记忆边界;长任务自动播报进度、语音唤醒更稳定、桌面端视觉刷新;
  • v1.8.3(08-12):精炼提示词、降低 token 消耗、修复已知问题。

其中"长任务自动播报进度"直接补上了语音 Agent 体验的关键一环——后端干活时不再沉默。加上 v1.6.1 内置的 computer-use(后端 Agent 可直接操作电脑)、v1.3.0 起的完全本地 speech-to-speech 前端(不依赖任何云 API Key),这个开源运行时正在快速逼近"开箱即用的语音 Agent 底座"。

3. CosyVoice Studio:一站式语音生产力平台

8 月 7 日,阿里巴巴正式推出国内首个一站式 AI 语音生产力平台 CosyVoice Studio(据量子位报道;官网 cosyvoice.net,标题"通义CosyVoice - 让声音创造价值")。平台基于阿里自研语音大模型 Qwen-Audio 打造:量子位报道称,在全球权威评测平台 Artificial Analysis 上,Qwen-Audio 拿下语音识别(ASR)、实时交互(RealTime)、语音合成(TTS)三个赛道的全球第一;官网给出的对应指标为 Qwen-Audio-3.0-ASR 字错率 WER 1.7%、Qwen-Audio-3.0-TTS 对话流畅度 97.8%、Qwen-Audio-3.0-Realtime 语音推理能力 97.6%(均为官网/报道口径)。

与"开源模型 + 自己拼装"不同,Studio 把"听、说、创"打包成三个开箱即用的产品:

产品 定位 能力要点
语音键盘(CosyFlow) 语音转"结构化文本" 在 ASR 之上叠加语义理解:自动过滤"那个""嗯"等口语填充词;自我修正不留痕迹;口述直接生成邮件/汇报/纪要;"随记"模式按声纹区分发言人、自动生成结构化章节、一键多语言翻译,单次最长转写 6 小时录音
音频创作(CosyCreative) 文本/文档 → 播客/有声书 内置上千种音色,支持声音复刻;上传文档、网页链接或一句话,即可生成对话播客、多角色有声书
语音智能体(CosyAgent) 企业级实时语音 Agent 用自然语言创建具备企业知识、工具调用和实时语音交互能力的智能体,支持 prompt 与 workflow 深度配置,面向智能客服、电话营销等场景

个人端 App 已在 iOS/Android/Mac/Windows 应用商店上线,不限量免费;CosyAgent/CosyCreative 目前以白名单邀请制面向企业测试。阿里此前的开源 CosyVoice 系列 TTS 仓库(GitHub 22,702 star、Apache-2.0)仍是语音开源生态常客,Studio 则是把新一代 Qwen-Audio 语音大模型以"聚合产品"形态对外开放。

与传统 TTS 的本质区别在于:语义理解被放进了语音链路。传统 TTS(拼接式、参数式合成,以及大量单点"语音 API")只解决"文字 → 声音"最后一跳,按文本机械朗读;而 Studio 的语音键盘是在"听懂你说什么"之后再组织表达——过滤口语词、整理逻辑、生成结构化文本,甚至区分发言人。这意味着同样的语音能力,在传统方案里要开发者自己拼装 ASR + LLM + TTS 三段,在 Studio 里则是一个开箱即用的产品。对内容生产场景(会议纪要、播客、有声书)来说,省掉的不是一次 API 调用,而是一整条自研流水线。

4. 上手:基于开源运行时搭一个实时语音 Agent

# 1. 全局安装(需要 Node.js 22.22.2+ / 24.15.0+,npm 10+)
npm install -g qwen-audio-agent

# 2. 生成配置并填入 DashScope API Key
qwenaudio config

# 3. 终端 1:启动 Gateway
qwenaudio

# 4. 终端 2:启动 TUI(或 qwenaudio webui 打开浏览器界面)
qwenaudio tui

配置示例(来自 README quickstart):

DASHSCOPE_API_KEY=***
# 语音前端模型:qwen-audio-3.0-realtime-flash 或 qwen-audio-3.0-realtime-plus(默认)
QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus
# 后端 Agent 协议:可留空(仅前端模式),或填 openclaw 等
AGENT_PROTOCOL=openclaw
# 后端模型:可留空,留空则复用 Agent 自身配置
QWEN_AUDIO_AGENT_BACKEND_MODEL=qwen3.7-max

落地建议三点:接入——没有 DashScope Key 也能玩,切到本地 speech-to-speech 前端即可零云成本体验全双工对话;需要真实工具调用时 qwenaudio setup 选一个后端 Agent(OpenCode/OpenClaw 支持一键安装),自动复用现有模型、工具、MCP 与 Skills。延迟——官方未公布统一端到端毫秒级指标(截至 2026-08-12 核查),但架构已把延迟压到最低:前端不做多步编排、spawn_thinking 非阻塞、v1.8.2 起长任务自动播报进度;注意 Linux/Windows 全双工无回声消除时官方建议戴耳机。成本——开源运行时零授权费,成本大头在云端语音模型(DashScope 计费)或本地算力;个人开发者先本地验证、再切云端上线,是性价比最高的路径。企业级"语音智能体"场景则可以直接走 CosyVoice Studio。

5. 总结

  • qwen-audio-agent(Apache-2.0,JavaScript/npm,GitHub 2,082 star)用"实时前端 + Gateway + 后端 Agent(ACP)"三层架构解决语音 Agent"说话、工作、在场"不可兼得的难题,一周五版的迭代速度说明生态正在快速成熟,npm install -g qwen-audio-agent 即可上手;
  • CosyVoice Studio(2026-08-07 发布,基于 Qwen-Audio)是国内首个一站式 AI 语音生产力平台,以语音键盘 CosyFlow / 音频创作 CosyCreative / 语音智能体 CosyAgent 覆盖"听、说、创",把语义理解融入了语音链路,个人端不限量免费;
  • 实时语音 Agent 的开发门槛正被"开源运行时 + 一站式平台"两条路径同时压低:想深度定制走开源,想快速上线走平台;延迟与成本的最优解,取决于你的场景是"对话型"还是"任务型"。

参考链接

  • qwen-audio-agent 仓库:https://github.com/QwenAudio/qwen-audio-agent
  • qwen-audio-agent 架构文档(中文):https://github.com/QwenAudio/qwen-audio-agent/blob/main/docs/architecture.zh.md
  • npm 包 qwen-audio-agent:https://www.npmjs.com/package/qwen-audio-agent
  • 量子位报道《阿里推出国内首个AI语音平台CosyVoice Studio,将语义理解融入语音能力》:https://www.qbitai.com/2026/08/468324.html
  • CosyVoice Studio 官网:https://cosyvoice.net
  • CosyVoice 开源仓库:https://github.com/QwenAudio/CosyVoice
  • Artificial Analysis(报道中引用的评测平台):https://artificialanalysis.ai
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐