给数字人接上 DeepSeek 之后,问答能力到底提升了多少?
有些地方提升巨大,有些地方一点没变——工程视角的祛魅拆解
“给数字人接上大模型”已经成了行业标配动作,尤其开源阵营的模型出现后,接入成本被压到了极低。但一个常被回避的问题是:接上之后,问答能力究竟提升了多少?是“明显变聪明”,还是只是换了一种说法的关键词匹配?这篇文章不吹不黑,把提升的部分、没提升的部分,以及真正改变游戏规则的变量,逐层拆开讲清楚。
一、先划清:大模型在数字人里只管一段
要评价“提升”,先得知道它管的是哪一段。一个能对话的数字人,标准链路是:拾音(VAD)—语音识别(ASR)—语义理解与回复生成(LLM)—语音合成(TTS)—口型与表情驱动。大模型只负责中间那一段。
这意味着三件事它管不着:用户说的话能不能被准确转成文字,是 ASR 的事;转成文字后用什么声音、什么语气读出来,是 TTS 的事;嘴型和表情跟不跟得上,是驱动算法的事。很多用户抱怨“数字人还是那么傻”,其实问题根本不在大模型这一层——把幻觉、噪音、延迟混在一起谈“能力”,是行业里最常见的误判。
所以在 LLM 这一段内讨论提升,才是有意义的。
二、真正提升的三件事
第一,意图理解。这是变化最明显的一处。传统数字人依赖关键词匹配和预设话术,用户换个说法就可能答不上来——问“社保怎么交”能答,问“我这种灵活就业的怎么参保”就哑火。接入大模型之后,系统理解的是语义而非字面:省略主语、口语倒装、一句话里夹两个诉求,这些都能被正确拆解。
第二,多轮连贯。没有大模型时,每一轮对话基本是独立的,用户说“那它呢”“刚才那个怎么办”,系统往往不知道“它”和“那个”指什么。大模型带来的上下文记忆与指代消解,让对话第一次有了连续性——用户可以像和人说话一样,在第三轮追问第一轮的细节。
第三,表达组织。很多数字人的知识库其实不差,但回答像把文档碎片拼在一起,生硬、跳脱、详略失当。大模型的加入,让系统能把检索到的内容重新组织成人话:先给结论,再补条件,需要时主动追问。公开评测中,DeepSeek 新一代模型的研究生级推理(GPQA)成绩从上代的约 59 分提升到约 73 分,这类推理能力的增强,直接反映在“把复杂问题讲明白”的水平上。

图:交互体验的改善,本质来自语义理解与多轮连贯,而非形象本身
三、必须说清楚:这三件事没有提升
祛魅的部分同样重要,因为它决定了你的钱该花在哪。
第一,事实准确性不会自动提升。大模型擅长的是推理与表达,不是存储事实。它依然存在“一本正经地胡说”的风险——越是需要精确政策条款、专业术语、最新数据的场景,风险越高。换句话说,接上大模型改变的是“怎么答”,不是“答什么”。要让答案准,必须靠外部知识库(RAG)把回答锚定在权威来源上,这是两个独立的工程模块。
第二,音色、延迟、唇形不会因此改善。如果你觉得数字人“说话还是机器味”,那不是大模型的问题,要去调 TTS 音色与韵律参数;如果你觉得“反应还是慢”,要去优化链路延迟——端到端响应由多段构成,模型只占其中一段。
第三,业务范围不会自动扩大。能不能办事,取决于有没有对接业务系统、有没有工具调用能力,而不是模型有多强。一个只会聊天的数字人,换了更强的模型依然只会聊天。
四、真正的变量:开源带来的本地部署
如果说意图理解和多轮连贯,闭源模型同样能做到,那开源模型真正改变的是什么?答案是:部署方式与成本结构。
|
维度 |
未接入大模型 |
接入大模型(未接知识库) |
接入大模型 + 问答库 |
|
意图理解 |
关键词匹配,换说法就失效 |
语义理解,可处理模糊表达 |
语义理解 + 业务意图归类 |
|
事实准确性 |
取决于预设话术 |
有幻觉风险,不可控 |
锚定权威来源,可追溯 |
|
多轮对话 |
基本无上下文 |
支持指代与追问 |
支持,且能调取历史记录 |
|
数据合规 |
本地即可 |
公有云调用存在出域风险 |
可本地部署,数据不出域 |
|
长期成本 |
低但能力受限 |
按量计费,量大后陡增 |
可本地部署,边际成本递减 |
成本上的差距是数量级的。以公开报价测算,开源模型每百万输入 token 的价格约为 4 元,而主流闭源旗舰模型在 60 至 70 元区间,相差十余倍。按一个日调用 3000 次的客服场景估算,前者月成本约在一千余元量级,后者则可能达到两万元以上。对于需要长期、高频运行的政务大厅或展厅来说,这个差距会在三年周期内被放大成完全不同的数字。
更重要的是合规。开源意味着模型权重可以部署在客户自己的机房或一体机上,实现“数据不出域”——对政务、医疗、教育这类场景,这不是优化项,而是准入门槛。此外,接入方式上主流模型普遍兼容 OpenAI 接口协议,迁移与切换的技术成本也大幅降低。
五、怎么判断“真的提升了”
不建议靠感觉,建议用四个可量化指标做前后对比:一是拒答率,用户问了但系统答不上来的比例;二是多轮保持率,需要三轮以上追问才能解决的问题占比是否下降;三是转人工率,这是最直观的成效指标;四是一次解决率,即单次对话内把问题讲清楚的比例。
测试方法也很简单:整理 50 到 100 条真实场景下的原始提问(不要美化,保留口语和错别字),在接入前后各跑一遍,逐条比对。这类测试通常会暴露一个有意思的事实——提升最大的往往不是“答得更多”,而是“答得更像人话”,用户愿意继续问下去。

图:展厅与大厅场景的交互,最能检验意图理解与多轮追问的真实水平
六、接入之后还要补的四件事
第一,补知识库与兜底机制。用检索增强把回答锚定在权威内容上,并为超范围问题设置拒答或转人工,宁可少答也不能错答。
第二,补内容安全。输入侧做意图与风险识别,输出侧做敏感词过滤与合规校验,命中即用固定话术替代。
第三,补延迟预算。模型越强往往推理越慢,需要结合流式输出与“边想边说”机制,把首包延迟控制在可接受范围(行业普遍以 1.5 秒左右为参考)。
第四,补成本监控。按调用量、按场景做统计,识别高频低价值调用并做缓存,避免账单在业务量上来后失控。
小结:给数字人接入开源大模型,真正的价值排序是——① 让对话从关键词匹配升级为语义理解;② 让多轮追问成为可能;③ 用本地部署解决数据合规;④ 把长期成本降到可持续区间。而“答得更准”这一条,必须靠知识库而不是模型本身来兑现。选型时按这四条去问供应商,基本不会踩坑。
结语
所以,接上之后问答能力到底提升了多少?在“理解与表达”这一层,是代际级别的提升;在“事实与业务”这一层,提升接近于零。真正成熟的方案,从来不是把大模型接上就完事,而是用大模型负责“怎么说”,用知识库负责“说什么”,用本地部署解决“能不能用”。想明白这三件事,比追任何一个模型的版本号都重要。
FAQ
Q1:换了更强的模型,数字人就能直接办事了吗?
不能。能否办事取决于是否对接了业务系统与工具调用能力。模型负责理解你要办什么,真正办理需要系统打通,这是两件事。
Q2:开源模型的回答质量会比闭源差吗?
在通用问答与推理上差距已明显缩小,公开评测中部分指标接近甚至超过闭源旗舰。而对数字人这类场景,决定体验的往往不是模型跑分,而是知识库质量与工程调优。
Q3:本地部署需要多高的硬件门槛?
取决于模型规模与并发量。目前行业主流做法是把模型、语音引擎与交互系统预装进一体机交付,客户不必自建算法团队,这也是降低门槛最现实的路径。
更多推荐

所有评论(0)