企业把大模型用出性价比,与是否具备统一的模型接入层、按任务难度分级的路由能力,以及一套能持续更新的评测集密切相关。DeepSeek、GPT、智谱三家的差别,主要体现在成本、延迟、数据边界这三条曲线的不同位置上,所谓按需调度,就是给每一类任务在这三条曲线上找到合适的点。

一个模型打天下的账,如何评估

多数分词器里,一个汉字通常对应一到两个 token,一个常见英文单词往往不足一个 token,所以表达同一段意思,中文的计费长度普遍比英文长。

输入和输出分开计价,原因是二者占用的资源形态不同。输入部分可以一次性并行算完,输出部分只能一个 token 一个 token 串行生成,每生成一个都要回头读取此前所有 token 的中间结果。回答越长,输出侧越贵。同一个模型拿去做长文档摘要和拿去做三分类打标,单次成本能差出几十倍。

第二层是能力结构不同。 一种扩大模型的做法是加深加宽,参数越多,每次推理的计算量同比例上涨。另一种做法是稀疏化,把前馈层拆成若干并行的专家模块,每次前向只根据输入挑选其中少数几个参与计算,其余保持静默。总参数量因此可以往上堆,单次推理真正激活的参数只占一小部分。这类结构对需要广博知识覆盖的任务友好,代价是显存必须装得下全部参数。

第三层是数据边界不同。调用托管在云端的模型,提示词中的原文需要经过网络传输。

三层因素叠加,使得单一模型较难同时在成本、效果、合规上占优。

把换模型做成改一行配置

如今主流模型服务无论开源还是闭源,多数都提供一套事实标准的请求响应格式:请求里带消息数组、工具描述、采样参数,响应里给内容和用量统计。做兼容层,就是让自己的调用方只认这一套格式,底下接哪家由配置决定。

有一个点值得单独提醒。兼容只保证字段长得像,行为未必一致。工具调用的参数拼接方式、结构化输出的严格程度、流式返回的分块粒度、上下文长度的统计口径,各家都有出入。工程上需要在兼容层之上再补一层能力画像:最大上下文、是否支持工具调用、是否支持 JSON 模式、并发配额、输入输出单价、平均首字延迟,全部记进去。路由决策读的是这份画像,不读模型名字。

切换还必须具备降级能力。强模型超时或触发限流时,请求要能自动落到备选模型,并把"这次走了备选"写进日志。

先给任务分级,再给模型排序

落地时先把任务按认知负荷分级。信息抽取、文本分类、格式转换、短文本打标属于低负荷,几十亿参数的轻量模型就够用,且延迟更短。多步推理、长文档跨段落归纳、代码生成与审查、需要调用外部工具并自我纠错的流程属于高负荷,交给强模型。

行业里验证过的一种结构是级联:请求先送轻量模型,同时用一个置信度信号判断输出是否合格,不合格再升级到强模型重跑。后来有 RouteLLM 一类的开源实现把难度打分做成了可训练的小分类器。级联划不划算,取决于两个数字:轻量模型的合格率,以及重复调用叠加起来的总成本。

在压成本上,缓存是值得关注的策略之一

缓存的思想从处理器的多级缓存一路传到 Web 时代,Memcached、Redis 走的都是精确匹配,键完全相等才算命中。大模型场景里请求千变万化,精确匹配的命中率极低,于是有了语义缓存:把请求的向量存下来,新请求先比相似度,超过阈值就直接返回历史答案。

另一条路径是前缀缓存。注意力机制在生成每个新 token 时都要回顾此前所有 token 的键值,这些键值算一次就能存着复用。当多次请求共享同一段开头,比如系统提示词、长文档正文、固定的工具描述,这段计算可以只做一次。部分推理服务对命中前缀的部分提供较低的输入单价。系统提示词较长的应用,从这一项上省下的钱常常比换成更便宜的模型更多。

再往下是量化。神经网络权重最早用 32 位浮点存储,训练和推理共用一套精度。后来发现推理阶段不需要这么高的数值精度,16 位浮点在多数任务上几乎不掉点,权重占用立刻减半。继续压到 8 位整数、4 位整数,需要配合逐通道的缩放因子和校准集,占用再减半、再减半。单张 GPU 能装下的模型规模随位数成倍变化,原本需要多卡才能跑起来的模型量化后单卡就够,私有化部署的硬件门槛随之下降。

小艾智能体的对应设计

小艾智能体可将DeepSeek、GPT-4、智谱 AI 等模型纳入同一接入层,可通过配置决定当前启用哪一个,业务代码无需为每个模型各写一套调用方式。配置化的 Agent 工作流引擎可支持不同节点指定不同模型,抽取类节点走轻量模型,推理与生成类节点走强模型,节点之间的状态可自动传递。文档处理引擎、知识图谱系统、向量检索引擎与 Skills 技能系统可集成在这套引擎之上,需要私有化时可将模型指向内网部署的实例,上层流程通常无需改动。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐