前言
这周 AI 圈最大的变化:Kimi K3 智能分突破60分,追平 GLM-5.3,仅落后 GPT-5.6 Sol 1分。

但"60分"这个数字本身没有工程意义。对开发者来说,真正需要回答的是三个问题:

第一,60分的 Kimi K3,真实能力边界在哪?能做什么,不能做什么?

第二,同是60分,Kimi K3和 GLM-5.3 该怎么选?快还是准?长还是短?

第三,45分的 DeepSeek V4 Pro,为什么依然是很多业务的最优解?低分不等于低价值。

本文用"能力-速度-成本"三维数据,一起与你理清选型边界。

  1. 智能分与定价总览

Artificial Analysis Intelligence Index(智能分)是衡量模型综合推理、理解、结构化输出能力的核心指标。

各模型智能分与定价如下:

1、GPT-5.6 Sol(max):智能分61,上下文1M,输入价1.23美元/百万token,输出价209.11美元/百万token。

2、Kimi K3(max):智能分60,上下文1.05M,输入价0.84美元/百万token,输出价2.67美元/百万token。

3、GLM-5.3(max):智能分60,上下文1M,输入价0.68美元/百万token,输出价1.88美元/百万token。

4、Claude Sonnet 5(max):智能分55,上下文1M,输入价1.72美元/百万token,输出价184.48美元/百万token。

5、DeepSeek V4 Pro(max):智能分45,上下文1M,输入价0.05美元/百万token,输出价1.78美元/百万token。

三款国产模型,三条完全不同的路线:

Kimi K3:能力对标旗舰。60分 + 1.05M上下文,输出价仅为 GPT 的七十八分之一。

GLM-5.3:能力对标旗舰。60分 + 速度更快(85 token/秒),输出价比 K3 更低。

DeepSeek V4 Pro:极致性价比。45分 + 输入价0.05美元/百万token,适合成本敏感型任务。

核心结论:海外模型赢上限,国产模型赢落地。K3 和 GLM-5.3 的智能分已逼近 GPT-5.6 Sol,但输出价格低两个数量级。

  1. 速度与延迟

智能分决定"任务上限",速度和延迟决定"业务能不能用"。

各模型速度与延迟如下:

1、GLM-5.3(max):速度85 token/秒,延迟31.39毫秒,适合实时聊天、智能客服、高并发问答。

2、DeepSeek V4 Pro(max):速度74 token/秒,延迟68.03毫秒,适合中速通用场景。

3、Kimi K3(max):速度38 token/秒,延迟68.17毫秒,适合长文档解析、合同审查、深度推理。

4、Claude Sonnet 5(max):速度76 token/秒,延迟191.06毫秒,适合高质量输出。

5、GPT-5.6 Sol(max):速度65 token/秒,延迟216.76毫秒,适合高质量输出。

结论:

GLM-5.3 是国产速度标杆,85 token/秒、31毫秒延迟,实时交互场景的首选。

Kimi K3 速度仅为 GLM-5.3 的一半(38 token/秒),不适用于实时对话,但 1.05M 超长上下文 + 60分智能分使其在文档分析、深度推理中占据独特位置。

DeepSeek V4 Pro 速度中等、延迟可控,配合极致低价,适合大批量通用任务。

一句话总结:聊天用 GLM-5.3,读文档用 K3,跑批量用 DeepSeek——混合调用比单一模型更省钱。

  1. 真实业务成本测算

用开发者最常用的两类场景,量化真实调用成本。

场景A:短文本任务(代码编写+解释),输入2K token、输出1K token:

DeepSeek V4 Pro(max)单次费用0.00188美元,约0.013元。GLM-5.3(max)单次费用0.00332美元,约0.024元。Kimi K3(max)单次费用0.00435美元,约0.032元。

结论:短文本场景下,所有模型单次成本仅0.013元到0.032元,价差可以忽略。不用纠结价格,优先根据速度、准确度选型。

场景B:长文本任务(50页合同摘要),输入50K token、输出1K token:

DeepSeek V4 Pro(max)单次费用0.00428美元,约0.031元,成本为 K3 的十分之一。

GLM-5.3(max)单次费用0.0359美元,约0.26元,成本为 K3 的0.8倍。

Kimi K3(max)单次费用0.0447美元,约0.33元。

Claude Sonnet 5(max)单次费用0.270美元,约1.97元,成本为 K3 的6倍。

结论:长文本场景成本差距彻底拉开。DeepSeek V4 Pro 成本仅为 K3 的十分之一、Claude 的六十分之一,适合大批量长文本预处理。K3 和 GLM-5.3 成本是 DeepSeek 的8到10倍,但60分带来的理解精度提升,在合同审查、法律合规、财报分析等场景中是值得付出的溢价。

  1. 计费模式选型指南
    快速自测三问:

调用以短文本为主?→ 按次抵扣更划算。

月长文本调用超10万token?→ 按量计费更划算。

模型价格波动大?→ 按次抵扣锁定成本。

选型速查:

实时聊天、智能客服、高并发问答 → 按次抵扣 + GLM-5.3

代码生成、短文本创作、日常开发 → 按次抵扣 + K3 或 GLM-5.3

50页以上合同审查、长文档精读 → 按量计费 + K3 或 GLM-5.3

大批量通用文本处理,对精度不敏感 → 按量计费 + DeepSeek V4 Pro

  1. 可运行接入代码

python

`import os

from openai import OpenAI

========== API 配置(请替换为你的实际凭证)==========

API_KEY = os.getenv(“LLM_API_KEY”, “”)

BASE_URL = os.getenv(“LLM_BASE_URL”, “”)

if not API_KEY or not BASE_URL:

raise ValueError("请配置环境变量 LLM_API_KEY 和 LLM_BASE_URL")

client = OpenAI(

base_url=BASE_URL,

api_key=API_KEY,

timeout=120.0,  # 长文档建议120秒以上

)

def llm_chat(

model_name: str,

prompt: str,

system_prompt: str = "你是严谨的技术助手,结论优先、逻辑清晰。",

max_tokens: int = 4096,  # 长文档建议调至16384+

temperature: float = 0.3,

) -> str:

resp = client.chat.completions.create(

    model=model_name,  # kimi-k3 / glm-5.3 / deepseek-v4-pro
    
    messages=[
    
        {"role": "system", "content": system_prompt},
        
        {"role": "user", "content": prompt},
    ],
    temperature=temperature,
    max_tokens=max_tokens,
)
return resp.choices[0].message.content

if name == “main”:

result = llm_chat(
    model_name="kimi-k3",
    prompt="对比 Kimi K3 与 GLM-5.3 在长文档场景的适配差异。",
)
print(result)
`

使用前提:将 BASE_URL 替换为你的实际网关地址,model_name 替换为平台对应的模型名称;max_tokens 和 timeout 根据任务长度动态调整。

  1. 选型总结

实时对话、高并发问答 → GLM-5.3(85 token/秒,31毫秒延迟)

长文档精读、合同/财报分析、深度推理 → Kimi K3(60分 + 1.05M上下文)

大批量预处理、极致控成本 → DeepSeek V4 Pro(0.05美元/百万token输入)

混合调用策略:同一个业务里,聊天用 GLM-5.3,文档用 K3,批量预处理用 DeepSeek——比单一模型更省钱、更高效。

结语

Kimi K3 60分的真正意义,不是"超越谁",而是国产模型已经进入"能力对标旗舰、价格贴近工程"的成熟阶段。

榜单只是参考,业务场景的速度、精度、成本三角平衡,才是模型选型的唯一标准。

参考资料
Artificial Analysis 周榜原始数据:https://artificialanalysis.ai(2026-08-19 抓取)

Kimi K3 官方技术报告:https://platform.moonshot.cn/docs/k3

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐