关键词:大模型对比、模型选型、聚合 API、Python 实战
适用:做 AI 应用的同学想快速给模型「摸底」

一、为什么需要横向对比

选型时最头疼的不是「哪个最强」,而是「哪个最适合我的场景、我的预算」。逐个去各家注册、对接不同的 SDK、再统一打分,光是接入就劝退一大半人。

如果用聚合 API,这件事会被极大简化:一个 Key、一个接口、换 model 名字就能换模型。本文就用 TokenPortal 的聚合网关,写一份代码,把目前最受欢迎的四家——Claude(Anthropic)、GPT(OpenAI)、DeepSeek、通义千问 Qwen——在同一道题上跑一遍,顺带统计耗时与用量,做一次真正的横向对比。

顺带说一句:这份代码不是只能跑这四家。平台已接入 Google、月之暗面、智谱、MiniMax、百度等主流厂商,后面想加模型,往列表里加一行名字即可。

二、环境准备

pip install openai

登录 TokenPortal 控制台创建 API Key,只显示一次,存好。控制台入口与模型清单来我主页查看。base_url 指向平台网关(以控制台「API 文档」页为准,本文用 https://api.tokenportal.ai/v1 占位)。

三、核心代码:一份代码跑完所有模型

import time
from openai import OpenAI

client = OpenAI(api_key="你的_KEY", base_url="https://api.tokenportal.ai/v1")

# 本次横向对比的四家主力模型;想加 Kimi / Gemini / GLM 等,往里加一行即可
models = [
    "anthropic/claude-opus-4.8",     # Claude:长链路推理、编码、Agent 能力强
    "openai/gpt-5.5",                # GPT:通用能力均衡、生态成熟
    "deepseek/deepseek-v4-pro",      # DeepSeek:性价比高、中文与代码表现扎实
    "qwen/qwen3.7-max",              # Qwen:国产长上下文、中文语感自然
]

prompt = "用一句话解释什么是向量数据库,并举一个实际应用场景"

for m in models:
    t0 = time.time()
    r = client.chat.completions.create(model=m, messages=[{"role": "user", "content": prompt}])
    dt = time.time() - t0
    u = r.usage
    print(f"【{m}{dt:.2f}s | token: {u.prompt_tokens}+{u.completion_tokens}")
    print("→", r.choices[0].message.content, "\n")

跑完你就能直观看到:谁答得准、谁更快、谁更省(用量 × 单价)。四家在同一道题下直接同台竞技,对比一目了然。

四、横向对比看什么:四个维度

光看输出不够,做严肃横评建议固定四个维度,把每次返回存成结构化记录再打分:

维度看什么怎么量化
回答质量是否准确、完整、贴合题意人工评分 / LLM-as-judge
速度首字与总耗时代码里的 dt 计时
成本单次调用花多少completion_tokens × 单价
中文 / 场景适配中文语感、专业术语、长文本针对性样例题

把返回落库后统一比对:

results = []
for m in models:
    r = client.chat.completions.create(model=m, messages=[{"role": "user", "content": prompt}])
    results.append({
        "model": m,
        "answer": r.choices[0].message.content,
        "elapsed_s": round(time.time() - t0, 2) if False else None,  # 建议在循环内记录
        "completion_tokens": r.usage.completion_tokens,
    })

# 后续可接人工打分 / LLM-as-judge / 自动校验,再生成对比表

小提示:计时变量 t0 要放在每个模型的循环体里(见第三节写法),上面的落库片段仅为结构示意。

跑出结果后,你心里基本就有数了:要长链路推理和编码看 Claude,要通用均衡与生态看 GPT,要压低成本看 DeepSeek,要国产长上下文与中文语感看 Qwen——而这四家现在一个接口就能全部调度。

五、小结

聚合 API 的价值不只是「少注册几家」:

  • 覆盖广:Anthropic、OpenAI、Google、DeepSeek、阿里通义、月之暗面、智谱、MiniMax、百度等主流厂商一个接口通吃;
  • 好切换:横评完发现某家更合适,生产里只改 model 一行;
  • 有折扣:部分模型在平台上有折扣(如 Anthropic 系列低至 5 折),做横评时成本也更低;
  • 可开票、官方货源、稳定,对要走公司财务流程的团队友好。

模型列表与实时折扣,来我主页查看。

下一篇我会讲怎么在这套接口上搭一个「会自己调工具」的 Agent,并做多模型兜底切换,关注不迷路。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐