Day 04 · LLM API 横评:GLM / DeepSeek / Qwen / OpenAI
「AI Python 系列」第 01 栏 · AI 时代的 Python 办公自动化
全栏 20 篇 · 零成本跟完 🍃
品牌:梅雅达编程笔记
摘要: 同一个任务跑四家大模型API,速度、质量、免费额度全面对比。GLM-4.7-Flash永久免费,DeepSeek V4-Flash便宜量大,Qwen试用额度90天,GPT-4o-mini需付费翻墙。附横评脚本一键测出你家该用谁。
开篇 · 四家模型,到底选哪个?
Day 02 搭环境的时候说了:我们的 llm_client.py 支持四家模型一键切换。但很多读者问:
- “GLM 免费是真好用,但万一不够呢?”
- “DeepSeek 最近很火,跟 GLM 差多少?”
- “公司要求用 Qwen,能无缝切过去吗?”
- “GPT-4o-mini 到底比国产强多少?”
今天不吹不黑,用同一套任务跑四家模型,速度、质量、成本,一个一个给你摆出来。
前提说明: 本篇代码只需要你有 GLM 的 Key(Day 02 已配好)就能跑。其他三家有 Key 就测,没 Key 自动跳过,不影响你看到对比方法。
一、2026 年 7 月:四家模型最新现状
以下数据截至 2026 年 7 月 19 日,各平台可能调整策略,以官方页面为准。
价格与免费额度对比
| 维度 | GLM-4.7-Flash | DeepSeek V4-Flash | Qwen-Plus | GPT-4o-mini |
|---|---|---|---|---|
| 价格策略 | 永久免费 | 试用后付费 | 试用后付费 | 付费 |
| 免费额度 | 永久免费 + 新用户送2000万Token | 新用户送100万Token(一次性) | 新用户约100万Token(90天有效) | 无免费额度 |
| 输入价格 | ¥0 | ¥0.02/百万(缓存命中) · ¥1/百万(未命中) | ¥0.75/百万 | $0.15/百万(约¥1.08) |
| 输出价格 | ¥0 | ¥2/百万 | ¥3/百万 | $0.60/百万(约¥4.32) |
| 国内访问 | ✅ 直连 | ✅ 直连 | ✅ 直连 | ❌ 需翻墙 |
| 注册门槛 | 手机号 | 手机号 | 阿里云账号 | 海外信用卡 |
能力参数对比
| 维度 | GLM-4.7-Flash | DeepSeek V4-Flash | Qwen-Plus | GPT-4o-mini |
|---|---|---|---|---|
| 上下文窗口 | 200K | 1M | 256K | 128K |
| 最大输出 | 128K | 384K | 8K | 16K |
| JSON 输出 | ✅ | ✅ | ✅ | ✅ |
| Function Calling | ✅ | ✅ | ✅ | ✅ |
| 并发限制 | 30 | 2500 | 按量 | 按量 |
| 架构 | MoE 30B/3B激活 | MoE | — | — |
几个关键发现:
- GLM-4.7-Flash 是唯一永久免费的——其他三家要么试用期过后收费,要么一开始就收费
- DeepSeek 上下文最长(1M),但免费额度只有 100 万 Token,跑完就没了
- Qwen 免费层已于 2026 年 4 月结束,现在只有 90 天试用额度
- GPT-4o-mini 对国内用户门槛最高——需要海外信用卡 + 翻墙
⚠️ 重要更新: DeepSeek 的旧模型名 deepseek-chat 将于 2026 年 7 月 24 日弃用,新名称为 deepseek-v4-flash。我们的 llm_client.py 已更新为新名称。(来源:DeepSeek 官方文档)
二、传统做法 vs AI 时代做法
传统做法:手动一家家试
想对比四家模型,传统方式是:
- 打开四个浏览器标签页
- 把同一个问题复制粘贴四遍
- 手动记录响应时间和输出内容
- 人眼对比质量
痛点: 慢、容易漏、不可复现、没法批量测。
AI 时代做法:一段代码跑四家
用我们的 llm_client.py,切换供应商只需要改一个参数:
# 同一个任务,跑四家
for provider in ["glm", "deepseek", "qwen", "openai"]:
client = LLMClient(provider=provider)
result = client.chat("帮我写个周报")
print(f"{provider}: {result}")
优雅在哪:
- 一键切换,代码不变
- 自动计时
- 批量任务可复现
- 没
Key的自动跳过,不报错
三、三大测试任务设计
为了公平对比,我们设计三个典型办公场景任务:
任务 1:周报生成(测试生成能力)
输入: 一段工作要点
考察: 内容质量、格式稳定性、字数控制
任务 2:邮件分类(测试理解能力)
输入: 3 封待分类邮件 + 3 个示例(Few-shot)
考察: 分类准确率、一致性
任务 3:JSON 信息提取(测试结构化输出)
输入: 一段非结构化文字
考察: JSON 格式是否正确、字段是否完整
四、完整代码:四家模型横评脚本
完整代码已放到
model_compare.py文件中,需要的可以找我要。以下是主要代码逻辑:
model_compare.py(主要代码)
"""四家 LLM API 横评脚本"""
from llm_client import LLMClient
# 四家供应商
PROVIDERS = ["glm", "deepseek", "qwen", "openai"]
def init_clients():
"""初始化所有已配置 Key 的客户端,跳过未配置的"""
clients = {}
for provider in PROVIDERS:
try:
clients[provider] = LLMClient(provider=provider)
except ValueError:
pass # 未配置 Key 自动跳过
return clients
# 三大测试任务
def task1_summary(client, provider_name):
"""任务1:周报生成(测试生成能力)"""
result = client.chat("工作要点...", system_prompt="写简洁周报...", temperature=0.3)
return {"task": "周报生成", "provider": provider_name, "content": result}
def task2_classify(client, provider_name):
"""任务2:邮件分类(测试理解能力,Few-shot)"""
# 3个分类示例 + 3封测试邮件,调用 client.chat() 进行分类
result = client.chat("分类示例 + 测试邮件...", temperature=0)
return {"task": "邮件分类", "provider": provider_name, "content": result}
def task3_json(client, provider_name):
"""任务3:JSON提取(测试结构化输出)"""
result = client.chat_json("张三,手机号13800138000...", temperature=0.1)
return {"task": "JSON提取", "provider": provider_name, "content": result}
def main():
"""主流程:遍历四家模型,依次执行三个任务,汇总结果"""
clients = init_clients()
tasks = [task1_summary, task2_classify, task3_json]
for task_func in tasks:
for provider, client in clients.items():
result = task_func(client, provider)
# 输出耗时、长度、内容...
# 打印横评汇总表...
if __name__ == "__main__":
main()
运行方式
# 确保已配置 .env(至少有 GLM_API_KEY)
python model_compare.py
预期输出(仅 GLM 时的效果)
============================================================
四家 LLM API 横评
============================================================
初始化客户端:
✅ GLM-4.7-Flash 就绪
⏭️ DeepSeek V4-Flash 跳过(未配置 Key)
⏭️ Qwen-Plus 跳过(未配置 Key)
⏭️ GPT-4o-mini 跳过(未配置 Key)
共 1 家模型就绪,开始测试
============================================================
任务1:周报生成
============================================================
--- GLM-4.7-Flash ---
⏱️ 耗时:1.23s
📏 长度:287字
📝 内容:
## 本周完成
- 订单模块重构:优化接口逻辑,响应速度提升约40%
- 修复12个bug(严重级3个,一般级9个)
- 数据库查询优化,慢查询减少60%
...
============================================================
任务2:邮件分类
============================================================
--- GLM-4.7-Flash ---
⏱️ 耗时:2.15s
📏 长度:3封
📝 内容:
[售前咨询] 你们的价格能优惠吗
[售后咨询] 发票怎么开
[技术投诉] 系统又崩了
============================================================
任务3:JSON提取
============================================================
--- GLM-4.7-Flash ---
⏱️ 耗时:0.87s
📏 长度:89字
📝 内容:
✅ 合法JSON
{"name": "张三", "phone": "13800138000", "email": "zhangsan@meiyada.com", "company": "梅雅达公司"}
============================================================
📊 横评汇总
============================================================
任务 模型 耗时 长度
-------------------------------------------------------
周报生成 GLM-4.7-Flash 1.23s 287字
邮件分类 GLM-4.7-Flash 2.15s 3封
JSON提取 GLM-4.7-Flash 0.87s 89字
注意: 实际耗时和输出内容每次可能略有不同。如果你配置了多家的
Key,会看到四家并排对比的效果。
如果想测其他家?
在 .env 文件中添加对应的 Key 即可:
# 已有
GLM_API_KEY=你的智谱Key
# 可选:添加其他家
DEEPSEEK_API_KEY=你的DeepSeekKey
DASHSCOPE_API_KEY=你的通义千问Key
OPENAI_API_KEY=你的OpenAIKey
添加后重新运行 model_compare.py,脚本会自动检测并测试所有已配置的模型。
五、选型建议:你的场景该用谁?
场景一:跟这个专栏学习
推荐:GLM-4.7-Flash
理由很简单——永久免费。200K 上下文够用,128K 输出空间充足,中文能力优秀。整个专栏 18 篇跑下来一分钱不花。
💡 外部背书: 2026 世界人工智能大会上,巴西科学院院士博姆接受央视采访时专门点赞中国开源大模型,透露自己正在测试智谱 GLM。连算力受限国家的科学家都开始关注,说明国产开源模型确实站住了。
场景二:公司有阿里云生态
推荐:Qwen-Plus
如果你的公司已经用了阿里云,通义千问跟阿里云的 OSS、RDS、函数计算等整合更好。但注意免费额度只有 90 天。
场景三:需要处理超长文档
推荐:DeepSeek V4-Flash
1M 上下文是四家里最长的。一本书扔进去都行。价格也便宜——缓存命中时百万 Token 只要 0.02 元。但免费额度只有 100 万 Token,跑几次长文本就用完了。
场景四:英文为主的工作场景
推荐:GPT-4o-mini
英文理解能力略强于国产模型。但需要翻墙 + 海外信用卡,门槛最高。如果不是必须用 OpenAI,GLM-4.7-Flash 的英文能力也够日常用。
最终建议
| 你的情况 | 推荐 | 理由 |
|---|---|---|
| 零成本学习 | GLM-4.7-Flash |
永久免费,质量够用 |
| 商用低成本 | GLM-4.7-Flash + DeepSeek 备用 |
GLM 免费,DeepSeek 兜底 |
| 企业级 | Qwen-Plus / DeepSeek V4-Pro |
生态整合 + SLA 保障 |
| 海外业务 | GPT-4o-mini |
英文场景 + 国际兼容性 |
一句话总结: 对 95% 的个人开发者和中小团队来说,GLM-4.7-Flash 免费且够用。只有当你确实遇到了 GLM 处理不了的复杂场景,才需要考虑付费替代方案——而且那时候你已经知道该花多少钱了。
📊 本篇成本透明栏
| 项目 | 数值 |
|---|---|
| API 调用次数 | 约 7 次(仅 GLM:3任务×约2次) |
| 消耗 Token | 约 8,000 tokens |
| 成本 | ¥0(GLM-4.7-Flash 永久免费) |
| 免费额度是否够 | ✅ 够用 |
| 商用估算 | ¥0(GLM)/ 约¥0.02(DeepSeek)/ 约¥0.03(Qwen) |
练手改造题
改造 1(基础): 在横评脚本中加一个"翻译任务"——同一段中文翻译成英文,对比四家模型的翻译质量。
提示:新增 task4_translate() 函数,用 client.chat() 调用。
改造 2(进阶): 给横评脚本加一个"准确率评分"功能——对邮件分类任务,预设正确答案,自动计算每家模型的准确率。
提示:定义 correct_answers = {"你们的价格能优惠吗": "售前咨询", ...},对比 AI 输出计算准确率。
改造 3(挑战): 写一个"成本估算器"——输入一段文本和预计调用次数,估算四家模型分别花多少钱。用 GLM 的 Token 计数方式近似估算。
提示:中文大约 1 字 ≈ 1.5 Token,英文大约 4 字符 ≈ 1 Token。
下期预告
Day 05 · 让 AI 输出结构化数据
横评跑完了,你发现 JSON 提取那步最关键。Day 05 深入讲怎么让 AI 稳定输出结构化数据——JSON、表格、固定格式——这是后面 15 篇办公自动化代码的地基。讲完这篇,AI 就不会"偶尔给你一段散文"了。
📚 资源与工具(文末合规集中)
- 智谱开放平台(GLM,免费 API Key): https://open.bigmodel.cn/
- GLM 模型文档: https://docs.bigmodel.cn/
- DeepSeek 开放平台: https://platform.deepseek.com/
- DeepSeek 定价页: https://api-docs.deepseek.com/zh-cn/quick_start/pricing
- 通义千问(Qwen)定价: https://help.aliyun.com/en/model-studio/model-pricing
- OpenAI 定价: https://openai.com/api/pricing/
- 本专栏配套代码: CSDN 下载区(每篇更新)
数据说明: 本篇价格数据采集于 2026 年 7 月 19 日,各平台可能随时调整定价策略。实际使用请以各平台官方定价页面为准。
🍃 作者的话
梅雅达编程笔记,专注 Python + AI 办公自动化实战教程。
横评的意义不是"分个高下",而是让你知道什么场景用什么模型。GLM-4.7-Flash 永久免费这个优势太大了——对学习和轻量商用来说,它就是当前性价比最高的选择。
但如果你做的是企业级项目,DeepSeek 的 1M 上下文和 Qwen 的阿里云生态整合也有不可替代的价值。工具没有最好,只有最合适。
下一篇 Day 05,我们深入结构化输出——让 AI 不再"偶尔给你一段散文",而是每次都老老实实吐 JSON 🍃
往期回顾
Day 01 · 为什么 2026 年办公自动化得“AI 化“了
下一篇: Day 05 · 让 AI 输出结构化数据
专栏订阅: 「AI 时代的 Python 办公自动化」
姊妹专栏:
- Python 零基础入门
- 编程启蒙-Scratch转Python
更多推荐

所有评论(0)