「AI Python 系列」第 01 栏 · AI 时代的 Python 办公自动化

全栏 20 篇 · 零成本跟完 🍃

品牌:梅雅达编程笔记

摘要: 同一个任务跑四家大模型API,速度、质量、免费额度全面对比。GLM-4.7-Flash永久免费,DeepSeek V4-Flash便宜量大,Qwen试用额度90天,GPT-4o-mini需付费翻墙。附横评脚本一键测出你家该用谁。

开篇 · 四家模型,到底选哪个?

Day 02 搭环境的时候说了:我们的 llm_client.py 支持四家模型一键切换。但很多读者问:

  • “GLM 免费是真好用,但万一不够呢?”
  • “DeepSeek 最近很火,跟 GLM 差多少?”
  • “公司要求用 Qwen,能无缝切过去吗?”
  • “GPT-4o-mini 到底比国产强多少?”

今天不吹不黑,用同一套任务跑四家模型,速度、质量、成本,一个一个给你摆出来。

前提说明: 本篇代码只需要你有 GLM 的 Key(Day 02 已配好)就能跑。其他三家有 Key 就测,没 Key 自动跳过,不影响你看到对比方法。


一、2026 年 7 月:四家模型最新现状

以下数据截至 2026 年 7 月 19 日,各平台可能调整策略,以官方页面为准。

价格与免费额度对比

维度 GLM-4.7-Flash DeepSeek V4-Flash Qwen-Plus GPT-4o-mini
价格策略 永久免费 试用后付费 试用后付费 付费
免费额度 永久免费 + 新用户送2000万Token 新用户送100万Token(一次性) 新用户约100万Token(90天有效) 无免费额度
输入价格 ¥0 ¥0.02/百万(缓存命中) · ¥1/百万(未命中) ¥0.75/百万 $0.15/百万(约¥1.08)
输出价格 ¥0 ¥2/百万 ¥3/百万 $0.60/百万(约¥4.32)
国内访问 ✅ 直连 ✅ 直连 ✅ 直连 ❌ 需翻墙
注册门槛 手机号 手机号 阿里云账号 海外信用卡

能力参数对比

维度 GLM-4.7-Flash DeepSeek V4-Flash Qwen-Plus GPT-4o-mini
上下文窗口 200K 1M 256K 128K
最大输出 128K 384K 8K 16K
JSON 输出
Function Calling
并发限制 30 2500 按量 按量
架构 MoE 30B/3B激活 MoE

几个关键发现:

  1. GLM-4.7-Flash 是唯一永久免费的——其他三家要么试用期过后收费,要么一开始就收费
  2. DeepSeek 上下文最长(1M),但免费额度只有 100 万 Token,跑完就没了
  3. Qwen 免费层已于 2026 年 4 月结束,现在只有 90 天试用额度
  4. GPT-4o-mini 对国内用户门槛最高——需要海外信用卡 + 翻墙

⚠️ 重要更新: DeepSeek 的旧模型名 deepseek-chat 将于 2026 年 7 月 24 日弃用,新名称为 deepseek-v4-flash。我们的 llm_client.py 已更新为新名称。(来源:DeepSeek 官方文档


二、传统做法 vs AI 时代做法

传统做法:手动一家家试

想对比四家模型,传统方式是:

  1. 打开四个浏览器标签页
  2. 把同一个问题复制粘贴四遍
  3. 手动记录响应时间和输出内容
  4. 人眼对比质量

痛点: 慢、容易漏、不可复现、没法批量测。

AI 时代做法:一段代码跑四家

用我们的 llm_client.py,切换供应商只需要改一个参数:

# 同一个任务,跑四家
for provider in ["glm", "deepseek", "qwen", "openai"]:
    client = LLMClient(provider=provider)
    result = client.chat("帮我写个周报")
    print(f"{provider}: {result}")

优雅在哪:

  • 一键切换,代码不变
  • 自动计时
  • 批量任务可复现
  • Key 的自动跳过,不报错

三、三大测试任务设计

为了公平对比,我们设计三个典型办公场景任务:

任务 1:周报生成(测试生成能力)

输入: 一段工作要点
考察: 内容质量、格式稳定性、字数控制

任务 2:邮件分类(测试理解能力)

输入: 3 封待分类邮件 + 3 个示例(Few-shot
考察: 分类准确率、一致性

任务 3:JSON 信息提取(测试结构化输出)

输入: 一段非结构化文字
考察: JSON 格式是否正确、字段是否完整


四、完整代码:四家模型横评脚本

完整代码已放到 model_compare.py 文件中,需要的可以找我要。以下是主要代码逻辑:

model_compare.py(主要代码)

"""四家 LLM API 横评脚本"""
from llm_client import LLMClient

# 四家供应商
PROVIDERS = ["glm", "deepseek", "qwen", "openai"]

def init_clients():
    """初始化所有已配置 Key 的客户端,跳过未配置的"""
    clients = {}
    for provider in PROVIDERS:
        try:
            clients[provider] = LLMClient(provider=provider)
        except ValueError:
            pass  # 未配置 Key 自动跳过
    return clients

# 三大测试任务
def task1_summary(client, provider_name):
    """任务1:周报生成(测试生成能力)"""
    result = client.chat("工作要点...", system_prompt="写简洁周报...", temperature=0.3)
    return {"task": "周报生成", "provider": provider_name, "content": result}

def task2_classify(client, provider_name):
    """任务2:邮件分类(测试理解能力,Few-shot)"""
    # 3个分类示例 + 3封测试邮件,调用 client.chat() 进行分类
    result = client.chat("分类示例 + 测试邮件...", temperature=0)
    return {"task": "邮件分类", "provider": provider_name, "content": result}

def task3_json(client, provider_name):
    """任务3:JSON提取(测试结构化输出)"""
    result = client.chat_json("张三,手机号13800138000...", temperature=0.1)
    return {"task": "JSON提取", "provider": provider_name, "content": result}

def main():
    """主流程:遍历四家模型,依次执行三个任务,汇总结果"""
    clients = init_clients()
    tasks = [task1_summary, task2_classify, task3_json]
    
    for task_func in tasks:
        for provider, client in clients.items():
            result = task_func(client, provider)
            # 输出耗时、长度、内容...
    
    # 打印横评汇总表...

if __name__ == "__main__":
    main()

运行方式

# 确保已配置 .env(至少有 GLM_API_KEY)
python model_compare.py

预期输出(仅 GLM 时的效果)

============================================================
四家 LLM API 横评
============================================================

初始化客户端:
  ✅ GLM-4.7-Flash 就绪
  ⏭️ DeepSeek V4-Flash 跳过(未配置 Key)
  ⏭️ Qwen-Plus 跳过(未配置 Key)
  ⏭️ GPT-4o-mini 跳过(未配置 Key)

共 1 家模型就绪,开始测试

============================================================
  任务1:周报生成
============================================================

--- GLM-4.7-Flash ---
  ⏱️ 耗时:1.23s
  📏 长度:287字
  📝 内容:
     ## 本周完成
     - 订单模块重构:优化接口逻辑,响应速度提升约40%
     - 修复12个bug(严重级3个,一般级9个)
     - 数据库查询优化,慢查询减少60%
     ...

============================================================
  任务2:邮件分类
============================================================

--- GLM-4.7-Flash ---
  ⏱️ 耗时:2.15s
  📏 长度:3封
  📝 内容:
     [售前咨询] 你们的价格能优惠吗
     [售后咨询] 发票怎么开
     [技术投诉] 系统又崩了

============================================================
  任务3:JSON提取
============================================================

--- GLM-4.7-Flash ---
  ⏱️ 耗时:0.87s
  📏 长度:89字
  📝 内容:
     ✅ 合法JSON
     {"name": "张三", "phone": "13800138000", "email": "zhangsan@meiyada.com", "company": "梅雅达公司"}

============================================================
  📊 横评汇总
============================================================

任务           模型                 耗时       长度
-------------------------------------------------------
周报生成       GLM-4.7-Flash        1.23s      287字
邮件分类       GLM-4.7-Flash        2.15s      3封
JSON提取       GLM-4.7-Flash        0.87s      89字

注意: 实际耗时和输出内容每次可能略有不同。如果你配置了多家的 Key,会看到四家并排对比的效果。

如果想测其他家?

.env 文件中添加对应的 Key 即可:

# 已有
GLM_API_KEY=你的智谱Key

# 可选:添加其他家
DEEPSEEK_API_KEY=你的DeepSeekKey
DASHSCOPE_API_KEY=你的通义千问Key
OPENAI_API_KEY=你的OpenAIKey

添加后重新运行 model_compare.py,脚本会自动检测并测试所有已配置的模型。


五、选型建议:你的场景该用谁?

场景一:跟这个专栏学习

推荐:GLM-4.7-Flash

理由很简单——永久免费。200K 上下文够用,128K 输出空间充足,中文能力优秀。整个专栏 18 篇跑下来一分钱不花。

💡 外部背书: 2026 世界人工智能大会上,巴西科学院院士博姆接受央视采访时专门点赞中国开源大模型,透露自己正在测试智谱 GLM。连算力受限国家的科学家都开始关注,说明国产开源模型确实站住了。

场景二:公司有阿里云生态

推荐:Qwen-Plus

如果你的公司已经用了阿里云,通义千问跟阿里云的 OSS、RDS、函数计算等整合更好。但注意免费额度只有 90 天。

场景三:需要处理超长文档

推荐:DeepSeek V4-Flash

1M 上下文是四家里最长的。一本书扔进去都行。价格也便宜——缓存命中时百万 Token 只要 0.02 元。但免费额度只有 100 万 Token,跑几次长文本就用完了。

场景四:英文为主的工作场景

推荐:GPT-4o-mini

英文理解能力略强于国产模型。但需要翻墙 + 海外信用卡,门槛最高。如果不是必须用 OpenAIGLM-4.7-Flash 的英文能力也够日常用。

最终建议

你的情况 推荐 理由
零成本学习 GLM-4.7-Flash 永久免费,质量够用
商用低成本 GLM-4.7-Flash + DeepSeek 备用 GLM 免费,DeepSeek 兜底
企业级 Qwen-Plus / DeepSeek V4-Pro 生态整合 + SLA 保障
海外业务 GPT-4o-mini 英文场景 + 国际兼容性

一句话总结: 对 95% 的个人开发者和中小团队来说,GLM-4.7-Flash 免费且够用。只有当你确实遇到了 GLM 处理不了的复杂场景,才需要考虑付费替代方案——而且那时候你已经知道该花多少钱了。


📊 本篇成本透明栏

项目 数值
API 调用次数 约 7 次(仅 GLM:3任务×约2次)
消耗 Token 约 8,000 tokens
成本 ¥0(GLM-4.7-Flash 永久免费)
免费额度是否够 ✅ 够用
商用估算 ¥0(GLM)/ 约¥0.02(DeepSeek)/ 约¥0.03(Qwen)

练手改造题

改造 1(基础): 在横评脚本中加一个"翻译任务"——同一段中文翻译成英文,对比四家模型的翻译质量。

提示:新增 task4_translate() 函数,用 client.chat() 调用。

改造 2(进阶): 给横评脚本加一个"准确率评分"功能——对邮件分类任务,预设正确答案,自动计算每家模型的准确率。

提示:定义 correct_answers = {"你们的价格能优惠吗": "售前咨询", ...},对比 AI 输出计算准确率。

改造 3(挑战): 写一个"成本估算器"——输入一段文本和预计调用次数,估算四家模型分别花多少钱。用 GLM 的 Token 计数方式近似估算。

提示:中文大约 1 字 ≈ 1.5 Token,英文大约 4 字符 ≈ 1 Token。


下期预告

Day 05 · 让 AI 输出结构化数据

横评跑完了,你发现 JSON 提取那步最关键。Day 05 深入讲怎么让 AI 稳定输出结构化数据——JSON、表格、固定格式——这是后面 15 篇办公自动化代码的地基。讲完这篇,AI 就不会"偶尔给你一段散文"了。


📚 资源与工具(文末合规集中)

数据说明: 本篇价格数据采集于 2026 年 7 月 19 日,各平台可能随时调整定价策略。实际使用请以各平台官方定价页面为准。


🍃 作者的话

梅雅达编程笔记,专注 Python + AI 办公自动化实战教程。

横评的意义不是"分个高下",而是让你知道什么场景用什么模型。GLM-4.7-Flash 永久免费这个优势太大了——对学习和轻量商用来说,它就是当前性价比最高的选择。

但如果你做的是企业级项目,DeepSeek 的 1M 上下文和 Qwen 的阿里云生态整合也有不可替代的价值。工具没有最好,只有最合适。

下一篇 Day 05,我们深入结构化输出——让 AI 不再"偶尔给你一段散文",而是每次都老老实实吐 JSON 🍃


往期回顾

Day 01 · 为什么 2026 年办公自动化得“AI 化“了

Day 02 · 环境搭建:一套装备打天下

Day 03 · Prompt 工程 5 大心法

下一篇: Day 05 · 让 AI 输出结构化数据

专栏订阅:AI 时代的 Python 办公自动化

姊妹专栏:

  • Python 零基础入门
  • 编程启蒙-Scratch转Python
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐