DeepSeek V4 Pro 涨价后实测:5 场景 vs Kimi K3,能力各有胜负,账单 12 元 vs 180 元
前言
8.13 号凌晨 DeepSeek V4 Pro 正式版发布的消息在几个技术群里传开了,去官网 API 开放平台果然看到了 DeepSeek-V4-Pro-0813 版本。
还是非常兴奋的,梁叔叔终于定义下来了什么是"八月月初",各个评分也是直逼 Fable 5。
尤其是 Terminal Bench 2.1 能力评分达到 87.9,Deep SWE 能力评分达到了 62.7。
博主第一时间就把模型接入了 Codex,并和 Kimi K3 一起做了个对比。
8 月 17 日峰谷定价生效,DeepSeek V4 Pro 高峰输出 6→27 元/百万 token;5 场景实测 vs Kimi K3:能力各有胜负,账单 12 元 vs 180 元(按官方价折算)
一、DeepSeek 涨价到底涨了多少

8 月 13 日 DeepSeek V4 Pro 正式版(0813)上线,价格暂时与预览版一致;
同时官方公布 8 月 17 日生效的峰谷定价。单位:元/百万 token(人民币,官方按量价)。
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| V4 Pro(8-13 上线,现价) | 0.025 | 3 | 6 |
| V4 Pro 峰谷·空闲时段(8-17 起) | 0.15 | 4.5 | 13.5 |
| V4 Pro 峰谷·高峰时段(8-17 起) | 0.30 | 9 | 27(现行价 4.5 倍) |
| Kimi K3(官方按量价) | 2 | 20 | 100 |
- Kimi K3 输出价是 V4 Pro 的 16.7 倍(100 vs 6),缓存命中输入贵 80 倍(2 vs 0.025)
- V4 Pro 自身涨幅:输出 6→27 元(4.5 倍)、缓存命中输入 0.025→0.30(12 倍)
二、DeepSeek V4 Pro 0813 主要更新
正式版 DeepSeek V4 Pro 极大增强了 Agent 能力
DeepSeek API 现已原生支持 OpenAI Responses API 格式,适配了 Codex
随着 DeepSeek V4 全系列模型正式版上线,API 价格进行了上涨

三、场景实测

3.1 解释 AI Agent 和 AI ChatBot
提示词
你是一名经验丰富的 AI 技术顾问。
请回答下面的问题:
为什么 AI Agent 不只是"更聪明的聊天机器人"?
请从以下三个方面进行解释:
1. 工作方式
2. 工具调用
3. 自主执行
要求:
- 面向没有 AI 技术背景的普通读者
- 不要堆砌专业术语
- 每个概念都给出一个简单例子
- 最后用一个现实生活中的类比总结 Chatbot 和 Agent 的区别
- 控制在 800 字以内
生成结果
DeepSeek V4 Pro 和 Kimi K3 都明确指出了 AI Agent 智能体和 AI ChatBot 聊天机器人的区别,并用生活中的类比形象地说明了 AI Agent 更像是私人助理。
相较于 AI ChatBot 只会一问一答的形式,AI Agent 可以帮助你去做事情。
同样是问北京三日游旅行计划:
- AI ChatBot 会回答旅行安排,包括景点推荐、穿衣建议、推荐打卡地、小吃街等
- AI Agent 可以去查地图、查天气、安排行程、订机票、购买景点票、订宾馆等

3.2 商务达人建联工作台
基于电商企业商务达人建联场景,设计并实现一款达人建联工作台产品。包含达人寻源、建联、沟通、议价、合作、关怀整个达人生命周期。
提示词
你是一名资深互联网产品经理、UI/UX设计师和前端工程师。
请根据下面的业务需求,设计并实现一个"达人商务建联工作台"的 Web 产品。
【产品背景】
一家电商品牌需要与大量内容创作者/KOL/KOC 建立合作关系。
目前商务团队主要通过 Excel、微信、飞书等工具管理达人,存在达人信息分散、
达人寻源效率低、建联状态难跟踪、报价记录混乱、合作后缺少持续维护等问题。
现在需要设计一个统一的"达人商务建联工作台"。
【核心业务流程】
达人寻源 → 达人筛选 → 达人建联 → 商务沟通 → 达人议价 →
合作确认 → 合作跟进 → 达人关怀 → 长期维护
【核心模块】
1. 达人寻源(列表、搜索、多条件筛选、排序、标签、粉丝数、互动率、平均播放、内容垂类、地域、报价、评级、合作状态)
2. 达人建联(详情、建联状态、商务沟通时间线、历史记录、待办、下一步行动建议)
3. 达人议价(报价、品牌预算、历史合作价格、同类型参考、AI议价建议、AI生成议价话术)
4. 商务跟进(今日待办、待回复、待报价、待确认、即将超期、跟进时间线)
5. 达人关怀(生命周期、合作次数、最近合作时间、关系健康度、高价值达人、AI关怀建议、AI生成关怀话术)
【UI/UX要求】
- 整体视觉达到成熟商业 SaaS 产品水平
- 信息密度适中,强调数据层级和业务状态
- 页面具有明显的信息架构
- 支持响应式布局,使用统一的设计系统
- 不要做成简单的后台管理模板
- 不要大量使用渐变、炫酷动画或装饰性元素
- 优先保证实际业务可用性
【技术要求】
- React + TypeScript
- 使用 Mock 数据模拟业务数据
- 所有主要页面和交互都应该可以演示
- 不要为了简化任务只实现一个页面
请直接开始实现。
完成后说明:项目结构、已实现页面、核心交互、尚未实现的功能、如何运行项目。
生成结果
1. 工作台
(1)业务是否闭环
- DeepSeek V4 Pro 达人建联业务未闭环,缺少达人建联状态流转的功能,无法维护达人完整的生命周期
- Kimi K3 达人寻源待办任务,可以通过推进阶段功能,变更待建联/已建联/沟通中/议价中/已确认/合作中/已完结状态,完成达人建联的基本生命周期
(2)UI 风格
- DeepSeek V4 Pro 更符合现阶段的产品设计,浅色风格紫色主题色。有个问题是达人 Icon 没有设计头像,采用了随机的背景色,有点视觉污染
- Kimi K3 生成的 UI 风格和布局都偏向于传统的 web 页面风格

2. 达人库
(1)达人列表
- DeepSeek V4 Pro 设计了列表和卡片模式两种展示风格,添加达人设计了 AI 智能推荐达人功能
- Kimi K3 设计了手动录入达人,粉丝数和报价两个核心指标采用了 Slider 滑块组件做筛选,用户体验更友好
在当下企业 AI 推广落地的大背景下,DeepSeek V4 Pro 的产品设计更符合应用场景。
(2)达人详情
- DeepSeek V4 Pro 将达人概览信息单独抽出 1 个 Tab 页签,沟通时间线、报价记录、待办与建议等信息做成了 3 个独立的 Tab 页签。缺点是想查看这些信息时,用户路径深了一层
- Kimi K3 设计了 Steps 步骤条,非常直观地展示了当前达人的生命周期阶段。推进阶段功能很好地闭环了一个达人的生命周期。沟通时间线、合作记录、待办与建议、达人资料按比例左右分块布局,可以在 1 个页面内看到所有信息


3. 议价管理
DeepSeek V4 Pro 和 Kimi K3 功能都没问题。
- DeepSeek V4 Pro 的页面风格还是有较重的 AI 味的,But…
- Kimi K3 你作为资深互联网前端工程师,对工作台产品有什么误解吗,设计的款式这么老

4. 达人关怀
这是一个简单的达人列表,给达人分别打上生命周期流失预警标签,针对达人信息和预警标签,AI 给出关怀建议。
- DeepSeek V4 Pro 满足功能,AI 关怀建议和关怀话术都是用户主动点击生成才会生成
- Kimi K3 的 AI 关键建议是自动生成的,仅关怀话术需要用户主动点击生成。另外,Kimi K3 设计了个高价值达人模块,你在达人关怀功能下设计这个模块是做什么用的,我将辞职专心研究这个问题

3.3 AI 产品 Landing Page
指定做一款前端高质量网页,不是传统的后台管理风格,而是有设计感的网站主页。
提示词
请使用 React + TypeScript 创建一个高质量的 AI 产品 Landing Page。
主题:"AI Agent Future"
视觉风格:
- 深色科技感
- 极简
- 高级
- 不要使用传统后台管理风格
核心视觉:
1. 全屏粒子星空背景
2. 粒子之间根据距离自动连线
3. 鼠标移动时产生粒子吸引效果
4. 页面中心展示一个动态 AI Core
5. AI Core 周围有缓慢运动的粒子
6. 滚动页面时产生视差效果
7. 标题和核心元素具有自然的入场动画
要求:
- React + TypeScript
- 使用 Canvas/WebGL 等合适技术实现
- 页面可以直接运行
- 不使用静态图片模拟动态效果
- 注意性能
- 桌面端优先,同时兼容移动端
- 不要只实现一个静态 Demo
生成结果
DeepSeek V4 Pro
页面结构:Hero → Features(能力卡片带鼠标跟随高光)→ How it works(3 步流程)→ Console(打字机式 Agent 运行演示)→ CTA → Footer
技术栈:React 18 + TypeScript + Vite 6,Canvas/CSS/SVG 实时渲染
性能优化:requestAnimationFrame 帧循环、DPR 上限、visibilitychange 暂停、prefers-reduced-motion 降级为静态、粗指针设备自动降档
Kimi K3
页面结构:Hero → Features(能力卡片无鼠标跟随高光)→ Footer
技术栈:React 18 + TypeScript + Vite 6,Canvas/CSS/SVG 实时渲染
性能优化:滚动视差(星空分层位移 + 核心与文案反向位移,rAF 节流),IntersectionObserver 驱动的 stagger 入场动画(支持 prefers-reduced-motion 降级)



综合看下来,DeepSeek V4 Pro 的全屏粒子星空背景、粒子跟随鼠标效果做得较好。相较 Kimi K3,落地页内容更丰富。
Kimi K3 把这个简单的需求做得过分简单了,内容做得很少,只有功能卡片、指标数据和开始使用模块。
DeepSeek V4 Pro 做了 How it works 模块,通过三步工作流介绍怎么使用这个产品。
DeepSeek V4 Pro 做了 Watch an agent work 模块,通过 console 面板加打字机效果演示 Agent 是如何工作的。


3.4 Astron Agent 项目工程理解力
基于 astron-agent 开源项目指定版本 v1.1.0,DeepSeek V4 Pro 和 Kimi K3 分别独立分析项目说明文档,分析项目架构,按要求输出自己的理解。
说明:星辰 Agent 是一个企业级、商业友好的 Agentic Workflow 开发平台,融合了 AI 工作流编排、模型管理、AI 与 MCP 工具集、RPA 自动化和团队空间等特性。平台支持高可用部署,帮助企业快速构建可规模化落地的智能体应用,打造面向未来的 AI 基座。
地址:https://github.com/iflytek/astron-agent/tree/release/v1.1.0
提示词(第一轮)
你现在位于一个开源项目的工作目录。
请不要假设你已经了解这个项目,请通过查看当前工作目录中的文件和代码,自主建立对项目的理解。
请完成以下任务:
1. 分析项目整体目录结构,说明主要模块分别负责什么。
2. 找出项目的核心启动入口,并说明从启动到核心业务执行的大致调用链路。
3. 分析项目的核心技术栈。
4. 找出项目中最核心的 3~5 个模块,并说明它们之间的依赖关系。
5. 分析项目的 Agent / Workflow 核心执行流程。
6. 找出与 LLM、Tool、MCP 或 Agent 执行相关的关键代码位置。
7. 如果项目包含前端、后端、基础设施等多个部分,请分别说明其职责。
8. 最后用一张简化的架构图总结整个项目。
要求:
- 所有结论必须基于当前项目中的实际文件和代码。
- 必须先阅读项目,再进行分析。
- 不要凭项目名称或常识猜测。
- 对无法确认的信息明确标注"无法从当前代码确认"。
- 回答时尽量引用具体的文件路径和关键类/函数。
- 不要修改项目中的任何文件。
- 本轮任务只进行项目分析,不执行代码修改。
生成结果
基于 Astron 项目模块说明,结合以下 DeepSeek V4 Pro 和 Kimi K3 生成的目录模块与架构图,可以看出两个模型的分析风格不太一样:DeepSeek V4 Pro 颗粒度更细、细节更多;Kimi K3 更侧重宏观结构、重点突出。
Kimi K3 做到了「看懂目录结构并抓住核心」;DeepSeek V4 Pro 做到了「钻到代码里、把类名端口协议都扒出来」。
| Kimi K3 | DeepSeek V4 Pro | 差距 | |
|---|---|---|---|
| 信息密度 | 中等,重点突出 | 高,接近代码级 | DeepSeek 更细 |
| 技术颗粒度 | 到「模块+技术栈」 | 到「类名/端口号/协议/环境变量」 | DeepSeek 深 1-2 层 |
| 架构准确性 | 宏观正确,部分连线存疑 | 宏观正确,连线关系更完整 | DeepSeek 更可信 |
| 批判性思维 | 纯罗列,无质疑 | 对 memory/database 提出「存疑项」 | DeepSeek 有分析意识 |
| 可视化规范 | 4 层简化图,清晰 | 6 层架构图,协议/端口全标注 | DeepSeek 更详细 |
Astron 项目模块说明(官方文档)
通过 Astron Agent 项目模块说明我们知道,项目主要职责模块如下:
Astron Agent 项目模块说明文档地址: https://github.com/iflytek/astron-agent/blob/release/v1.1.0/docs/zh/PROJECT_MODULES.md
-
Console Frontend(控制台前端)
-
Console Backend(控制台后端层)
-
Agent Service(智能体服务)
-
Workflow Service(工作流服务)
-
Knowledge Service(知识库服务)
-
Memory DB Service(内存数据库服务)
-
Tenant Service(租户服务)
-
Plugin: AI Tools(AI 工具插件)
-
Plugin: RPA(RPA 插件)
-
Plugin: Link(链接插件)
-
Common Module(公共模块)
DeepSeek V4 Pro 输出 Astron 架构图

Kimi K3 输出 Astron 架构图

提示词(第二轮)
基于你刚才对当前项目的分析,请不要重新泛泛介绍项目。
现在回答以下问题:
1. 用户提交一个 Agent/Workflow 请求后,系统从哪个入口开始处理?
2. 请求经过哪些核心模块?
3. LLM 调用发生在哪里?
4. Tool / MCP 调用由哪个模块负责?
5. 如果一个 Tool 执行失败,项目中是否存在重试、异常处理或状态恢复机制?
6. Agent 执行完成后,结果最终通过什么路径返回给用户?
请针对每一个问题:
- 给出具体文件路径
- 给出类名/函数名
- 用简短语言解释调用关系
- 如果无法确认,请明确说明
DeepSeek V4 Pro 和 Kimi K3 都较好地回答了以上问题,并基于实际文件找到了关键代码,梳理出了 Agent/Workflow 请求的完整流程。
DeepSeek V4 Pro 针对每个问题都把 Agent 和 Workflow 两种方式的请求链路回答了出来,并且额外标注了当前代码仓库文件无法确认的内容,比如外部依赖的 MCP 具体实现。
Kimi K3 仅第一个问题回答了 Agent 和 Workflow 两种方式请求入口,后续问题仅以 Workflow 为例回答了工作流场景下的调用链、实际方法、失败异常处理机制等问题。


提示词(第三轮)
假设我是一个没有接触过 Astron Agent 的普通开发者。
请不要使用过多专业术语。
用 500 字以内告诉我:
1. Astron Agent 是干什么的?
2. 它解决了什么问题?
3. 它大概是怎么工作的?
4. 如果我是 Java/Python 开发者,什么时候可能会需要它?
最后用一句话总结:
"如果把 Astron Agent 比作一个现实中的东西,它更像什么?"
DeepSeek V4 Pro 一句话总结 Astron Agent如果把 Astron Agent 比作现实中的东西,它更像一家“AI 机器人装配工厂”——你选好零件(模型、工具、知识库),设计好流水线,它就能源源不断地产出会干活的智能助手。
Kimi K3 一句话总结 Astron Agent一句话总结:如果把 Astron Agent 比作现实中的东西,它更像一条智能流水线工厂——你画好工序图,大模型是厂里的工人,工具和 RPA 是机器手臂,原料(用户问题)进去,成品(答案和已办好的事)出来。
3.5 回合制自动战斗小游戏
提示词
请使用 React + TypeScript 创建一个完整可玩的"AI Agent Battle"网页小游戏。
游戏设定:两个 AI Agent 在竞技场中自动战斗。
每个 Agent 拥有:HP、能量、攻击、防御、暴击率
技能:普通攻击、强力攻击、防御、治疗
游戏规则:
1. 双方自动轮流行动
2. 根据当前状态选择不同技能
3. HP 降到 0 时游戏结束
4. 每个回合显示行动日志
5. 显示血条、能量条和技能状态
6. 支持重新开始
7. 支持暂停/继续
UI:
- 像素游戏风格
- 动态战斗动画
- 技能释放效果
- 伤害数字飘字
- 血条动画
- 战斗日志滚动
- 游戏结束动画
要求:
- 完整可运行
- 不需要后端
- 使用前端状态管理实现游戏逻辑
- 不要使用静态图片假装动画
- 保证游戏逻辑真实可玩
生成结果
-
DeepSeek V4 Pro:设定了两个 Agent(
ALPHA-7均衡型 /OMEGA-9高攻高暴击型)自动轮流行动。包含属性系统、技能系统、能量经济系统。UI 方面不是传统的像素风格,更接近现在的审美。技能爆发效果、受到伤害闪光实现效果相较 Kimi K3 更好些。 -
Kimi K3:实现了竞技场、游戏结束遮罩、屏幕震动。游戏引擎包括纯函数逻辑,含 AI 决策、伤害结算、事件与日志。UI 方面还是有点太复古了。像素风也没必要这么复古吧。


四、横向对比总结
| 测试场景 | DeepSeek V4 Pro | Kimi K3 | 结论 |
|---|---|---|---|
| 概念解释(Agent vs ChatBot) | 清晰,类比到位 | 也讲清楚了 | 持平 |
| 商务达人建联工作台 | 产品设计更现代,AI 功能更多 | 业务闭环更好,考虑更周全 | 各有优劣 |
| AI 产品 Landing Page | 内容更丰富 | 偏简洁,该有的都有 | DeepSeek 略优 |
| Astron 架构分析 | 细节多,颗粒度细 | 宏观准确,重点突出 | Kimi 更稳 |
| 小游戏开发 | 视觉效果好 | 功能完整,风格偏复古 | 各有千秋 |
先说结论:Kimi K3 仍然是目前最好的开源模型,综合能力很能打。DeepSeek V4 Pro 在某些场景下细节更多、颗粒度更细,但整体差距没有跑分看起来那么大。V4 Pro 的核心优势还是便宜,不过这次正式版涨价之后,性价比优势也在缩小。
测完这一圈,说几句实在话。
Kimi K3 仍然是目前最好的开源模型,没有之一。综合能力很稳,大部分场景都够用,架构分析宏观准确、重点突出,不是那种花架子模型。
DeepSeek V4 Pro 的提升也是实打实的,在 Landing Page、架构分析这些场景下,输出的细节更多、颗粒度更细。两者的差距没有跑分看起来那么大,很多时候是风格差异,不是能力差异。
V4 Pro 最大的优势其实还是便宜。在涨价之前,性价比非常高。但这次正式版上线价格上调之后,这个优势也在缩小。梁叔叔在梁子滑动变阻器上疯狂试探。
接下来打算把两个模型都留在 Codex 里混用一段时间,看看真实开发场景下的长期表现。
参考链接:
-
DeepSeek 开放平台:https://platform.deepseek.com/
-
Astron Agent GitHub:https://github.com/iflytek/astron-agent/tree/release/v1.1.0
-
Astron 项目模块说明:https://github.com/iflytek/astron-agent/blob/release/v1.1.0/docs/zh/PROJECT_MODULES.md
如果本文对你有帮助,欢迎点赞、收藏、转发!有任何问题欢迎在评论区留言交流。
niaonao · Building Executable AI
更多推荐




所有评论(0)