deepseek-v4为何如此火爆
一、DeepSeek-V4:中国AI的“新名片”
1.1 模型概览
2026年4月24日,在OpenAI发布GPT-5.5仅仅几个小时后,来自杭州的DeepSeek正式推出了新一代大模型——DeepSeek-V4系列,并同步开源。
此次发布包含两个版本:
| 版本 | 总参数 | 激活参数 | 定位 |
|---|---|---|---|
| V4-Pro | 1.6万亿 | 49亿 | 旗舰版,对标顶级闭源模型 |
| V4-Flash | 2840亿 | 130亿 | 性价比版,快速经济型 |
两者均原生支持100万token超长上下文(约75万字),采用开源的MIT协议。这意味着你可以一次性让AI处理整本《三体》三部曲、一个完整的代码仓库,或是一份上百页的法律合同,无需额外搭建检索增强生成(RAG)系统。
在架构上,V4实现了多项底层创新:
-
CSA+HCA混合注意力机制:通过“分级压缩+分级检索”,将1M token场景下的推理算力降至前代的27%,KV缓存降至10%
-
Muon优化器:替代传统AdamW,训练更稳更快,完美适配MoE大模型
-
mHC流形约束超连接:升级残差连接,解决深层训练数值不稳定问题
1.2 与顶流模型的对比
| 对比维度 | DeepSeek-V4-Pro | GPT-5.4 / GPT-5.5 | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 代码能力 | LiveCodeBench 93.5分,开源第一 | 91.7分 | — | 89.2分 |
| 数学推理 | HMMT 2026 Feb 95.2分 | 97.7分 | — | — |
| 知识储备 | SimpleQA 57.9分 | — | — | 75.6分(领先) |
| 长上下文 | 100万token(原生支持) | — | — | — |
| 价格(输出/百万token) | $3.48 | ~$20-60 | $25(V4的7倍) | — |
| 开源协议 | MIT(完全开源) | 闭源 | 闭源 | 闭源 |
优势领域:
-
代码生成:在Vals AI的Vibe Code Benchmark中,V4以“压倒性优势”拿下开源权重模型第一名,击败了Gemini 3.1 Pro等闭源前沿模型
-
数学与STEM:在竞赛数学、科学推理等硬核任务上,V4全面超越所有开源模型,比肩全球顶级闭源模型
-
工程化长程任务:实测显示,V4-Pro能够连续自主编程60分钟以上,无需人工干预即可完成数据库设计和安卓模拟器开发等复杂工程
短板与差距:
-
世界知识储备:在SimpleQA等事实性知识评测中,V4-Pro(57.9分)与Gemini 3.1 Pro(75.6分)差距明显
-
深度推理:在HLE高难度推理任务上,仍有约7个百分点的距离
-
多模态能力:V4目前仍是纯文本模型,在图像理解和视频生成等主流赛道上“完全缺席”
DeepSeek官方给出了颇为克制的评估:V4的知识与推理能力与最先进的前沿模型仍存在约3至6个月的差距,其中数学和STEM领域进度最快,知识和事实检索方面差距较远。
二、火爆原因与黄仁勋的“预言成真”
2.1 为什么V4如此火爆?
1. 极致性价比,打破硅谷定价霸权
V4延续了DeepSeek“价格屠夫”的传统:
-
V4-Flash:输出仅需2元/百万token(约0.28美元)
-
V4-Pro:输出为24元/百万token(约3.48美元)
对比之下,Claude Opus 4.6的价格约为25美元/百万token,V4-Pro比它便宜超过7倍,Flash版更是便宜了99%以上。用彭博社的话说,这是对中国AI“突飞猛进的实力”的又一次证明,让全球科技公司开始重新审视在AI上投入数百亿美元的合理性。
2. 开源即巅峰,开发者“用脚投票”
不同于硅谷巨头的闭源策略,DeepSeek将旗舰级V4-Pro模型通过MIT协议完全开源。Hugging Face机器学习工程师证实,V4是该平台上冲上榜首速度最快的模型。全球开发者可以自由下载、修改、商用,这极大激发了创新活力。
3. 技术硬实力,用算法效率对抗暴力算力
V4的火爆不是靠营销,而是靠实打实的工程创新。VentureBeat用“真正的架构创新”来形容V4的混合注意力机制,认为它“在不牺牲性能的前提下,极大地降低了显存需求和计算成本”。这种“四两拨千斤”的能力,让整个行业重新思考:后发者是否必须靠堆算力才能追上?
2.2 为什么引发黄仁勋关注?
一句话:DeepSeek让英伟达的“算力护城河”开始漏水。
就在V4发布前9天,英伟达CEO黄仁勋在一次播客中直言:“如果DeepSeek率先在华为平台上发布,那对我们国家来说将是灾难性的。”
这句话当时听起来像是危言耸听。但仅仅9天后,DeepSeek-V4正式发布,全面适配华为昇腾芯片,成为全球首个在国产算力底座上完成训练与推理的万亿参数级模型。
黄仁勋的“预言”精准应验。背后的逻辑很清晰:
-
英伟达的商业模式建立在“最好的模型必须跑在最好的芯片上”这一假设之上
-
如果中国公司能在国产芯片上训练出世界一流的大模型,英伟达的议价能力和市场地位将受到根本性冲击
-
更可怕的是,算力的“卡脖子”效应将大幅削弱——算法是自己的,代码是开源的,芯片是国产的,整个叙事实现了闭环
路透社敏锐地捕捉到这一点:V4引发的不仅是“模型强不强”的讨论,更是“它会把谁逼急”的拷问。美国媒体一边承认中国公司的工程效率和价格优势,一边又不愿承认“硅谷靠芯片、资本和封闭生态筑起的那道墙,已经开始松动”。
三、国内大模型发展:从“跟跑”到“并跑”的质变
3.1 这是一次系统性的突破
DeepSeek-V4的亮眼表现,绝非单一企业的偶然成功,而是中国AI大模型行业多年深耕、厚积薄发的必然结果。
中国科学院科技战略咨询研究院专家指出,这集中体现了中国AI在技术创新、算力自主、人才储备、产业协同四大维度的系统性跃升:
| 维度 | 过去 | 现在 |
|---|---|---|
| 技术路径 | 模仿跟随,堆叠参数 | 原生创新,底层架构突破(CSA、Muon等) |
| 算力基础 | 依赖英伟达GPU | 华为昇腾、寒武纪等国产芯片全面适配 |
| 人才格局 | 人才外流海外 | 全球顶尖AI人才加速回流与本土成长 |
| 产业生态 | 各自为战 | 模型+算力+场景协同发力 |
3.2 “开源”成为中国的战略优势
与硅谷巨头“筑高墙、建小楼”的闭源路线形成鲜明对比,中国几乎所有性能优异的AI模型都选择了开源。
杭州更是成为全球唯一一个同时拥有三个世界顶级开源模型的城市——DeepSeek、群核科技、阿里巴巴的通义千问,包揽了HuggingFace趋势榜单前三名。
这种开放策略正在产生深远影响:
-
全球开发者“用脚投票”:从吉隆坡到拉各斯,越来越多程序员基于中国开源模型研发产品
-
马来西亚主权AI项目已明确宣布将基于DeepSeek技术建设
-
2025年,中国开源AI模型约占全球AI使用量的三分之一,DeepSeek是使用量最多的模型
正如《纽约时报》所言:“开源是未来技术的软实力。”中国正在用开放赢得全球影响力。
3.3 体验V4
- 配置模型
mkdir -p ~/.claude && cat > ~/.claude/settings.json << 'EOF'
{
"env": {
"ANTHROPIC_BASE_URL": "https://teniuapi.online",
"ANTHROPIC_AUTH_TOKEN": "sk-xxxx",
"API_TIMEOUT_MS": "3000000",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
"ANTHROPIC_MODEL": "deepseek-v4-flash",
"ANTHROPIC_SMALL_FAST_MODEL": "deepseek-v4-flash",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "deepseek-v4-flash",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "deepseek-v4-flash",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "deepseek-v4-flash"
}
}
访问https://teniuapi.online获取令牌,通过“令牌管理”获取令牌,替换上面配置中的 ANTHROPIC_AUTH_TOKEN的值,就可以体验到deepseek-v4的魅力了!
- claude安装教程
如果还没安装claude,可以参考另外一篇博文【ClaudeCode使用教程】
更多推荐


所有评论(0)