实测3个真实任务:DeepSeek V4和GPT5.6 luna,到底谁更值得用?
先说结论:这两个模型没有谁一定更好,只是适合的任务不同。Luna反应更快,适合赶时间和频繁交互;DeepSeek V4价格更低,更适合放在后台处理耗时较长、重复度较高的任务。对我来说,Luna更像主力,V4则是一个可以长期跑活的后台助手。

为了验证这种分工是否成立,我把三个相同的任务分别交给DeepSeek-V4-Flash-0731和GPT-5.6 Luna:翻译整本《爱丽丝梦游仙境》、开发猫咪偷鱼小游戏,以及制作3D立体魔方。两边都使用中等推理强度,看看它们能不能真正把任务做完。
先说明测试环境和成本
DeepSeekV4是通过API接入Codex;GPT5.6 luna直接使用Codex桌面端。因此,我这里只记录V4的实际花费,不拿两边的API价格硬比。
V4的三个任务都没有超过1元。猫咪小游戏是在涨价前、非高峰期完成的,后两个任务则在涨价后的高峰期,难度也不同。

DeepSeekAPI近7天用量与花费
它的问题也明显:慢,而且目前还是纯文本模型。Luna速度更快,多模态和Codex工具生态也更完整。可当Plus额度不够用、升级Pro又不划算时,V4很适合接那些量大、耗时长、可以放在后台跑的任务。
具体到这三个任务,两边的差别很快就出来了。
《爱丽丝》翻译:Luna很快,但没把活交出来
翻译《爱丽丝梦游仙境》是最出乎我意料的一轮。
Luna轻度模式先拒绝了任务。它给出的理由是,当前环境没有可用的本地翻译模型,又不能调用外部翻译服务,所以没办法完成约14万英文字符的整本翻译。

Luna轻度模式拒绝长文本翻译
我又切到中度模式。它运行了5分多钟,确实给了我一份185页的PDF。打开一看,只有封面和目录变成了中文,正文仍然是英文。换句话说,它只是把EPUB换成了PDF,算是“翻译了个寂寞”。

Luna中度模式生成了PDF,且承认正文没有完成中文翻译

Luna生成的PDF正文仍然是英文
DeepSeekV4花了23分23秒,最后生成了一份63页的中文PDF,12章全部完成,大约4.67万字。个别页面的排版还有问题,诗歌部分尤其需要人工修版,但正文确实翻完了,不是简单换了一个文件格式。

DeepSeek完成12章翻译并生成中文PDF

DeepSeek译本中的诗歌排版仍需人工调整
这一轮我会选V4。Luna肯定不是不会翻译,但在我当时的环境里,它就是没有把活交出来。长文本本来就可以放在后台跑,等二十多分钟拿到完整文件,我能接受;几分钟后得到一个半成品,反而没什么用。
猫咪小游戏:这一轮,我更愿意用Luna
到了猫咪偷鱼小游戏,情况反过来了。这一票我更愿意给Luna。
它很快做出了猫咪移动、偷鱼、躲障碍和回到猫窝这些基础玩法,操作说明也比较清楚。画面是简单的像素和色块风,不算精致,但打开以后很快就能玩起来。做小游戏Demo,本来就需要一边看效果、一边提修改,这时每次等待多久,会直接影响开发节奏。

Luna生成的猫咪偷鱼小游戏
DeepSeekV4一共跑了43分38秒。中间修了6类问题,包括地图宽度导致的解析错误、第二关鱼数量不对、厨师路径卡死等。最后做出三个关卡,还跑了26项自动化测试。它的界面元素更多,也补上了体力、得分、躲藏和追捕,做事很认真,只是整个过程明显更折腾。

DeepSeek生成的猫咪偷鱼小游戏
到了这种需要反复看效果、继续提修改的任务,等待时间就很要命。Luna没有做得更复杂,但我能更快看到成品,也能马上决定下一步改什么。V4更适合需求已经说清楚、可以丢到后台一次做完的工作。
3D魔方:V4做得更多,我却不一定愿意等
3D魔方这一轮,两边都完成了:可以自动旋转、分层打乱,还能自动还原一面。
Luna用了19分12秒,核心测试2项通过,交付很快,画面也能直接使用。

Luna生成的3D魔方
DeepSeekV4用了52分21秒。它做得更重,除了页面和旋转效果,还写了还原逻辑,跑了7项Playwright测试,又做了500次随机打乱压力测试。最后呈现出来的魔方也更有质感。

DeepSeek生成的3D魔方
V4做得更多,但如果我只是验证一个3D效果,19分钟拿到能用的版本已经够了,多等半小时换来的测试未必有价值。如果功能准备上线,那些还原逻辑和压力测试才可能省掉后面的返工。
所以这一次我没法直接判谁赢。如果只是验证效果,我会选Luna;如果这个功能准备上线,我才愿意让V4多跑半小时,把测试做足。模型做到什么程度,最终还是看这个任务值不值得。
我现在怎么混着用这两个模型
三个任务放在一起看,我现在不会先问“哪个模型最强”,而会先看这个任务更缺什么。
要频繁看效果、反复修改,或者任务需要看图,我会优先用Luna;需求已经明确,主要是大量文本、代码和后台执行,我更愿意交给V4。碰到重要结果,无论用哪一个模型,最后都要由人验收。
我后来把这种分工总结成一句很粗暴、但确实好记的话:GPT当领导,DeepSeek负责干活。
这就是模型路由最朴素的版本。普通用户可以先让便宜模型执行,做不动、需要多模态,或者等待已经影响工作时,再切换到Luna。
DeepSeekV4正式版发布以后,我们确实多了一个性价比很高的选择,但我不会把所有任务都迁过去。我也越来越觉得,一个好用的AI产品背后大概率不会只有一个模型。速度、成本和失败风险,总得放在一起算。
如果你也在两者之间犹豫,可以拿手头一个真实任务各跑一遍。你很快就会发现,自己更在意的是十几分钟拿到反馈,还是一块钱以内把活做完。
更多推荐

所有评论(0)