DeepSeek视觉模型来了!
刚刚,DeepSeek 发布全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。目前已知支持通过API调用,模型 ID 是:
deepseek-v4-flash-vision-exp
在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
在视觉理解 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

定价方面,视觉模型与 deepseek-v4-flash 相同。
每百万输入 token,缓存命中为空闲时段 0.05 元、高峰时段 0.10 元;
缓存未命中为空闲 1.5 元、高峰 3 元;
每百万输出 token 为空闲 4.5 元、高峰 9 元。

图片会先按尺寸换算成 token,再与文本 token 合并计费;每张图最多计384token,多图逐张累加。
接口支持 JPEG、PNG、GIF、WebP,单张 base64 或外链图片最大 32 MiB(约33.6 MB),单次请求最多 600 张、请求体最大 48 MiB;当一次请求包含 15 张及以上图片时,单图最长边上限会从 8192 像素降至 4096 像素。
对于需要跨请求反复使用,或超过 32 MiB 内联限制的图片,DeepSeek 还同步上线了Files API。
开发者可先通过 POST /files 上传图片,再用 file_id 调用视觉模型;单个文件最大 64 MiB,单用户最多存储 25 GiB、1 万个文件,文件不会自动过期。
需要注意的是,Files API 当前只接受 JPEG、PNG、GIF 和 WebP,并与 deepseek-v4-flash-vision-exp 配合使用;文件归属于上传时使用的 API Key。
目前,只有 deepseek-v4-flash-vision-exp 接受图片。
我在 DeepSeek Harness 中选择 DeepSeek V4 Flash Vision Experimental,然后上传一张柯洁的表情包并询问「这个是啥」。

实测发现,模型能读出了图片文字和人物捂嘴的动作,解释了它通常表达的无语、不想回应等语境。已经具备基础识图、OCR 和表情包语义理解能力。

不过,尽管我继续追问图中人物是谁,它这次没有判断出是柯洁。
接着,我更换对话,询问模型最近很火的牛来模型海报,问他这是啥意思。

新模型读出了「OX IS COMING」,识别出黄色牛形角色、黑色翅膀、山崖、乌云和远处城市等元素,并联系「Winter is coming」的视觉母题,给出了牛市、牛年和《权力的游戏》梗等多种可能解释。
能结合构图与文化语境进行一些推断。

画面元素基本读对了,但是,却没有接上近期走红的动画电影《牛来》。
不过有了视觉能力,V4-Flash-Vision-Exp 现已可以在各类 Agent 框架内展现出较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。
官方示例1:在 Agent 框架下生成商业定制西藏自驾游 PPT
Prompt:帮我做个西藏攻略的ppt,藏南+藏北,一个月,自驾游,我是高端定制游,只做私人服务,和别的旅行团不一样,核心调性:野性、原始、探索感——不是常规打卡路线,是深入无人区级别的体验。视觉风格要大气、粗粝、有力量感,拒绝小清新和网红风。ppt要发送给高净值客户,要足够大气、野性、高端美观且最后给到三种真实定价方案,所有配图使用真实摄影图片风格(实拍质感)
官方示例2:对 DeepSeek Harness 官网进行二次创作

用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,经过长多轮交互后重构得到的未来主义风格开发者网站
官方示例3:制作黏土怪物风格动态特效的前端 Mini Demo
一群可爱的 3D 黏土小怪物加入一个跃动的复古舞池派对
可以预见,一双看得见的眼睛带给模型前端能力的提升,真的很大。
更多推荐


所有评论(0)