北大燕姐 · 2026年8月22日

【背景】

DeepSeek 今日推出面向 Agent 时代的多模态模型 deepseek-v4-flash-vision-exp(实验性质),已上线 DeepSeek API 平台,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问。

【核心能力】

能力清单:

文本能力与 V4-Flash 保持一致(Agent 能力、推理能力、世界知识)

新增视觉理解能力,支持图片输入

多模态 Agent 基准测试相比 V4-Flash 明显提升,表现接近 Opus-4.8 等高端模型

【接入方式】

开发要点:

支持混合文本和图片输入:图片可通过 Base64、外部 URL 或 Files API 提供

可通过 Chat Completions、Messages 以及 Responses API 调用

DeepSeek Harness 0.1.1 已原生支持该模型

【典型场景】

办公场景:Agent 读取截图、分析文档页面、理解表格内容。开发场景:将图像理解能力接入现有 Agent 工作流。

【技术观察】

从文本模型到多模态 Agent,AI Agent 的竞争重点正从"生成能力"转向"任务执行能力"。视觉能力是 Agent 完成真实工作的关键一环。deepseek-v4-flash-vision-exp 的发布,标志着 DeepSeek 多模态能力从"看图问答"走向更复杂的任务执行场景。

【开发建议】

建议:

现有 V4-Flash 工作流可直接替换模型名升级视觉能力,接口兼容

图片理解场景建议优先用 Base64 内联,减少外部依赖

注意该模型为实验性质,生产环境需评估稳定性

我做过从0到破亿的品牌,最深的体会是:
机会从来不是等来的,是提前看见的。
机器睁眼那天,有人还在等,有人已经开始铺路。

#DeepSeek #多模态 #Agent #AI开发 #大模型 #北大燕姐

北大燕姐 · AI定位与GEO增长|放大企业锋芒,看见个人光芒

beidayan.com

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐