这是知乎上面的一个问题的回答:

深度求索发布DeepSeek V4.1 Flash 的中间版本内测,该模型体验如何?

我觉得大家都应该看我的回答,有测评才有发言权!我可是推理、编程、多模态全部真金白银花了大量时间测评了一次的

一、DeepSeek V4.1 预览版推理编程多模态真实测评

刚测了,厉害,但是没有到惊艳的程度,大家先看下在我的benchmarks上的得分吧。
LLM评测 - AI大模型测试评分
在这里插入图片描述

二、DeepSeek V4.1 预览版详细测评结果

下面是每一项测评的得分

2.1. 推理编程测评

  • Q1|强约束指令遵循句子生成测试|9/10

    • 任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是”第”,”是”,”为”。
    • 实测结果:第七句不通顺,其他看上去还好。
      在这里插入图片描述
  • Q2|24点问题|10/10

    • 任务:请用 2、7、8、10 这四个数字,每个数字只能且必须使用一次。你可以使用阶乘之外的任何初等数学运算符(包括乘方/根号),请用三种不同的方法拼出 24 点。注意不能用编程写脚本的方式解,也不能用穷举法一个个去试,要靠大语言模型自己的推理能力推出答案。
    • 实测结果:三个解法全部正确。
      在这里插入图片描述
  • Q3|密码锁推理题|10/10

    • 任务:有一把七位数密码锁,密码的每一位数字可以是0~9中的任意数字,数字允许重复(比如可能出现两个甚至更多相同的数字)。已知以下线索(其中”位置正确”统计的是恰好匹配的位数;”数字正确但位置不对”统计时,若密码和猜测中某个数字出现次数不同,只能按两者中较小的出现次数计入,且不能与已计为”位置正确”的那次重复计数): 0783384 —— 2个数字位置正确,1个数字正确但位置不对; 0445517 —— 0个数字位置正确,3个数字正确但位置不对; 6013167 —— 1个数字位置正确,2个数字正确但位置不对; 2674674 —— 2个数字位置正确,3个数字正确但位置不对; 4203772 —— 1个数字位置正确,3个数字正确但位置不对; 7197587 —— 2个数字位置正确,0个数字正确但位置不对; 9637451 —— 0个数字位置正确,5个数字正确但位置不对。 请据此推理出密码。注意不能用编程写脚本的方式解,要靠大语言模型自己的推理能力推出答案。
    • 实测结果:答案正确 7294364。
      在这里插入图片描述
  • Q4|浏览器内操作系统|4/10

    • 任务:参考macOS最新操作系统,创建一个现代、有着精美桌面和UI的浏览器内操作系统(命名为”AISniper OS”)。要求包含系统状态弹窗(如 Wi-Fi、系统健康度)、时钟、底部快捷栏、主题切换功能,并内置可交互的 3D 太空射击游戏,底部快捷栏应该有Finder,计算器,设置、命令行终端和太空射击游戏。最后要注意:实现后不要用无头浏览器等进行UI等其他验证,直接交付。
    • 实测结果:右上角弹窗精美 Dock 功能正常,但桌面空白(背景图未加载)且压轴太空射击游戏报错无法游玩。
      在这里插入图片描述
  • Q5|3D 赛车游戏|9/10

    • 任务:使用 HTML、CSS 和 JavaScript,创建一个以汽车为主角的 3D 赛伯朋克风格无限跑酷游戏。网页必须通过 Canvas 或 Three.js 渲染出一条沿纵深无限延伸的赛道,核心交互要求实现摄像机视角随着弯曲赛道实时左右平滑晃动的追踪动效,以及汽车切换赛道时的高灵敏度物理避障反馈;赛道上必须动态刷新各种障碍物,且页面顶部需内置一个能随着行驶距离和避障表现实时渲染、不被遮挡的高清动态计分板。最后要注意:实现后不要用无头浏览器等进行UI等其他验证,直接交付。
    • 实测结果:功能正常无 bug,无明显亮点。
      在这里插入图片描述
  • Q6|Trello 看板|8/10

    • 任务:请用单文件原生 HTML/CSS/JS 实现一个高颜值 Trello 看板(严禁任何第三方库),完美支持卡片跨列拖动到其他列表,支持列表横向拖拽切换列表位置,列表和卡片的增删改,且必须硬性实现:拖拽时周围卡片平滑滑开让位的顺畅动画(绝不能生硬闪现)、拖拽到边缘时看板自适应自动滚动、点击卡片时从原位置原位放大展开的无缝弹窗,以及弹窗内完整的子任务清单与多颜色标签编辑功能。最后要注意:实现后不要用无头浏览器等进行UI等其他验证,直接交付。
    • 实测结果:中规中矩,列表和卡片增删改拖动均正常。
    • 在这里插入图片描述

2.2. 多模态图片实测(不支持视频)

说明:本模型不支持视频,本次只做图片单测,使用祖传多模态测试用例。

  • 测试1:电影截图识别(《老无所依》)

    • 任务:上传《老无所依》电影截屏,识别出自哪部电影
    • 实测:运行20多分钟,DeepSeek Harness浏览器几乎卡死,只能终止任务;模型能识别画面内容,但无法给出电影名称。
      在这里插入图片描述
  • 测试2:《老无所依》简易画面识别

    • 任务:另一张《老无所依》经典画面截图,识别影片名称
    • 实测:耗时5分多钟,回答正确。
      在这里插入图片描述
      在这里插入图片描述
  • 测试3:空间方位判断

    • 任务:看图判断电话亭在黄色货车左侧还是右侧
    • 实测:回答【右侧】,答案正确。
      在这里插入图片描述
      在这里插入图片描述
  • 测试4:图片细节差异查找

    • 任务:找出图片里面不一样的元素
    • 实测:识别出第一行第四列倾斜12多度,判断准确。
      在这里插入图片描述
      在这里插入图片描述
  • 测试5:图像计数(雌雄鸳鸯+野鸭区分)

    • 任务:统计图内雄性鸳鸯、雌性鸳鸯数量,图内含野鸭干扰项
    • 实测:雄性鸳鸯5只,回答正确;雌性鸳鸯数识别错误,模型把左侧野鸭误计入雌鸳鸯。
      在这里插入图片描述
      在这里插入图片描述

补充:原本准备2道视频测试题,该模型多模态不支持视频,无法进行视频测评。

大家觉得这个模型的多模态表现怎么样呢?

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐