China's open-source AI model launches consumer chatbot to claim mass  market-Xinhua

没有显卡也能跑视频理解?Qwen3.8-27B 的 CPU 推理路径正在打通

八月中旬的一个晚上,阿里巴巴把 Qwen3.8-27B 的权重挂上了 Hugging Face。五天之后,SGLang 仓库里冒出了一份编号 35492 的草稿 PR,标题写得直白:给 CPU 环境加上 torchcodec 和 ffmpeg 支持,同时拿掉 pin_memory。翻译成人话就是——有人在试图让这台 270 亿参数的视觉语言模型,在完全没有 GPU 的机器上读懂视频

这听起来像是个边缘场景,毕竟现在连 7B 的小模型大家都恨不得往显卡上塞。但恰恰是这条"无显卡路径"的存在,让 Qwen3.8-27B 从一个"需要 48GB 显存才能玩"的庞然大物,变成了可能在普通服务器、虚拟机甚至边缘网关上异步处理视频字幕、内容审核和文档解析的实用工具。

Understanding and Implementing Qwen3 From Scratch

这个模型到底什么来头

Qwen3.8-27B 属于 Qwen 3.8 系列里唯一一个把视频能力打包进开源权重的 checkpoint。Apache 2.0 协议,商业使用随便搞,没有收入门槛,也不用签额外合同。278 亿参数,64 层,隐藏维度 5120,自带独立的视觉塔。文本、图像、视频输入都是原生支持,不是后来硬塞的适配器。上下文窗口默认 262144 个 token,用 YaRN 能扩展到百万级别。

真正让部署者省心的其实是两个不太上新闻稿的架构细节。第一个是混合注意力机制——大部分层跑的是 Gated DeltaNet 线性注意力,只有四分之一的层保留完整 KV 缓存。这意味着长上下文的内存占用被砍到了传统密集模型的几分之一,262K 的窗口才有可能塞进单张消费级显卡第二个是多词元预测(MTP),检查点自带推测解码头,服务框架如果接得住,解码速度能实打实地提升。

同系列的旗舰开源版 Qwen3.8-2.4T-A95B 其实只支持文本,而托管的 Qwen3.8-Max API 是在权重之上额外加了视觉能力27B 这个尺寸是你能下载到本地、开箱即用就支持文本加图像加视频的权重,所以它的 CPU 视频路径才值得关注。

GitHub - sgl-project/sglang: SGLang is a high-performance serving framework  for large language models and multimodal models. · GitHub

GitHub - sgl-project/sglang: SGLang is a high-performance serving framework  for large language models and multimodal models. · GitHub

SGLang 那份草稿 PR 到底动了什么

PR 本身的改动范围很集中,读起来不费劲。核心就三件事。

torchcodec 被拉进了依赖——这是 PyTorch 基于 ffmpeg 的视频解码库,作用是让视频帧在主机 CPU 上完成解码和预处理。PR 把 torchcodec 锁死在 0.12.0 版本,要求搭配 torch 2.12,同时 ffmpeg 必须低于 9 版本。

pin_memory 被从多模态路径里移除。这个优化原本是为了固定主机内存缓冲区,实现到 GPU 的快速异步复制。既然目标硬件没有独立加速器,留着它反而碍事。

复现命令直接指向 Qwen/Qwen3.8-27B,通过 sglang.launch_server 在 CPU 上启动,同时打开文本加视频的输入通道。

不过先别急着兴奋——这份 PR 目前还是草稿状态,CI 全红,版本锁定也还在来回改,等待代码所有者审查。它更像是一张路线图,而不是已经能用的发布。背景是 SGLang 在 GPU 上服务 Qwen3.8-27B 已经跑通了,H200、RTX PRO 6000RTX 5090 和 DGX Spark 都有对应指南,连专门的 lmsysorg/sglang:qwen38-27b 镜像都准备好了。所以 CPU 上的文本加视频路径,才是这次真正的新鲜事。

7 Revolutionary Types of Multimodal AI: The Complete Guide to Image  Generation & Beyond | by TANVEER MUSTAFA | Towards AI

为什么 CPU 跑视频理解这件事比听起来重要

阿里巴巴从发布第一天就把 27B 定位成边缘 AI。联发科在权重上线的当天就宣布把它适配到了天玑移动芯片和 C-X1 汽车座舱里。本地部署的故事也很完整:Q4_K_M 量化后大约 17.1GB,24GB 显存的消费级显卡能装下,32GB 统一内存的 Apple Silicon Mac 也能跑。但所有这些场景都有一个共同盲区——没有 GPU 的机器怎么处理视频。

这份 PR 要填的正是这个坑。一条 CPU 文本加视频路径意味着视频理解可以部署在纯 CPU 设备上:虚拟机、小型服务器、机架里的老机器、边缘网关。这些场景里工作负载通常是异步的,吞吐量比延迟敏感得多。给视频打字幕、做内容审核、解析文档和图表对录好的视频做离线检索——这些批处理任务不需要 GPU 的实时交互,但以前任何带视频输入能力的视觉语言模型都默认绑死显卡。

说实话,270 亿参数在 CPU 上不可能快。配 AVX 指令集的服务器,上下文里塞了视频帧的情况下,token 生成速度大概是个位数每秒。适合夜间批处理,不适合对着视频聊天。CPU 路径的价值不在于速度,而在于"能跑"这个事实本身——无 GPU 部署可以运行同一模型的视频模式,不用降级到更小的视觉模型,也不用把每一帧都发到云端。

Multi-modal AI pipeline — Ray 2.57.0

AI for Video Understanding:NSFW moderation and Summarization

现在能在哪里跑这个模型

生态跟进的速度很快。自托管这边,llama.cpp 和 LM Studio 有低至约 10.7GB 的 2-bit 量化 GGUF 包Ollama 一行命令就能拉起来;vLLM 和 SGLang 负责正式的服务部署。不过目前这些大多只支持文本或图像,CPU 上的视频处理路径还在搭。

不想自己折腾硬件的话,托管路线已经通了。OrcaRouter 提供 qwen/qwen3.8-27b 的接口,支持文本、图像视频输入,262144 token 的上下文,输出纯文本。输入每百万 token 0.33 美元,输出每百万 2.40 美元。接口是 OpenAI 兼容的,一个 API key 搞定,不用另签合同。自动故障转移和路由 DSL 对这个 key 下的两百多个模型都生效。一个刚发布五天、CPU 路径还没验证的模型,其实最适合放在路由后面试——你可以在真实负载上试用 Qwen3.8-27B,不用把整个调用链路押在单一服务栈上,自托管和托管版本之间切换也不用改代码。

这些数字先当作方向看,别当定论

下面所有成绩都来自阿里巴巴自己的模型卡和发布材料。模型才出来五天,独立复现刚开始冒头,所以先带着审慎的眼光读

SWE-bench Pro 61.7 分(阿里自报;同一表格里 Claude Opus 4.6 Max 是 53.4)。Terminal-Bench 2.1 拿了 73.0,OSWorld-Verified 84.3,AndroidWorld 81.9,DeepSWE 1.1 42.2——大概是之前开源 27B 模型 13.3 分的三倍。

视觉这边,VideoMME 视频理解 87.0,MathVision 无工具视觉推理 90.0。Artificial Analysis 的初步评测给它在智能指数上打了 52 分,代理指数 51 分,特定推理设置下能跟规模大得多的闭源模型掰手腕但这些都是早期分数,等更多第三方跑完再下结论不迟。

本地和 CPU 部署必须留意的坑

Qwen3.8-27B 默认开启思考模式,支持按请求调节 reasoning_effort,可选 low、medium、xhigh。默认的 xhigh 会严重过度思考——社区里已经有记录,17GB 的 GGUF 首次跑一张简单图像,花了大约 21 分钟、消耗 22000 个推理 token 才出结果。尤其在 CPU 上,这个参数直接决定体验是流畅还是完全卡死。调低 reasoning_effort 可能是本地部署要做的第一件事。

接下来值得盯的三个信号

PR 35492 会不会被合并。现在还是草稿,CI 全红。只有合并后的绿色版本进正式 release,CPU 文本加视频路径对普通用户才算可用。

独立基准测试。SWE-bench Pro 的 61.7 和 VideoMME 的 87.0 都是供应商自报。接下来几周 LMArena 和 Artificial Analysis 的跑分才能看出这些数字在阿里自己的测试环境之外还剩多少。

托管版的百万 token 上下文能不能兑现。原生 262K 已经不小,但多模态模式下百万 token 的上下文才是混合注意力缓存节省真正发光的地方。

眼下选择其实不复杂。有硬件的话,17GB 的 Q4 GGUF 配合 SGLang 或 llama.cpp 今天就能跑;CPU 上的文本加视频 PR 展示了无显卡路线的方向。没有硬件的话,支持视频的开源 27B 模型本身就是 Qwen 3.8 这一代里最值得关注的 checkpoint——而且它才发布了五天。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐