阿里突然放出Qwen3.8-Flash-Next:这不是Qwen4,却可能是2026年开源大模型圈最重要的一次“剧透“
2026年8月25日,ModelScope社区里悄悄上线了一个倒计时页面。没有发布会,没有预热通稿,阿里巴巴通义千问团队就这样把Qwen3.8-Flash-Next的权重释放时间定了下来——北京时间8月26日晚11点。这个操作本身就很反常:一款搭载全新架构的模型,居然在目标产品系列正式发布之前就提前开源了。
业内很快意识到,这不是一次常规迭代,而是一次精心设计的"生态预埋"。


先厘清一件事:它叫Qwen3.8,但身体里住的是Qwen4的骨架
很多人第一眼看到这个名字会懵。Qwen3.8-Flash-Next,听起来像是Qwen3.x家族里的又一个变体,但实际上它是一款基于Qwen4架构打造的技术验证模型。通义千问团队在Hugging Face的页面上写得明白——"Qwen4 Architecture Preview",ModelScope的倒计时标语则是"迈向下一代,闪电般快速"。
换句话说,你可以把它理解成一辆用旧车标伪装起来的新车。外壳挂着Qwen3.8的命名规则,底盘和发动机却是下一代的。阿里这么做的意图很明显:在Qwen4全系列正式登场之前,先让开源推理生态——llama.cpp、vLLM、SGLang这些框架——有足够的时间去写内核、做量化、适配服务层。等真正的Qwen4来的时候,社区已经准备好了。
这种"平台策略"而非"基准测试策略"的思路,在国产开源大模型里并不多见。

三大架构改动,每一个都在挑战现有推理框架的舒适区
Qwen3.8-Flash-Next之所以引起开发者社区的高度关注,核心在于它带来了三个此前在通义千问产品线中从未出现过的架构组件。这不是改改配置就能适配的,而是需要推理框架从内核层面重写代码。
GDN层:用固定循环状态换掉膨胀的KV缓存
传统Transformer的注意力机制有个老毛病——序列越长,键值缓存(KV Cache)越膨胀,内存占用呈二次方增长。门控Delta网络(GDN)的解决思路很直接:在大部分层里用固定大小的循环状态替代标准注意力,让内存开销和上下文长度脱钩。社区从短暂露面的ModelScope卡片里扒出的层组合数据显示,这款模型用了69层GDN配23层全注意力,比例大概三比一。全注意力层负责"精准检索",GDN层负责"批量处理",各司其职。
这其实是Gated DeltaNet架构的延续。去年9月发布的Qwen3-Next就已经小规模验证过这个路线,当时总参数量800亿、激活参数仅30亿。Flash-Next的不同之处在于规模——总参数量直接拉到了1250亿级别。
QSA:稀疏注意力到底怎么"疏",目前还是个谜
Qwen稀疏注意力(QSA)的名字出现在了官方卡片上,但具体实现方式语焉不详。社区目前的猜测集中在几个方向:学习稀疏、块稀疏、滑动窗口,或者几者的混合。它到底是一次渐进式优化还是全新的注意力范式,得等技术报告出来才能见分晓。


510亿参数的n-gram表:把草稿模型"焊"进主模型
这是最让圈内人挠头的设计。Qwen3.8-Flash-Next内置了一张510亿参数的n-gram嵌入表,社区普遍解读为一种集成的推测性解码机制。传统做法需要额外跑一个小模型来预测后续token,再用主模型验证;而这个n-gram表可以直接提供低成本的候选token,相当于把草稿模型的功能内化到了主架构里。
但这里面的未知数太多了:这张表是否必须常驻显存?量化之后表现如何?510亿是否包含在1250亿的总参数量里?在官方技术报告出来之前,这个数字更适合当作部署规划的变量,而不是固定成本。


参数迷雾:1250亿总参、60亿激活,到底什么水平?
关于Qwen3.8-Flash-Next的参数配置,目前流传最广的说法是总参数量1250亿、每token激活60亿、n-gram嵌入表510亿。这组数据源自一张曾被通义千问团队短暂展示后又撤下的ModelScope卡片,虽然多位独立观察者交叉验证过一致性,但严格来说并非官方文档。
社区里有人套用一个经验公式来估算其实际能力:sqrt(125B × 6B) ≈ 27B。意思是它的输出质量可能接近一个270亿参数的密集模型,而推理成本却接近60亿参数的小模型。Beer And Code的Lucas Souza提醒得很对——这只是一条启发式规则,不是定理。路由质量、训练数据、n-gram表的加成,这些变量都还没法量化。
SaaSCity创始人ghosty的说法更直接:"今天任何发布该模型基准图表的人,数据都是编的。"在权重真正落地、社区跑完独立评测之前,所有关于性能的断言都只能是推测。
硬件现实:你的RTX 4090,真的扛不住
聊完架构,必须直面一个残酷的问题——这玩意儿到底能不能本地跑?
先看一组粗略的权重内存估算:
-
BF16/FP16格式:约250GB
-
FP8格式:约125GB
-
Q4量化:约65-70GB
注意,这只是主权重,还没算上下文缓存、KV开销和运行时额外占用。如果那510亿的n-gram表必须常驻显存,总内存需求会进一步飙升。单张RTX 4090的24GB显存连门都摸不着,RTX 5090同样没戏。
真想本地折腾,得往两个方向找方案:一是128GB以上统一内存的设备,比如满配Mac Studio(M2 Ultra或M3 Ultra)、AMD Strix Halo,或者NVIDIA DGX Spark这类平台;二是多卡高显存GPU集群。Reddit用户u/KURD_1_STAN的吐槽很犀利——"内存价格这么高,怎么能叫本地友好?"X上的@Dicklong1999也指出,虽然稀疏激活意味着生成速度对硬件充裕的用户来说或许尚可接受,但"1250亿的体量,普通用户基本别想在本地运行"。



为什么阿里选择"提前剧透"?
把一款下一代架构的模型提前开源,这个决策背后的逻辑值得琢磨。
回顾通义千问的家族谱系,Qwen3-Next在去年9月就已经小试牛刀,用800亿总参、30亿激活的体量验证了GDN混合路线的可行性。随后的Qwen3.5/3.6/3.7系列也沿用了类似的混合模式。到了Qwen3.8这一代,产品线分出了几条并行轨道:8月刚发布的Qwen3.8-27B是密集架构的中坚力量,Qwen3.8-Max则是约2.4万亿总参的旗舰级MoE模型,而Flash-Next走的是另一条路——它不负责冲榜,不负责刷分,它的任务是替Qwen4"踩坑"。
让推理框架提前适配GDN和QSA,让量化社区摸清n-gram表的脾气,让API服务商把FP8版本跑顺——等真正的Qwen4发布时,生态已经就位。Unsloth已经宣布在争取首日支持,这种"先铺路、后通车"的策略,在开源大模型的竞争格局里算得上一步好棋。
当然,也有社区成员对这条"Next"路线持保留态度。X用户@LufzzLiz提到,去年的Qwen3-Next系列"令人失望",这正是此次需要等基准测试结果出来再下结论的原因。


开发者现在该做什么?
权重释放就在眼前,如果你正在评估这款模型是否值得接入自己的技术栈,不妨按这个思路来:
先盘一盘硬件家底。打算本地部署的话,确认设备有没有128GB以上的统一内存或者多GPU配置,达不到就直接转向API方案。Hugging Face上的模型卡会在权重发布后第一时间更新实际规格、许可证和上下文长度,值得盯紧。目前许可证虽未官宣,但参照Qwen3.8-27B和Qwen3.8-Max的先例,Apache 2.0的可能性很大。
评估流程可以提前准备起来。基准测试提示词、评测脚本在权重公布前就位,社区前24小时的实测数据往往比官方宣传更有参考价值。但千万别急着把生产 workload 切过去——没有独立基准、架构太新、运行时支持不成熟、许可证未最终确认,这四个因素叠加在一起,现阶段只适合用来研究和评估,不适合承载有经济损失风险的应用。
如果你在维护推理工具,那现在就该动手了。GDN加QSA的组合需要内核层面的开发,不是改改配置文件就能搞定的。越早理解这套架构,就能越早提供社区支持。
更多推荐



所有评论(0)