摘要:阿里开源 Qwen3.8‑2.4T‑A95B,2.4 万亿参数 MoE 大模型实现昇腾、海光、沐曦、摩尔线程等多款国产 AI 芯片 Day‑0 适配,大幅降低全国产硬件栈私有化部署门槛。MoE 稀疏架构推理对多卡协同、高速外设 IO 提出更高要求,PCIe 交换作为整机内部算力、存储、网络的核心互联枢纽,成为国产算力方案不可忽视的硬件环节。本文从业务痛点、芯片能力、落地场景、工程约束几个维度,分析 IX9104 在 Qwen3.8‑2.4T 私有化 AI 服务项目中的应用价值。

一、行业背景:万亿 MoE 模型推动国产算力硬件栈完整落地

阿里 Qwen3.8‑2.4T‑A95B 作为开源旗舰 MoE 大模型,总参数 2.4 万亿,激活参数约 950 亿,原生支持 262K 超长上下文,面向私有知识库、Agent 业务、行业微调、离线推理等企业级场景。 本次发布最大产业变化,是权重开放的同时完成 9 款芯片原生适配,其中包含 8 款国产 AI 加速芯片,意味着政企、科研机构可以完全基于国产 NPU 构建私有化大模型服务,不再强制依赖海外 GPU 硬件栈。

MoE 混合专家架构推理存在显著硬件特征:推理过程 token 会路由至不同专家单元,多卡之间会产生大量数据交互;同时万亿级模型权重、KV 缓存、向量知识库,对高速 NVMe 存储、高速网卡并发吞吐提出严苛要求。 国产 CPU 原生 PCIe 通道数量有限,当整机内部同时挂载多块 NPU、多路高速 SSD、高速网卡时,原生通道很快成为性能瓶颈。PCIe5.0 交换芯片承担算力卡、存储、网卡之间的数据调度,直接影响 MoE 模型首 token 时延、推理吞吐、权重加载速度,是全国产推理服务器的关键中间器件。

过去高端 PCIe5.0 交换芯片长期由海外厂商垄断,在信创私有化项目中,不仅存在供货交期风险,部分项目还存在器件国产化指标硬性约束。国产 PCIe5.0 交换芯片的成熟,补齐了国产大模型部署硬件链条的重要一环。

二、IX9104 核心技术能力,匹配 MoE 大模型部署的硬件诉求

IX9104 是国产 PCIe5.0 交换芯片,104 Lane PCIe5.0,总双向带宽 1664Gbps,可灵活配置 26 组端口,支持硬件 P2P 对等传输、NTB 跨域互联,典型转发延迟约 115ns,支持工业宽温,固件与驱动全国产自研,引脚对标进口同规格 PCIe5.0 交换器件芯动科技 ...。

针对 Qwen3.8‑2.4T 这类 MoE 大模型推理,重点解决三类硬件痛点:

  1. PCIe 通道扩展,释放多 NPU 并行能力 国产主控 CPU 原生 PCIe5.0 通道数目有限,高密度推理节点下,很难同时对接多块国产 NPU 加速卡。通过 IX9104 扩展端口,单节点可以挂载多片 NPU,支撑 Qwen3.8‑2.4T 切分部署,实现张量并行,把模型专家分布在不同加速卡上完成推理计算。开启硬件 P2P 直传,NPU 之间数据交互绕过 CPU,降低 MoE 架构跨卡数据搬运带来的时延开销。

  2. 高速存储集群挂载,支撑大权重与向量库读写 Qwen3.8‑2.4T 模型权重体积庞大,私有化知识库、向量数据库会占用大量高速 NVMe 存储资源。IX9104 可扩展多路 PCIe5.0 NVMe SSD,实现模型权重快速加载、KV‑Cache 离线落盘、向量数据库高并发读写,缓解显存不足带来的 offloading 压力,提升长上下文 Agent 业务稳定性。

  3. 高速网络外设统一接入,支撑 AI 服务对外输出 单机推理节点需要对接高速网卡,对外提供 REST 推理接口,承接多用户并发访问。IX9104 实现 NPU、高速网卡之间高速数据交换,减少 CPU 中转带来的性能损耗,提升私有化大模型服务 QPS。

补充说明:IX9104 只负责 PCIe 域内数据交换,不替代 AI 加速芯片本身;模型推理性能上限依然取决于 NPU 算力、显存、软件栈算子优化水平,交换芯片解决的是整机 IO 通路瓶颈。

三、面向 Qwen3.8‑2.4T 私有化 AI 服务,四大典型应用场景

场景 1:政企信创高密度私有化推理服务器

业务需求:政务、国企内部部署 Qwen3.8‑2.4T 量化版本,搭建内部知识库问答、文档解析、行业 Agent 服务,要求整机器件满足国产化要求,数据不出本地机房。 硬件架构:国产 CPU 平台 + 多片国产 NPU 加速卡 + IX9104 PCIe5.0 交换芯片 + 多路 NVMe 向量库存储 + 高速网卡。 业务价值:解决 CPU 原生 PCIe 通道不足问题,实现多 NPU、高速存储、网卡共存;整套硬件实现互联器件国产化,满足信创项目验收指标,构建 7×24 小时稳定本地大模型推理服务。

场景 2:科研院所模型微调 + 推理混合节点

业务需求:科研团队基于 Qwen3.8‑2.4T 底座做行业二次微调,同时跑推理验证业务,同一套硬件兼顾模型迭代开发与推理服务。 硬件架构:国产服务器平台,多块国产 AI 加速卡,IX9104 扩展多路高速 SSD,用于存放海量训练数据集、模型 checkpoint 权重、测试向量库。 业务价值:无需采购两套独立硬件设备,一套整机完成算子调试、微调训练、推理压测,降低科研硬件投入;高速 IO 保障数据集读写、权重保存加载效率。

场景 3:中型分布式 Agent 推理集群柜内计算节点

业务需求:单机柜部署多台推理节点,对外提供批量 Agent 调用、私有知识库服务,不需要建设超大规模智算中心。 硬件架构:每台服务器节点板载 IX9104,完成单机内部 NPU、存储、网卡高速互联;机柜多节点上层再通过高速以太网交换机做 scale‑out 组网。 业务价值:单机内部依靠 PCIe5.0 交换实现算力与外设扩展,跨节点依靠网络横向扩容,构建轻量化全国产 MoE 推理集群,适合中等规模私有化项目。

场景 4:行业垂直大模型一体机硬件平台

业务需求:面向金融、能源、制造行业,推出预装 Qwen3.8 行业微调版本的 AI 一体机产品,交付给客户开箱即用。 硬件架构:机架式一体机,多 NPU 算力,IX9104 作为 IO 中枢,统一管理加速卡、高速存储、业务网卡。 业务价值:硬件拓扑灵活,可根据客户并发规模调整 NPU、SSD 数量;国产交换器件规避海外芯片供货波动风险,便于整机厂商批量交付行业私有化 AI 项目。

四、工程落地需要关注的约束与选型建议

  1. NUMA 拓扑规划:使用 IX9104 做端口配置时,需要做好 Root Port 分组与 NUMA 亲和性规划,MoE 推理场景下不合理拓扑会引入额外访问延迟,需要结合 BIOS、ACPI SRAT 配置调优。
  2. 软件栈协同:芯片硬件能力发挥,需要大模型推理框架、国产 NPU 驱动、PCIe 固件之间协同适配;P2P 功能需要确认国产 AI 芯片驱动完整支持。
  3. 选型区分:IX9104 定位 PCIe5.0 高密度多卡服务器场景;对于 2‑4 卡中小轻量化整机,可以优先评估 PCIe4.0 系列交换芯片,平衡 BOM 成本。
  4. 性能边界:交换芯片优化 IO 通路,但不能弥补 NPU 算力、显存、算子优化短板,MoE 模型实际吞吐上限主要取决于加速芯片本身。

五、结语

Qwen3.8‑2.4T 完成多款国产 AI 芯片原生适配,标志着万亿级 MoE 大模型全国产私有化部署从概念走向工程落地。算力芯片是系统的计算核心,而 PCIe 交换芯片作为整机内部数据枢纽,决定算力、存储、网络之间的数据流转效率。 IX9104 这类国产高端 PCIe5.0 交换芯片,补齐了国产算力硬件栈高速互联环节,在政企信创推理服务器、科研混合节点、行业 AI 一体机等场景,为 MoE 大模型私有化项目提供国产化硬件选项。未来随着更多超大参数开源模型持续涌现,国产高速互连器件会在算力系统中扮演越来越重要的角色。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐