阿里开源 Qwen3.8-Max:2.4 万亿参数、百万上下文,NVIDIA GB300 NVL72 首日即可高效推理
阿里巴巴发布迄今最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数 2.4 万亿、每 token 激活 950 亿,采用细粒度 MoE 与全注意力/线性注意力混合架构,上下文窗口最长 100 万 token。据 NVIDIA 技术博客,该模型在 GB300 NVL72 上以 FP8 精度实现单 GPU 每秒超 4000 token 的首日吞吐。
据 NVIDIA 技术博客介绍,阿里巴巴已开放 Qwen3.8-2.4T-A95B(称 Qwen3.8-Max)的模型权重,这是其最大的开源权重模型,官方称将接近前沿的能力带入开源生态。模型总参数达 2.4 万亿,每个 token 激活 950 亿参数,面向高要求的推理与智能体工作负载。
架构上,该模型采用细粒度混合专家(MoE)设计,并将全注意力与线性注意力交替混合:全注意力层中每个 token 关注所有 token,线性注意力层则以有界的循环状态替代不断增长的 KV 缓存,使计算与内存随上下文扩展至最长 100 万 token 时保持有界,输出长度最高 128K。细粒度 MoE 将容量分散到更多小专家中,由学习到的路由器按需激活,服务成本取决于激活参数而非总参数量。
模型内置低/高/超高(low/high/xhigh)三档推理控制,开发者可按请求配置推理深度,在复杂多步推理与高吞吐文档处理之间权衡算力与推理质量。
性能方面,在 NVIDIA GB300 NVL72(单机架整合 72 块 Blackwell Ultra GPU、NVLink 域内全互连带宽 130 TB/s)上,无需额外调优即可在首日(Day 0)以 FP8 精度实现单 GPU 每秒超 4000 token 吞吐、单用户每秒超 350 token;后续 NVFP4 精度优化预计带来进一步提升。
部署路径上,NVIDIA 提供 SGLang、vLLM 与 NVIDIA Dynamo 的开源推理方案,以及可服务任意支持模型的 model-free NIM 容器;开发者可用 NeMo AutoModel 直接在 Hugging Face 检查点上做 SFT 或 LoRA 微调。权重可从 Hugging Face 或 ModelScope 下载,也可通过 DeepInfra、DigitalOcean、Fireworks AI、Modal 和 OpenRouter 的托管 API 试用。
为什么值得关注
开源生态首次触及 2.4 万亿参数量级并逼近前沿能力,但部署依赖数据中心级算力,实际影响取决于托管服务与微调生态的跟进速度。