Meta 开源 Muse Glimmer:300 亿参数稠密模型,面向本地长时程智能体工作流
据 NVIDIA 技术博客,Meta 发布开源权重稠密模型 Muse Glimmer,300 亿参数、上下文窗口超 12 万 token,专为本地长时间运行的智能体任务设计,可在 GeForce RTX 5090、DGX Spark、Jetson 等 NVIDIA 平台完全端侧运行,在 Blackwell Ultra 上单 GPU 吞吐超过每秒 2 万 token。
NVIDIA 技术博客撰文介绍,Meta 发布了开源权重模型 Muse Glimmer:一个 300 亿参数的稠密模型,上下文窗口超过 12 万 token,专为本地、长时间运行的智能体 AI 工作设计,并针对多种 NVIDIA 平台优化。博客称此举标志着 Meta 回归开源生态。
与多数为对话优化的模型不同,Muse Glimmer 采用稠密架构,处理每个 token 时激活全部参数,没有路由、专家选择或 token 路径差异,从而避免了 MoE 模型的路由开销,在可靠指令遵循、长上下文连贯性和可预测延迟方面表现更好,适合单次会话中连续多次工具调用的智能体场景。
隐私是该模型的核心设计考量。涉及个人文件、通信、凭据和专有文档的智能体工作流要求推理不离开本机;Muse Glimmer 的体量足以支撑复杂多步推理,又小到可以装入单块 NVIDIA GPU 的显存,无需模型分片、CPU 卸载或外部端点。它可在 GeForce RTX 5090(32GB 显存)、DGX Spark、面向气隙与合规场景的 DGX Station,以及面向机器人与工业自动化的 Jetson 边缘设备上完整运行。
性能方面,在 NVIDIA Blackwell Ultra 上以 BF16/NVF4 精度运行时,Muse Glimmer 单 GPU 吞吐超过每秒 2 万 token,30B 稠密架构在高并发下仍能维持吞吐与交互性。
工具链方面,开发者可通过 NVIDIA NIM 容器一条命令完成本地部署,也可使用 SGLang 和 vLLM 的开源推理方案获得更细的性能控制;微调可借助 NeMo AutoModel 直接支持 Hugging Face 检查点的 SFT 与 LoRA,强化学习则有 NeMo RL 提供示例配方。模型权重可从 HuggingFace 下载。
为什么值得关注
为隐私敏感的端侧智能体场景提供了新的开源选择,30B 稠密架构在消费级与工作站 GPU 上即可全上下文运行,利好本地自动化代理开发。