← 返回今日精选
关注开源生态68

NVIDIA 发布 FLARE 联邦多模态 AI 训练方案:LoRA 适配器把每轮通信量从 28.6GB 降至 0.094GB

NVIDIA 技术博客介绍如何用开源框架 FLARE 编排联邦多模态 AI 训练。与威廉玛丽学院合研的 FedUMM 方法在冻结的 BLIP 骨干上仅交换轻量 LoRA 适配器,实验中每轮每客户端通信量从 28.6GB 降至 0.094GB,性能接近集中式训练基线。

NVIDIA 技术博客发文介绍如何利用开源联邦学习框架 NVIDIA FLARE 构建联邦多模态 AI 工作流,解决视觉语言模型(VLM)在数据无法集中场景下的训练难题。

文章指出,联邦训练 VLM 面临两大工程问题:各站点数据与任务组合不同,需要明确客户端更新契约;全模型更新的序列化、传输和服务器内存开销巨大。FLARE 通过大对象外置化、张量流式传输和磁盘备份聚合等机制应对这些约束,同时支持参数高效和全模型两种通信模式。

由威廉玛丽学院与 NVIDIA 合作开发的 FedUMM 提供了具体范例:在冻结的 BLIP 多模态骨干上仅联邦训练轻量 LoRA 适配器。实验显示,每轮每客户端通信量从 28.6GB 降至 0.094GB,同时模型性能保持在接近集中式训练基线的水平。

FedUMM 获 NVIDIA 学术资助计划支持,并在 TheWebConf 2026 的 FL@FM 工作坊上获得杰出学生论文奖。FLARE 的 Recipe API、Tensor Downloader 和磁盘卸载模块为可扩展部署提供了经过验证的方案。

编辑部解读

为什么值得关注

在医疗等数据难以出域的行业,联邦多模态训练是落地关键。通信量降低约 300 倍且性能几乎无损,使跨机构训练大型多模态模型在工程上更加可行。