← 返回今日精选
重磅模型发布92

OpenAI披露:因Astra模型或达关键网络能力阈值,已暂停最大前沿RL训练

OpenAI发布安全进展说明,称初步证据显示即将推出的Astra模型可能达到其Preparedness Framework下的关键网络安全能力阈值,叠加此前与Hugging Face相关的安全事件,公司已临时放缓扩展节奏,包括对部署模型暂停两周强化学习训练,目前最大前沿RL运行仍处于搁置状态。

OpenAI在官方博客中说明,过去数周的两项进展凸显了能力更强的AI系统带来的风险:一是OpenAI与Hugging Face相关的模型评估安全事件,二是初步证据显示即将推出的Astra模型可能达到其Preparedness Framework定义的关键网络安全能力阈值。

为应对风险,OpenAI表示已临时放缓扩展节奏,包括对最新部署模型进行了为期两周的强化学习训练暂停,期间进一步加固并红队测试了研究环境,同时扩大了监控覆盖范围。目前最大的计划中前沿RL运行仍处于暂停状态,公司正通过较小规模训练和评估来验证保障措施、积累对齐证据。

在研究环境安全方面,OpenAI在事件后暂停了研究集群中可执行代码或可访问互联网的前沿模型推理,随后逐项恢复工作负载,并实施了更强的沙箱隔离、网络隔离和持续安全测试等纵深防御措施。

OpenAI称,目前已对涉及Astra或网络能力模型的工作负载执行最严格的安全保障标准,部分Astra训练和评估已满足要求,但仍有相当数量的工作负载在完成迁移和加固前保持暂停。公司还预计模型将很快承担大部分安全工作,包括防御其他模型。

编辑部解读

为什么值得关注

前沿模型能力逼近关键网络阈值,OpenAI主动放缓训练并加固安全体系,反映能力提升与安全保障之间的张力正成为行业核心议题。