← 返回今日精选
重要模型发布88

NVIDIA AVO 智能体架构在 ARC-AGI-3 拿下满分,系统设计而非模型本身决定上限

NVIDIA 研究项目 AVO(Agentic Variation Operators)在 ARC-AGI-3 基准上取得 100% 的 RHAE 得分,完成全部 183 个关卡。该系统将 Claude Opus 5 从约 30% 的模型基线提升至满分,证明长时程自主任务的表现更多取决于智能体系统架构,而非模型能力本身。在 GPU 内核优化任务中,AVO 连续自主运行七天,生成的注意力内核性能超过 FlashAttention-4 最多 10.5%。

NVIDIA 在技术博客中介绍了其研究项目 Agentic Variation Operators(AVO),一个面向长时程自主运行的通用编码智能体系统。该项目在交互式推理基准 ARC-AGI-3 上取得 100.00 的 RHAE 得分,完成了 25 个环境中的全部 183 个关卡,且环境动作数比 VISTA 少 12%。

值得注意的是,AVO 所用的底层模型 Claude Opus 5 单独基线得分约为 30%。NVIDIA 强调,这一结果说明前沿语言模型只是智能体的一个组件,外层的系统设计——包括上下文管理、工具使用、状态维护、失败恢复等——才是解锁长时程前沿表现的关键。

在 GPU 内核优化实验中,AVO 连续自主运行七天,探索了超过 500 个优化方向,提交了 40 个内核版本。在 NVIDIA DGX B200 系统上,生成的多头注意力内核比 cuDNN 快最多 3.5%,比 FlashAttention-4 快最多 10.5%;随后仅用约 30 分钟的额外自主工作就将内核适配到分组查询注意力。

AVO 的核心机制包括持久记忆和监督者两部分:持久记忆保存此前的实现、评估结果和推理过程,让智能体可以从当前状态继续而非反复重建搜索;监督者则监控整体轨迹,在搜索停滞时将主智能体引向其他策略。

NVIDIA 表示,同一套通用智能体架构只需更换环境特定的工具和评估接口,即可从 GPU 内核优化迁移到 ARC-AGI-3,体现了架构的通用性。

编辑部解读

为什么值得关注

该研究为智能体工程提供了有力证据:在长时程任务上,精心设计的系统层可以数倍放大同一模型的能力,对智能体开发者和基准评估都有直接参考价值。