关注开源生态70 分
NVIDIA 开源 SkillEvaluator:实测显示技能包让智能体平均提升 31 分
NVIDIA 技术博客介绍开源工具 SkillEvaluator,通过静态检查、区分度分析和沙箱内实跑对比三层评估衡量技能包对智能体表现的影响。对 30 多款产品、300 多个已验证技能的基准测试显示,平均 Skill Lift 达 31 分(剔除安全维度为 39 分)。
NVIDIA 在技术博客中介绍了开源评估工具 SkillEvaluator,用于测量"技能"(skills)对 AI 智能体表现的实际影响。NVIDIA 已验证技能是经过打包和签名的描述文件,告诉智能体某款 NVIDIA 产品做什么、何时调用以及如何调用。
评估分三层:第一层做安全与结构检查,包括 schema 验证、提示注入与数据外泄扫描、密钥与个人信息检测等;第二层用嵌入相似度识别技能内部及目录间的重复覆盖;第三层在隔离沙箱中让智能体分别带技能和不带技能执行相同任务,计算得分差即 Skill Lift。
在 2026 年 8 月 12 日的基准快照中,NVIDIA 对 30 多款产品的 300 多个已验证技能进行了评估,每个技能在两个独立智能体框架上测试。结果显示在正确性、可发现性、有效性和效率四个维度上均有显著提升,平均 Skill Lift 为 31 分,剔除安全维度后为 39 分。
无技能基线方面,四个维度的平均得分在 39 到 46 分(满分 100)之间,说明改进空间很大;安全维度例外,基线平均已达 97 分。NVIDIA 还发布了面向 Claude Code、Codex 和 Cursor 的插件,技能也可通过 Skills.sh、ClawHub 和 Hermes Hub 获取。
为什么值得关注
为智能体技能包建立可量化、可复现的评估标准,有助于技能生态从"感觉有用"走向数据驱动,对智能体工具生态有参考价值。