研究进展·Hacker News
Nvidia 编程代理 AVO 满分通过 ARC-AGI-3 推理基准测试
Nvidia 宣布其通用编程代理 AVO 在 ARC-AGI-3 交互推理基准测试中取得 100% 的满分成绩。AVO 在没有指令、规则或目标的情况下,完成了全部 25 个公开环境中的 183 个关卡。这意味着 AI 在自主推理和任务理解方面达到了新水平,对开发者的工具选择有参考意义。
Nvidia 在社交媒体上宣布,其通用编程代理 AVO 在 ARC-AGI-3 交互推理基准测试中拿到满分。该测试旨在评估 AI 在陌生环境中的推理和适应能力,不提供任何预先说明的规则或目标。
AVO 完成了全部 25 个公开环境中的 183 个关卡,全程没有任何指令或明确规则。Nvidia 称,AVO 需要自行理解每个环境的目标并找到完成路径,这对代理的自主性要求极高。
ARC-AGI 系列基准由抽象推理语料库演变而来,第三版更强调交互和动态决策。此前的模型在该测试中得分普遍较低,AVO 的满分成绩是少数公开报告中的最高记录之一。Nvidia 强调这是一次性通过,而非多次尝试。
该结果发布于 2026 年 8 月 21 日,测试环境数量有限,且 Nvidia 未透露 AVO 的具体技术细节或运行成本,但满分成绩本身已引发开发者社区讨论。目前该代理尚未向公众开放使用。
#Nvidia#ARC-AGI-3#评测#推理
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。