Nvidia研究:AI智能体表现取决于外部框架而非模型本身
速览
Nvidia最新研究显示,通过精心设计的框架,Claude Opus 5在ARC-AGI-3基准测试中得分从30%跃升至100%。这一发现表明,在长期任务中,框架比模型本身更重要。对开发者而言,优化框架可能是提升AI智能体性能的关键。
Nvidia周五发布的新研究揭示,在让AI执行长期任务时,外部框架(harness)比底层模型本身重要得多。研究人员通过定制一个擅长处理记忆、并包含类似上级监督组件的框架,让Claude Opus 5在交互推理基准测试ARC-AGI-3上取得了100%的满分。而未使用该框架时,Opus 5仅得分30%,这已是所有测试模型中的最佳成绩。
长期任务要求AI串联多个决策,有时耗时数天才能完成,这与简单响应提示词截然不同。如何防止AI在此过程中偏离方向、陷入混乱,是智能体研究的关键难题。Nvidia研究人员采用了名为Agentic Variation Operators(AVO)的自制框架,其中引入的监督组件尤为关键。该组件像CEO一样,在主体偏离方向或陷入死胡同时进行引导。
Nvidia产品副总裁Adel El Hallack表示,智能体不只是模型的API,而是模型与框架的结合体,包括工具、运行时和相关技能库。他强调,开放的框架能让用户转动更多旋钮来提升准确性。此前Databricks在7月的研究也表明,框架对AI成本的影响甚至超过模型本身,错误的框架选择可能使成本翻倍。
值得注意的是,ARC-AGI-3基准测试此前曾让OpenAI颇为困扰,其模型得分不足10%,促使OpenAI上月也展开了类似研究。通过调整框架的两个设置,OpenAI模型的成绩提升了三倍,但仍未达到满分水平。Nvidia强调这不是新产品,而是其Nemo品牌下开源技术组合的展示。
原文Nvidia just showed that the harness, not the AI model, is now the real herotechcrunch.com
#英伟达#AI Agent#微调
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。