英伟达自己测的。公开题满分,不是对照实验,也不是新产品。
外壳比模型更能决定智能体能走多远
英伟达星期五发了一篇技术博客。他们把给智能体用的那层外壳叫 AVO。外壳不是模型:它管记性、工具、怎么从失败里爬起来,还有一个盯着别走偏的监工。产品负责人对 TechCrunch 说,监工几乎像个老板——主智能体走偏、钻死胡同,或把走过的路再走一遍时,它会把人拽回来。同一套架构,他们先让它连改七天显卡内核,后来又接到一套没说明书的小游戏上。
那套游戏叫 ARC-AGI-3。进去没有规则、没有目标,得自己试、自己猜、自己赢。公开题一共二十五个环境、一百八十三关。他们用 Claude Opus 5 跑完整套公开题,按官方计分拿了满分,动作次数比另一套同类外壳少大约一成二。更早的时候,这套外壳连跑七天改注意力内核,在他们测过的配置里,可比现在常用的 FlashAttention-4 快一成出头。
该不该信。满分是英伟达自己在公开题上测的,不是比赛用的半私密或私密题。官方排行榜上,Claude Opus 5 单独大约三成。公司自己写清楚了:两次用的推理档、外壳和计分设定都不一样,不能当成「外壳贡献了七十个百分点」的对照实验。TechCrunch 写得更干脆,说没外壳三成、有外壳一百分——那是记者的压缩,不是论文里的因果。这不是货架上的新产品,是实验室里的一套架构。
所以怎样。买模型之前先问外壳。模型是脑子,外壳才是它能不能连续干活的手脚和记性。工作集仍空。Stripe 买 OpenRouter 还没交割。ChatGPT 发短信的插件没有新平台。