NVIDIA的编程智能体AVO在ARC-AGI-3公开测试集上拿到了100%的满分。关键点在于,这并不是一个全新的大模型,而是一套名为AVO的“外挂”架构(Harness),其核心驱动力依然是Claude Opus 5。这套架构的强悍之处在于它支持长程自主推理,能连续运行数天,尝试数百种路径来解决一个抽象难题。
目前这个成绩仅限于公开数据集,而真正能防住“刷榜”的私有测试集由于规则限制尚未进行验证。
这件事反映出AI竞争的重心正在从“炼大模型”转向“造智能体”。社区指出,这更像是一种针对特定考试的“刷题技巧”,而非通用智能的质变。如果把模型比作大脑,AVO就是给大脑配上了能反复推敲的草稿纸和无限的思考时间。虽然100%的数字很唬人,但如果脱离了这套复杂的外部支撑,模型本身在处理陌生逻辑时依然会撞墙。
比起盯着这些不断移动的基准测试终点线,观察AI能否在没有人工干预的情况下玩转一款刚发售的复杂策略游戏,或许才是判断它是否具备“常识”和“自主性”的更有趣视角。