Nvidia AVO 在 ARC-AGI-3 交互式推理基准测试中获得 100% 的成绩。
Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark

原始链接: https://twitter.com/NVIDIAAI/status/2090786258981466231

NVIDIA AVO 通过使用记忆、工具和执行反馈,持续进行检查、规划、实施和评估,并在此过程中不断积累经验。这使得系统能够在长时间运行的任务中持续推进,而无需在每次模型重置上下文时重新开始。阅读更多

Nvidia 近日宣布,其“AVO”(代理变异算子)框架在 ARC-AGI-3 公共基准测试集中取得了 100% 的得分。AVO 充当了一种进化式“外壳”,通过封装 Claude Opus 5 或 GPT-5.6 等现有前沿模型来优化代理性能。 Hacker News 上的讨论褒贬不一。批评者指出,100% 的得分仅适用于“公共”测试集,并强调 ARC-AGI-3 旨在测试原始推理能力;使用重型“外壳”来实现这些结果可能并不代表真正的自主智能。另一些人则认为,尽管结果令人印象深刻,但该基准测试往往存在“刷榜”现象,这些工具本质上只是复杂的包装器,而非通用人工智能(AGI)领域的突破。 这一辩论反映出人们对于现行基准测试是否能有效衡量 AGI 的广泛怀疑。尽管一些贡献者认为 AVO 生成自主优化的能力代表了能力的根本性转变,但许多人仍将其视为在定义和实现机器类人智能的过程中,又一次“移动球门”的尝试。
相关文章

原文

NVIDIA AVO continuously inspects, plans, implements, and evaluates, using memory, tools, and execution feedback to build on what it learns along the way. This allows the system to sustain progress across long-running tasks rather than starting over with each model context. Read

联系我们 contact @ memedata.com