ARC-AGI 排行榜
ARC-AGI Leaderboard

原始链接: https://arcprize.org/leaderboard

排行榜解读说明 仅展示运行成本低于 10,000 美元的系统。 对于未能生成完整测试输出的模型,剩余任务被标记为错误。 标记为“预览”的结果为非官方结果,可能基于不完整的测试。 1 ARC-AGI-2 分数估算基于部分测试结果及 o1-pro 定价。 2 临时成本估算基于 Gemini 3 Pro 定价。模型发布后将进行重新测试。

最近关于 ARC-AGI 排行榜的 Hacker News 讨论反映了人们对人工智能基准测试可靠性的深刻怀疑与争论。用户质疑像 Claude Opus 5 这样的顶尖模型是否“针对测试集进行了训练”,并指出即便出色的基准测试分数也往往无法转化为日常任务中更强的实际效用。 一个主要担忧是数据污染:由于 ARC-AGI 的评估通常在闭源模型服务器上进行,因此无法保证私有测试集不会被纳入后续的训练周期。尽管一些用户主张通过私有数据集来减轻“操纵”基准测试的行为,但另一些人指出,AI 实验室完全可以构建模仿解题程序的专门工具,使模型无需获得真正的通用智能即可在特定任务上表现优异。 此次讨论还强调了像 Fable 这类模型所展现出的“类人”特质,引发了人们对监管限制或数据留存政策是否限制了公众获取最先进 AI 能力的质疑。归根结底,该讨论凸显了在不透明的专有系统中验证性能的难度,这也让许多人得出结论:相比标准化的行业基准测试,个性化且独特的评估方式依然更为可信。
相关文章

原文

Leaderboard Breakdown

Notes

Only systems which required less than $10,000 to run are shown.

For models that were not able to produce full test out puts, remaining tasks were marked as incorrect.

Results marked as "preview" are unofficial and may be based on incomplete testing.

1 ARC-AGI-2 score estimate based on partial testing results and o1-pro pricing.

2 Provisional cost estimates based on Gemini 3 Pro pricing. Model to be retested once released.

联系我们 contact @ memedata.com