NanoGPT 速通前沿
NanoGPT Speedrun Frontier

原始链接: https://www.primeintellect.ai/research/nanogpt-speedrun

这份数据展示了 20 个 AI 模型的性能排行榜,这些模型很可能与编程或技术任务相关。排名榜首的是 **Fable 5**,以 2,726 分和 81.7% 的闭环率位居第一。 性能趋势显示,随着分值的增加,闭环率呈现明显的下降趋势。表现最好的模型(Fable 5、Opus 2 和 Kimi K3)的闭环率保持在 50% 以上,而排名第 13 位及以后的模型则表现欠佳,成功率降至 15% 以下。 数据凸显了一个竞争激烈的格局,主要由 Claude、GPT、Kimi 和 Grok 架构的各种迭代版本主导。大多数顶级模型依赖于专用的代码执行环境(例如 `claude-code`、`codex`、`grok-cli`),其计算能力需求从“高”到“超高”不等。虽然许多模型目前处于“已关闭”状态,但包括 Qwen 3.8 Max、DeepSeek V4 Pro 和 Grok 4.6 在内的几个模型仍处于活跃状态或运行过程中,这表明相关的开发和评估工作仍在持续进行。

抱歉。
相关文章

原文

1

claude-code · high@24H 3,0108.7d

2

claude-code · max@24H 3,0452.9d

3

prime-agent · max@24H 3,1253.6d

4

kimi-code · max@24H 3,1355.1d

5

claude-code · max@24H 3,1803.0d

6

codex · xhigh@24H 3,1606.1d

7

codex · xhigh@24H 3,1003.4d

8

claude-code · max@24H 3,1202.0d

9

codex · xhigh@24H 3,1701.9d

10

grok-cli · xhigh@24H 3,1602.7d

11

qwen-code · max@24H 3,2251.9d

12

pi · high@24H 3,2001.8d

13

claude-code · max@24H 3,2051.1d

14

codex · xhigh@24H 3,2141.1d

15

grok-cli · xhigh0.6d

16

muse-code · xhigh0.6d

17

pi · max@24H 3,2403.7d

18

codex · xhigh@24H 3,2341.1d

19

kimi-code · max@24H 3,2401.6d

20

claude-code · xhigh

联系我们 contact @ memedata.com