DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731

原始链接: https://arcprize.org/results/deepseek-v4-flash-0731

2026年7月发布的 **DeepSeek V4 Flash 0731** 模型在 ARC-AGI 基准测试中表现出色。在全力运行下,该模型在 **ARC-AGI-1** 上达到了 **89.0% 的准确率**(每个任务成本为 0.02 美元),在 **ARC-AGI-2** 上达到了 **61.4% 的准确率**(每个任务成本为 0.04 美元)。 性能表现随推理强度的不同而变化,“高”与“低”两种设置显示出计算投入与公共评估任务成功率之间存在明显的正相关性。包括不同推理水平下各项任务通过/失败指标在内的详细表现,可在 ARC Prize 排行榜上查阅。该模型属于 ARC-AGI 系列的一部分,该系列通过年度竞赛和透明的基准测试,旨在推动人工智能高级推理的研究。

Hacker News 社区正热议 DeepSeek V4 Flash 的发布,并强调了其卓越的性价比。用户反馈称,该模型功能强大,足以胜任几乎所有任务,且价格低廉,足以实现诸如自动化 CI/CD 修复、测试生成和实时日志监控等全新应用场景。 讨论的主要结论包括: * **可负担性:** 该模型价格极其低廉,使得“高强度”AI 使用在经济上变得微不足道,甚至可能超越 Claude Max 等昂贵的订阅服务。 * **定价不确定性:** 尽管人们对 DeepSeek 官方 API 即将到来的涨价表示担忧,但参与者指出,由于该模型权重开源,OpenRouter 等平台上的多家供应商提供了具有竞争力且稳定的替代方案。 * **市场影响:** 观察人士认为,推理成本的迅速下降是行业的一个重要里程碑,这表明可访问性正变得比追求顶尖性能(SOTA)更为重要。 * **技术争论:** 讨论还涉及了推理优化的作用、“廉价缓存”背后的“秘密武器”,以及标准的每 Token 价格指标是否能真实反映该模型与 Kimi K3 或 Luna 等其他顶级模型相比的效率。
相关文章

原文

ARC Prize Verified

DeepSeek V4 Flash 0731

DeepSeek·Jul 31, 2026·3 reasoning variants

At max effort, DeepSeek V4 Flash 0731 scores 89.0% on ARC-AGI-1 Semi-Private at $0.02 per task and 61.4% on ARC-AGI-2 Semi-Private at $0.04 per task.

ARC-AGI 2 leaderboard

DeepSeek V4 Flash 0731

Verified scores

VariantARC-AGI-1ARC-AGI-2ARC-AGI-3
Max
89.0%
61.4%
High
87.0%
56.0%
Low
84.0%
46.0%

Tasks & environments

Pass/fail per reasoning level across each benchmark.

ARC-AGI-2 Public Eval

120 tasks
Task
Max
High
Low

ARC-AGI-1 Public Eval

400 tasks
Task
Max
High
Low
联系我们 contact @ memedata.com