Show HN: FrontierHarness Eval – 9 种评测方案,同一模型,单次成本差异达 17 倍
Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x

原始链接: https://frontierharness.org

综合基准评估 在 12 种配置下对 9 种工具集进行评估,均使用相同的软件工程任务、模型和运行环境。 每次运行均采用相同的冷启动 全部 360 次试验均从全新的检查点恢复启动。正式任务从未提前运行,排除了缓存预热带来的偏差。 无主场优势的中立评估 每次运行均使用 Kimi K3,并在 Runta 上执行,通过全新的恢复方式,确保 vCPU、内存、磁盘大小、磁盘内容及内存状态完全一致。

“FrontierHarness Eval”项目近期在 Hacker News 上引发了热烈讨论,该项目旨在评估编码代理框架(Harness)而非底层大语言模型(LLM)。用户称赞此举填补了生态系统中的明显空白,并指出随着模型逐渐趋于商品化,管理代理的框架质量正成为核心差异化因素。 主要观点与社区反馈包括: * **方法论疑虑:** 评论者指出该评估缺乏统计显著性(样本量小且缺乏误差线),并质疑该基准测试是否真正做到模型无关,因为部分框架针对特定模型(如 Kimi)的特性进行了深度优化。 * **对复杂度的需求:** 许多用户认为单一模型的对比不足以说明问题,并呼吁建立完整的“框架 × 模型”兼容性矩阵。 * **可复现性:** 批评者敦促开发者不仅要发布结果,还应公开运行基准测试的代码,这对于建立公信力至关重要。 * **未来展望:** 项目开发者确认 1.1 版本将涵盖更多模型和框架,旨在建立全面的兼容性矩阵,以确定哪些工具在不同模型架构下表现最优。
相关文章

原文

Comprehensive harness evaluation

9 harnesses across 12 configurations, tested on identical software engineering tasks with the same model and runtime.

Identical cold start on every run

All 360 trials start from the same fresh checkpoint restore. Formal tasks were never run early, preventing warm-cache bias.

Neutral evaluation with no home-field advantage

Every run used Kimi K3 and was executed on Runta with a fresh restore using identical vCPU, memory, disk size, disk contents and memory state

联系我们 contact @ memedata.com