我在同一个 Three.js 任务上测试了 10 种模型/工具组合。
I tested 10 model/harness combinations on the same Three.js task

原始链接: https://alvins82.github.io/hangar-harness-model-tests/

为确定生成复杂 Three.js 项目的最佳配置,我们使用特定的科幻机库提示词进行了一系列性能测试。评估对比了多种模型与框架组合(包括 GLM 5.3 Flash Max、Luna 5.6 和 Qwen 3.8 27B)在耗时、Token 效率(输入/输出/推理)、工具使用可靠性以及浏览器渲染成功率等关键指标上的表现。 结果显示性能存在显著差异: * **效率:** `MaxCodexOpen` 和 `OpenCodeOpen` 等框架展现了高缓存利用率,这对降低 Token 开销至关重要。 * **可靠性:** 尽管偶尔出现工具错误,但 GLM 5.3 Flash Max 与 `MaxCodexOpen` 的组合仍能实现视觉验证成功。 * **可扩展性:** Qwen 3.8 27B 等模型能够处理更大的推理负载,但总耗时因所选框架不同而差异巨大(从约 8 分钟到 41 分钟不等,例如 `x-highOMPOpen` 对比 `OpenCodeOpen`)。 这些数据表明,仅靠模型选择是不够的;将模型与高效框架进行匹配,对于平衡代码复杂度、推理深度以及在浏览器环境下的快速部署至关重要。

在最近的一场 Hacker News 讨论中,用户 `alvins82` 分享了一项对比测试,针对 Three.js 开发任务评估了 10 种不同的大语言模型(LLM)与代码运行框架的组合。社区分析指出,模型选择和框架的细微差异会对视觉效果及功能实现产生显著影响。 讨论的主要结论包括: * **性能差异:** Astra 和某些 GLM 模型因其更出色的光照实现而呈现了更优的视觉效果,而 Qwen(特别是 Q8 版本的 3.8 模型)则因其性能与代码质量的平衡而受到称赞。 * **框架影响:** 参与者指出,所选用的“框架”(即封装 LLM 的工具)与模型本身同等重要,其中 Pi (OMP) 的表现优于其他框架。 * **方法论疑虑:** 评论者讨论了模型生成的是原创代码,还是仅仅依赖于现有模板或竞赛编程示例。关于未来测试的建议包括:增加成本跟踪指标,以及为模型引入视觉验证循环。 * **未来应用:** 该讨论延伸至对实际应用场景的探讨,例如构建由 LLM 驱动的战斗模拟器,让机器人能够在游戏过程中动态更新自身的代码。
相关文章

原文
Hangar Harness / Model Tests

I've been testing a simple prompt with different model and harness combinations to work out which one produces best results. I do this in /goal mode.

Prompt: Build a single-page Three.js sci-fi hangar with hovering drones, animated warning lights, emissive runway strips, and subtle volumetric-style fog planes. Include drone formation toggle and cinematic camera path. Output one self-contained HTML file with inline JavaScript.

GLM 5.3 Flash Max Codex Open 9m 0.232s 9.344s 457,685 17,458 7,694 475,143 85.26% 14 1 Blocked No
Luna 5.6 MaxCodexOpen9m 13.098s6.199s1,146,75525,5126,8791,172,26792.76%322YesYes
SOL 5.6 MaxCodexOpen10m 48.765s8.460s1,069,16328,2787,5151,097,44194.60%215NoNo
Astra 6.0 MaxCodexOpen37m 29.705s3.589s1,292,36643,12915,2711,335,49594.93%205YesNo
GLM 5.3 Flash MaxOMPOpen30m 14.979s6.596s1,678,50963,4051,741,91478.54%570YesYes
Qwen 3.8 27B x-highOMPOpen41m 25.836s15.275s3,407,45171,93549,1313,479,38686.92%890YesYes
GLM 5.3 Flash MaxOpenCodeOpen20m 28.948s6.284s4,305,44750,46833,4144,355,91596.89%670YesYes
Qwen 3.8 27B x-highOpenCodeOpen8m 48.470s10.182s665,49041,81728,788707,30795.64%130YesYes
Qwen 3.8 27B x-highDSH / PTCOpen24m 32.929s7.724s1,012,49989,8941,102,39391.69%235YesYes
Qwen 3.8 27B x-highDSHOpen18m 15.239s6.755s2,654,45778,2322,732,68995.48%422NoNo

All GLM runs are labelled GLM 5.3 Flash Max; input tokens include cached input. Output tokens are the generated total, including reasoning; when a harness reports reasoning separately, the reasoning column shows that subset. The DSH adapter does not report a separate reasoning count. DSH durations sum active turn time across both turns, excluding the pause between turns. Tool errors are recorded failed tool events. A dash means unavailable or not reported.

联系我们 contact @ memedata.com