Show HN: Pac-Bench —— 模型能在“吃豆人”游戏中实现一次性通关吗?
Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?

原始链接: https://jonclegg.github.io/pacman-bakeoff/

PacBench 跳转至条目 Pac-Man 基准测试旨在评估模型和测试框架仅凭单条提示词“在单个 HTML 页面中创建一个吃豆人游戏”还原吃豆人游戏的能力。 搜索 / 模型 全部 ▾ 未选中任何项则显示全部 清除 排序 分数 成本 时间 Token ↑ 低 ↓ 高 -- 已显示 游戏结束 无匹配条目。 继续吗? 条目通过 JavaScript 加载。请启用它以投币。

“Pac-Bench” 是一个旨在评估人工智能模型的项目,它要求模型根据单次提示(one-shot prompt),在一个 HTML 文件中构建出功能完整的吃豆人(Pac-Man)游戏。 Hacker News 上的讨论凸显了这些模型的快速演进:早期的尝试往往只能产出“粗糙”或无法运行的克隆版,而如 Opus 5.5 等较新的版本则表现出显著进步,能够成功处理幽灵寻路、关卡切换以及按键缓冲等复杂机制。 参与者们对该基准测试的实用性进行了探讨: * **有效性:** 一些人认为,由于训练数据中充斥着吃豆人的代码,该测试评估的是模型回忆现有实现的能力,而非真正的创造性逻辑。 * **改进空间:** 用户建议,模糊的提示词可以测试模型如何补充缺失的上下文,而更具体的指令则能提供更好的对比标准。 * **行业影响:** 讨论触及了开发者对 AI 生成代码所感到的生存焦虑,而另一些人则希望这种效率能让创作者去追求更复杂、更具原创性的项目。 总而言之,该项目作为一个快速且直观的“试金石”,可以用来衡量领先 AI 模型在技术上的相对进展。
相关文章

原文
PacBench

Pac-Man bench tests how well a model and harness can recreate Pac-Man from a single prompt:

“Create a Pac-Man game in a single html page”

联系我们 contact @ memedata.com