**ProgramBench Vetted** 是一项经过强化的基准测试,包含 50 个任务,旨在评估 AI 智能体从已编译的“封装”二进制文件中重构功能性代码库的有效性。与前代产品不同,它专注于**难度校准**,确保评分能准确反映模型通过实验推理逻辑的能力,而非利用测试套件的缺陷。 ### 核心特性 * **挑战内容:** 智能体将获得一个二进制文件、使用文档和一个 Shell 环境(无互联网)。它们必须探测二进制文件、推测其行为,并编写一个能通过一系列行为测试的替代代码库。 * **严格流程:** 任务经过多轮自动化及人工验证。专门的“评审”和“纠错”智能体会审计环境泄露、重复测试以及“捷径”式解决方案(例如调用已安装的系统库而非编写代码)。 * **公平性:** 该基准测试旨在奖励有意义的局部进展,而非“全有或全无”的成功,从而防止模型仅通过复现浅层的命令行界面来获取高分。 ### 核心意义 ProgramBench Vetted 通过测试智能体协调长期任务的能力,解决了“记忆悖论”。即便模型在预训练数据中见过目标程序,它仍需展示出正确进行逆向工程与逻辑实现的能力。
TigerBeetle 采用“协议感知确定性模拟测试”(Protocol-Aware Deterministic Simulation Testing, DST)来确保其分布式数据库的可靠性。传统的黑盒测试(如 Jepsen)是从外部对系统进行测试,而 TigerBeetle 则采用“由内而外”的测试方法。
通过利用逻辑和物理确定性,该数据库在一个名为 VOPR 的模拟器中运行,其中时间以及存储和网络等外部交互均可完全控制。这使开发人员能够在一个进程内以极高的速度探索庞大的状态空间,从而模拟崩溃、网络分区和数据损坏等情况。
至关重要的是,由于模拟器具备协议感知能力,它能够深入洞察各个副本的状态。它强制执行以下约束:
* **安全性不变量:** 验证共识协议和存储引擎(LSM 树)在所有副本间保持逐字节的一致性。
* **活性不变量:** 确保副本即使在复杂的恢复场景下,也能有效地将本地和全局持久性转化为可用性。
通过检查这些内部属性,TigerBeetle 超越了简单的系统级断言,使开发人员能够捕获细微的 Bug,验证复杂的恢复协议,并以绝对可复现的精度对优化效果进行基准测试。这种方法将那些“难以调试”的分布式场景转化为了可控且快速的测试用例。