GPT-6 Astra 的表现呈现出两极分化:它在编程任务中表现卓越,但在通用智能方面表现参差不齐。
**编程代理指标:** Astra 表现极为突出,足以比肩 Fable 5 和 Claude Opus 5 等顶级竞品。其成功得益于巨大的 Token 使用效率提升——相较于 GPT-5.6 Sol,其 Token 用量减少了多达 70%。因此,它在成本效益方面处于领先地位,以相近的价格提供了优于前代产品的性能。
**智能指标:** 其表现更为复杂。尽管 Astra 在整体智能评分上与 GPT-5.6 Sol 持平,但由于基础价格上涨了 2.5 倍,导致其单项任务成本增加了 75%,这抵消了它在 Token 效率上 10% 的提升。值得注意的是,Astra 显著降低了幻觉率(降至 51%),并在复杂的长跨度知识工作(AA-Briefcase)中表现出强劲增长。然而,它在其他基准测试中出现了倒退,例如 GDPval-AA v2 和特定的领域推理任务。
总的来说,GPT-6 Astra 代表了编程效率和可靠性方面的一次重大飞跃,但其高昂的定价使其相比前代产品平衡且高性价比的表现,成为了更专业化的工具。
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了业内领先的成绩,该测试旨在评估智能体在全新抽象环境中的表现。通过两种不同的评估工具,Astra 分别获得了 62.7%(标准模式)和近乎完美的 99.9%(提供者适配器模式)的得分,在“行动效率”(即以最少交互完成任务的能力)方面显著超越了人类基准。
主要发现包括:
* **符号建模**:Astra 展示了将陌生环境转化为高密度代数速记的高级能力,能够精准追踪机制、坐标和规划。
* **工具使用**:在高级设定下,该模型能够创建自定义的游戏专用软件库和工具(如寻路器和状态模型),以优化性能。
* **行动效率**:在 96% 的关卡中,Astra 所需的行动次数少于人类中位数,有效达到或超过了人类的任务执行水平。
尽管开发人员认为这些成果是通用性和智能体能力方面的一个重要里程碑,但他们明确表示,在 ARC-AGI-3 测试中取得满分并不等同于证明了 AGI(通用人工智能)的实现。该基准测试针对的是确定性的受限环境,研究人员目前正在开发未来的测试方法,以衡量更复杂、更开放的智能。