Figure 在保护其专有硬件、同时避免延误 F.04 项目的情况下,退役了 F.02 机器人车队。由于美国和墨西哥的铸造厂拒收采用锂离子电池的机器人,Figure 与阿诺德·施瓦辛格合作,并在芬兰伊马特拉找到了一家愿意接收这些机器人的铸造厂。 团队在模拟环境中训练 F.02 机器人,并以特技演员作为参照,让它们自主跳入盛有 molten steel 的桶中。尽管现场高温严重、存在电磁干扰、电子设备不断故障,熔炼时间也只有六次、每次仅 20 分钟,且机器人只能停留 24 小时,但它们仍成功完成了任务。 回收的钢材被运回美国,并被加工成限量发行的纪念品,为收藏者保留了 F.02 的一部分历史。如今,大多数 F.02 机器人已被销毁,只有少数几台仍留在 Figure 总部。
作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。
在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。
Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。
这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。