这篇文章追溯了“唯一凭直觉就能使用的界面就是乳头”这一说法的来源。人们通常认为这句话出自布鲁斯·埃迪格,但他否认是自己发明的。早在1994年8月,斯科特·弗朗西斯就在一篇帖子中提出了这一概念。1995年1月,杰·沃尔默也给出了几乎相同的表述:“实际上,唯一真正凭直觉就能使用的界面就是乳头。”从1995年2月起,埃迪格开始使用类似说法,其中包括:“除此之外,一切都得靠学习。”他究竟是沿用了沃尔默的措辞,还是从其他地方看到了这个想法,目前并不清楚。作者认为,埃迪格最有资格被视为人们熟悉的那种说法的来源,但作者更喜欢他后来更为讽刺的版本:“根本不存在凭直觉就能使用的界面,连乳头也不例外。一切都得靠学习。”
作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。
在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。
Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。
这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。
本月目标是让全部 20 亿个 token 都使用 GLM 5.3 Flash,但实际只有 50% 的使用量使用了目标模型。前半段保持在预算内,花费 68 美元,耗电约 4 千瓦时,排放 365 克二氧化碳;由于基础设施容量问题以及大量模型实验,剩余 10 亿个 token 转而使用了其他模型。
最大的一项意外支出是一个快速编码完成的 Wagtail MCP 原型。由于选错了模型,它在一夜之间消耗了 4.5 亿个 token、花费 150 美元,并耗电 5 千瓦时。虽然这个原型做出了有价值的演示,但如果规划得当,类似结果很可能只需约五分之一的成本即可实现。
总体而言,实际耗电量为 35 千瓦时,而目标是 10 千瓦时,因此这次挑战在技术上并不成功,但提供了很多有价值的信息。后续措施包括:持续在本地测量成本、能耗和结果;设定明确的实验预算;更加谨慎地选择原型和模型;采用有明确范围和限制的多智能体工作流;以及持续评估高效的模型。目标是让大多数常规 AI 推理使用一个或两个低成本的 Flash 模型,并以效率和结果为评估标准,而不是只看 token 数量。