**探索式建模 (Explorative Modeling, XM)** 引入了一种新的生成式建模范式,将复杂训练目标的负担从“分解生成”(如扩散模型等多步过程)转移到了“分解训练”(探索)上。
传统的生成模型往往因为试图预测多种有效输出的平均值而失败,导致生成结果模糊且质量低下。目前的解决方案(如扩散模型或自回归模型)通过将生成过程拆解为许多小而可预测的步骤来解决这一问题,但这造成了“暴露偏差”,并阻碍了真正的端到端学习。
XM 通过引入**生成表达力 (generative expressivity)** 作为继参数和数据之外的第三个预训练维度,解决了上述问题。在训练过程中,XM 模型会生成 $K$ 个潜在输出,仅针对与真实值匹配度最高的那一个进行训练。这鼓励模型专注于独特的、高质量的数据点,而不是对它们进行平均。
**主要优势:**
* **效率:** XM 在样本效率(6.2倍)、算力效率(FLOP,4.1倍)和参数效率方面均有显著提升。
* **可扩展性:** 随着模型和数据规模的扩大,性能提升愈加显著。
* **端到端性能:** 在控制任务中,XM 在减少高达 256 倍推理计算量的情况下,达到了与扩散模型相当的性能;通过消除迭代推理步骤,实现了真正的端到端生成。
Spotify 正面临一个日益严峻的挑战:在线服务和人工智能代理需要从其“数据湖”的艾字节(exabyte)级数据中,进行亚秒级的“点查询”(即查找特定用户的数据)。虽然云存储延迟已大幅降低,但像 Trino 或 BigQuery 这样的标准查询引擎主要针对分析型吞吐量进行了优化,而非单行查找。
随机访问 Parquet(Random Access Parquet,简称 RAP)通过直接在现有 Parquet 文件上实现交互式查询,填补了这一空白,且无需数据冗余或专门的键值(KV)存储。
RAP 使用“外部索引”将键(如 `user_id`)直接映射到文件位置和行偏移量。这消除了标准 Parquet 文件中常见的昂贵、高延迟的扫描以及“依赖读取链”。通过优化文件布局(例如按键排序、交错列存储以及使用 ZSTD 帧重置),RAP 可以将查询简化为仅需几次千字节的并行范围读取,甚至可以通过覆盖索引完全免除存储读取。
最终,RAP 将数据湖从仅能进行批处理的系统,转变为能够提供交互式、实时 AI 上下文的系统,使企业能够以传统服务系统极低的分数成本和复杂度来查询历史数据。
受寻找琐事“最优解”(例如免费餐厅面包)的启发,一位软件工程师开始探寻“幂等键”(idempotency key)的起源,这是一种用于分布式系统中防止同一请求被重复处理的工具。
作者首先通过一个生动的类比阐述了这一概念:如何防止家里的狗林戈(Ringo)被不同的家庭成员重复喂食。在反驳了大型语言模型关于 Stripe 在 2011 年发明该概念的说法后,作者追溯了幂等性的演变过程,从 21 世纪初的“仅限一次 POST”(POST Once Exactly)规范和企业级传输协议,一直回溯到印加结绳记事等古老的记录方法。
将搜索范围聚焦于数字计算领域后,作者将这一谱系追溯到了施乐帕罗奥多研究中心(Xerox PARC)1984 年发表的研究论文《实现远程过程调用》(Implementing Remote Procedure Calls,作者为 Birrell 和 Nelson)。该论文描述了一种用于消除重复数据包的“调用标识符”,标志着该机制的一个基础实例。尽管作者承认要确定绝对的“首例”依然困难,但他们总结认为,对这类问题的探索凸显了人类是如何不断地重新发明解决方案,以应对分布式系统中“仅处理一次”这一持久难题的。