压缩即预测
Compression is prediction

原始链接: https://ngrok.com/blog/compression-is-prediction

数据压缩与大型语言模型(LLM)本质上是相同的技术:两者都是旨在最小化信息熵的预测引擎。 传统的压缩工具由两个主要部分组成:一个用于估计符号出现概率的**模型**,以及一个使用这些概率将数据表示为紧凑比特序列的**熵编码器**(如算术编码)。当数据包含冗余时,压缩效果最好,因为更高概率的预测可以显著减小文件大小。 LLM 遵循完全相同的原理。当 LLM 预测序列中的下一个标记(token)时,它实际上是在根据上下文分配概率。在信息论中,LLM 训练所要最小化的“交叉熵”,与衡量压缩器效率所使用的数学原理是相同的。从理论上讲,一个训练完美的模型可以实现最大可能的压缩。 虽然与传统算法相比,LLM 是更优越的预测器,但它们目前并不适用于通用文件压缩。巨大的计算成本和模型本身的庞大体积,使得它们对于网页浏览等日常任务来说显得“杀鸡用牛刀”。然而,归根结底,压缩和人工智能是同一枚硬币的两面:**压缩即预测,而 LLM 就是压缩器。**

这篇 Hacker News 帖子探讨了一个核心论点,即“压缩等同于预测”。基于 ngrok.com 的一篇文章,参与者们探讨了统计建模与数据压缩之间存在的本质联系,并指出 Hutter 奖长期以来一直倡导“高质量压缩是智能的代理指标”这一理念。 争论的一个主要焦点在于其对大语言模型(LLM)的意义。一些评论者认为,将 LLM 视为“在庞大的压缩算法家族中进行优化”,有助于揭示“新想法”涌现的奥秘,这暗示了复杂的预测本质上就是高级的压缩。 然而,另一些人则反对将两者画等号。他们警告说,虽然所有 LLM 都是压缩器,但并非所有压缩器都像 LLM 那样运作。批评者指出,尽管统计模型和压缩器在建模概率分布方面有着共同的基础,但现代 LLM 与 zstd 等传统压缩工具在架构细节(如嵌入和神经网络编码器)上存在差异。这场讨论凸显了在“将 LLM 视为简单的下一个词预测器”与“认可其更复杂、涌现出的能力”之间,始终存在着某种张力。
相关文章

原文
联系我们 contact @ memedata.com