突破三值大语言模型的 1.58-bit 极限
Breaking the 1.58-bit Barrier for Ternary LLMs

原始链接: https://arxiv.org/abs/2609.16338

arXivLabs 是一个允许合作者直接在我们的网站上开发并分享 arXiv 新功能的框架。与 arXivLabs 合作的个人和组织都秉持并认可我们对开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并仅与同样遵守这些准则的合作伙伴共事。您有能够为 arXiv 社区增值的项目想法吗?了解更多关于 arXivLabs 的信息。

这次讨论重点介绍了近期关于突破三值大语言模型(LLM)“1.58比特壁垒”的研究。研究人员利用权重中常出现零值的特性,实现了每个权重 1.48 比特的有效压缩率。 三值模型的主要吸引力在于其计算效率:由于权重仅限于 -1、0 或 1,矩阵运算可以简化为简单的加减法。这种架构在硬件加速(尤其是 ASIC)方面极具潜力,有望使内存和功耗受限的边缘设备能够运行高性能大语言模型。 尽管一些评论者讨论了量化感知训练(QAT)与训练后量化(PTQ)之间的权衡,但支持者强调,直接在这些低比特率下进行训练(而非压缩现有模型)是保持精度和速度的关键。如果这些技术能成功整合到定制芯片中,将可能从根本上改变大语言模型的部署方式,在维持模型性能的同时显著降低推理所需的硬件门槛。
相关文章

原文

arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.

Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them.

Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs.

联系我们 contact @ memedata.com