研究进展·Hacker News

BITCOS 新方法突破三元 LLM 1.58 比特存储极限

研究人员提出 BITCOS 布局,利用三元 LLM 权重中大量零值的特点,将存储成本降至每权重 1.485 比特。该方法在 29 个模型中 26 个优于传统五元组打包,推理吞吐量最高提升 1.28 倍。对部署大模型的开发者而言,这意味着更低的内存占用和更快速度。

三元大语言模型将每个权重存储为 -1、0 或 +1,理论存储成本约为每权重 1.585 比特。现有部署方式采用五元组打包,实际成本为 1.625 比特。Intel 的研究人员测量了 29 个三元模型后发现问题:零值平均占比很高,最高可达 51.5%,传统打包方式完全浪费了这种稀疏性。

他们提出的 BITCOS 布局由两部分组成:一个密集的存在位图和一个紧凑的符号向量。由于零值不需要存储符号,整体成本降至每权重 2 - z 比特(z 为零值密度)。在 29 个测试模型中,26 个的存储效率超过五元组打包,最稀疏的模型达到每权重 1.485 比特。

BITCOS 针对现代处理器设计了高效的解包序列,支持 AVX-512、AVX2 和 Intel Xe2 GPU。在实际零值密度下,与现有三元矩阵向量乘内核相比,性能提升最高 1.28 倍。端到端推理测试覆盖 5 个平台,包括客户端和服务端 CPU、集成及独立 GPU,解码吞吐量在 CPU 上提升最高 1.18 倍,GPU 上提升最高 1.27 倍。

这项工作的意义在于,它不改变模型本身,只改变存储和计算方式,就能获得额外收益。对于内存受限的边缘部署场景,BITCOS 提供了一条低成本优化路径。

#开源工具#大模型#量化#研究

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。