计算机科学 > 人工智能
[提交于2026年9月14日]
标题:突破三值LLM的1.58比特壁垒
作者:Evangelos Georganas、Alexander Heinecke、Pradeep Dubey
查看论文《突破三值LLM的1.58比特壁垒》的PDF,作者为Evangelos Georganas等3人
摘要:三值大语言模型(LLM)将每个权重存储为三种符号之一,因此三值模型的成本通常以信息论上的每权重 log₂3 ≈ 1.585 比特为参考。目前主流的部署格式将五个三值权重打包进一个字节(五trit打包),并且由于实践中使用2的幂次组大小,这会向上取整为每权重1.625比特。这种有效存储位宽将三种符号视为等概率。我们测量了29个三值LLM模型的实际符号分布,发现零值占所有权重的比例高达51.5%。受这一发现启发,我们提出了BITCOS,一种简单的分布自适应布局,由一个密集的存在位图加一个压缩的符号向量组成,在模型权重零密度为z的情况下,每权重元素成本为 2 − z 比特。在29个受测模型中的26个上,BITCOS的权重存储比五trit打包更紧凑,在最稀疏的模型上达到每权重1.485比特。BITCOS可在现代处理器和GPU上高效解包,我们为AVX-512、AVX2和Intel Xe2 GPU提出了优化的解包序列。与生产级最先进的三值矩阵-向量乘法内核相比,在真实三值模型所呈现的零密度下,我们提出的布局实现了高达1.28×的收益。最后,我们展示了在5个不同平台(客户端和服务器CPU、集成与独立Xe2 GPU)上的端到端LLM推理结果,解码吞吐量在CPU上最高提升1.18×,在GPU上最高提升1.27×。
学科:
人工智能(cs.AI);机器学习(cs.LG)
引用格式: arXiv:2609.16338 [cs.AI]
(或 arXiv:2609.16338v1 对应此版本)
https://doi.org/10.48550/arXiv.2609.16338
arXiv通过DataCite签发的DOI(注册中)
提交历史
来自:Evangelos Georganas [查看邮箱] [v1] 2026年9月14日 星期一 20:54:24 UTC(144 KB)
全文链接:
获取论文:
查看许可协议(CC BY 4.0)
当前浏览上下文:
cs.AI
[下一篇 >]
[最新] | [近期] | [2026-09]
切换浏览:[cs] [cs.LG]
参考文献与引用
- NASA ADS
- Google Scholar
- Semantic Scholar
BibTeX格式引用
数据提供方:
书签
BibSonomy、Reddit
文献与引用工具
Bibliographic Explorer 开关——Bibliographic Explorer(什么是Explorer?)
Connected Papers 开关
Litmaps
scite.ai 智能引用
与本文相关的代码、数据和媒体
alphaXiv
CatalyzeX 代码查找器
DagsHub
GotitPub
Hugging Face
ScienceCast
演示
Replicate
Hugging Face Spaces
TXYZ.AI
相关论文
推荐与搜索工具
Influence Flower
CORE 推荐器
- 作者
- 发表会议
- 机构
- 主题
关于 arXivLabs:与社区合作者的实验性项目
arXivLabs 是一个允许合作者在我们网站上开发并分享新 arXiv 功能的框架。
个人和组织均拥抱并接受我们开放、社区、卓越与用户数据隐私的价值观。arXiv 致力于这些价值观,且仅与遵守这些价值观的合作伙伴合作。
有想法为 arXiv 社区增加价值?[了解更多]。
[哪些作者是本文的认可者?] | [禁用MathJax]