谷歌TurboQuant算法引爆芯片产业:AI内存占用降至1/6,推理速度提升购倍

谷歌研究院最新推出的TurboQuant算法,正在悄悄改写AI芯片产业的格局。这项技术的出现,甚至引发了存储芯片板块的股价暴跌。

AI内存瓶颈的终极解决方案

大语言模型在生成文本时,需要使用键值缓存(KV Cache)来存储历史计算结果,避免重复计算。但这种缓存机制极易造成内存瓶颈,尤其是在处理长文本或大规模搜索时。

传统的量化技术虽然能压缩数据,但需要为微小数据块计算和存储量化常数,引入了额外的”内存开销”,部分抵消了压缩的优势。

TurboQuant的黑科技

谷歌的解决方案分为两个关键步骤。首先,利用PolarQuant方法进行高质量压缩。这个方法打破常规,放弃了传统的笛卡尔坐标系,转而将数据向量转换为极坐标,映射到边界已知的固定”圆形”网格上,彻底消除了传统方法的内存开销。

随后,利用QJL算法处理遗留的微小误差。QJL仅需1比特的残差压缩算力,就能像数学纠错机一样消除偏差,确保模型计算出精准的注意力分数。

性能数据触目惊心

在Gemma和Mistral等开源大模型上的测试表明,TurboQuant无需任何预训练或微调,就能将键值缓存压缩至3比特,并在长上下文测试中实现零精度损失,同时将内存占用降低至1/6。

更惊人的是,在H100 GPU加速器上,4比特TurboQuant的运行速度比未量化的32比特基准提升了高达8倍。这意味着更少的内存占用,更快的推理速度。

芯片产业的地震

这项技术的出现,直接冲击了存储芯片产业。美光科技下跌4%,西部数据下跌4.4%,希捷下跌5.6%,闪迪更是重挫6.5%。市场已经意识到,高效的AI算法可能会减少对高端存储芯片的需求。

本文来自用户或匿名投稿,不代表大众智能立场;本文所有内容(包括图片、视频等)版权均为原作者所有。涉及的相关问题请查阅本站免责声明,如侵权请及时与本站运营方取得联系(联系我们)我们将按声明中的处理方式进行处理。本文链接:https://dzzn.com/2026/3886.html

(0)
上一篇 2026年3月29日 下午5:26
下一篇 2026年3月29日 下午5:31

相关推荐

发表回复

登录后才能评论