谷歌TurboQuant算法引爆芯片产业:AI内存占用降至1/6,推理速度提升购倍

google研究院最新推出的TurboQuant算法,正在悄悄改写AImicrochip产业的格局。这项技术的出现,甚至引发了存储芯片板块的股价暴跌。

AI内存瓶颈的终极解决方案

大语言模型在生成文本时,需要使用键值缓存(KV Cache)来存储历史计算结果,避免重复计算。但这种缓存机制极易造成内存瓶颈,尤其是在处理长文本或大规模搜索时。

传统的量化技术虽然能压缩数据,但需要为微小数据块计算和存储量化常数,引入了额外的”内存开销”,部分抵消了压缩的优势。

TurboQuant的黑科技

谷歌的解决方案分为两个关键步骤。首先,利用PolarQuant方法进行高质量压缩。这个方法打破常规,放弃了传统的笛卡尔坐标系,转而将数据向量转换为极坐标,映射到边界已知的固定”圆形”网格上,彻底消除了传统方法的内存开销。

随后,利用QJL算法处理遗留的微小误差。QJL仅需1比特的残差压缩算力,就能像数学纠错机一样消除偏差,确保模型计算出精准的注意力分数。

性能数据触目惊心

在Gemma和Mistral等开源大模型上的测试表明,TurboQuant无需任何预训练或微调,就能将键值缓存压缩至3比特,并在长上下文测试中实现零精度损失,同时将内存占用降低至1/6。

更惊人的是,在H100 GPU加速器上,4比特TurboQuant的运行速度比未量化的32比特基准提升了高达8倍。这意味着更少的内存占用,更快的推理速度。

芯片产业的地震

这项技术的出现,直接冲击了存储芯片产业。美光科技下跌4%,西部数据下跌4.4%,希捷下跌5.6%,闪迪更是重挫6.5%。市场已经意识到,高效的AI算法可能会减少对高端存储芯片的需求。

This article comes from users or anonymous contributions, does not represent the position of Mass Intelligence; all content (including images, videos, etc.) in this article are copyrighted by the original author. Please refer to this site for the relevant issues involvedstatement denying or limiting responsibilityPlease contact the operator of this website for any infringement of rights (Contact Us)我们将按声明中的处理方式进行处理。本文链接:https://dzzn.com/en/2026/3886.html

Like (0)
Previous 2026年3月29日 pm5:26
Next 2026年3月29日 pm5:31

Recommended

Leave a Reply

Please Login to Comment