TurboQuant 将改变 AI 经济学
有人读过谷歌最近发布的关于 TurboQuant 的研究论文吗?老实说,这可能是我见过的最接近现实生活中“皮德·派珀”那种压缩的东西。
这不仅仅是另一个量化技巧,它的压缩效果极其强大,几乎没有准确性损失,不需要重新训练,没有花哨的东西,纯粹是数学在发挥作用。
- KV 缓存内存下降了大约 6 倍
- 在 H100 上,注意力变得更快,甚至可以降到大约 3 位,同时保持性能不变。
而且这不仅仅适用于 LLM,甚至向量搜索在没有所有那些繁重的 k-means 胡扯的情况下也能获得更好的召回,几乎是即时索引。哇,这实际上意味着大型模型的运行成本突然变得更低,长上下文在较小设备上变得现实,而本地… 查看更多