跳到正文
原文
Google Research·· 2026-03-25精选AI 评分60

TurboQuant:通过极致压缩重新定义 AI 效率

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。

推荐理由

原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。

来源:Google Research · research.google