Google TurboQuant 驚豔問世:壓縮演算法翻轉 AI 記憶體瓶頸,GPU 效能飆升八倍

Google 研究團隊日前發表了名為「TurboQuant」的全新免訓練壓縮演算法,這項革命性技術能將大型語言模型(LLM)的鍵值快取(KV caches)大幅壓縮至僅剩 3 位元,且絲毫不影響模型準確度。此突破性方案為當前 AI 運算領域記憶體資源消耗龐大的難題,提供了顯著的硬體最佳化解方,預計將在 2026 年國際學習表徵會議(ICLR 2026)上正式亮相。

AI 運算面臨記憶體瓶頸:從 KV 快取看挑戰

隨著大型語言模型(LLM)的應用日益普及,其處理的上下文長度持續擴張,記憶體資源的消耗也隨之暴增,使得記憶體瓶頸成為 AI 產業界亟待解決的核心難題。在 AI 模型生成文字的過程中,鍵值快取(KV caches)扮演著至關重要的角色,它負責儲存先前計算過的注意力數據,讓模型在每個 token 生成步驟中無需重複繁複計算,大幅提升效率。

然而,當上下文長度越來越長,KV 快取所佔用的記憶體空間便會呈現爆炸性成長,最終成為系統效能的主要瓶頸。過去業界多半嘗試透過傳統的向量量化(vector quantization)方法來縮減快取體積。不過,這類方法有個盲點,系統必須額外儲存量化常數,導致每個數值都會產生數個位元的記憶體消耗。面對超大型上下文時,這些微小的額外開銷會不斷累積,最終嚴重侵蝕掉量化所帶來的記憶體節省效益。

Google 研究科學家 Amir Zandieh 指出:「大型語言模型對記憶體的需求如同無底洞,傳統壓縮技術已難以應付。TurboQuant 的目標正是要從根本上解決這個痛點,為 AI 運算提供更高效、更具成本效益的基礎設施。」

TurboQuant 的兩階段創新:極座標與錯誤修正

為徹底消除傳統量化方法帶來的額外開銷,Google 團隊透過創新的「兩階段處理流程」打造出 TurboQuant 演算法。第一階段導入了名為 PolarQuant 的技術,其核心原理是將數據向量從傳統的笛卡爾座標(Cartesian coordinates)轉換為極座標(polar coordinates)。透過這種巧妙的轉換,每個向量被分離成代表大小的半徑(radius)與代表方向的角度(angles)。

有趣的是,在極座標下,角度的分佈具有高度的可預測性且非常集中,這使得 PolarQuant 能夠直接省略傳統量化器必須執行的、極度消耗運算資源的每區塊正規化(per-block normalization)步驟。這項設計的成果,是模型在達成高品質壓縮的同時,實現了零量化常數儲存消耗的驚人表現。

第二階段則是一層 1 位元(1-bit)的錯誤修正層,採用了名為 Quantized Johnson-Lindenstrauss (QJL) 的演算法。QJL 演算法會將殘餘的量化誤差投影到一個較低維度的空間之中,接著將每個數值進一步縮減至僅剩一個單一符號位元。此數學轉換幾乎沒有增加任何額外的運算成本,同時還能有效消除在計算注意力分數時所產生的系統性偏差,確保模型的高精準度。

實測效能卓越:AI 運算效能與記憶體優化雙贏

為了驗證 TurboQuant 的實際效能,Google 團隊在多個業界標準的長文本基準測試中進行了全面評估,涵蓋了 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 以及 L-Eval 等項目,並使用了 Gemma 與 Mistral 等開源模型。結果顯示,在輝達(Nvidia)H100 GPU 上進行的基準測試中,採用 4 位元版本的 TurboQuant 在計算注意力對數(attention logits)時,相較於未經量化的 32 位元金鑰,其效能提升了高達 8 倍,同時將 KV 快取記憶體的需求量降低了至少 6 倍

更令人振奮的是,在 LongBench 的資訊檢索任務中,TurboQuant 即使在將 KV 記憶體壓縮至少 6 倍的嚴苛條件下,依然取得了完美的下游分數。而在包含問答、程式碼生成以及文章摘要等多元任務的 LongBench 測試中,TurboQuant 的表現不僅追平,甚至在所有任務上都超越了 KIVI 基準線。此外,TurboQuant 在向量搜尋領域也展現了強大的實力,即使面對如 Product Quantization 和 RabbiQ 等依賴龐大碼本與特定資料集微調的現有基準技術,TurboQuant 在 GloVe 資料集的評測中依舊取得了最高的 1@k 召回率。

  • 顯著的效能提升:在 Nvidia H100 GPU 上,注意力對數計算效能提升 8 倍。
  • 大幅降低記憶體消耗:KV 快取記憶體需求量降低至少 6 倍。
  • 無需訓練或微調:免訓練特性使其能無縫部署於現有系統。
  • 極低的運行資源消耗:在生產環境中具備高度實用性。
  • 多模型與多任務表現優異:在 Gemma、Mistral 等模型及多項長文本基準測試中表現卓越。

展望與影響:AI 運算門檻的全面降低

Google 副總裁 Vahab Mirrokni 強調,TurboQuant 最具商業價值的優勢在於它完全不需要任何訓練或微調,且在執行時期的資源消耗微乎其微。這些優異特性使得 TurboQuant 能夠非常輕易且無縫地部署於現有的生產級推論系統以及大規模的向量搜尋系統之中,預計將大幅降低 AI 運算的硬體門檻與營運成本。

這項由 Google 研究科學家 Amir Zandieh 與副總裁 Vahab Mirrokni 共同撰寫的技術,預計將於下個月舉辦的 2026 年國際學習表徵會議(ICLR 2026)上正式發表。隨著 TurboQuant 等創新技術的問世,AI 產業的發展將不再受限於龐大的記憶體消耗,有望加速大型語言模型的普及與應用,開啟 AI 運算的新篇章。