Problem

雖然量化技術能降低大型語言模型(LLM)的運算成本,但在極低位元寬度下,注意力機制的量化常會產生巨大誤差,導致模型效能顯著下降。現有方法多依賴平滑技術處理離群值,但仍難以在極低位元環境下完美平衡精確度與效率。

Method

提出 HyQuant 混合量化框架,將大部分注意力狀態量化為低位元格式,但保留少數關鍵的「垂直線標記」(vertical-line tokens)與「局部視窗狀態」於高精度格式。系統透過輕量級訊號偵測這些關鍵區域,並在 Prefill 階段採用混合精度算子,於 Decode 階段則將 KV 快取(KV-cache)解量化與注意力計算融合,以提升硬體執行效率。

Results

在多項任務、模型與資料集的測試中,HyQuant 展現了近乎無損的準確度。其設計簡單且具備極高的實作可行性,證明了混合精度量化在減少注意力機制誤差方面的卓越能力,並有效提升了記憶體與硬體的運作效能。

Significance

本研究突破了傳統統一量化的限制,證明混合精度是解決 LLM 注意力機制效能瓶頸的關鍵。這項技術為未來超大規模模型的高效率部署與推理優化提供了實用的參考架構,兼顧了學術創新與工業界大規模應用的需求。