Problem

視覺語言模型(VLM)因龐大的記憶體佔用與高昂的運算需求,難以在資源受限的行動裝置上順暢執行,且傳統量化流程往往需要存取原始訓練資料與複雜的環境設定。

Method

研發一套創新的 2.7-bit 參數格式,並針對 Arm CPU 優化推論效率;此外,開發出利用模型自身生成訓練資料的量化管線,能在不依賴原始訓練設定的情況下完成壓縮。

Results

成功將擁有 11B 參數的 Llama 3.2 視覺指令模型壓縮至僅 3.7 GB(搭配 8-bit 活化值),在多項標準視覺問答(VQA)任務中,成功維持了極佳的性能表現。

Significance

本研究為行動端 AI 部署提供了高效能的解決方案,證明極低位元量化能大幅降低硬體門檻,讓複雜的視覺生成式 AI 技術得以在智慧型手機等邊緣裝置上普及應用。