Problem
全模態大語言模型(OmniLLMs)在處理音訊與視訊時,冗長的權杖(token)序列會產生巨大的記憶體與推理成本。現有壓縮方法多關注在固定預算下篩選重要權杖,卻忽視了如何在不同模態間合理分配預算,導致關鍵資訊遺失或保留過多冗餘內容。
Method
提出無需訓練的 OmniDelta 框架,結合「意圖感知」跨模態分配與「內容感知」模態內分配。首先建立音視訊技能池,根據查詢需求動態調整各模態預算;接著依據區域複雜度與時間冗餘性,重新分配音訊段落與視訊影格的配額,並可與現有剪枝策略結合。
Results
在 Qwen2.5-Omni 模型的四個基準測試中,OmniDelta 樹立了新的精準度與效率平衡標竿。在僅保留 25% 權杖的情況下,Qwen2.5-Omni-7B 可減少 22.0% 的 GPU 記憶體使用,並達到 1.64 倍的端到端推理加速。
Significance
這項研究填補了全模態壓縮中預算分配的空白,證明透過動態調整而非固定比例的壓縮策略,能在硬體資源有限的環境下,更有效地處理複雜的多模態資訊。