Problem
現有的創作代理(Creative Agents)缺乏從高品質影片學習的有效方式,主因在於缺乏一種既能忠實還原影片內容,又便於代理進行推理與操作的結構化表示法,這限制了 AI 生成電影級視聽作品的能力。
Method
研究團隊開發了 AVA-Encoder 框架,將影片編碼為具備階層性與狀態節點的知識圖譜(KG),並將影像與音訊資產與之關聯。系統採用文字梯度優化(Textual-gradient optimization),將重建影片的差異轉化為自然語言反饋,用於外迴圈的編碼策略訓練以及內迴圈的表示法優化。
Results
實驗數據顯示,AVA-Encoder 比最強的現有基準線提升了 20.7 個百分點。在策略測試中,其自動生成的鏡頭級編碼策略表現優於精心人工調優的結果,且僅需消耗原先 25.7% 的提示詞代幣(System-prompt tokens)。
Significance
本研究提出了一種代理原生的影片格式,讓 AI 能更直觀地理解、查詢與剪輯影像內容。隨框架發布的重建基準測試與首個高品質電影知識圖譜資料集,將有力推動自動化影視創作技術的發展。