Problem
大型視覺語言模型(VLM)在理解幽默時面臨巨大挑戰。幽默往往涉及實體、事件與語境之間微妙且隱含的交互作用,傳統的線性思維鏈(CoT)難以捕捉影像與文字間複雜的非線性因果推論需求。
Method
提出 CaRGo-T(因果推理圖思維)框架。該方法將多模態幽默底層的因果與情境關係建模為輕量化的圖形推理結構,並將其序列化為模型可理解的程式碼格式,讓 VLM 在零樣本或情境學習中進行更精確的邏輯解讀。
Results
在包含諷刺、迷因等四種不同形式的資料集測試中,CaRGo-T 顯著超越現有基準模型,幽默理解能力提升 1-20%,幽默偵測準確率增加 1-3%。互資訊分析顯示,此方法生成的推理表徵含有更高密度的目標相關資訊。
Significance
這項研究突破了現有線性推論的限制,證明圖型化因果結構能更有效地協助 AI 處理具備高度不確定性與隱含意義的文化語意任務,為提升多模態模型的情感與語意理解提供了新方向。