現在只要提到 AI,大眾腦中浮現的通常是 ChatGPT 或 Claude,而支撐這些技術的底層架構正是 Transformer。大多數技術文件在介紹這個模型時,會直接帶領讀者進入「查詢(Query)」、「鍵(Key)」與「值(Value)」這些抽象的數學公式。然而,這種「從結果出發」的學習方式,往往讓我們忽略了一個核心問題:為什麼工程師當初會選擇這種設計?在 Transformer 出現之前,自然語言處理的主流是循環神經網路(RNN)。RNN 的運作邏輯很像人類閱讀,一次處理一個字,並試圖將前面的記憶傳遞給下一個字。雖然直覺,但這種序列處理方式存在致命缺點:處理長文本時極為緩慢,且前面的資訊極易在傳遞過程中流失。

Transformer 的出現,本質上是對「計算效率」與「長程依賴」的重新思考。它大膽地拋棄了循序漸進的傳遞,改用全域掃描的邏輯,這對整個 AI 產業產生了深遠影響。最直接的衝擊在於運算資源的解放,因為不再受限於必須處理完前一個字才能處理下一個,GPU 的平行運算能力得以被發揮到極致。這也解釋了為什麼我們現在能訓練出參數量動輒數千億的模型。如果沒有這種結構性的設計翻轉,單純依靠硬體升級,生成式 AI 的發展恐怕還停留在只能處理短句的階段。此外,這種架構也從語言處理跨足到電腦視覺與生醫領域,成為當代深度學習的通用標準。

我們之所以需要回頭探究這些設計初衷,是因為理解「為什麼」比「怎麼做」更具長遠價值。在技術日新月異的今天,追逐最新推出的模型名稱往往讓人疲於奔命。若能掌握 Transformer 如何平衡模型複雜度與運算效能的邏輯,開發者在面對硬體限制或優化推論速度時,將能做出更明智的技術決策。同時,這也能幫助我們看清當前架構的侷限性,例如運算成本會隨資料長度平方增長的難題。對於台灣的科技從業人員而言,建立這層深刻的技術洞察,是我們在 AI 浪潮中保持競爭力、甚至開發出下一代替代架構的關鍵基石。