Salesforce 在推動其 AI 代理平台 Agentforce 的過程中,面臨一個典型的技術難題:如何在降低基礎設施成本的同時,維持企業級的高可用性(High Availability, HA)。過去,為了節省昂貴的 GPU 資源,Salesforce 採用 Amazon SageMaker 推論元件(Inference Components, ICs),透過讓多個模型共用同一個 GPU 實例,成功將運算成本降低了 8 倍。然而,這種成本優化手段卻在韌性上出現了隱憂,因為預設的分配機制無法保證模型副本會跨越不同的可用區域(Availability Zones, AZs)部署。

對於 Salesforce 而言,內部的合規標準要求所有生產環境的模型必須支援 2-AZ 備援。但在 SageMaker 推論元件的早期架構中,系統調度算法是以個別部署操作為中心,這可能導致同一個模型的所有副本意外地集中在同一個可用區域,甚至是同一個實例上。一旦該區域發生故障,整個 AI 服務就會中斷。為了解決這個問題,Salesforce 導入了全新的 SchedulingConfig 參數,這項技術更新讓開發者能更精確地控制模型副本的地理分佈。

這項發展對產業具備深遠的影響。首先,它打破了「高效能 AI」與「高成本」之間的必然聯繫。過往企業為了確保穩定,往往需要租用大量獨立的 GPU 資源,導致資源閒置與浪費。透過 SageMaker 的新配置,企業可以在共用資源的基礎上,依然享有跨區域的災難復原能力。這代表生成式 AI 服務已從單純的技術展示,轉向更成熟的「工業級」運作階段,對於金融、醫療等對穩定性極度敏感的產業來說,這是一項關鍵的技術轉折。

從更宏觀的角度來看,Salesforce 的案例凸顯了 AI 基礎設施演進的重要性。當 AI 代理(Agents)開始承擔更多企業核心業務時,系統的停機時間將直接轉化為商業損失。這次技術優化的核心意義在於,雲端服務商開始針對 AI 特有的運算負載(如 GPU 共享)提供更細緻的管理工具。這不僅是技術上的微調,更是為了因應未來大規模 AI 部署所需的韌性標準。對於台灣正積極數位轉型的企業而言,學習如何在雲端架構中靈活運用這類調度機制,將會是控制成本並維持服務競爭力的關鍵。