過去兩年間,全球人工智慧基礎設施幾乎由 GPU 獨占鰲頭。在傳統大語言模型(LLM)的預訓練與單輪對話中,常見「8 顆頂級 GPU 僅搭配 1 至 2 顆 CPU」的配置,CPU 多半僅充當資料搬移的附屬角色。然而,隨著產業邁入以「代理型 AI(Agentic AI)」為核心的新階段,運算架構的鐘擺正迅速回盪——英特爾最新分析直指,CPU 即將在未來的 AI 機櫃中扮演關鍵主導地位,甚至催生以 CPU 為主體的全新機架型態。
代理式AI讓伺服器架構產生變革
|
促成這項轉變的根本原因,在於 Agentic AI 的工作負載本質發生了位移。AI Agent 不再只是回答單一問題,而是必須自主規劃任務、多步驟推理、調用外部 API、查詢向量資料庫,並在沙盒環境中反覆執行與驗證程式碼。
英特爾與學界的研究數據顯示,在多代理工作流中,高達 50% 至 90% 的整體延遲實際上來自工具呼叫與資料檢索。這些涉及邏輯判斷、多代理溝通、檔案 I/O 與網路調度的「控制平面(Control Plane)」任務,全屬於典型的 CPU 密集型負載(CPU-Bound Workload)。若基礎設施僅一味堆疊 GPU,卻缺乏充足的 CPU 算力進行即時編排,要價高昂的 GPU 往往會因等待調度而處於「閒置(Idle)」狀態,造成算力與電力的巨大浪費。
在英特爾發布的《System-Level TCO in Agentic AI》白皮書中明確指出,優化整體擁有成本的關鍵在於重新配置 CPU:GPU 的運算比例。當前多數任務的最佳 CPU 對 GPU 配比已大幅提升至近乎 1:1 甚至更高。透過擴大 CPU 與記憶體池的投資,能大幅降低因 GPU 空轉帶來的系統隱形成本。
此外,企業落地不可或缺的檢索增強生成(RAG)、向量資料庫管理與機密資料治理,本身就是 x86 CPU 架構具備深厚生態系與彈性優勢的領域。兼顧即時性與資料主權的受監管產業(如金融、醫療),更傾向於在本地機房利用 CPU 伺服器進行資料清洗與中小模型推論。
隨著次世代伺服器 CPU(如 Diamond Rapids)導入高達 256 核心設計、內建矩陣加速技術(Intel AMX/AVX)與破 TB 級的記憶體頻寬,現代 CPU 已能直接以極低功耗高效執行小型專用代理模型(SLM)。
這意味著未來的資料中心佈局將出現鮮明分工:GPU 負責處理超大規模模型的密集運算,而配備大量核心與大快取的「CPU 專用機架」則化身整個 AI 系統的「大腦神經指揮中心」,負責串接規劃、驗證與調度;在許多中小型企業與邊緣端,甚至僅需純 CPU 機櫃即可完成完整的 Agentic AI 業務閉環。這場由 Agent 引發的架構革命,正宣告伺服器產業正式重返系統級平衡的新時代。

