
數萬顆GPU同步訓練模型時,整個叢集會被最慢、甚至計算錯誤的單一GPU拖住。Meta Platforms(NASDAQ:META)AI暨運算基礎部門副總裁唐春強(CQ Tang) 2日在SEMICON Taiwan 2026大師論壇指出,Meta實測每數百顆GPU就有一顆曾發生靜默資料錯誤(Silent Data Corruption,SDC),發生頻率高於CPU的每數千顆一例;若錯誤未被即時辨識,可能讓價值數十億美元的AI叢集花費數天或數週訓練出錯誤模型。 唐春強把同步訓練比喻成1萬輛車串在一起比賽:所有車輛必須以相同速度前進,任一輛車減速,整個車隊都會變慢;任一具引擎故障,整隊就可能停下。「一顆GPU變慢,整個訓練就變慢;一顆GPU故障,整項訓練工作就會停止。」 故障率曾高於目標百倍,一年內改善50倍 Meta設定的可靠度目標,是每天每8,000顆GPU最多發生兩次硬體故障,但叢集建置初期,實際故障率一度高出目標約100倍。唐春強表示,Meta過去12個月與供應商改善診斷工具、提早發現異常並加快更換故障零組件,已把故障率降低約50倍,但隨改善幅度逐漸收斂,後續下降速度可能趨緩。 故障來源涵蓋GPU、HBM、SRAM、交換器、網路線、CPU及SSD。現階段統計中,Scale-up與Scale-out網路被歸類為最常出現問題的部分,但Tang提醒,這項數字不能直接解讀為網路元件本身最不可靠。許多不同根因最終都會在軟體端表現為通訊錯誤,當真正原因無法確認時,容易被歸類到網路,因而放大網路故障占比。 軟體先隔離故障群組,SDC仍可能污染整套模型 為避免單一GPU故障就拖停整項工作,Meta把GPU分成多個Replica Group,在群組間採資料平行運算。若其中一顆GPU故障,系統可移除其所在群組,讓其他群組繼續訓練,只損失部分算力;修復後再把群組重新加入。這也是標題採用「可能拖停」的原因,因為一般硬體故障可由軟體隔離,並非每一次都會讓數萬顆GPU全部停擺。 真正難處理的是SDC。這類錯誤不會讓設備直接停機,而是在沒有警示的情況下產生錯誤計算結果,可能源自先進製程微縮後的製造差異、硬體老化,或電壓與溫度波動。一台伺服器的錯誤結果可能擴散到其他節點,最後造成推薦結果失準,或讓整套模型沿著錯誤資料持續訓練。 唐春強並舉出一個看似簡單、影響卻很大的製造問題:匯流排螺絲鬆動,曾使約5% GPU回報錯誤功耗。部分GPU誤以為耗電過高而被韌體限速,實際效能下降後,整項同步訓練也跟著變慢;另一些GPU則回報不合理的低功耗。問題雖已修正,卻顯示一顆螺絲也可能影響數十億美元AI叢集的利用率。 Meta已將SDC檢測套件CP-Bench開源,供晶片、伺服器與製造夥伴使用。Tang強調,超大規模叢集可靠度不能只靠提高GPU良率,必須由晶片、HBM、網路、伺服器、製造測試與訓練軟體共同處理,才能在零組件必然陸續故障的情況下,把影響限制在最小範圍。
评论 (0)