
為在既有設施中迅速建成超過10萬顆GPU的AI叢集,Meta甚至將五座仍在承載正式服務的資料中心清空,重新配置機櫃與網路。Meta Platforms(NASDAQ:META)AI暨運算基礎部門副總裁唐春強(CQ Tang)2日在SEMICON Taiwan 2026大師論壇表示,Meta於2024年為打造12.9萬顆GPU叢集,搬移逾5,000座機櫃、把五座資料中心網路容量擴大至四倍,並開挖新管線連接各棟建築,整項工程在不影響使用者服務下,數月內完成。 唐春強指出,Meta每天有36億人使用旗下產品,相當於全球人口逾四成;Facebook、Instagram等平台每天提供逾2,000億次內容推薦,WhatsApp每天處理逾1,250億則訊息。生成式AI、推薦模型、訓練、推論、強化學習及AI Agent所需硬體條件各不相同,因此Meta不以單一晶片處理所有工作,而是並用NVIDIA、超微(AMD)GPU及自研MTIA加速器。 沒有空資料中心,只能搬走既有正式服務 唐春強表示,Meta當時需要連接多座位置相近的資料中心,才能容納超過10萬顆GPU,但手上沒有可立即使用的空資料中心。由於AI需求上升速度太快,公司採取過去從未使用的方法,將五座正在處理使用者正式工作負載的資料中心騰空,再把服務遷移至其他設施。 團隊搬運逾5,000座、每座重量約1,000磅的機櫃,為加快移動速度還自行打造牽引機器人;網路容量則擴大至原來四倍,並在五棟建築之間開挖溝槽、鋪設新連線。唐春強說:「我們在短短幾個月內完成這一切。」最後形成12.9萬顆GPU共同運作的訓練叢集。 這項工程也凸顯AI擴建的瓶頸已超出GPU本身。當模型跨越多座資料中心,電力、光纖、機櫃搬遷、服務轉移及施工時程必須同步協調;任何一項沒有及時到位,都會讓已採購的GPU無法形成可用算力。 Prometheus今年底上線,Hyperion朝5 GW推進 完成12.9萬顆GPU叢集後,Meta持續把建設規模推向GW級。唐春強指出,Prometheus叢集預計今年底前上線,運算容量超過1 GW;未來數年另將興建Hyperion,規模最高達5 GW。兩項計畫意味Meta的AI基礎設施將從多棟資料中心串聯,進一步走向大型AI園區。 自研晶片也同步加速。Meta已開發四代MTIA並部署數十萬顆,最新路線圖包括MTIA 400、450及500,主要鎖定生成式AI推論與Agentic AI工作負載。Meta採模組化設計,使新晶片可沿用既有機櫃基礎設施,以縮短從設計到部署的時間。 唐春強表示,AI工作負載快速變動,基礎設施夥伴必須能共同開發並跟上相同速度。從清空五座資料中心、搬移5,000座機櫃到網路擴容四倍,Meta的案例顯示,超大規模AI競賽已不是取得GPU後就告完成,而是必須把晶片、機櫃、電力、網路、軟體與施工整合成一套可持續運作的系統。
评论 (0)