簡而言之: 人工智慧資料中心是一個 高密度 場所,其電力、冷卻、基礎設施和儲存都圍繞著模型的訓練和服務而設計,而不是一個配備額外GPU的伺服器機房。晶片本身固然重要,但 建築本身 決定了它們能否正常運作。如果影像無法遷移,可以改造一個小型資料中心;大多數團隊應該選擇租用資料中心。
重點總結:
晶片與架構:電源、冷卻、網路架構和儲存決定加速器能否正常運作。
場所而非宮殿:資料無法離開時,改造兩個機架;不要購買園區。
平均值與中位數:運行八次後,中位數會重新開始計算;使用 18 小時平均值。
抗誤用性:不要為混合大廳中的兩個機架提供 PUE 值。
結果說明:八次運行只能產生一張小地圖,並不能節省 50% 的生產成本。

您可能還想閱讀以下文章:
🔗 人工智慧可靠嗎?影片和測驗
透過引人入勝的影片和互動測驗探索人工智慧的可靠性。
🔗 如何在日常生活中使用人工智慧
探索人工智慧簡化日常任務和流程的實用方法。
🔗 如何在工作中應用人工智慧
學習如何運用人工智慧提高工作場所效率的實用方法。
🔗 人工智慧能獨立思考嗎?
了解人工智慧是否真的能夠獨立思考或推理。
它與「普通」資料中心有何不同
傳統機房的設計目標是優化混合工作負載,並確保眾多小型服務的正常運作時間。當然,你會關注冗餘,也會關注PUE(電源使用效率)的概念——也就是 建築物為提供一瓦運算能力而額外消耗的能量。但通常情況下,你不會把每條走廊都圍繞著一個像移動加熱器一樣的機架來設計。
人工智慧網站顛覆了這種比例。密度上升。網路成為訓練任務不可或缺的一部分。儲存必須確保檢查點持續運行,否則加速器就會像塞車中的賽馬一樣停滯不前。.
文化差異也很明顯。企業維運人員的思考模式是工單和變更窗口,而AI維運人員的思考模式是作業隊列,以及長時間運行中某個節點崩潰時那種令人沮喪的感覺。我想,你仍然可以稱它們為“資料中心”,因為它們本質上就是資料中心。這個標籤只是掩蓋了其內部的底層架構。.
| 類型 | 它建造的目的是什麼? | 出色的硬體 | 功率/散熱特性 | 適合誰? | 它存在的意義 |
|---|---|---|---|---|---|
| 傳統企業資料中心 | 混合型IT:資料庫、虛擬機器、電子郵件、文件 | CPU、一般伺服器、常用儲存設備 | 空氣主導;適中密度;PUE(功率利用率)成為討論焦點 | 公司日常營運系統 | 保持業務應用程式正常運行 |
| 人工智慧訓練集群 | 長期、緊密銜接的培訓工作 | 高密度加速器機架;GPU互連 | 高密度;液冷或[後門熱交換器](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | 實驗室和模型建構者都在排隊等待工作。 | 完成跑動,不要讓籌碼耗盡。 |
| 人工智慧推理設施 | 模型服務;即時和批次回答 | 加速器;真正重要的負載平衡器 | 依然火熱,只是……少了些戲劇性;延遲比蠻力密度更重要 | 現在必須回答問題的產品 | 將模型放置在使用者附近 |
| 混合人工智慧大廳 | 在同一屋簷下進行培訓和服務;嗯——差不多是這樣。 | 混合式貨架;帶圍欄的游泳池;共享布料 | 兩個個性迥異的冷凍設備放在同一個機房裡;場面一度尷尬。 | 無法負擔兩所校區的球隊 | 資本有限,人生無常 |
這不是道德排名。不同的機器,相同的家族姓氏。.
GPU、加速器和耗電機架
走在傳統的架空貨架上,它們看起來還算規規矩矩;走在人工智慧機架上,它們卻像是要把整棟大樓吞噬掉似的。.
真正出彩的硬體並非強大的CPU,而是加速器托盤:GPU或其他AI晶片,它們被打包到伺服器、機架,再到共享高頻寬網路的行列中。 GPU 互連將這些晶片連接起來,使其能夠模擬成一個巨大的加速器;集群網路則在行級規模上實現了同樣的效果。並行訓練只有在這些連結保持高速穩定時才能有效進行。一旦連結出現問題,你的「集群」就只是一堆共享相同郵遞區號的昂貴工作站而已。
電源跟隨晶片運作。不是那種笨重的辦公室配電單元(PDU)。一旦整個大廳都裝滿了設備,IT負載就會達到兆瓦級——我就不妄下斷言了。機架密度才是關鍵。機架數量減少,每個機架都像小型熔爐。限制因素通常是變電站,而不是GPU的配置清單。你也知道,採購部門想要更多加速器;電力公司則希望進行長時間的談判,並支付一大筆費用。.
我一直有個有點傻的比喻:烤架就像一頭飢餓的野獸。你可以培育出跑得更快的,但你仍然需要餵養牠,仍然需要清理熱源。如果忽略其中任何一項,它就會變成一個非常昂貴的擺設。.
功率、熱量和冷卻問題
輸入電力,輸出熱。這就是全部的宗教。.
高密度機架散發的熱量遠超過空氣所能承受的範圍。你可以透過增加空氣流通量——例如後門熱交換器、更熱的通道、巧妙的密封設計——來提高空氣流通效率,但這在一定程度上是有效的。然而,液體問題隨後就會出現:
-
冷卻循環系統使機房看起來像個化工廠。
-
沉浸於一些設計之中,這仍然會讓那些認為水和服務器不應該共用一句話的人感到驚訝。
這一切都不光鮮亮麗。這一切都是產品本身,因為一個會限制動力輸出的加速器,你已經付了錢卻無法充分利用。.
PUE 仍然很重要。它是一個比率,而不是一個性格特徵。營運商之所以追求 PUE,是因為每一瓦浪費在風扇和水泵上的功率,就意味著少了一瓦分配給 GPU 的功率。我不會引用一個「典型」數值;氣候以及你如何界定 PUE 的邊界都會影響它,而虛假的精確度比沒有精確度更糟。水也是影響 PUE 的重要因素。有些植物吸水少,有些植物吸水多。 蒸發冷卻 在河流氾濫或乾旱等極端情況下效率很高,但一旦發生問題,它就變得不再那麼重要了。
網路:為什麼網路結構與晶片同樣重要
人們會拍攝顯示卡,他們也應該拍攝交換器。.
訓練就像一場對話。成千上萬的加速器緊密同步地交換梯度、參數和模型碎片。如果網路出現抖動,整個任務都會因為最慢的連結而停滯不前。這就是為什麼人工智慧中心如此重視高頻寬網路、低延遲以及即使鏈路故障也不會崩潰的網路拓撲結構。例如, 類似 InfiniBand 的網路架構、同樣扮演重要角色的乙太網路、內建 GPU 互連以及必須一次正確完成的佈線。
推理是另一回事。模型服務關注的是尾延遲-也就是慢響應,而不是平均反應。批量處理和即時處理截然不同。訓練集群需要的是大量、 集體、幾乎全部回應的。而服務叢集則需要許多較小的請求,且請求之間需要隔離,避免負載平衡器出現擁塞。
我在這裡要補充一點:人們把網路比喻為管道,把薯條比喻為餐廳。但在這棟大樓裡,管道就是餐廳。如果忽略了這一點,你就買了一個無法接收外帶的廚房。.
訓練與推理:兩棟建築,有時是字面上的。
訓練就像一場戰役。你建立一個集群,輸入數據,定期執行檢查點,運行數小時甚至數週,然後祈禱網路架構一切順利。它需要處理大量批次任務,佔用大量頻寬,並且需要耐心等待——直到某個節點故障導致運行中斷。在一個緊密耦合的作業中,一個加速器失效就可能導致整個作業停滯。.
推理就像一個門面。模型已經訓練完畢,現在可以回答問題、分類圖像、產生文字。延遲至關重要。客戶附近的略顯老舊的加速器,其性能可能勝過遠在大陸之外的一台頂級加速器。.
所以就出現了分化。訓練中心追求的是電力、土地和密度。推理中心追求的是延遲和網路覆蓋。混合型辦公大樓也存在,因為資金並非無限。當然,也不總是兩棟。有時可能只需要一棟大樓,外加一條警戒線和兩套冷卻系統。.
這也是託管、超大規模園區和本地部署的分野之處。超大規模資料中心營運商的規模之大,讓我們這些一般用戶相形見絀,就像在擺放家具一樣。託管資料中心以機架密度出售資料。而本地部署則適用於資料無法遷移的情況。.
儲存吞吐量、檢查點和高功耗晶片
沒人會把平行檔案系統放在宣傳冊的封面上。.
訓練資料必須夠快到達,才能避免GPU不堪負荷。檢查點必須成功加載,否則崩潰會導致一週的訓練成果付諸東流。模型權重必須在服務副本上線前載入完畢。儲存吞吐量——而不僅僅是容量——才是真正的瓶頸所在。即使你花費巨資購買加速器,如果使用的是專為虛擬機器設計的、效能有限的儲存陣列,也可能導致加速器效能不足。.
這種模式似曾相識:一個閃亮的集群,一個作業隊列,以及像一張刺眼賬單一樣盯著你的 I/O 等待。如果只進行計算集群化而不對資料路徑進行集群化,就會造成代價高昂的空閒。要嘛保證晶片的正常運行,要嘛就承認你買了個擺設。.
軟體、編排與不為人知的維運層
硬體是主角,調度程序負責執行實際工作。.
如果作業找不到 GPU,如果兩個團隊無法和平共享集群,如果故障的進程無法替換,如果韌體漂移導致整個架構緩慢崩潰,那麼 AI 資料中心就毫無用處。編排、可觀測性、功耗限制——這些看似不起眼的運維層,正是它們至關重要的原因。.
我對這一層情有獨鍾。還有,如果網卡配置錯誤導致整個下午都像是散熱問題……你得吃點苦頭才能發現。.
當節點在運行過程中死亡
節點宕機了。變更視窗仍然會與不考慮你日程安排的訓練運行衝突。你只能集中調度大型作業,隔離推理池,編寫運行手冊來應對各種故障,從「作業運行緩慢」到「作業徹底崩潰」。冗餘仍然至關重要——電力、冷卻、路徑、儲存——但故障模式遠不如以前那種九成正常運行時間的幻燈片那麼清晰。推理:複製副本,排空故障節點,繼續回應。訓練需要的是檢查點,而不是盲目樂觀。.
位置、水源、電網和鄰居
你不會為了欣賞風景而把這些東西放在小屋旁邊。.
併網往往才是真正的選址難題。相較之下,土地選址相對容易,而變電站和擁有其他使用者的公用設施則不然。如果使用水進行冷卻,一旦雨勢過大,就會引發鄰裡糾紛。噪音、視覺上的體積龐大、邊界圍欄處的熱量等等,都會造成問題。規劃委員會一旦需要佔用田地和河流,就會發現人們對「雲」的看法。
延遲問題則恰恰相反。推理過程最好靠近使用者和互連網路。訓練過程則可以在電力成本較低、氣候較涼爽的地區進行。業內人士似乎認為有一個完美的站點。但實際上並不存在。最終的結果往往只是透過新聞稿來掩蓋某種妥協。.
餘熱與不速之客-暖氣爐
宣傳冊上總是喜歡用這句描述。把多餘的熱量輸送到住宅、游泳池、溫室——這真是個動聽的句子。有時候,區域循環系統確實存在。但有時候,園區選址不當,熱量仍會散失到空氣中。我對宣傳冊上的描述持懷疑態度;但我對其中的物理原理深信不疑。.
誰需要買(以及誰應該租)?
大多數人並不需要擁有其中一座大廳。.
直言不諱的清單:
-
超大規模資料中心,因為其產品是叢集。
-
實驗室中,當排隊時間成為瓶頸,或資料無法離開時,就會發生這種情況。
-
對於擁有秘密資料集的銀行、醫院集團、政府機構或製造商而言,無論將資料集放在本地還是私人資料中心,即使這樣做有些麻煩,也可能是合理的。
其他人應該租用。高密度託管,滿足人工智慧需求。雲端資源預留。託管叢集。您無需成為電廠操作員即可獲得加速器。但當有人凌晨三點問誰負責冷卻液循環時,浪漫的氣氛就會消散。.
我承認,這其中確實有份自豪感。擁有這套集群就像擁有了預測工具。然而,當電費帳單寄來時,這份自豪感便蕩然無存。.
這棟建築的用途是什麼?
那麼,什麼是人工智慧資料中心呢?它是一個專門的高密度園區,加速器、電力、冷卻、網路架構和儲存等設施都圍繞著訓練和服務模型而構建,而不是像通用IT設施那樣在角落放一個GPU。它看起來像個倉庫,運作方式則像個能進行數學運算的發電站。.
就算你什麼都記不住:晶片贏得名聲;變電站、冷卻劑和網路決定了這些晶片的設計是否明智。訓練和推理可以共處一室,但它們的行事方式卻截然不同。大多數機構應該租房,少數機構應該自建。無論如何,鄰居都會注意到。.
雲朵一直都有自己的建築。如今,這棟建築也有了自己的觀點。.
實際案例:雙機架訓練單元,影像無法離開
設想
Tomos是Kestrel Precision的基礎設施負責人,這是一家位於西米德蘭茲郡、擁有400名員工的製造商。他們已經有一個小型內部機房:ERP系統、檔案共享、虛擬機,以及本文開頭提到的各種混合環境。風冷散熱。普通乙太網路。 SAN存儲,足以滿足辦公磁碟的需求。.
機器視覺團隊需要利用工廠現場照片訓練一個偵測模型。這些照片不能離開工廠。它們展示了公司不會上傳到雲端(即使是私有雲盤)的流程。採購部門的解決方案是四台雙加速伺服器,以及一張題為「我們的AI資料中心」的幻燈片。由於空間有限,這些伺服器被安裝在兩個現有的機架中。.
並非如此。不到兩週,GPU 就開始發出繁忙的噪音,然後悄無聲息地降頻。當檢查點到達 SAN 時,作業執行速度驟降。一個節點在運行 11 小時後崩潰,整個運行就此結束。 Tomos 並非沒有買晶片。他買了一大堆昂貴的工作站,這些工作站都位於同一郵遞區號區域。這棟大樓當時仍然是一個企業機房。.
他們不需要園區、新的變電站或河流。他們需要的是一個小型單元,其功能類似於微型人工智慧資料中心:機架能夠承受的電力、不會燒壞晶片的散熱、訓練任務可以通訊的網路架構、能夠儲存檢查點的儲存空間,以及節點故障時的運作手冊。由於鏡像資料無法外傳,租用四十分鐘車程外的機房並非良策。改造兩個機架才是正解。.
細胞需要什麼
-
這是根據PDU(電源分配單元)而非GPU需求清單,對該行伺服器的功率預算進行精確計算的結果。如果剩餘容量無法滿足四台伺服器在訓練負載下的需求,那麼討論就到此為止,他們會考慮更密集的機房,而不是尋求奇蹟。
-
冷卻空氣從未被要求處理如此高密度的空氣:如果大廳空間允許,則採用後門熱交換器;如果空間允許,則採用小型液冷循環系統。如果以上兩種方法都不行,伺服器就不會安裝在這裡。
-
四個節點之間需要專用的高頻寬網路結構,而不是辦公室乙太網路。如果供應商的產品目錄中只有 10Gb 交換機,那就不是集群。
-
用於檢查點和訓練分片的本地快速存儲,而不是虛擬機器 SAN。
-
調度器、檢查點間隔和預先編寫的重新啟動路徑。硬體才是主角。這一層才是真正的任務。
-
為生產線設置一個封閉的推理箱,與訓練噪音隔離,因為服務需要的是尾部延遲和隔離,而不是集體幹擾。
-
需要取得記錄電源、GPU 時鐘、節流事件和作業實際運行時間的權限。如果他們無法檢查這些訊息,他們就會拍攝 GPU 的照片,而忽略開關。
範例說明
Tomos 在設施簡報中用簡單易懂的語言闡述了這一點:
不要稱之為人工智慧園區。在現有大廳內搭建一個兩機架的訓練單元,用於放置四台雙加速伺服器。出廠鏡像保留在本地。成功標準是:這四個節點能夠完成一個包含 12 個週期的偵測訓練流程,且不會出現過熱降頻;能夠在幾分鐘內(而不是幾十分鐘)寫入檢查點;並且在我們故意終止某個節點後,能夠從該檢查點恢復運作。散熱必須確保 GPU 始終處於訓練時脈頻率。網路必須由這四個伺服器共享,而不是透過辦公大樓的堆疊結構。儲存必須能夠滿足晶片的需求。如果後門式熱交換器無法安裝,請直接說明並停止專案。不要為混合型大廳內的兩個機架計算 PUE 值。那樣的數值太不靠譜了。.
然後他把這些內容寫進了訓練工作:
每 30 分鐘檢查一次本地快速池。如果某個進程當機,請從上一個完整的檢查點重新開始。不要等待 SAN 恢復。如果時鐘因過熱而下降,請停止訓練。記錄並停止訓練,以便我們查看停滯原因。.
一個好的訓練小時是這樣的:所有八個GPU都以訓練頻率運行,檢查點檔案已寫入,作業仍在同步運行。一個糟糕的訓練小時是這樣的:風扇全速運轉,頻率下降,十分鐘後檢查點文件只寫入了2%,辦公室裡有人說「集群啟動了」。啟動並不意味著正在訓練。.
如何測試它
他們在改造之前就編寫了測試案例,這正是不相信演示結果的關鍵。.
-
相同的 12 個週期配方,相同的 120,000 張檢測靜幀,運行八次
-
計時是指從作業提交到第 12 個紀元的最後一個檢查點之間,包括任何重啟在內的整個流程的實際時間。
-
過熱問題已解決:GPU 時脈頻率在運作期間保持在訓練目標值。即使作業最終完成,降頻事件也算失敗。
-
儲存狀況概述:作業日誌中的檢查點寫入時間、中位數和最差值
-
關於織物的通行證:工作不會因為隊伍健康而停滯不前。如果他們看不到這種停滯,儀器就無法完成。
-
在八次嘗試中,有兩次故意在固定步驟殺死一名士兵,以測試重新開始的路徑。
-
推理測試是獨立於生產線和封閉式發球區之外的一項包含 200 張圖像的測試。訓練成功不計入發球成功。
-
他們以15分鐘為間隔記錄PDU的機架功率,這樣就不用再發明兆瓦這個單位了。
接受將單元格命名為「AI就緒」的標準:8 個配方全部完成;8 個配方中沒有出現過熱降頻;所有被終止的運行都已恢復;檢查點保留在幾分鐘內。如果他們錯過了這些,他們仍然有一個配備高級顯示卡的伺服器機房。.
結果
結果僅為示例,來自虛構的八次測試,並非已發布的 Kestrel 數據。.
假設:兩台機架中的四台雙加速器伺服器;一個偵測模型;120,000 張靜態影像;固定 12 個週期的配方運行八次;掛鐘包括配方完成前的重啟;節流是指訓練時鐘的記錄下降;檢查點時間是寫入時間,而不是期望時間;機架功率是 PDU 採樣值,而不是園區 PUE。.
改造前,辦公室乙太網路和虛擬機器儲存區域網路 (VM SAN) 上的普通風冷機架中的 GPU:
-
8 次嘗試中有 5 次一次性成功。這 5 次嘗試的平均耗時為 14 小時。
-
8 個任務中有 3 個在大約 11 小時後停滯,必須重新開始(其中兩個是因為節點死亡且檢查點過期,一個是因為檢查點填滿了 SAN)。立即重試,無需等待過夜:浪費了 11 個小時,加上第二次嘗試的 14 個小時,這三個任務總共耗時 25 小時才完成。
-
八道菜的平均完成時間(包括重新開始的次數)為 18 小時。 (其中五道菜為 14 小時,三道菜為 25 小時。八道菜的中位數仍然是 14 小時,這會掩蓋重新開始的次數。因此,這裡以平均值作為基準。)
-
8 次運行中有 7 次記錄到熱節流。在 14 小時的嘗試中,平均降頻運轉時間為 3 小時。
-
檢查點寫入:中位數 22 分鐘
-
等級殺戮並非他們能夠通過的考驗。他們沒有操作手冊。兩起意外死亡事件是調查結果。
-
訓練期間兩個機架的尖峰 IT 負載約為 18 千瓦。機架具備所需的功率,但缺乏冷卻和網路傳輸設備。
在這兩個機架的後門熱交換器之後,四個節點之間建立了一個專用交換結構,一個用於檢查點的小型 NVMe 池,每 30 分鐘進行一次檢查點,以及一個重啟運行手冊:
-
8 人全部一次完成。平均耗時:9 小時
-
熱節流:0/8
-
檢查點寫入:中位數為 90 秒。最糟情況:3 分鐘
-
這兩次故意擊殺都是從上一個30分鐘檢查點重新開始的。這兩次額外耗時:每次約40分鐘,包括診斷時間,所以這兩局總共耗時接近9小時40分鐘。八輪平均耗時9小時。
-
IT尖峰負載仍約為18千瓦。晶片相同。但樓宇運作情況不同。
在這個樣本中,完成一個配方的平均時間從 18 小時降至 9 小時,即每次 9 小時,八次運行共耗時 72 小時。一次成功率從 8 次中的 5 次提高到 8 次中的 8 次。油門反應從 8 次中的 7 次降至 8 次中的 0 次。最後一個數字表明他們買的是加速器還是鎮紙。他們不會把時間變化稱為生產效率提高 50%。八次運行是一個規模較小、易於操作的樣本。.
這些數據是基於既定測試、小樣本、單一模型和一個混合大廳的範例估算值。它們並非PUE值,也非校園兆瓦用電量,更不能證明Kestrel應該在田裡建造訓練基地。日誌審查結果顯示,測試時間在9小時內,他們並未隱瞞。 18千瓦的數據是PDU讀數的近似值,並非實際的電費帳單。他們沒有將72小時的測試時間轉化為成本,因為工廠的混合電價會造成虛假的商業案例。.
服務檢查是單獨進行的,規模也更小:現場只需將200張線條影像輸入到圍籬框內即可。這是推理,而非訓練。將兩者混為一談,就如同混合大廳的微縮版錯誤。.
可能出現什麼問題
-
採購部門一直把四台伺服器稱為「人工智慧資料中心」。這個標籤掩蓋了內部的管道,而下一次採購又是為同一個糟糕的通道添加更多的GPU。
-
後門熱交換器安裝完畢,水側卻無人調試。風扇依舊吶喊。時鐘依舊落下
-
此網路架構是一個單交換機,沒有備用路徑。一旦一條連結發生故障,「集群」就會再次只剩下四台工作站。
-
檢查點保留在 SAN 上,因為 NVMe 池處於「第二階段」。第二階段會在下一個失效節點出現前完成。
-
他們給出的PUE值是基於混合大廳中兩個機架的。但氣候、邊界條件以及ERP陣列的其他部分都會影響這個比率,因此這個比率並不固定。
-
培訓和服務共享同一架構。檢查點過多會導致生產線停滯。尾延遲才是最終結果,而非密度。
-
一個節點宕機了,有人卻把它當成正常運作時間故障單處理,而不是檢查點重啟。企業維運和AI運維人員就這樣各說各話,浪費了一整個下午的時間。
-
他們本來可以租個籠子,但影像無法離開。忘記了這個限制,他們便陷入了一場迷霧般的對話,而他們必須從中解脫出來。
實用要點
這種形式的人工智慧資料中心,既不是倉庫,也不是GPU帳單。它是一個讓加速器完成運作的單元:它能容納的電力、能散發的熱量、基礎設施、檢查點,以及在進程崩潰時負責的人。 Kestrel不需要園區,他們只需要兩個機架就能停止裝模作樣。大多數團隊應該效法這種做法。而少數擁有秘密資料集和能夠承受高溫的機房的團隊,應該建造一個獨立的單元,拒絕被套牢。.
常問問題
什麼是人工智慧資料中心?
這是一個高密度運算中心,其電力、冷卻、網路和儲存都圍繞著平行訓練和模型服務而設計,而非整齊排列的通用伺服器。它的設計旨在讓大量加速器能夠同時訓練和運行模型,而不會出現過熱、網路擁塞或磁碟等待等問題。普通的企業機房就像一個混合社區,而人工智慧機房則是一個單一的生態系統,其價值單位是加速器,例如GPU或TPU晶片。它看起來像一個倉庫,運作起來就像一個進行數學運算的發電站。.
人工智慧資料中心與一般資料中心有何不同?
傳統機房優化的是混合工作負載和眾多小型服務的正常運作時間。而人工智慧資料中心則顛覆了這種模式:密度更高,網路成為訓練任務不可或缺的基礎,儲存必須確保檢查點的持續運行,否則加速器就會閒置。企業維運關注的是工單和變更窗口,而人工智慧運作關注的是任務隊列以及長時間運行中節點宕機帶來的糟糕體驗。其實兩者都可以稱為資料中心,只是名稱掩蓋了其內部運作機制。.
為什麼人工智慧資料中心需要消耗這麼多電力?
真正出彩的硬體並非效能卓越的CPU,而是加速器托盤:GPU或其他AI晶片,它們被打包到伺服器、機架,再到共享高頻寬網路的機架行。關鍵在於每個機架的密度:機架數量減少,但每個機架都像一個小型熔爐。一旦整個機房裝滿,就會產生兆瓦級的IT負載,不過要估算一個典型值意義不大。限制因素通常是變電站,而不是GPU的數量。.
人工智慧資料中心是如何冷卻的?
高密度機架的散熱方式是空氣散熱從未真正需要過的。你可以透過後門熱交換器、更高的通道溫度和巧妙的散熱設計來提高空氣的散熱效率。然後液體冷卻也加入了:晶片直冷、冷卻液循環以及一些設計中的浸沒式冷卻。一個會限制效能的加速器,你已經為此付費,卻無法充分利用。 PUE(電源使用效率)仍然很重要,因為每一瓦用於風扇和水泵的功率,就意味著少給GPU的一瓦功率。水也扮演著重要的角色:有些植物只是小口啜飲,有些則需要大口吞嚥。.
為什麼網路效能與GPU效能同樣重要?
訓練就像一場對話:成千上萬個加速器緊密同步地交換梯度、參數和模型碎片。如果網路出現抖動,整個任務都會因為最慢的連結而停滯不前。這就是為什麼人工智慧中心如此重視高頻寬網路、低延遲、類似 InfiniBand 的網路架構或以太網,以及即使鏈路故障也不會崩潰的網路拓撲結構。推理則更關注尾延遲、大量小型請求和隔離性。在這個中心,管道系統就像餐廳一樣至關重要。.
人工智慧資料中心是用於訓練還是推理?
訓練是一個漫長的過程:建立集群,輸入數據,定期檢查節點,然後運行數小時甚至數週。推理則像門面:模型已經訓練完畢,現在可以快速回應,延遲至關重要。訓練中心追求的是電力、土地和密度。推理中心追求的是延遲和地理位置。混合型資料中心的存在是因為資金有限,有時一個資料中心甚至需要配備兩個冷卻迴路。一台離客戶稍近的、略顯老舊的加速器,其性能可能勝過遠在大陸之外的頂級加速器。.
為什麼儲存對人工智慧資料中心至關重要?
訓練資料必須夠快到達,才能避免GPU不堪負荷。檢查點必須成功加載,否則崩潰會導致一週的訓練成果付諸東流。模型權重必須在服務副本上線前載入完畢。儲存吞吐量,而不僅僅是容量,才是真正的瓶頸所在。即使你花費巨資購買加速器,如果使用的是專為虛擬機器設計的、效能適中的陣列,也可能導致加速器效能不足。.
節點在運行過程中崩潰會發生什麼?
在一個緊密耦合的訓練任務中,一個加速器故障就可能導致整個任務停滯。訓練需要的是檢查點,而不是盲目樂觀。推理會耗盡故障節點的資源,保持副本回應,從而確保任務持續運作。變更視窗仍然會與訓練運行發生衝突,而訓練運行並不在乎你的日程安排。冗餘對於電力、冷卻、路徑和儲存仍然至關重要,但故障模式遠不如過去那種「9%正常運行時間」的幻燈片那樣清晰明了。.
人工智慧資料中心對電網、水資源和周邊居民有何影響?
併網往往才是真正的選址過程。與變電站和擁有其他用戶的公用事業公司相比,土地相對容易取得。如果使用冷卻水,一旦雨勢過大,就會引發鄰裡糾紛,同時也會帶來噪音、視覺上的臃腫感以及邊界圍欄附近的熱量。培訓可以隱藏在更便宜的電力市場和更涼爽的氣候中。幹擾因素傾向於靠近使用者。沒有完美的選址。最後只能透過新聞稿來達成妥協。.
我需要擁有自己的人工智慧資料中心,還是應該租用?
大多數人並不需要擁有這樣的機房。超大規模資料中心營運商之所以會建造機房,是因為他們的產品就是龐大的資料中心集群。實驗室之所以會建造機房,是因為隊列時間成為瓶頸,或是資料無法外發。對於擁有機密資料集的銀行、醫院、政府機構或製造商來說,在本地部署或使用私人機房是合理的選擇。其他使用者則應該選擇租賃:例如,提供人工智慧就緒的託管機房、雲端預留空間或託管叢集。這樣,您無需成為資料中心運營商即可獲得加速器。.
參考
-
國際能源總署 (IEA) - www.iea.org
-
勞倫斯伯克利國家實驗室 (LBNL) - datacenters.lbl.gov
-
綠色網格——www.thegreengrid.org
-
勞倫斯伯克利國家實驗室 (LBNL) - datacenters.lbl.gov
-
勞倫斯伯克利國家實驗室 (LBNL) - datacenters.lbl.gov
-
Uptime Institute - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com