關鍵重點
資料中心如何突破 IT/OT 整合挑戰,打造支援 AI 運算的關鍵基礎設施?
- 即時基礎設施監測: 即時掌握 GPU 運算負載,動態調整冷卻與供電資源配置,降低高密度 AI 機櫃熱點風險。
- 通訊協定閘道器實現 IT/OT 整合: 將 Modbus RTU 資料轉換為 SNMP、MQTT 或 BACnet 等通訊格式,協助既有設備順利接軌 DCIM 與雲端監控平台。
- 毫秒級備援與安全連網: 透過 Secure Terminal Server 與 Turbo Ring 備援技術,確保關鍵資料傳輸不中斷,提升資料中心網路可靠度與營運韌性。
突破 IT/OT 整合挑戰,打造 AI 資料中心基礎設施
資料中心產業正面臨數十年來最重大的架構轉型。過去,資料中心的主要任務是提供可靠的資料儲存與穩定的存取服務。然而,隨著生成式 AI 快速發展,資料中心的定位與設計正被重新定義。如今,企業打造的不再只是傳統資料中心,而是支撐高密度 AI 運算的關鍵基礎設施。面對日益成長的 AI 工作負載,資料中心正逐步從以儲存為核心的架構,轉型為支援 AI 訓練、推論與即時運算的高效能運算平台。
在 AI 時代,高密度 GPU 運算叢集對環境監測精度、供電穩定性及系統可靠度提出前所未有的要求,而這些需求往往超出傳統資料中心基礎設施的設計範圍。
如今,Tier III 和 IV 基準認證已成為 AI 就緒資料中心的最低門檻。對營運團隊而言,最大的挑戰在於如何善用既有設備與基礎設施,支援日益增加的 AI 運算負載,同時控制升級成本與維運複雜度。
關鍵在於建立強固且可靠的連網架構。在支援 AI 運算的資料中心環境中,即使冷卻系統或供電鏈發生短暫中斷,也可能導致設備故障,甚至造成高成本運算資源與時間的損失。因此,打造具備高韌性與高可靠度的關鍵基礎設施,必須從網路、供電、監測與資安等層面全面規劃。
1. 從被動監控走向智慧調適的基礎設施管理
傳統企業資料中心的散熱管理多半仰賴定期檢查與被動式應對機制。然而,在以 GPU 為核心的 AI 資料中心中,單一機櫃功率可能接近 100 kW,幾乎沒有容錯空間,任何溫度監測資料的缺漏或誤差,都可能導致設備故障。
因此,資料中心需要從被動監控轉向智慧調適的維運模式。這意味著必須將電力監測資料從單純的監控工具,提升為支撐營運決策的重要基礎。
透過集中整合冰水主機系統、液冷設備及配電櫃(PDC)等基礎設施的即時監測資料,營運人員可同步掌握電力與熱能變化,並根據 AI 運算負載動態調整資源配置,避免熱點產生,同時即時優化能源使用效率。
2. 打通 IT/OT 資料流:從 Modbus 到雲端平台的整合關鍵
要實現完整的資料中心監測架構,首先必須整合分散於各系統中的設備資料。然而,最大的挑戰往往來自 IT 與 OT 系統之間的通訊協定差異。
許多關鍵電力與基礎設施設備仍採用 Modbus RTU 等傳統工業通訊協定;而現代 DCIM 平台、雲端監控系統及 AI 驅動的管理工具,則多使用 SNMP、MQTT 等 IT 通訊架構。對許多營運團隊而言,供應商鎖定(vendor lock-in)也增加了系統升級的複雜度,使其必須在既有設備投資與現代化需求之間取得平衡。
全面汰換既有設備並非最理想的升級方式,更有效率的做法是透過通訊協定整合,讓既有設備順利接軌現代化 DCIM 平台。工業級通訊協定閘道器可將 Modbus RTU/ASCII 資料轉換為 Modbus TCP、BACnet 等主流協定,協助既有設備無縫串接 DCIM、EPMS 及雲端監控平台。
透過此方式,不僅能保留既有設備與配線架構,也能降低系統整合複雜度與升級成本,加速 AI 資料中心基礎設施現代化。
3. 強化既有設備資安防護,降低 AI 資料中心風險
隨著資料中心持續將更多既有設備納入網路架構,以取得更完整的設備監測資料與營運資訊,潛在的資安風險也隨之增加。許多傳統串列設備設計於資安要求尚未普及的年代,當時的防護機制多半仰賴實體隔離,而非現今常見的網路資安防護架構。
對現代 AI 資料中心而言,確保既有串列設備的通訊安全已成為不可忽視的基本要求。透過部署具備資安功能的串列設備伺服器(Secure Terminal Server),可利用安全通訊協定加密傳輸資料,降低設備遭未授權存取、資料被攔截或遭竄改的風險。
例如,攻擊者可能攔截關鍵配電設備(PDC)的控制指令,或偽造備援發電機的監測資料,進而影響資料中心營運穩定性。因此,建立安全可靠的網路環境不僅是資安需求,更是確保供電穩定、提升營運韌性的重要基礎。
4. 透過毫秒級網路備援確保關鍵系統不中斷
除了提升運算效能與資料整合能力外,支撐 AI 發展的另一項關鍵,在於確保系統發生異常時仍能持續穩定運作。
在 AI 資料中心中,基礎設施網路是維持冷卻系統、供電設備與監測平台穩定運作的關鍵骨幹。一旦冷卻控制網路中的交換器發生故障,高密度 AI 機櫃的溫度可能在短時間內快速升高,進而影響設備運作,甚至造成停機風險。然而,傳統 IT 網路常用的備援機制,例如 Spanning Tree Protocol(STP),故障復原時間通常以秒為單位計算,難以滿足資料中心關鍵基礎設施的即時需求。
因此,AI 資料中心更需要採用工業級高可靠度網路備援技術。以 Moxa Turbo Ring 為例,可在毫秒等級內完成網路故障切換,確保冷卻系統與電力監測資料持續不中斷傳輸。
在 AI 模型訓練成本日益提升的環境下,超高速網路復原能力不僅能強化系統韌性,更能降低停機造成的營運風險與成本損失。
打造 AI 資料中心,從穩固的 IT/OT 整合開始
資料中心從傳統運算環境演進至 AI 運算平台,不只是增加更多 GPU 或提升運算效能,更重要的是建構能支撐高密度 AI 運算的關鍵基礎設施。
可靠的連網能力是 AI 資料中心穩定運作的核心。透過即時掌握設備狀態、整合 IT 與 OT 資料,營運團隊可有效優化電力與冷卻資源配置,提升整體營運效率與系統可靠度。
透過強化 IT/OT 整合、提升既有設備的資安防護能力,以及導入毫秒級網路備援技術,Moxa 協助資料中心營運團隊在保留既有基礎設施投資的同時,順利建構符合 AI 時代需求的高可靠度運算架構。
想了解如何打造支援高密度 AI 運算的高可靠度資料中心基礎設施?立即查看 AI 資料中心基礎設施解決方案。