馬斯克的太空 AI 資料中心構想:散熱、輻射與維護的可行性分析

馬斯克 (Elon Musk) 最近在訪談中提出一個想法:「把 AI 資料中心送上太空,直接利用 24 小時不間斷的太陽能來驅動龐大的算力。」

這個構想先處理了能源來源:太空沒有雲層,也沒有地球上的晝夜變化,太陽能可以持續供電。另一個直覺是,太空溫度接近絕對零度 (-270°C),設備散熱應該更容易。

但把問題拆開來看,能源只是其中一部分。我比較在意的是散熱、輻射和維護。這三項會直接影響資料中心能否長期運作。


1. 散熱:太空很冷,但真空不利排熱

太空背景溫度很低,不代表運作中的設備容易降溫。真空中沒有空氣,熱量無法透過「對流」(Convection) 散出,主要只能靠「熱輻射」(Thermal Radiation)

  • 根據 NASA 與 IEEE 的研究,在電子元件的運作溫度下,太空散熱板每平方公尺約能排出 100 - 350 瓦 (W) 的熱量。
  • 一個標準的 NVIDIA H100 機櫃功率約 40,000 瓦 (40kW)
  • 依這個範圍估算,冷卻一個機櫃需要約 200 - 400 平方公尺 的散熱板,面積接近一個籃球場。若規模擴大到 100MW 的中型資料中心,散熱板面積大約相當於 100 個足球場,工程結構會很難處理。

2. 輻射:商用 GPU 的壽命問題

地球大氣層會阻擋一部分宇宙射線 (Cosmic Rays)。到了軌道上,商用級 GPU 會直接面對高能粒子。

  • 針對 NVIDIA Jetson Nano 架構的總游離劑量測試 (Total Ionizing Dose) 顯示,即使加上 2.5mm 厚的鋁屏蔽,在低軌道 (LEO) 的預期壽命仍只有 1.5 到 2 年
  • 在地球上,H100 可以使用 5 年甚至更久;若太空中的設備每 1.5 年就要更換一次,硬體資本支出 (CapEx) 可能達到地球方案的 3 倍以上

3. 維護:小故障可能變成整機損失

在地球資料中心,記憶體或風扇故障時,工程師可以直接更換,成本可能只有幾百美元。放到太空後,同樣的小故障可能讓一台價值數百萬美元的伺服器無法繼續使用。

除非另外部署能在軌道上工作的「AI 維修機器人」,否則維護成本會直接反映在總體擁有成本 (TCO) 上。這是商業化時很難避開的問題。


結論:較適合邊緣運算,不適合大型訓練

以目前條件來看,將大規模 AI 訓練中心 (Training Cluster) 送上太空,在物理上不是完全做不到,但散熱面積、輻射造成的硬體壽命,以及後續維護,都會讓工程與成本變得很難控制。

比較實際的方向仍是邊緣運算 (Edge Computing):直接在 Starlink 衛星上處理影像數據,減少傳回地球的頻寬,而不是在太空中訓練 GPT-6。


參考資料 (References)

Author image
關於 Richard Zheng
About me 喜歡爬山,瑜伽,溜冰,喜歡新奇的事,最喜歡的還是寫程式帶來的成就感,對於資訊會不斷的出現新事物也能抱持好奇與熱忱。近期開始將學習的心得寫在Blog,發現思路更清晰也加深了記憶。 紙上得來終覺淺,絕知此事要躬行