
面對大型 AI 運算技術會大幅占用記憶體,導致顯示卡、AI 運算卡的 HBM、GDDR 記憶體需要面臨高昂的容量成本與效率瓶頸,NVIDIA 發表 cuFile API 開源技術,能 GPU 在必要時直接將資料存取於 SSD 中,減少記憶體溢出需要分段訓練的麻煩。
NVIDIA 在 FMS 未來記憶體與儲存展上 cuFile API 技術,開技術基於 NVIDIA GPUDirect Storage (GDS) 架構中的開源核心元件,用以解決 GPU 在 AI 訓練上的記憶體容量困境,實現 GPU 可對 SSD 進行直接讀寫的操作。
一般 AI 訓練時,如果 GPU 的 HBM/GDDR 不足,需要工程團隊預先設定分段式訓練的指令,將原有的大型數據分切成多個小段落,將每個訓練段落的資料重新組裝後,再重新跑一次。過程需要頻繁的資料搬遷,讓 AI 訓練的過程相當沒效率。
而 cuFile API 便是略過傳統 GPU 資料調取需要先向 CPU 申請,再從 SSD 搬到 RAM 系統記憶體、最後才進到 VRAM 顯示記憶體的過程,降低了 CPU 與 RAM 的占用。
同時, cuFile API 能夠以微秒級的速率,將 VRAM 與 SSD 之間的資料進行調換,實現串流的連續資料存取,解決傳統爆記憶體需要先排空 VRAM,再重新填入的過程,理論上,提升的不只是效率,還可提升穩定性。
不過這個方案也是有代價的,由於高頻率抽換 SSD 與 VRAM 之間的數據,SSD 的寫入壽命會大幅消耗,但這點在企業機房的架構上,通常可以透過指定特定 SSD 當作快取使用,避免主要檔案發生損壞。
最後,這項技術由於需要依賴 Peer-to-Peer (P2P) PCIe 傳輸功能,這在消費級的 GeForce 顯卡產品上是被拔掉的,因此不適用一般人在家中用 RTX 50 系列顯卡跑 AI ,也無法應用在改善遊戲爆 VRAM 的問題。