餵飽 GPU,並且 checkpoint 不卡頓
一個 512 卡任務寫入數 TB 的 checkpoint,會把儲存鏈路上任何一個短板暴露出來。Velyrix 按你的 checkpoint 間隔與資料集讀取模式來配置儲存,而不是照著採購單上的容量數字配。
| 層級 | 技術 | 典型效能 | 用途 | 起價(每 TB/月) |
|---|---|---|---|---|
| 本地暫存 | 本地 NVMe Gen4/Gen5 | 單節點最高 60 GB/s | Shuffle 空間、dataloader 快取、臨時檔案 | 已包含 |
| 並行檔案系統 — 效能型 | WEKA 或 VAST(NVMe) | 總讀頻寬 1–10 TB/s | 訓練資料集、checkpoint | $42 |
| 並行檔案系統 — 容量型 | NVMe + HDD 混合層 | 200–800 GB/s | 冷資料輪次、資料集歸檔 | $22 |
| 塊儲存 | NVMe-oF 多副本 | 單卷最高 100 萬 IOPS | 資料庫、向量庫、系統盤 | $101 |
| 物件儲存 | S3 相容、糾刪碼 | 多 GB/s,11 個 9 永續性設計 | 資料湖、模型倉庫、產物 | $20 |
| 歸檔 | 冷物件 / 磁帶閘道器 | 數分鐘至數小時取回 | 留存、合規、原始語料 | $6 |
以上為美元參考標價,不含稅。並行檔案系統按叢集單獨配置與報價;效能資料取決於實際部署配置。
三個平面,互不拖累
- 計算平面:NVIDIA Quantum-X800 XDR 800G 或 Quantum-2 NDR 400G InfiniBand,rail-optimized、1:1 無阻塞、啟用 SHARP
- 乙太網方案:NVIDIA Spectrum-X,支援 RoCEv2、自適應路由、擁塞控制與 BlueField-3 DPU 解除安裝
- 儲存平面:獨立 200/400G,checkpoint 寫入永遠不會撞上梯度 all-reduce
- 管理平面:隔離的帶外 BMC 網路,透過跳板機訪問並全程審計
- 對外出口:雙上聯 100G 出口、DDoS 防護,可按需提供 BYOIP 與 BGP 會話
- 互聯:到 AWS、Azure、Google Cloud 與 Oracle 的專線,以及 Velyrix 園區之間的自有暗光纖
以上為 512 卡 pod 的參考拓撲。更大規模的網路會增加第三層,但 rail-optimized 的原則不變。
一個懂 NCCL、而不只是會 ping 的 NOC
7×24 NOC
7×24 值班輪轉,合同約定 P1 級 15 分鐘響應;接電話的工程師真正懂 GPU,並可直接升級到建設你叢集的那支團隊 — 不是照著話術唸的一線客服。
可觀測性
DCGM、node exporter、網路計數器與任務遙測統一進入 Prometheus 與 Grafana,支援按任務歸因並匯出到你的 SIEM。
主動健康檢查
任務之間自動執行節點健康檢查,分析 XID 與 ECC 趨勢,在訓練任務受損之前提前隔離並更換。
生命週期管理
韌體、驅動程式與推論引擎升級先在預釋出 pod 驗證,再按約定視窗滾動到生產環境。
排程器維運
Slurm 與 Kubernetes 調優、佇列與配額策略、公平共享配置,以及按團隊或成本中心的利用率報告。
SLA 報告
按合同口徑出具月度可用性、故障與容量報告,未達標時自動核減下一期賬單。
可舉證的隔離
- 租戶隔離:單租戶物理主機、專屬 VLAN/VRF 與專屬 InfiniBand 分割槽
- 身份:SAML/OIDC 單點登入、SCIM 自動開戶、硬體 MFA、按作用域的 API Key 與基於角色的許可權
- 金鑰:由 HSM 支撐的客戶自管金鑰;Velyrix 無法讀取租戶卷
- 靜態資料:塊、物件與並行儲存層均採用 AES-256 加密
- 傳輸中資料:對外 TLS 1.3,專線可選 MACsec 與 IPsec
- 韌體完整性:安全啟動、簽名韌體基線,每次開通時執行校驗
- 下架:按 NIST SP 800-88 執行擦除並出具證明,或客戶見證銷燬
- 日誌:控制檯、API 與物理准入事件的不可篡改審計記錄
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 張 GPU,一次 apply,交付時完成驗證 }
常見問題
大規模訓練應該用什麼儲存?
活躍資料集與 checkpoint 用效能型並行檔案系統(WEKA 或 VAST,基於 NVMe),更大的資料湖用 S3 相容物件儲存承接,每個節點再配本地 NVMe 作為 shuffle 空間。Velyrix 會按你的 checkpoint 大小與寫入間隔來配置效能層,確保 checkpoint 不會主導單步時間。
可以用乙太網代替 InfiniBand 嗎?
可以。如果你更希望統一為乙太網維運模型,我們提供支援 RoCEv2、自適應路由與擁塞控制的 NVIDIA Spectrum-X。最大規模的訓練網路預設仍用 InfiniBand,因為它有 SHARP 網內歸約和成熟的子網管理。
Velyrix 叢集能連到我們現有的雲環境嗎?
可以,透過到 AWS、Azure、Google Cloud 與 Oracle Cloud 的專線、到你自有機房的 IPsec 或 MACsec 鏈路,以及我們中立 MMR 機房內的跳線。
日常由誰來維運叢集?
你可以自己維運(擁有完整的 Root 與 BMC 許可權),也可以把維運交給 Velyrix 託管服務,涵蓋監控、故障響應、韌體與驅動程式生命週期、排程策略與 SLA 報告。