首頁/GPU 雲

GPU 雲與 AI 超算

NVIDIA GPU 雲,從一個節點到 4,096 張卡

按秒租用單租戶 NVIDIA 加速卡,或在整個訓練週期內預留一整套 InfiniBand 互聯的叢集。無論用哪種方式購買,硬體、網路和工程師團隊都是同一套。

開通速度
< 90 秒
計費方式
按秒計費,無流量費
網路
400G / 800G 無阻塞
最大叢集
單網路 4,096 卡
可用性 SLA
99.99% 基礎設施
GPU 清單

選擇你的加速卡

每一種型號都可以選擇單租戶裸金屬例項,或 GPU 直通的虛擬化例項。多節點型號預設配備 rail-optimized InfiniBand。

GPU架構視訊記憶體 / 頻寬互聯適用場景起價(每卡時)
GB300 NVL72Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 rack-scale + XDR 800G萬億引數訓練、長上下文推論$8.91
B300 SXM (HGX)Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 + XDR 800G前沿預訓練、MoE 微調$8.34
B200 SXM (HGX)Blackwell180 GB HBM3e · 8 TB/sNVLink 5 + NDR/XDR大規模訓練、FP4 推論$6.61
H200 SXM (HGX)Hopper141 GB HBM3e · 4.8 TB/sNVLink 4 + NDR 400G70B–400B 訓練與高吞吐推論$3.79
H100 SXM (HGX)Hopper80 GB HBM3 · 3.35 TB/sNVLink 4 + NDR 400G主流訓練、微調與推論$3.10
H100 NVL / PCIeHopper94 / 80 GB · 3.9 TB/sNVLink bridge + 200G高密度推論、混合負載$2.70
A100 SXM 80GBAmpere80 GB HBM2e · 2.0 TB/sNVLink 3 + HDR 200G成本優先的訓練與批次推論$1.90
A100 SXM 40GBAmpere40 GB HBM2 · 1.6 TB/sNVLink 3 + HDR 200G成本優先的訓練與批次推論$1.47
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 200G推論、模擬、圖形與 Omniverse$2.18
L40SAda Lovelace48 GB GDDR6 · 864 GB/sPCIe Gen4 · 100G推論、渲染、影片、雲桌面$1.35
RTX 5090Blackwell32 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 100G科研、擴散模型、開發叢集$0.75

以上為按需美元參考標價(每卡時),不含稅。預留與長約有折扣,詳見價格頁

三種購買方式

按你專案的預算方式來買算力

彈性

按需

按秒計費、無需承諾。適合實驗、評測流水線與突發微調。

  • 每例項 1–8 卡
  • API / 控制檯即時開通
  • 快照與恢復
  • 無流量費
最常選

預留叢集

1–36 個月獨佔的 InfiniBand 互聯 pod,容量鎖定、價格在合約期內固定。

  • 16–4,096 卡,無阻塞網路
  • 託管 Slurm 或 Kubernetes
  • 最高比按需低 55%
  • 合同中寫明容量保障
企業級

私有 AI 雲

由 Velyrix 按你的命名、策略與審計要求營運的物理隔離機房、網路與儲存。

  • 專屬籠位或套間
  • 客戶自持加密金鑰
  • 可選物理隔離
  • 定製 SLA 與變更管理
叢集網路

讓 GPU 不閒著的 rail-optimized 網路

訓練叢集的速度取決於最慢的那次 all-reduce。Velyrix 的每一個多節點 pod 都建立在 rail-optimized、無阻塞的胖樹之上,並配備獨立的儲存與管理平面。

  • 計算平面:NVIDIA Quantum-2 NDR 400G 或 Quantum-X800 XDR 800G InfiniBand,1:1 收斂比
  • 乙太網方案:NVIDIA Spectrum-X,支援 RoCEv2、自適應路由與擁塞控制
  • 網內計算:啟用 SHARP 聚合,降低大規模集合通訊的 all-reduce 時延
  • 儲存平面:獨立 200/400G 網路,checkpoint 寫入不會與梯度通訊爭搶頻寬
  • 管理平面:與租戶流量隔離的帶外 BMC 網路
  • 驗證:交付前提供 NCCL 匯流排頻寬與 all-reduce 時延報告
acceptance-report.txt
# 512× NVIDIA H200 SXM — XDR 800G rail-optimized
nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8

size        busbw       algbw      status
1.00 GB     372.4 GB/s  198.1 GB/s  PASS
4.00 GB     381.9 GB/s  203.7 GB/s  PASS
8.00 GB     384.6 GB/s  205.1 GB/s  PASS

fabric      : 1:1 無阻塞,72 小時 0 鏈路錯誤
gpu_burnin  : 72 小時滿載 — 0 次 XID,0 次 ECC 行重對映
sustained   : 48.9% MFU,Llama 級 70B 參考任務

以上為一次 Velyrix 驗收測試的代表性資料。結果會隨拓撲、模型、batch size 與軟體棧變化; 你的叢集會單獨實測並出具報告。

排程與軟體

帶著你現有的技術棧過來,而不是做一次遷移專案

託管 Slurm

預裝 Slurm,含 Pyxis/Enroot、公平共享計費、拓撲感知排程,以及適配長週期預訓練的 checkpoint-restart 鉤子。

託管 Kubernetes

符合 CNCF 標準的叢集,整合 NVIDIA GPU Operator、Network Operator、MIG 切分、KubeRay 與 Kueue 多租戶排程。

裸金屬 API

提供 Terraform Provider 與 REST API,支援映象部署、iPXE 引導、BMC 控制與網路分割槽 — 你可以在其上自建控制平面。

📦

映象倉庫

區域本地的 NGC、Docker Hub 與私有映象快取,避免 40 GB 映象拉取拖慢 512 卡任務的啟動。

📈

可觀測性

DCGM、Prometheus 與 Grafana,提供按任務的 GPU 利用率、功耗、溫度、XID 事件與網路計數器,可匯出到你自己的 SIEM。

🔧

框架支援

PyTorch、JAX、NeMo、Megatron-LM、DeepSpeed、TorchTitan、vLLM、SGLang 與 TensorRT-LLM 的驗證映象,每月更新。

每個叢集都包含

第一個任務跑起來之前你已經擁有的東西

儲存

按 token 預算配置的高效能並行檔案系統(WEKA 或 VAST),以及用於資料集與 checkpoint 的 S3 相容物件儲存。每節點含 10 TB NVMe 本地暫存。

網路

無阻塞 InfiniBand 或 Spectrum-X 計算網路、雙路 100G 網際網路出口、到 AWS/Azure/GCP/Oracle 的雲專線,以及可選 BGP/IP 出口。標準套餐不收流量費。

安全

單租戶主機、隔離的 VLAN/VRF 與網路分割槽、安全啟動韌體校驗、客戶自管金鑰,以及下架時的擦除與核驗(符合 NIST SP 800-88 purge)。

支援

7×24 NOC、專屬解決方案架構師、P1 級 15 分鐘響應、四小時現場硬體更換目標,以及對照合同可用率的月度 SLA 報告。

驗收

交付前完成:72 小時 GPU 烤機、記憶體與 ECC 驗證、NCCL 頻寬測試、網路錯誤掃描,並出具可交給你審計方的簽署版驗收報告。

與 AI 基礎設施架構師洽談

GPU 由你擁有,維運交給我們

向任何一家 OEM 或經銷商採購你的 NVIDIA 伺服器,直接寄送至 Velyrix 機房,其餘交給我們 — 部署、組網、散熱、監控與長期支援。當然也可以直接租用我們的機器。無論哪一種方式,一個工作天內提供完整方案。

常見問題

Velyrix GPU 雲怎麼計費?

按需例項按秒計費,無最低消費,標準套餐不收資料流出費。預留叢集按月固定費率計費,租期 1 至 36 個月。企業私有云按固定月度平臺費加算力容量報價。

我拿到的是裸金屬還是虛擬機器?

兩種都有。多節點訓練預設使用單租戶裸金屬,直接訪問 GPU、網路卡與 NVMe。在更看重快照與快速重灌的場景,也提供 GPU 直通的虛擬化例項。

多節點訓練叢集用什麼網路?

rail-optimized 無阻塞 InfiniBand —— 每卡 400G 的 NVIDIA Quantum-2 NDR 或 800G 的 Quantum-X800 XDR,並啟用 SHARP 網內歸約。如果你需要純乙太網維運模型,也可選擇支援 RoCEv2 的 NVIDIA Spectrum-X。

Slurm 和 Kubernetes 能跑在同一個叢集上嗎?

可以。常見做法是把預留叢集劃分為兩部分:Slurm 分割槽跑長週期訓練,Kubernetes 分割槽跑推論服務,兩者共享同一套並行檔案系統。分割槽比例在合約期內可以調整。

大規模叢集有最短合約期嗎?

256 卡以上的叢集通常最短三個月,因為涉及網路建設與佈線工作。如果某個機房已有空閒且規格匹配的 pod,可以接受更短的視窗。