喂饱 GPU,并且 checkpoint 不卡顿
一个 512 卡任务写入数 TB 的 checkpoint,会把存储链路上任何一个短板暴露出来。Velyrix 按你的 checkpoint 间隔与数据集读取模式来配置存储,而不是照着采购单上的容量数字配。
| 层级 | 技术 | 典型性能 | 用途 | 起价(每 TB/月) |
|---|---|---|---|---|
| 本地暂存 | 本地 NVMe Gen4/Gen5 | 单节点最高 60 GB/s | Shuffle 空间、dataloader 缓存、临时文件 | 已包含 |
| 并行文件系统 — 性能型 | WEKA 或 VAST(NVMe) | 总读带宽 1–10 TB/s | 训练数据集、checkpoint | $42 |
| 并行文件系统 — 容量型 | NVMe + HDD 混合层 | 200–800 GB/s | 冷数据轮次、数据集归档 | $22 |
| 块存储 | NVMe-oF 多副本 | 单卷最高 100 万 IOPS | 数据库、向量库、系统盘 | $101 |
| 对象存储 | S3 兼容、纠删码 | 多 GB/s,11 个 9 持久性设计 | 数据湖、模型仓库、产物 | $20 |
| 归档 | 冷对象 / 磁带网关 | 数分钟至数小时取回 | 留存、合规、原始语料 | $6 |
以上为美元参考标价,不含税。并行文件系统按集群单独配置与报价;性能数据取决于实际部署配置。
三个平面,互不拖累
- 计算平面:NVIDIA Quantum-X800 XDR 800G 或 Quantum-2 NDR 400G InfiniBand,rail-optimized、1:1 无阻塞、启用 SHARP
- 以太网方案:NVIDIA Spectrum-X,支持 RoCEv2、自适应路由、拥塞控制与 BlueField-3 DPU 卸载
- 存储平面:独立 200/400G,checkpoint 写入永远不会撞上梯度 all-reduce
- 管理平面:隔离的带外 BMC 网络,通过跳板机访问并全程审计
- 对外出口:双上联 100G 出口、DDoS 防护,可按需提供 BYOIP 与 BGP 会话
- 互联:到 AWS、Azure、Google Cloud 与 Oracle 的专线,以及 Velyrix 园区之间的自有暗光纤
以上为 512 卡 pod 的参考拓扑。更大规模的网络会增加第三层,但 rail-optimized 的原则不变。
一个懂 NCCL、而不只是会 ping 的 NOC
7×24 NOC
7×24 值班轮转,合同约定 P1 级 15 分钟响应;接电话的工程师真正懂 GPU,并可直接升级到建设你集群的那支团队 — 不是照着话术念的一线客服。
可观测性
DCGM、node exporter、网络计数器与任务遥测统一进入 Prometheus 与 Grafana,支持按任务归因并导出到你的 SIEM。
主动健康检查
任务之间自动执行节点健康检查,分析 XID 与 ECC 趋势,在训练任务受损之前提前隔离并更换。
生命周期管理
固件、驱动与推理引擎升级先在预发布 pod 验证,再按约定窗口滚动到生产环境。
调度器运维
Slurm 与 Kubernetes 调优、队列与配额策略、公平共享配置,以及按团队或成本中心的利用率报告。
SLA 报告
按合同口径出具月度可用性、故障与容量报告,未达标时自动核减下一期账单。
可举证的隔离
- 租户隔离:单租户物理主机、专属 VLAN/VRF 与专属 InfiniBand 分区
- 身份:SAML/OIDC 单点登录、SCIM 自动开户、硬件 MFA、按作用域的 API Key 与基于角色的权限
- 密钥:由 HSM 支撑的客户自管密钥;Velyrix 无法读取租户卷
- 静态数据:块、对象与并行存储层均采用 AES-256 加密
- 传输中数据:对外 TLS 1.3,专线可选 MACsec 与 IPsec
- 固件完整性:安全启动、签名固件基线,每次开通时执行校验
- 下架:按 NIST SP 800-88 执行擦除并出具证明,或客户见证销毁
- 日志:控制台、API 与物理准入事件的不可篡改审计记录
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 张 GPU,一次 apply,交付时完成验证 }
常见问题
大规模训练应该用什么存储?
活跃数据集与 checkpoint 用性能型并行文件系统(WEKA 或 VAST,基于 NVMe),更大的数据湖用 S3 兼容对象存储承接,每个节点再配本地 NVMe 作为 shuffle 空间。Velyrix 会按你的 checkpoint 大小与写入间隔来配置性能层,确保 checkpoint 不会主导单步时间。
可以用以太网代替 InfiniBand 吗?
可以。如果你更希望统一为以太网运维模型,我们提供支持 RoCEv2、自适应路由与拥塞控制的 NVIDIA Spectrum-X。最大规模的训练网络默认仍用 InfiniBand,因为它有 SHARP 网内归约和成熟的子网管理。
Velyrix 集群能连到我们现有的云环境吗?
可以,通过到 AWS、Azure、Google Cloud 与 Oracle Cloud 的专线、到你自有机房的 IPsec 或 MACsec 链路,以及我们中立 MMR 机房内的跳线。
日常由谁来运维集群?
你可以自己运维(拥有完整的 Root 与 BMC 权限),也可以把运维交给 Velyrix 托管服务,涵盖监控、故障响应、固件与驱动生命周期、调度策略与 SLA 报告。