首页/平台

存储、网络与托管运维

昂贵的 GPU 不闲着的平台层

加速卡只是最容易的部分。存储、网络、调度与可观测性这几层,才决定你的集群是跑在 30% 利用率还是 55% — 而这些我们全部 7×24 运营。

存储

喂饱 GPU,并且 checkpoint 不卡顿

一个 512 卡任务写入数 TB 的 checkpoint,会把存储链路上任何一个短板暴露出来。Velyrix 按你的 checkpoint 间隔与数据集读取模式来配置存储,而不是照着采购单上的容量数字配。

层级技术典型性能用途起价(每 TB/月)
本地暂存本地 NVMe Gen4/Gen5单节点最高 60 GB/sShuffle 空间、dataloader 缓存、临时文件已包含
并行文件系统 — 性能型WEKA 或 VAST(NVMe)总读带宽 1–10 TB/s训练数据集、checkpoint$42
并行文件系统 — 容量型NVMe + HDD 混合层200–800 GB/s冷数据轮次、数据集归档$22
块存储NVMe-oF 多副本单卷最高 100 万 IOPS数据库、向量库、系统盘$101
对象存储S3 兼容、纠删码多 GB/s,11 个 9 持久性设计数据湖、模型仓库、产物$20
归档冷对象 / 磁带网关数分钟至数小时取回留存、合规、原始语料$6

以上为美元参考标价,不含税。并行文件系统按集群单独配置与报价;性能数据取决于实际部署配置。

网络

三个平面,互不拖累

  • 计算平面:NVIDIA Quantum-X800 XDR 800G 或 Quantum-2 NDR 400G InfiniBand,rail-optimized、1:1 无阻塞、启用 SHARP
  • 以太网方案:NVIDIA Spectrum-X,支持 RoCEv2、自适应路由、拥塞控制与 BlueField-3 DPU 卸载
  • 存储平面:独立 200/400G,checkpoint 写入永远不会撞上梯度 all-reduce
  • 管理平面:隔离的带外 BMC 网络,通过跳板机访问并全程审计
  • 对外出口:双上联 100G 出口、DDoS 防护,可按需提供 BYOIP 与 BGP 会话
  • 互联:到 AWS、Azure、Google Cloud 与 Oracle 的专线,以及 Velyrix 园区之间的自有暗光纤
脊交换 — Quantum-X800 XDR×8
叶交换 — rail 0–7×32
存储叶交换 — Spectrum-X SN5600×4
边界 / 出口路由器2N
带外管理网络物理隔离
云专线 — 4×10G私有
子网管理器 — 高可用对主备

以上为 512 卡 pod 的参考拓扑。更大规模的网络会增加第三层,但 rail-optimized 的原则不变。

托管运维

一个懂 NCCL、而不只是会 ping 的 NOC

7×24 NOC

7×24 值班轮转,合同约定 P1 级 15 分钟响应;接电话的工程师真正懂 GPU,并可直接升级到建设你集群的那支团队 — 不是照着话术念的一线客服。

📊

可观测性

DCGM、node exporter、网络计数器与任务遥测统一进入 Prometheus 与 Grafana,支持按任务归因并导出到你的 SIEM。

🛡

主动健康检查

任务之间自动执行节点健康检查,分析 XID 与 ECC 趋势,在训练任务受损之前提前隔离并更换。

🔄

生命周期管理

固件、驱动与推理引擎升级先在预发布 pod 验证,再按约定窗口滚动到生产环境。

📦

调度器运维

Slurm 与 Kubernetes 调优、队列与配额策略、公平共享配置,以及按团队或成本中心的利用率报告。

📝

SLA 报告

按合同口径出具月度可用性、故障与容量报告,未达标时自动核减下一期账单。

安全架构

可举证的隔离

  • 租户隔离:单租户物理主机、专属 VLAN/VRF 与专属 InfiniBand 分区
  • 身份:SAML/OIDC 单点登录、SCIM 自动开户、硬件 MFA、按作用域的 API Key 与基于角色的权限
  • 密钥:由 HSM 支撑的客户自管密钥;Velyrix 无法读取租户卷
  • 静态数据:块、对象与并行存储层均采用 AES-256 加密
  • 传输中数据:对外 TLS 1.3,专线可选 MACsec 与 IPsec
  • 固件完整性:安全启动、签名固件基线,每次开通时执行校验
  • 下架:按 NIST SP 800-88 执行擦除并出具证明,或客户见证销毁
  • 日志:控制台、API 与物理准入事件的不可篡改审计记录
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 张 GPU,一次 apply,交付时完成验证
}
与 AI 基础设施架构师沟通

GPU 归你所有,运营交给我们

从任何一家 OEM 或代理商采购你的 NVIDIA 服务器,直接发到 Velyrix 机房,剩下的交给我们 — 部署、组网、散热、监控与长期支持。当然也可以直接租用我们的机器。无论哪种方式,一个工作日内给你完整方案。

常见问题

大规模训练应该用什么存储?

活跃数据集与 checkpoint 用性能型并行文件系统(WEKA 或 VAST,基于 NVMe),更大的数据湖用 S3 兼容对象存储承接,每个节点再配本地 NVMe 作为 shuffle 空间。Velyrix 会按你的 checkpoint 大小与写入间隔来配置性能层,确保 checkpoint 不会主导单步时间。

可以用以太网代替 InfiniBand 吗?

可以。如果你更希望统一为以太网运维模型,我们提供支持 RoCEv2、自适应路由与拥塞控制的 NVIDIA Spectrum-X。最大规模的训练网络默认仍用 InfiniBand,因为它有 SHARP 网内归约和成熟的子网管理。

Velyrix 集群能连到我们现有的云环境吗?

可以,通过到 AWS、Azure、Google Cloud 与 Oracle Cloud 的专线、到你自有机房的 IPsec 或 MACsec 链路,以及我们中立 MMR 机房内的跳线。

日常由谁来运维集群?

你可以自己运维(拥有完整的 Root 与 BMC 权限),也可以把运维交给 Velyrix 托管服务,涵盖监控、故障响应、固件与驱动生命周期、调度策略与 SLA 报告。