Beranda/Platform

Penyimpanan, jaringan & operasi terkelola

Platform yang menjaga GPU mahal tetap sibuk

Akselerator adalah bagian yang mudah. Velyrix membangun lapisan penyimpanan, fabric, penjadwalan, dan observabilitas yang menentukan apakah klaster Anda berjalan pada utilisasi 30% atau 55% — dan mengoperasikan semuanya 24×7.

Penyimpanan

Beri makan GPU, checkpoint tanpa tersendat

Job 512 GPU yang menulis checkpoint multi-terabyte akan menyingkap setiap kelemahan pada jalur penyimpanan. Velyrix menentukan ukuran penyimpanan berdasarkan interval checkpoint dan pola baca dataset Anda, bukan berdasarkan angka kapasitas pada pesanan pembelian.

TingkatTeknologiPerforma umumKasus penggunaanMulai (per TB/bulan)
ScratchNVMe lokal Gen4/Gen5Hingga 60 GB/s per nodeRuang shuffle, cache dataloader, sementaraTermasuk
FS paralel — performaWEKA atau VAST di NVMeBaca agregat 1–10 TB/sDataset pelatihan, checkpoint$42
FS paralel — kapasitasTingkat hibrida NVMe + HDD200–800 GB/sEpoch dingin, arsip dataset$22
BlokNVMe-oF tereplikasiHingga 1 juta IOPS per volumeBasis data, vector store, volume boot$101
ObjekKompatibel S3, erasure codedMulti-GB/s, desain daya tahan 11 nineData lake, registry model, artefak$20
ArsipObjek dingin / gateway tapePengambilan dalam menit hingga jamRetensi, kepatuhan, korpus mentah$6

Harga daftar indikatif, belum termasuk pajak. Sistem file paralel ditentukan ukuran dan harganya per klaster; angka kinerja bergantung pada konfigurasi yang di-deploy.

Jaringan

Tiga plane, tidak pernah berbagi hari buruk

  • Plane komputasi: InfiniBand NVIDIA Quantum-X800 XDR 800G atau Quantum-2 NDR 400G, rail-optimised, non-blocking 1:1, SHARP aktif
  • Alternatif Ethernet: NVIDIA Spectrum-X dengan RoCEv2, routing adaptif, kendali kongesti, dan offload DPU BlueField-3
  • Plane penyimpanan: 200/400G dedikasi agar penulisan checkpoint tidak pernah bertabrakan dengan all-reduce gradien
  • Plane manajemen: jaringan BMC out-of-band terisolasi dengan akses jump host dan audit penuh
  • Eksternal: transit 100G dual-homed, mitigasi DDoS, BYOIP, dan sesi BGP atas permintaan
  • Interkoneksi: tautan privat ke AWS, Azure, Google Cloud, dan Oracle, plus serat gelap antar kampus Velyrix
Spine — Quantum-X800 XDR×8
Leaf — rail 0–7×32
Leaf penyimpanan — Spectrum-X SN5600×4
Router perbatasan / transit2N
Manajemen out-of-bandTerisolasi
On-ramp cloud — 4×10GPrivat
Subnet manager — pasangan HAAktif/siaga

Topologi referensi untuk pod 512 GPU. Fabric yang lebih besar menambah tingkat ketiga; prinsip rail-optimised tidak berubah.

Operasi terkelola

NOC yang memahami NCCL, bukan sekadar ping

NOC 24×7

Rotasi siaga 24×7 dengan respons P1 kontraktual 15 menit, insinyur yang paham GPU, dan eskalasi langsung ke tim yang membangun klaster Anda — bukan skrip lini pertama.

📊

Observabilitas

DCGM, node exporter, penghitung fabric, dan telemetri job di Prometheus dan Grafana, dengan atribusi per job dan ekspor ke SIEM Anda.

🛡

Kesehatan proaktif

Pemeriksaan kesehatan node otomatis di antara job, analisis tren XID dan ECC, serta drain dan penggantian preventif sebelum satu run hilang.

🔄

Manajemen siklus hidup

Peningkatan firmware, driver, dan mesin divalidasi lebih dulu di pod staging, lalu digulirkan ke produksi pada jendela yang disepakati.

📦

Operasi penjadwal

Penyetelan Slurm dan Kubernetes, kebijakan antrean dan kuota, konfigurasi fair-share, dan pelaporan utilisasi per tim atau pusat biaya.

📝

Pelaporan SLA

Laporan ketersediaan, insiden, dan kapasitas bulanan diukur terhadap kontrak, dengan kredit diterapkan otomatis saat target tidak tercapai.

Arsitektur keamanan

Isolasi yang dapat Anda buktikan

  • Penyewaan: host fisik single-tenant, VLAN/VRF dedikasi, dan partisi InfiniBand dedikasi
  • Identitas: single sign-on SAML/OIDC, penyediaan SCIM, MFA perangkat keras, kunci API bercakupan, dan akses berbasis peran
  • Kunci: kunci enkripsi dikelola pelanggan dengan dukungan HSM; Velyrix tidak dapat membaca volume penyewa
  • Data saat diam: AES-256 pada tier blok, objek, dan penyimpanan paralel
  • Data saat transit: TLS 1.3 secara eksternal, opsi MACsec dan IPsec pada tautan privat
  • Integritas firmware: secure boot, baseline firmware bertanda tangan, dan atestasi pada setiap penyediaan
  • Dekomisioning: purge NIST SP 800-88 dengan sertifikat sanitasi, atau penghancuran disaksikan pelanggan
  • Pencatatan: jejak audit tak terubah atas setiap peristiwa konsol, API, dan akses fisik
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 GPUs, one apply, validated on delivery
}
Bicara dengan arsitek infrastruktur AI

GPU milik Anda. Kami yang mengoperasikannya.

Beli server NVIDIA Anda dari OEM atau distributor mana pun, kirim langsung ke fasilitas Velyrix, dan kami menangani sisanya: implementasi, jaringan, pendinginan, pemantauan, dan dukungan. Atau sewa milik kami. Apa pun pilihannya, Anda menerima rencana dalam satu hari kerja.

Pertanyaan umum

Penyimpanan apa yang harus kami pakai untuk pelatihan besar?

Sistem file paralel berkinerja - WEKA atau VAST pada NVMe - untuk dataset aktif dan checkpoint, didukung penyimpanan objek kompatibel S3 untuk data lake yang lebih luas, dengan NVMe scratch lokal di tiap node untuk ruang shuffle. Velyrix menentukan ukuran tier kinerja dari ukuran dan interval checkpoint Anda agar checkpointing tidak pernah mendominasi waktu langkah.

Apakah Anda mendukung Ethernet alih-alih InfiniBand?

Ya. NVIDIA Spectrum-X dengan RoCEv2, routing adaptif, dan kendali kongesti tersedia bila model operasional khusus Ethernet lebih disukai. InfiniBand tetap menjadi standar untuk fabric pelatihan terbesar karena reduksi SHARP dalam jaringan dan manajemen subnet yang matang.

Bisakah kami menghubungkan klaster Velyrix ke lingkungan cloud kami yang ada?

Ya, melalui interkoneksi privat ke AWS, Azure, Google Cloud, dan Oracle Cloud, tautan terlindungi IPsec atau MACsec ke pusat data Anda sendiri, serta cross-connect di ruang meet-me netral operator kami.

Siapa yang mengoperasikan klaster sehari-hari?

Anda dapat mengoperasikannya sendiri dengan akses root dan BMC penuh, atau menyerahkan operasi kepada Velyrix di bawah layanan terkelola yang mencakup pemantauan, respons insiden, siklus hidup firmware dan driver, kebijakan penjadwal, dan pelaporan SLA.