Accueil/Cloud GPU

Cloud GPU et supercalcul IA

Cloud GPU NVIDIA, d'un nœud à 4 096 GPU

Provisionnez des accélérateurs NVIDIA mono-locataires à la seconde, ou réservez un cluster entier connecté en InfiniBand pour toute la durée de votre campagne d'entraînement. Même matériel, même fabric, mêmes ingénieurs, quel que soit votre mode d'achat.

Provisionnement
< 90 secondes
Facturation
À la seconde, sans frais de sortie
Fabric
400G / 800G non bloquant
Cluster maximal
4 096 GPU sur un seul fabric
SLA de disponibilité
99,99% d'infrastructure
Catalogue GPU

Choisissez votre accélérateur

Chaque SKU est disponible en instance bare metal mono-locataire ou en instance virtualisée avec passthrough GPU. Les SKU multinœuds incluent l'InfiniBand optimisé par rail en standard.

GPUArchitectureMémoire / bande passanteInterconnexionIdéal pourÀ partir de (GPU-heure)
GB300 NVL72Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 rack-scale + XDR 800GEntraînement à mille milliards de paramètres, inférence à contexte long$8.91
B300 SXM (HGX)Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 + XDR 800GPré-entraînement de frontière, fine-tuning MoE$8.34
B200 SXM (HGX)Blackwell180 GB HBM3e · 8 TB/sNVLink 5 + NDR/XDREntraînement à grande échelle, inférence FP4$6.61
H200 SXM (HGX)Hopper141 GB HBM3e · 4.8 TB/sNVLink 4 + NDR 400GEntraînement 70B–400B et service à haut débit$3.79
H100 SXM (HGX)Hopper80 GB HBM3 · 3.35 TB/sNVLink 4 + NDR 400GEntraînement, fine-tuning et inférence courants$3.10
H100 NVL / PCIeHopper94 / 80 GB · 3.9 TB/sNVLink bridge + 200GDensité d'inférence, charges mixtes$2.70
A100 SXM 80GBAmpere80 GB HBM2e · 2.0 TB/sNVLink 3 + HDR 200GEntraînement et inférence par lots à coût optimisé$1.90
A100 SXM 40GBAmpere40 GB HBM2 · 1.6 TB/sNVLink 3 + HDR 200GEntraînement et inférence par lots à coût optimisé$1.47
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 200GInférence, simulation, graphismes et Omniverse$2.18
L40SAda Lovelace48 GB GDDR6 · 864 GB/sPCIe Gen4 · 100GInférence, rendu, vidéo, VDI$1.35
RTX 5090Blackwell32 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 100GRecherche, diffusion, clusters de développement$0.75

Tarifs de liste indicatifs à la demande en USD par GPU-heure, hors taxes. Les durées réservées et engagées sont remisées ; voir tarifs pour les tableaux par durée.

Modes de consommation

Achetez du calcul comme votre projet est financé

Élastique

À la demande

Facturation à la seconde, sans engagement. Idéal pour l'expérimentation, les bancs d'évaluation et le fine-tuning ponctuel.

  • 1 à 8 GPU par instance
  • Provisionnement instantané par API ou console
  • Instantanés et reprise
  • Aucun frais de sortie
Le plus choisi

Clusters réservés

Pods dédiés connectés en InfiniBand réservés de 1 à 36 mois, avec capacité nominative et tarif fixe sur la durée.

  • 16 à 4 096 GPU, fabric non bloquant
  • Slurm ou Kubernetes infogérés
  • Jusqu'à 55% sous le tarif à la demande
  • Garantie de capacité au contrat
Entreprise

Cloud IA privé

Une salle, un fabric et un stockage physiquement isolés, exploités par Velyrix selon votre nomenclature, vos politiques et votre régime d'audit.

  • Cage ou salle dédiée
  • Clés de chiffrement gérées par le client
  • Option isolée du réseau
  • SLA et gestion du changement sur mesure
Fabric du cluster

Un réseau optimisé par rail qui garde les GPU occupés

Un cluster d'entraînement ne va pas plus vite que son all-reduce le plus lent. Velyrix construit chaque pod multinœud sur un fat-tree non bloquant optimisé par rail, avec des plans de stockage et de gestion dédiés.

  • Plan de calcul : InfiniBand NVIDIA Quantum-2 NDR 400G ou Quantum-X800 XDR 800G, souscription 1:1
  • Option Ethernet : NVIDIA Spectrum-X avec RoCEv2, routage adaptatif et contrôle de congestion
  • Calcul dans le réseau : agrégation SHARP pour réduire la latence d'all-reduce sur les grands collectifs
  • Plan de stockage : réseau 200/400G distinct afin que les checkpoints n'entrent jamais en concurrence avec les gradients
  • Plan de gestion : réseau BMC hors bande, isolé du trafic locataire
  • Validation : bande passante de bus NCCL et latence d'all-reduce communiquées avant la livraison
acceptance-report.txt
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised
nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8

size        busbw       algbw      status
1.00 GB     372.4 GB/s  198.1 GB/s  PASS
4.00 GB     381.9 GB/s  203.7 GB/s  PASS
8.00 GB     384.6 GB/s  205.1 GB/s  PASS

fabric      : 1:1 non-blocking, 0 link errors / 72h
gpu_burnin  : 72h @ 100% — 0 XID, 0 ECC row remaps
sustained   : 48.9% MFU, Llama-class 70B reference run

Chiffres représentatifs d'une recette Velyrix. Les résultats varient selon la topologie, le modèle, la taille de lot et la pile logicielle ; votre cluster est mesuré et documenté individuellement.

Orchestration et logiciels

Arrivez avec votre pile, pas avec un projet de migration

Slurm infogéré

Slurm préconfiguré avec Pyxis/Enroot, comptabilité fair-share, ordonnancement conscient de la topologie et points d'accroche checkpoint-restart pour les longues campagnes de pré-entraînement.

Kubernetes infogéré

Clusters conformes CNCF avec NVIDIA GPU Operator, Network Operator, profils MIG, KubeRay et Kueue pour l'ordonnancement multi-locataire.

API bare metal

Provider Terraform et API REST pour le déploiement d'images, le démarrage iPXE, le contrôle BMC et le partitionnement du fabric — construisez votre propre plan de contrôle par-dessus.

📦

Registre de conteneurs

Registre et cache locaux par région pour NGC, Docker Hub et les images privées, afin que des téléchargements de 40 Go ne bloquent pas le lancement d'un job de 512 GPU.

📈

Observabilité

DCGM, Prometheus et Grafana avec utilisation GPU par job, consommation, températures, événements XID et compteurs de fabric — exportables vers votre propre SIEM.

🔧

Frameworks

Images validées pour PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang et TensorRT-LLM, actualisées chaque mois.

Inclus avec chaque cluster

Ce que vous obtenez avant le premier job

Stockage

Système de fichiers parallèle haute performance (WEKA ou VAST) dimensionné à votre budget de tokens, plus du stockage objet compatible S3 pour les jeux de données et les checkpoints. 10 To de NVMe local inclus par nœud.

Réseau

Fabric de calcul InfiniBand ou Spectrum-X non bloquant, double transit internet 100G, interconnexion privée vers AWS, Azure, GCP et Oracle, et options de transit BGP/IP. Aucun frais de sortie sur les offres standard.

Sécurité

Hôtes mono-locataires, VLAN/VRF et partitions de fabric isolés, attestation de firmware avec démarrage sécurisé, clés gérées par le client et effacement vérifié à la mise hors service (purge NIST SP 800-88).

Support

NOC 24×7, architecte solutions attitré, réponse P1 en 15 minutes, objectif de remplacement matériel en quatre heures sur site et rapports SLA mensuels par rapport à la disponibilité contractuelle.

Recette

Avant la livraison : burn-in GPU de 72 heures, validation mémoire et ECC, tests de bande passante NCCL, balayage d'erreurs du fabric et un rapport de recette signé que vous pouvez remettre à vos auditeurs.

Échangez avec un architecte d'infrastructure IA

Les GPU sont à vous. Nous les exploitons.

Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.

Questions fréquentes

Comment le cloud GPU Velyrix est-il facturé ?

Les instances à la demande sont facturées à la seconde, sans durée minimale ni frais de sortie de données sur les offres standard. Les clusters réservés sont facturés mensuellement à un tarif contractuel fixe pour des durées de un à trente-six mois. Les clouds privés d'entreprise font l'objet d'un forfait plateforme mensuel fixe plus la capacité.

Est-ce du bare metal ou des machines virtuelles ?

Les deux sont disponibles. Le défaut pour l'entraînement multinœud est le bare metal mono-locataire avec accès direct aux GPU, aux NIC et aux NVMe. Les instances virtualisées avec passthrough GPU sont proposées lorsque les instantanés et la réinstallation rapide comptent plus que les derniers pourcents de performance.

Quel réseau utilisent les clusters d'entraînement multinœuds ?

De l'InfiniBand non bloquant optimisé par rail — NVIDIA Quantum-2 NDR à 400G ou Quantum-X800 XDR à 800G par GPU — avec réduction SHARP dans le réseau. NVIDIA Spectrum-X Ethernet avec RoCEv2 est disponible lorsqu'un modèle d'exploitation tout-Ethernet est requis.

Puis-je faire tourner Slurm et Kubernetes sur le même cluster ?

Oui. Velyrix partitionne couramment un cluster réservé pour qu'une partition Slurm exécute les longs entraînements tandis qu'une partition Kubernetes sert l'inférence, avec un système de fichiers parallèle partagé entre les deux. La taille des partitions peut être ajustée en cours de contrat.

Existe-t-il un engagement minimum pour les grands clusters ?

Les clusters de plus de 256 GPU sont normalement contractés pour trois mois minimum en raison des travaux de construction et de câblage du fabric. Des fenêtres plus courtes sont possibles dans les salles où un pod équivalent est déjà construit et libre.