Accueil/Déploiement IA
Déploiement et mise en service d'infrastructure IADes palettes sur le quai à un cluster validé
Les ingénieurs de déploiement Velyrix construisent des usines IA pour des opérateurs, des entreprises et des administrations — dans nos salles ou les vôtres. Chaque mission se termine de la même façon : un cluster passé au burn-in, mesuré, documenté, et un rapport de recette signé que vos auditeurs peuvent lire.
Tout ce qui se passe entre le bon de commande et le premier entraînement
La plupart des projets GPU n'échouent pas sur le silicium. Ils échouent sur les boucles de liquide, sur un rail mal câblé, sur une dérive de firmware entre huit nœuds, ou parce que personne n'a jamais mesuré ce que fait réellement le fabric.
Conception et ingénierie
Topologie du cluster, élévations de baie, plans de puissance, conception des boucles de liquide, poids et charge au sol, plan de câblage du fabric et nomenclature.
Logistique et réception
Coordination du fret, appui documentaire en douane, réception sécurisée, saisie des actifs, enregistrement des numéros de série et évacuation des emballages.
Montage en baie
Installation mécanique des systèmes HGX, DGX, MGX et ORv3, kits de rails, plomberie CDU et collecteurs, serrage au couple contrôlé et manipulation sous contrôle ESD.
Énergie et refroidissement
Raccordement des canalisations et des câbles par des électriciens agréés, équilibrage des arrivées A/B, remplissage du liquide et essai de pression, mise en service de la détection de fuite.
Construction du fabric
Câblage InfiniBand ou Spectrum-X optimisé par rail, étiquetage selon plan, mise en place des optiques, entraînement des liens, balayage du taux d'erreur et vérification de topologie.
Alignement des firmwares
BIOS, BMC, CPLD, NIC, NVSwitch et VBIOS GPU alignés sur une ligne de base validée unique sur tous les nœuds, avec rapport de dérive.
Pile logicielle
Image système, pilote NVIDIA, CUDA, Fabric Manager, DCGM, runtime de conteneurs, Slurm ou Kubernetes, clients de stockage et agents de supervision.
Burn-in et validation
Stress soutenu de 72 heures, trempage thermique, surveillance ECC et XID, contrôle du remappage de lignes mémoire, tests de débit stockage et fabric.
Recette et livraison
Résultats de recette documentés, plans as-built, registre des actifs, runbooks, matrice d'escalade et formation des opérateurs.
La méthode de déploiement Velyrix
Un programme reproductible en neuf étapes avec chef de projet dédié, reporting hebdomadaire et un jalon documenté à la fin de chaque étape.
Découverte et revue de conception
Profil de charge, tailles de modèles, budgets de tokens et courbe de croissance traduits en topologie de cluster, enveloppe de puissance et dimensionnement du stockage. Livrable : document de conception et nomenclature.
Évaluation de préparation du site
Capacité électrique, charge au sol, disponibilité du liquide, accès de livraison, extinction incendie et cheminements de fabric audités par rapport à la conception. Livrable : rapport de préparation avec liste d'écarts.
Appui aux achats et à la logistique
Suivi des délais OEM, plan de stockage temporaire, appui documentaire export et import, et vérification de l'utilisateur final avant toute expédition de matériel contrôlé. Livrable : calendrier de livraison.
Installation mécanique
Baies de niveau et mises à la terre, systèmes installés, collecteurs et plaques froides raccordés, liquide rempli et testé en pression, câblage dressé selon plan. Livrable : élévations as-built.
Mise en service électrique
Raccordement des circuits, équilibrage des phases, coordination des protections et vérification du comptage par des électriciens agréés travaillant selon des modes opératoires documentés. Livrable : procès-verbal électrique.
Construction et vérification du fabric
Câblage optimisé par rail installé et étiqueté, chaque lien entraîné à pleine vitesse, balayage du taux d'erreur binaire, carte de topologie comparée à la conception. Livrable : rapport de liens et de topologie.
Logiciel et démarrage du cluster
Déploiement de l'image de référence, application de la ligne de base firmware, configuration de l'ordonnanceur, montages de stockage, intégration de la supervision et des alertes. Livrable : ligne de base de configuration.
Burn-in et validation de performance
Stress de 72 heures à pleine puissance, benchmarks NCCL all-reduce et all-gather, débit de stockage et entraînement d'un modèle de référence à l'échelle cible. Livrable : résultats de benchmark.
Recette et transfert en exploitation
Rapport de recette relu et signé, runbooks et chemins d'escalade transmis, formation des opérateurs dispensée, transition optionnelle vers l'exploitation infogérée Velyrix. Livrable : PV de recette signé.
Ce que nous mesurons avant de considérer que c'est fini
Les critères d'acceptation sont convenus par écrit en phase de conception et testés à la livraison. Tout échec est corrigé et retesté aux frais de Velyrix dans une mission à prix ferme.
| Test | Méthode | Critère d'acceptation typique | Preuve |
|---|---|---|---|
| Inventaire et santé GPU | nvidia-smi, DCGM diagnostics level 3 | 100% des GPU énumérés, zéro ECC non corrigible, zéro remappage de ligne en attente | Rapport DCGM par nœud |
| Burn-in soutenu | 72 h de stress combiné GPU, CPU, mémoire et NVMe | Zéro erreur XID, zéro événement de bridage thermique, fréquences stables | Export de télémétrie temporelle |
| NVLink / NVSwitch | nvbandwidth, test de bande passante et latence p2p | À 5% près de la bande passante de référence de la plateforme sur chaque paire | Matrice de bande passante |
| Qualité des liens du fabric | Entraînement de lien, balayage BER, compteurs d'erreur de port | Tous les liens à pleine vitesse, taux d'erreur symbole sous le seuil constructeur, zéro coupure en 72 h | Rapport de santé du fabric |
| Performance collective | NCCL all-reduce et all-gather, 8 Mo à 8 Go | Bande passante de bus à 10% près de la référence de topologie à pleine échelle | nccl-tests output |
| Débit de stockage | fio et IOR sur le système de fichiers parallèle | Débit agrégé en lecture/écriture et temps de checkpoint contractuels atteints | Journal de benchmark |
| Entraînement de référence | Modèle de référence de classe Llama au nombre de nœuds cible | Utilisation des FLOPs du modèle et temps par étape contractuels atteints | Journal d'entraînement et calcul de MFU |
| Bascule et résilience | Coupure d'alimentation A/B, retrait d'un commutateur leaf, bascule de pompe CDU | Aucune perte de job sur les chemins redondants, temps de reprise documenté | Feuille de témoin d'essai |
| Thermique et puissance | Trempage à pleine charge avec télémétrie d'entrée, de sortie et de liquide | Tous les composants dans les spécifications OEM à la température ambiante de conception | Étude thermique |
| Ligne de base de sécurité | Démarrage sécurisé, durcissement BMC, rotation des identifiants, segmentation réseau | Ligne de base appliquée à 100% des nœuds, aucun identifiant par défaut | Audit de configuration |
Conçu pour passer un audit d'OEM et d'assureur
Le travail de déploiement touche aux garanties des autres, aux salles des autres et à des installations électriques sous tension. Velyrix conduit la mission en conséquence.
- Modes opératoires et analyses de risque émis et approuvés avant tout travail sur un plateau en service
- Électriciens agréés pour tout raccordement électrique, conformément au code local et aux pratiques d'arc électrique
- Manipulation sous contrôle ESD alignée sur ANSI/ESD S20.20 pour protéger les conditions de garantie OEM
- Respect des guides d'installation OEM afin que la garantie et les droits de support du constructeur restent intacts
- Chaîne de possession du quai à la baie, avec saisie des actifs par numéro de série et relevés photographiques
- Gestion du changement avec fenêtres de travail documentées, plans de retour arrière et validations client
- Ingénieurs assurés et vérifiés, avec contrôle des antécédents et autorisation d'accès par site
- Vérification du contrôle des exportations effectuée avant toute expédition ou installation de matériel contrôlé
Modèles de mission
Périmètre convenu, critères de recette convenus, prix convenu. Le modèle le plus courant pour les clusters neufs.
Tarifs journaliers d'ingénieur pour les extensions, les corrections, les migrations et le diagnostic d'un parc existant.
Des ingénieurs Velyrix intégrés sur votre site pour une période définie afin de monter en compétence avec votre équipe.
Nous construisons, puis nous exploitons sous service infogéré avec SLA de disponibilité et de performance.
Les honoraires de déploiement à prix ferme vont d'environ 2 300 $ par nœud pour une extension simple refroidie à l'air à 4 600–10 900 $ par nœud pour des systèmes refroidis à l'eau à l'échelle de la baie, construction du fabric, validation et documentation comprises. Chaque mission est chiffrée après la revue de conception.
Nous sommes aussi l'équipe terrain derrière les affaires des autres
Nous sommes organisés pour réaliser des déploiements pour les constructeurs et leurs partenaires — sous notre marque ou, plus utile pour vous, sous la leur.
- Livraison en marque blanche — votre marque sur le plan de projet et le rapport de recette
- Manuels validés pour les plateformes Dell, Supermicro, GIGABYTE, HPE, Lenovo et NVIDIA DGX
- Support L1–L3 avec un chemin d'escalade documenté vers le constructeur
- Coordination des RMA et magasins de pièces dimensionnés au parc déployé
- Enregistrement d'affaire et une politique écrite de neutralité de canal
Préservation de la garantie par construction
Chaque plateforme que nous déployons dispose d'un manuel Velyrix dérivé du guide d'installation publié par le constructeur.
- Manipulation ESD alignée sur ANSI/ESD S20.20
- Spécifications de couple et procédures de kits de rails respectées
- Lignes de base firmware alignées sur la pile validée du constructeur
- Relevés par numéro de série et preuves photographiques conservés
- Preuves de défaillance préparées au format exigé par le constructeur
Résultat : la garantie et les droits de support du constructeur restent intacts, et les litiges RMA sur la pratique d'installation n'ont pas lieu.
Services de déploiement au-delà de la première construction
Migration et déménagement
Déplacez un parc GPU en production entre salles ou fournisseurs avec un plan de bascule par phases, une interruption d'entraînement minimale et une réconciliation complète des actifs.
Audit de santé du cluster
Évaluation indépendante d'un cluster existant : erreurs de fabric, dérive de firmware, marge thermique, efficacité de l'ordonnanceur et MFU réalisée, avec un plan de correction priorité.
Cycle de vie et renouvellement
Planification de capacité, renouvellement matériel par phases, mise hors service avec effacement NIST SP 800-88 et appui à l'élimination certifiée ou à la revente.
Exploitation infogérée
Supervision 24×7, réponse aux incidents, cycle de vie firmware et pilotes, gestion des pièces et reporting de capacité par rapport à votre SLA.
Les GPU sont à vous. Nous les exploitons.
Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.
Questions fréquentes
Que comprend réellement la mise en service d'une infrastructure IA ?
La mise en service est le processus formel qui prouve qu'un cluster est conforme aux spécifications avant sa livraison : alignement des firmwares, burn-in de 72 heures, contrôles de santé GPU et NVLink, balayages de qualité des liens du fabric, benchmarks collectifs NCCL, tests de débit de stockage, un entraînement de référence, des tests de bascule et une étude thermique — le tout consigné dans un rapport de recette signé.
Velyrix peut-il déployer dans notre propre centre de données plutôt que le vôtre ?
Oui. Une grande partie de notre activité se déroule sur des sites clients ou tiers : centres de données d'entreprise, installations gouvernementales et salles de colocation d'autres opérateurs. Nous travaillons selon les règles d'accès, de sécurité et de gestion du changement du site hôte, et nous pouvons intervenir en sous-traitance de votre intégrateur existant si cela simplifie les choses.
Combien de temps faut-il pour livrer un cluster GPU neuf ?
Une fois le matériel sur site, une construction typique demande trois à six semaines par pod. De bout en bout — conception, travaux, délai matériel, construction et mise en service — une usine IA neuve prend normalement 12 à 20 semaines, le délai OEM étant la plus grande variable.
Un déploiement par un tiers annule-t-il la garantie matérielle OEM ?
Non, dès lors que le travail suit le guide d'installation publié par le constructeur. Les ingénieurs Velyrix travaillent selon les procédures OEM avec manipulation sous contrôle ESD, spécifications de couple et traçabilité par numéro de série, de sorte que la garantie et les droits de support du constructeur restent intacts.
Que se passe-t-il si le cluster échoue à une recette ?
Dans une mission à prix ferme, Velyrix corrige et reteste à ses frais jusqu'à ce que les critères convenus soient atteints. Les défaillances imputables à du matériel défectueux sont traitées en garantie avec l'OEM, et nous pilotons ce processus en votre nom.
Prenez-vous en charge les systèmes refroidis à l'eau et à l'échelle de la baie comme le GB300 NVL72 ?
Oui. Les déploiements refroidis à l'eau incluent la pose des collecteurs et des plaques froides, le remplissage et l'essai de pression, la mise en service des CDU, la validation de la détection de fuite et les tests de bascule de pompe, en plus du protocole standard de recette calcul et fabric.