Inicio/Despliegue de IA

Despliegue y puesta en servicio de infraestructura de IA

De los palets en el muelle a un clúster validado

Los ingenieros de despliegue de Velyrix construyen fábricas de IA para operadores, empresas y administraciones, en nuestras salas o en las tuyas. Cada proyecto termina igual: un clúster con burn-in hecho, medido, documentado, y un informe de aceptación firmado que tus auditores pueden leer.

Construcción nueva
12 – 20 semanas
Pod de ampliación
3 – 6 semanas
Escala de clúster admitida
8 – 4,096 GPUs
Burn-in
72 horas mínimo
Entrega
Informe de aceptación firmado
Alcance

Todo lo que hay entre la orden de compra y el primer entrenamiento

La mayoría de los proyectos GPU no fracasan por el silicio. Fracasan por los circuitos de refrigerante, por un rail mal cableado, por la deriva de firmware entre ocho nodos, o porque nadie llegó a medir qué hace realmente el fabric.

📐

Diseño e ingeniería

Topología del clúster, alzados de rack, esquemas de potencia, diseño del circuito de refrigerante, peso y carga del suelo, plan de cableado del fabric y lista de materiales.

🚚

Logística y recepción

Coordinación del transporte, apoyo documental en aduanas, recepción segura, captura de activos, registro de números de serie y retirada de embalajes.

🔨

Montaje en rack

Instalación mecánica de sistemas HGX, DGX, MGX y ORv3, kits de rail, fontanería de CDU y colectores, apriete controlado por par y manipulación con control ESD.

Energía y refrigeración

Terminación de canalizaciones y latiguillos por electricistas titulados, equilibrado de acometidas A/B, llenado de refrigerante y prueba de presión, puesta en servicio de la detección de fugas.

📡

Construcción del fabric

Cableado InfiniBand o Spectrum-X optimizado por rail, etiquetado según plano, asiento de ópticas, entrenamiento de enlaces, barrido de tasa de error y verificación de topología.

💾

Línea base de firmware

BIOS, BMC, CPLD, NIC, NVSwitch y VBIOS de GPU alineados a una única línea base validada en todos los nodos, con informe de desviaciones.

💻

Pila de software

Imagen del sistema operativo, controlador NVIDIA, CUDA, Fabric Manager, DCGM, runtime de contenedores, Slurm o Kubernetes, clientes de almacenamiento y agentes de monitorización.

🔥

Burn-in y validación

Estrés sostenido de 72 horas, remojo térmico, monitorización de ECC y XID, comprobación de remapeo de filas de memoria y pruebas de rendimiento de almacenamiento y fabric.

📋

Aceptación y entrega

Resultados documentados de las pruebas de aceptación, planos as-built, registro de activos, runbooks, matriz de escalado y formación de operadores.

Programa

El método de despliegue de Velyrix

Un programa repetible de nueve etapas con jefe de proyecto asignado, informes semanales y un hito documentado al final de cada etapa.

Descubrimiento y revisión de diseño

Perfil de carga, tamaños de modelo, presupuesto de tokens y curva de crecimiento traducidos a topología de clúster, envolvente de potencia y dimensionado de almacenamiento. Entregable: documento de diseño y lista de materiales.

Evaluación de preparación del sitio

Capacidad eléctrica, carga del suelo, disponibilidad de refrigerante, acceso de entregas, extinción de incendios y recorridos de fabric revisados frente al diseño. Entregable: informe de preparación con lista de brechas.

Apoyo a compras y logística

Seguimiento de plazos del OEM, plan de almacenamiento temporal, apoyo documental de exportación e importación y verificación del usuario final antes de enviar cualquier hardware controlado. Entregable: calendario de entregas.

Instalación mecánica

Racks nivelados y equipotenciados, sistemas instalados, colectores y placas frías conectados, refrigerante cargado y probado a presión, cableado peinado según plano. Entregable: alzados as-built.

Puesta en servicio eléctrica

Terminación de circuitos, equilibrado de fases, coordinación de protecciones y verificación de medida por electricistas titulados que trabajan con procedimientos documentados. Entregable: acta eléctrica.

Construcción y verificación del fabric

Cableado optimizado por rail instalado y etiquetado, cada enlace entrenado a velocidad plena, barrido de tasa de error de bit y mapa de topología contrastado con el diseño. Entregable: informe de enlaces y topología.

Software y arranque del clúster

Despliegue de imagen dorada, aplicación de la línea base de firmware, configuración del planificador, montajes de almacenamiento e integración de monitorización y alertas. Entregable: línea base de configuración.

Burn-in y validación de rendimiento

Estrés de 72 horas a plena potencia, benchmarks NCCL de all-reduce y all-gather, rendimiento de almacenamiento y un entrenamiento de modelo de referencia a la escala objetivo. Entregable: resultados de benchmark.

Aceptación y traspaso operativo

Informe de pruebas de aceptación revisado y firmado, runbooks y rutas de escalado entregados, formación de operadores impartida y transición opcional a operación gestionada por Velyrix. Entregable: ATP firmado.

Protocolo de pruebas de aceptación

Lo que medimos antes de darlo por terminado

Los criterios de aprobación se acuerdan por escrito en la fase de diseño y se prueban en la entrega. Todo lo que falle se corrige y se vuelve a probar a cargo de Velyrix en un proyecto a precio cerrado.

PruebaMétodoCriterio de aprobación típicoEvidencia
Inventario y salud de GPUnvidia-smi, DCGM diagnostics level 3100% de las GPU enumeradas, cero ECC no corregibles, cero remapeos de fila pendientesInforme DCGM por nodo
Burn-in sostenido72 h de estrés combinado de GPU, CPU, memoria y NVMeCero errores XID, cero eventos de limitación térmica, frecuencias establesExportación de telemetría temporal
NVLink / NVSwitchnvbandwidth, prueba de latencia y ancho de banda p2pDentro del 5% del ancho de banda de referencia de la plataforma en cada parMatriz de ancho de banda
Calidad de los enlaces de fabricEntrenamiento de enlace, barrido BER, contadores de error de puertoTodos los enlaces a velocidad plena, tasa de error de símbolo por debajo del umbral del fabricante, cero caídas en 72 hInforme de salud del fabric
Rendimiento colectivoNCCL all-reduce y all-gather, 8 MB – 8 GBAncho de banda de bus dentro del 10% de la referencia de topología a escala completanccl-tests output
Rendimiento de almacenamientofio e IOR contra el sistema de ficheros paraleloLectura/escritura agregada y tiempo de checkpoint contratados alcanzadosRegistro de benchmark
Entrenamiento de referenciaModelo de referencia de clase Llama al número de nodos objetivoUtilización de FLOPs del modelo y tiempo de paso contratados alcanzadosRegistro de entrenamiento y cálculo de MFU
Conmutación por error y resilienciaCorte de alimentación A/B, retirada de conmutador leaf, conmutación de bomba de CDUSin pérdida de trabajos en rutas redundantes, tiempo de recuperación documentadoHoja de testigo de prueba
Térmica y potenciaRemojo a plena carga con telemetría de entrada, salida y refrigeranteTodos los componentes dentro de la especificación del OEM a la temperatura ambiente de diseñoEstudio térmico
Línea base de seguridadArranque seguro, endurecimiento de BMC, rotación de credenciales, segmentación de redLínea base aplicada al 100% de los nodos, sin credenciales por defectoAuditoría de configuración
Cómo trabajamos de forma segura

Construido para superar una auditoría de OEM y de aseguradora

El trabajo de despliegue toca garantías de terceros, salas de terceros e instalaciones eléctricas en tensión. Velyrix gestiona el proyecto en consecuencia.

  • Procedimientos de trabajo y evaluaciones de riesgo emitidos y aprobados antes de cualquier trabajo en una planta en servicio
  • Electricistas titulados para toda la terminación eléctrica, conforme al código local y a las prácticas de arco eléctrico
  • Manipulación con control ESD alineada con ANSI/ESD S20.20 para proteger las condiciones de garantía del OEM
  • Se siguen las guías de instalación del OEM de modo que la garantía y los derechos de soporte del fabricante permanecen intactos
  • Cadena de custodia del muelle al rack, con captura de activos por número de serie y registro fotográfico
  • Control de cambios con ventanas de trabajo documentadas, planes de reversión y aprobaciones del cliente
  • Ingenieros asegurados y verificados, con comprobación de antecedentes y autorización de acceso por sitio
  • Verificación de control de exportaciones completada antes de enviar o instalar hardware controlado

Modelos de contratación

Construcción a precio cerrado

Alcance acordado, criterios de aceptación acordados, precio acordado. El modelo más habitual para clústeres nuevos.

Tiempo y materiales

Tarifas diarias de ingeniero para ampliaciones, correcciones, migraciones y diagnóstico de un parque existente.

Residencia

Ingenieros de Velyrix integrados en tu sede durante un periodo definido para desarrollar capacidad junto a tu equipo.

Construir y operar

Lo construimos y después lo operamos bajo un servicio gestionado con SLA de disponibilidad y rendimiento.

Las tarifas típicas de despliegue a precio cerrado van desde unos 2.300 $ por nodo en una ampliación sencilla refrigerada por aire hasta 4.600–10.900 $ por nodo en sistemas refrigerados por líquido a escala de rack, incluyendo construcción del fabric, validación y documentación. Cada proyecto se presupuesta tras la revisión de diseño.

Para OEM, distribuidores y revendedores

También somos el equipo de servicios de campo detrás de los proyectos de otros

Estamos organizados para ejecutar trabajo de despliegue para fabricantes de hardware y sus partners, bajo nuestra marca o, más útil para ti, bajo la suya.

  • Entrega de marca blanca — tu marca en el plan de proyecto y en el informe de aceptación
  • Manuales validados para plataformas Dell, Supermicro, GIGABYTE, HPE, Lenovo y NVIDIA DGX
  • Soporte L1–L3 con una ruta de escalado documentada hacia el fabricante
  • Coordinación de RMA y almacenes de repuestos dimensionados a la flota desplegada
  • Registro de oportunidades y una política escrita de neutralidad de canal

Preserva la garantía por construcción

Cada plataforma que desplegamos tiene un manual Velyrix derivado de la guía de instalación publicada por el fabricante.

  • Manipulación ESD alineada con ANSI/ESD S20.20
  • Se siguen las especificaciones de par y los procedimientos de kits de rail
  • Líneas base de firmware alineadas con la pila validada del fabricante
  • Se conservan registros por número de serie y evidencia fotográfica
  • La evidencia de fallo se prepara en el formato exigido por el fabricante

Resultado: la garantía y los derechos de soporte del fabricante permanecen intactos y no surgen disputas de RMA sobre la práctica de instalación.

También disponible

Servicios de despliegue más allá de la primera construcción

Migración y traslado

Traslada un parque GPU en producción entre salas o proveedores con un plan de corte por fases, mínimo tiempo de parada de entrenamiento y conciliación completa de activos.

🔍

Auditoría de salud del clúster

Evaluación independiente de un clúster existente: errores de fabric, deriva de firmware, margen térmico, eficiencia del planificador y MFU real, con un plan de corrección priorizado.

🔁

Ciclo de vida y renovación

Planificación de capacidad, renovación de hardware por fases, baja con sanitización de soportes NIST SP 800-88 y apoyo a la eliminación certificada o la reventa.

👥

Operación gestionada

Monitorización 24×7, respuesta a incidentes, ciclo de vida de firmware y controladores, gestión de repuestos e informes de capacidad frente a tu SLA.

Hable con un arquitecto de infraestructura de IA

Las GPU son suyas. Nosotros las operamos.

Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.

Preguntas frecuentes

¿Qué incluye realmente la puesta en servicio de infraestructura de IA?

La puesta en servicio es el proceso formal de demostrar que un clúster cumple la especificación antes de entregarlo: línea base de firmware, burn-in de 72 horas, comprobaciones de salud de GPU y NVLink, barridos de calidad de enlace del fabric, benchmarks colectivos NCCL, pruebas de rendimiento de almacenamiento, un entrenamiento de referencia, pruebas de conmutación por error y un estudio térmico, todo recogido en un informe de aceptación firmado.

¿Puede Velyrix desplegar en nuestro centro de datos en lugar del vuestro?

Sí. Una parte importante de lo que hacemos se ejecuta en instalaciones de clientes o de terceros: centros de datos corporativos, instalaciones gubernamentales y salas de colocation de otros operadores. Trabajamos conforme a las normas de acceso, seguridad y control de cambios del sitio anfitrión, y podemos actuar como subcontratista de tu integrador actual si eso simplifica las cosas.

¿Cuánto se tarda en entregar un clúster GPU nuevo?

Con el hardware ya en sitio, una construcción típica lleva de tres a seis semanas por pod. De principio a fin (diseño, obra, plazo de entrega del hardware, construcción y puesta en servicio) una fábrica de IA nueva suele llevar de 12 a 20 semanas, siendo el plazo del OEM la mayor variable.

¿Anula la garantía del hardware que el despliegue lo haga un tercero?

No, siempre que el trabajo siga la guía de instalación publicada por el fabricante. Los ingenieros de Velyrix trabajan con procedimientos del OEM, manipulación con control ESD, especificaciones de par y registro documentado por número de serie, de modo que la garantía y los derechos de soporte del fabricante permanecen intactos.

¿Qué ocurre si el clúster no supera una prueba de aceptación?

En un proyecto a precio cerrado, Velyrix corrige y vuelve a probar a su costa hasta cumplir los criterios acordados. Los fallos atribuibles a hardware defectuoso se tramitan con el OEM en garantía, y gestionamos ese proceso en tu nombre.

¿Soportáis sistemas refrigerados por líquido y a escala de rack como GB300 NVL72?

Sí. Los despliegues refrigerados por líquido incluyen instalación de colectores y placas frías, llenado de refrigerante y prueba de presión, puesta en servicio de CDU, validación de detección de fugas y pruebas de conmutación de bombas, además del protocolo estándar de aceptación de cómputo y fabric.