Inicio/Despliegue de IA
Despliegue y puesta en servicio de infraestructura de IADe los palets en el muelle a un clúster validado
Los ingenieros de despliegue de Velyrix construyen fábricas de IA para operadores, empresas y administraciones, en nuestras salas o en las tuyas. Cada proyecto termina igual: un clúster con burn-in hecho, medido, documentado, y un informe de aceptación firmado que tus auditores pueden leer.
Todo lo que hay entre la orden de compra y el primer entrenamiento
La mayoría de los proyectos GPU no fracasan por el silicio. Fracasan por los circuitos de refrigerante, por un rail mal cableado, por la deriva de firmware entre ocho nodos, o porque nadie llegó a medir qué hace realmente el fabric.
Diseño e ingeniería
Topología del clúster, alzados de rack, esquemas de potencia, diseño del circuito de refrigerante, peso y carga del suelo, plan de cableado del fabric y lista de materiales.
Logística y recepción
Coordinación del transporte, apoyo documental en aduanas, recepción segura, captura de activos, registro de números de serie y retirada de embalajes.
Montaje en rack
Instalación mecánica de sistemas HGX, DGX, MGX y ORv3, kits de rail, fontanería de CDU y colectores, apriete controlado por par y manipulación con control ESD.
Energía y refrigeración
Terminación de canalizaciones y latiguillos por electricistas titulados, equilibrado de acometidas A/B, llenado de refrigerante y prueba de presión, puesta en servicio de la detección de fugas.
Construcción del fabric
Cableado InfiniBand o Spectrum-X optimizado por rail, etiquetado según plano, asiento de ópticas, entrenamiento de enlaces, barrido de tasa de error y verificación de topología.
Línea base de firmware
BIOS, BMC, CPLD, NIC, NVSwitch y VBIOS de GPU alineados a una única línea base validada en todos los nodos, con informe de desviaciones.
Pila de software
Imagen del sistema operativo, controlador NVIDIA, CUDA, Fabric Manager, DCGM, runtime de contenedores, Slurm o Kubernetes, clientes de almacenamiento y agentes de monitorización.
Burn-in y validación
Estrés sostenido de 72 horas, remojo térmico, monitorización de ECC y XID, comprobación de remapeo de filas de memoria y pruebas de rendimiento de almacenamiento y fabric.
Aceptación y entrega
Resultados documentados de las pruebas de aceptación, planos as-built, registro de activos, runbooks, matriz de escalado y formación de operadores.
El método de despliegue de Velyrix
Un programa repetible de nueve etapas con jefe de proyecto asignado, informes semanales y un hito documentado al final de cada etapa.
Descubrimiento y revisión de diseño
Perfil de carga, tamaños de modelo, presupuesto de tokens y curva de crecimiento traducidos a topología de clúster, envolvente de potencia y dimensionado de almacenamiento. Entregable: documento de diseño y lista de materiales.
Evaluación de preparación del sitio
Capacidad eléctrica, carga del suelo, disponibilidad de refrigerante, acceso de entregas, extinción de incendios y recorridos de fabric revisados frente al diseño. Entregable: informe de preparación con lista de brechas.
Apoyo a compras y logística
Seguimiento de plazos del OEM, plan de almacenamiento temporal, apoyo documental de exportación e importación y verificación del usuario final antes de enviar cualquier hardware controlado. Entregable: calendario de entregas.
Instalación mecánica
Racks nivelados y equipotenciados, sistemas instalados, colectores y placas frías conectados, refrigerante cargado y probado a presión, cableado peinado según plano. Entregable: alzados as-built.
Puesta en servicio eléctrica
Terminación de circuitos, equilibrado de fases, coordinación de protecciones y verificación de medida por electricistas titulados que trabajan con procedimientos documentados. Entregable: acta eléctrica.
Construcción y verificación del fabric
Cableado optimizado por rail instalado y etiquetado, cada enlace entrenado a velocidad plena, barrido de tasa de error de bit y mapa de topología contrastado con el diseño. Entregable: informe de enlaces y topología.
Software y arranque del clúster
Despliegue de imagen dorada, aplicación de la línea base de firmware, configuración del planificador, montajes de almacenamiento e integración de monitorización y alertas. Entregable: línea base de configuración.
Burn-in y validación de rendimiento
Estrés de 72 horas a plena potencia, benchmarks NCCL de all-reduce y all-gather, rendimiento de almacenamiento y un entrenamiento de modelo de referencia a la escala objetivo. Entregable: resultados de benchmark.
Aceptación y traspaso operativo
Informe de pruebas de aceptación revisado y firmado, runbooks y rutas de escalado entregados, formación de operadores impartida y transición opcional a operación gestionada por Velyrix. Entregable: ATP firmado.
Lo que medimos antes de darlo por terminado
Los criterios de aprobación se acuerdan por escrito en la fase de diseño y se prueban en la entrega. Todo lo que falle se corrige y se vuelve a probar a cargo de Velyrix en un proyecto a precio cerrado.
| Prueba | Método | Criterio de aprobación típico | Evidencia |
|---|---|---|---|
| Inventario y salud de GPU | nvidia-smi, DCGM diagnostics level 3 | 100% de las GPU enumeradas, cero ECC no corregibles, cero remapeos de fila pendientes | Informe DCGM por nodo |
| Burn-in sostenido | 72 h de estrés combinado de GPU, CPU, memoria y NVMe | Cero errores XID, cero eventos de limitación térmica, frecuencias estables | Exportación de telemetría temporal |
| NVLink / NVSwitch | nvbandwidth, prueba de latencia y ancho de banda p2p | Dentro del 5% del ancho de banda de referencia de la plataforma en cada par | Matriz de ancho de banda |
| Calidad de los enlaces de fabric | Entrenamiento de enlace, barrido BER, contadores de error de puerto | Todos los enlaces a velocidad plena, tasa de error de símbolo por debajo del umbral del fabricante, cero caídas en 72 h | Informe de salud del fabric |
| Rendimiento colectivo | NCCL all-reduce y all-gather, 8 MB – 8 GB | Ancho de banda de bus dentro del 10% de la referencia de topología a escala completa | nccl-tests output |
| Rendimiento de almacenamiento | fio e IOR contra el sistema de ficheros paralelo | Lectura/escritura agregada y tiempo de checkpoint contratados alcanzados | Registro de benchmark |
| Entrenamiento de referencia | Modelo de referencia de clase Llama al número de nodos objetivo | Utilización de FLOPs del modelo y tiempo de paso contratados alcanzados | Registro de entrenamiento y cálculo de MFU |
| Conmutación por error y resiliencia | Corte de alimentación A/B, retirada de conmutador leaf, conmutación de bomba de CDU | Sin pérdida de trabajos en rutas redundantes, tiempo de recuperación documentado | Hoja de testigo de prueba |
| Térmica y potencia | Remojo a plena carga con telemetría de entrada, salida y refrigerante | Todos los componentes dentro de la especificación del OEM a la temperatura ambiente de diseño | Estudio térmico |
| Línea base de seguridad | Arranque seguro, endurecimiento de BMC, rotación de credenciales, segmentación de red | Línea base aplicada al 100% de los nodos, sin credenciales por defecto | Auditoría de configuración |
Construido para superar una auditoría de OEM y de aseguradora
El trabajo de despliegue toca garantías de terceros, salas de terceros e instalaciones eléctricas en tensión. Velyrix gestiona el proyecto en consecuencia.
- Procedimientos de trabajo y evaluaciones de riesgo emitidos y aprobados antes de cualquier trabajo en una planta en servicio
- Electricistas titulados para toda la terminación eléctrica, conforme al código local y a las prácticas de arco eléctrico
- Manipulación con control ESD alineada con ANSI/ESD S20.20 para proteger las condiciones de garantía del OEM
- Se siguen las guías de instalación del OEM de modo que la garantía y los derechos de soporte del fabricante permanecen intactos
- Cadena de custodia del muelle al rack, con captura de activos por número de serie y registro fotográfico
- Control de cambios con ventanas de trabajo documentadas, planes de reversión y aprobaciones del cliente
- Ingenieros asegurados y verificados, con comprobación de antecedentes y autorización de acceso por sitio
- Verificación de control de exportaciones completada antes de enviar o instalar hardware controlado
Modelos de contratación
Alcance acordado, criterios de aceptación acordados, precio acordado. El modelo más habitual para clústeres nuevos.
Tarifas diarias de ingeniero para ampliaciones, correcciones, migraciones y diagnóstico de un parque existente.
Ingenieros de Velyrix integrados en tu sede durante un periodo definido para desarrollar capacidad junto a tu equipo.
Lo construimos y después lo operamos bajo un servicio gestionado con SLA de disponibilidad y rendimiento.
Las tarifas típicas de despliegue a precio cerrado van desde unos 2.300 $ por nodo en una ampliación sencilla refrigerada por aire hasta 4.600–10.900 $ por nodo en sistemas refrigerados por líquido a escala de rack, incluyendo construcción del fabric, validación y documentación. Cada proyecto se presupuesta tras la revisión de diseño.
También somos el equipo de servicios de campo detrás de los proyectos de otros
Estamos organizados para ejecutar trabajo de despliegue para fabricantes de hardware y sus partners, bajo nuestra marca o, más útil para ti, bajo la suya.
- Entrega de marca blanca — tu marca en el plan de proyecto y en el informe de aceptación
- Manuales validados para plataformas Dell, Supermicro, GIGABYTE, HPE, Lenovo y NVIDIA DGX
- Soporte L1–L3 con una ruta de escalado documentada hacia el fabricante
- Coordinación de RMA y almacenes de repuestos dimensionados a la flota desplegada
- Registro de oportunidades y una política escrita de neutralidad de canal
Preserva la garantía por construcción
Cada plataforma que desplegamos tiene un manual Velyrix derivado de la guía de instalación publicada por el fabricante.
- Manipulación ESD alineada con ANSI/ESD S20.20
- Se siguen las especificaciones de par y los procedimientos de kits de rail
- Líneas base de firmware alineadas con la pila validada del fabricante
- Se conservan registros por número de serie y evidencia fotográfica
- La evidencia de fallo se prepara en el formato exigido por el fabricante
Resultado: la garantía y los derechos de soporte del fabricante permanecen intactos y no surgen disputas de RMA sobre la práctica de instalación.
Servicios de despliegue más allá de la primera construcción
Migración y traslado
Traslada un parque GPU en producción entre salas o proveedores con un plan de corte por fases, mínimo tiempo de parada de entrenamiento y conciliación completa de activos.
Auditoría de salud del clúster
Evaluación independiente de un clúster existente: errores de fabric, deriva de firmware, margen térmico, eficiencia del planificador y MFU real, con un plan de corrección priorizado.
Ciclo de vida y renovación
Planificación de capacidad, renovación de hardware por fases, baja con sanitización de soportes NIST SP 800-88 y apoyo a la eliminación certificada o la reventa.
Operación gestionada
Monitorización 24×7, respuesta a incidentes, ciclo de vida de firmware y controladores, gestión de repuestos e informes de capacidad frente a tu SLA.
Las GPU son suyas. Nosotros las operamos.
Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.
Preguntas frecuentes
¿Qué incluye realmente la puesta en servicio de infraestructura de IA?
La puesta en servicio es el proceso formal de demostrar que un clúster cumple la especificación antes de entregarlo: línea base de firmware, burn-in de 72 horas, comprobaciones de salud de GPU y NVLink, barridos de calidad de enlace del fabric, benchmarks colectivos NCCL, pruebas de rendimiento de almacenamiento, un entrenamiento de referencia, pruebas de conmutación por error y un estudio térmico, todo recogido en un informe de aceptación firmado.
¿Puede Velyrix desplegar en nuestro centro de datos en lugar del vuestro?
Sí. Una parte importante de lo que hacemos se ejecuta en instalaciones de clientes o de terceros: centros de datos corporativos, instalaciones gubernamentales y salas de colocation de otros operadores. Trabajamos conforme a las normas de acceso, seguridad y control de cambios del sitio anfitrión, y podemos actuar como subcontratista de tu integrador actual si eso simplifica las cosas.
¿Cuánto se tarda en entregar un clúster GPU nuevo?
Con el hardware ya en sitio, una construcción típica lleva de tres a seis semanas por pod. De principio a fin (diseño, obra, plazo de entrega del hardware, construcción y puesta en servicio) una fábrica de IA nueva suele llevar de 12 a 20 semanas, siendo el plazo del OEM la mayor variable.
¿Anula la garantía del hardware que el despliegue lo haga un tercero?
No, siempre que el trabajo siga la guía de instalación publicada por el fabricante. Los ingenieros de Velyrix trabajan con procedimientos del OEM, manipulación con control ESD, especificaciones de par y registro documentado por número de serie, de modo que la garantía y los derechos de soporte del fabricante permanecen intactos.
¿Qué ocurre si el clúster no supera una prueba de aceptación?
En un proyecto a precio cerrado, Velyrix corrige y vuelve a probar a su costa hasta cumplir los criterios acordados. Los fallos atribuibles a hardware defectuoso se tramitan con el OEM en garantía, y gestionamos ese proceso en tu nombre.
¿Soportáis sistemas refrigerados por líquido y a escala de rack como GB300 NVL72?
Sí. Los despliegues refrigerados por líquido incluyen instalación de colectores y placas frías, llenado de refrigerante y prueba de presión, puesta en servicio de CDU, validación de detección de fugas y pruebas de conmutación de bombas, además del protocolo estándar de aceptación de cómputo y fabric.