Inicio/Plataforma
Almacenamiento, red y operación gestionadaLa plataforma que mantiene ocupadas a las GPU caras
Los aceleradores son la parte fácil. Velyrix construye las capas de almacenamiento, fabric, planificación y observabilidad que deciden si tu clúster funciona al 30% de utilización o al 55%, y las opera todas 24×7.
Alimenta las GPU y haz checkpoint sin atascos
Un trabajo de 512 GPU escribiendo un checkpoint de varios terabytes expondrá cualquier debilidad en la ruta de almacenamiento. Velyrix dimensiona el almacenamiento según tu intervalo de checkpoint y tu patrón de lectura de datos, no según una cifra de capacidad en una orden de compra.
| Nivel | Tecnología | Rendimiento típico | Caso de uso | Desde (por TB/mes) |
|---|---|---|---|---|
| Scratch | NVMe local Gen4/Gen5 | Hasta 60 GB/s por nodo | Espacio de shuffle, caché del dataloader, temporales | Incluido |
| FS paralelo — rendimiento | WEKA o VAST sobre NVMe | 1–10 TB/s de lectura agregada | Datasets de entrenamiento, checkpoints | $42 |
| FS paralelo — capacidad | Nivel híbrido NVMe + HDD | 200–800 GB/s | Épocas frías, archivo de datasets | $22 |
| Bloques | NVMe-oF replicado | Hasta 1M IOPS por volumen | Bases de datos, vectores, volúmenes de arranque | $101 |
| Objetos | Compatible S3, código de borrado | Varios GB/s, durabilidad de 11 nueves | Data lake, registro de modelos, artefactos | $20 |
| Archivo | Objeto frío / pasarela a cinta | Recuperación en minutos u horas | Retención, cumplimiento, corpus en bruto | $6 |
Precios de lista indicativos, sin impuestos. Los sistemas de ficheros paralelos se dimensionan y presupuestan por clúster; las cifras de rendimiento dependen de la configuración desplegada.
Tres planos que nunca comparten un mal día
- Plano de cómputo: InfiniBand NVIDIA Quantum-X800 XDR 800G o Quantum-2 NDR 400G, optimizado por rail, sin bloqueo 1:1, con SHARP habilitado
- Alternativa Ethernet: NVIDIA Spectrum-X con RoCEv2, enrutamiento adaptativo, control de congestión y descarga en DPU BlueField-3
- Plano de almacenamiento: 200/400G dedicados para que las escrituras de checkpoint nunca choquen con el all-reduce de gradientes
- Plano de gestión: red BMC fuera de banda aislada, con acceso por jump host y auditoría completa
- Externo: tránsito de 100G con doble acometida, mitigación de DDoS, BYOIP y sesiones BGP bajo petición
- Interconexión: enlaces privados a AWS, Azure, Google Cloud y Oracle, más fibra oscura entre campus de Velyrix
Topología de referencia para un pod de 512 GPU. Los fabrics mayores añaden un tercer nivel; el principio de optimización por rail no cambia.
Un NOC que entiende NCCL, no solo el ping
NOC 24×7
Una rotación de guardia 24×7 con respuesta P1 contractual en 15 minutos, ingenieros que dominan GPU y escalado directo al equipo que construyó tu clúster, no un guión de primera línea.
Observabilidad
DCGM, node exporter, contadores de fabric y telemetría de trabajos en Prometheus y Grafana, con atribución por trabajo y exportación a tu propio SIEM.
Salud proactiva
Comprobaciones automatizadas de salud de nodo entre trabajos, análisis de tendencias de XID y ECC, y drenaje y sustitución preventivos antes de perder una campaña.
Gestión del ciclo de vida
Actualizaciones de firmware, controladores y motores validadas primero en un pod de preproducción y después desplegadas en producción en ventanas acordadas.
Operación del planificador
Ajuste de Slurm y Kubernetes, política de colas y cuotas, configuración fair-share e informes de utilización por equipo o centro de coste.
Informes de SLA
Informes mensuales de disponibilidad, incidencias y capacidad medidos frente al contrato, con créditos aplicados automáticamente cuando no se alcanzan los objetivos.
Aislamiento que puedes evidenciar
- Tenencia: hosts físicos de un solo inquilino, VLAN/VRF dedicadas y particiones InfiniBand dedicadas
- Identidad: inicio de sesión único SAML/OIDC, aprovisionamiento SCIM, MFA por hardware, claves de API con ámbito y acceso basado en roles
- Claves: claves de cifrado gestionadas por el cliente con respaldo HSM; Velyrix no puede leer los volúmenes del inquilino
- Datos en reposo: AES-256 en los niveles de bloque, objeto y almacenamiento paralelo
- Datos en tránsito: TLS 1.3 en el exterior, MACsec e IPsec opcionales en enlaces privados
- Integridad del firmware: arranque seguro, líneas base de firmware firmadas y atestación en cada aprovisionamiento
- Baja de servicio: purga NIST SP 800-88 con certificado de sanitización, o destrucción presenciada por el cliente
- Registro: rastro de auditoría inmutable de cada acceso de consola, API y físico
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
Las GPU son suyas. Nosotros las operamos.
Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.
Preguntas frecuentes
¿Qué almacenamiento deberíamos usar para grandes entrenamientos?
Un sistema de ficheros paralelo de rendimiento (WEKA o VAST sobre NVMe) para conjuntos de datos activos y checkpoints, respaldado por almacenamiento de objetos compatible con S3 para el data lake más amplio, con NVMe local en cada nodo como espacio de shuffle. Velyrix dimensiona el nivel de rendimiento a partir del tamaño y el intervalo de tus checkpoints para que estos nunca dominen el tiempo de paso.
¿Admitís Ethernet en lugar de InfiniBand?
Sí. NVIDIA Spectrum-X con RoCEv2, enrutamiento adaptativo y control de congestión está disponible cuando se prefiere un modelo operativo únicamente Ethernet. InfiniBand sigue siendo la opción por defecto en los fabrics de entrenamiento más grandes por la reducción en red SHARP y la madurez de la gestión de subred.
¿Podemos conectar un clúster de Velyrix a nuestro entorno cloud actual?
Sí, mediante interconexiones privadas con AWS, Azure, Google Cloud y Oracle Cloud, enlaces protegidos con IPsec o MACsec hacia tus propios centros de datos y cross-connects en nuestras salas de interconexión neutrales.
¿Quién opera el clúster en el día a día?
Puedes operarlo tú con acceso root y BMC completo, o delegar la operación en Velyrix bajo un servicio gestionado que cubre monitorización, respuesta a incidentes, ciclo de vida de firmware y controladores, política del planificador e informes de SLA.