Inicio/Nube GPU
Nube GPU y supercomputación de IANube GPU NVIDIA, desde un nodo hasta 4.096 GPU
Aprovisiona aceleradores NVIDIA de un solo inquilino por segundos, o reserva un clúster completo conectado por InfiniBand durante toda tu campaña de entrenamiento. El mismo hardware, el mismo fabric, los mismos ingenieros, compres como compres.
Elige tu acelerador
Cada SKU está disponible como instancia bare metal de un solo inquilino o como instancia virtualizada con paso a través de GPU. Las SKU multinodo incluyen InfiniBand optimizado por rail de serie.
| GPU | Arquitectura | Memoria / ancho de banda | Interconexión | Ideal para | Desde (GPU-hora) |
|---|---|---|---|---|---|
| GB300 NVL72 | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 rack-scale + XDR 800G | Entrenamiento de billones de parámetros, inferencia de contexto largo | $8.91 |
| B300 SXM (HGX) | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 + XDR 800G | Preentrenamiento de frontera, ajuste fino MoE | $8.34 |
| B200 SXM (HGX) | Blackwell | 180 GB HBM3e · 8 TB/s | NVLink 5 + NDR/XDR | Entrenamiento a gran escala, inferencia FP4 | $6.61 |
| H200 SXM (HGX) | Hopper | 141 GB HBM3e · 4.8 TB/s | NVLink 4 + NDR 400G | Entrenamiento 70B–400B y servicio de alto rendimiento | $3.79 |
| H100 SXM (HGX) | Hopper | 80 GB HBM3 · 3.35 TB/s | NVLink 4 + NDR 400G | Entrenamiento, ajuste fino e inferencia generales | $3.10 |
| H100 NVL / PCIe | Hopper | 94 / 80 GB · 3.9 TB/s | NVLink bridge + 200G | Densidad de inferencia, cargas mixtas | $2.70 |
| A100 SXM 80GB | Ampere | 80 GB HBM2e · 2.0 TB/s | NVLink 3 + HDR 200G | Entrenamiento e inferencia por lotes con coste optimizado | $1.90 |
| A100 SXM 40GB | Ampere | 40 GB HBM2 · 1.6 TB/s | NVLink 3 + HDR 200G | Entrenamiento e inferencia por lotes con coste optimizado | $1.47 |
| RTX PRO 6000 Blackwell | Blackwell | 96 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 200G | Inferencia, simulación, gráficos y Omniverse | $2.18 |
| L40S | Ada Lovelace | 48 GB GDDR6 · 864 GB/s | PCIe Gen4 · 100G | Inferencia, renderizado, vídeo, VDI | $1.35 |
| RTX 5090 | Blackwell | 32 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 100G | Investigación, difusión, clústeres de desarrollo | $0.75 |
Precios de lista indicativos bajo demanda en USD por GPU-hora, sin impuestos. Los plazos reservados y comprometidos tienen descuento; consulta precios para ver las tablas por plazo.
Compra cómputo como se financia tu proyecto
Bajo demanda
Facturación por segundo, sin compromiso. Ideal para experimentación, bancos de evaluación y fine-tuning puntual.
- 1–8 GPU por instancia
- Aprovisionamiento instantáneo por API o consola
- Instantáneas y reanudación
- Sin cargos de salida
Clústeres reservados
Pods dedicados conectados por InfiniBand reservados de 1 a 36 meses, con capacidad nominada y tarifa fija durante el plazo.
- 16–4.096 GPU, fabric sin bloqueo
- Slurm o Kubernetes gestionados
- Hasta un 55% por debajo de bajo demanda
- Garantía de capacidad en contrato
Nube de IA privada
Una sala, un fabric y un almacén físicamente aislados, operados por Velyrix bajo tu nomenclatura, tus políticas y tu régimen de auditoría.
- Jaula o sala dedicada
- Claves de cifrado gestionadas por el cliente
- Opción aislada de la red
- SLA y control de cambios a medida
Red optimizada por rail que mantiene ocupadas a las GPU
Un clúster de entrenamiento es tan rápido como su all-reduce más lento. Velyrix construye cada pod multinodo sobre un fat-tree sin bloqueo optimizado por rail, con planos de almacenamiento y gestión dedicados.
- Plano de cómputo: InfiniBand NVIDIA Quantum-2 NDR 400G o Quantum-X800 XDR 800G, suscripción 1:1
- Opción Ethernet: NVIDIA Spectrum-X con RoCEv2, enrutamiento adaptativo y control de congestión
- Cómputo en red: agregación SHARP para reducir la latencia de all-reduce en colectivos grandes
- Plano de almacenamiento: red independiente de 200/400G para que los checkpoints nunca compitan con los gradientes
- Plano de gestión: red BMC fuera de banda, aislada del tráfico del inquilino
- Validación: ancho de banda de bus NCCL y latencia de all-reduce reportados antes de la entrega
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8 size busbw algbw status 1.00 GB 372.4 GB/s 198.1 GB/s PASS 4.00 GB 381.9 GB/s 203.7 GB/s PASS 8.00 GB 384.6 GB/s 205.1 GB/s PASS fabric : 1:1 non-blocking, 0 link errors / 72h gpu_burnin : 72h @ 100% — 0 XID, 0 ECC row remaps sustained : 48.9% MFU, Llama-class 70B reference run
Cifras representativas de una prueba de aceptación de Velyrix. Los resultados varían según topología, modelo, tamaño de lote y pila de software; tu clúster se mide y documenta individualmente.
Ven con tu pila, no con un proyecto de migración
Slurm gestionado
Slurm preconfigurado con Pyxis/Enroot, contabilidad fair-share, planificación con conocimiento de topología y ganchos de checkpoint-restart para campañas largas de preentrenamiento.
Kubernetes gestionado
Clústeres conformes a CNCF con NVIDIA GPU Operator, Network Operator, perfiles MIG, KubeRay y Kueue para planificación multiinquilino.
API de bare metal
Proveedor de Terraform y API REST para despliegue de imágenes, arranque iPXE, control BMC y particionado de fabric: construye tu propio plano de control encima.
Registro de contenedores
Registro y caché locales por región para NGC, Docker Hub e imágenes privadas, de modo que descargas de 40 GB no bloqueen el arranque de un trabajo de 512 GPU.
Observabilidad
DCGM, Prometheus y Grafana con utilización de GPU por trabajo, consumo, temperaturas, eventos XID y contadores de fabric, exportables a tu propio SIEM.
Frameworks
Imágenes validadas para PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang y TensorRT-LLM, actualizadas mensualmente.
Lo que recibes antes de que corra el primer trabajo
Sistema de ficheros paralelo de alto rendimiento (WEKA o VAST) dimensionado a tu presupuesto de tokens, más almacenamiento de objetos compatible con S3 para conjuntos de datos y checkpoints. Incluye 10 TB de NVMe local por nodo.
Fabric de cómputo InfiniBand o Spectrum-X sin bloqueo, doble tránsito de internet de 100G, interconexión privada con AWS, Azure, GCP y Oracle, y opciones de tránsito BGP/IP. Sin cargos de salida en los planes estándar.
Hosts de un solo inquilino, VLAN/VRF y particiones de fabric aisladas, atestación de firmware con arranque seguro, claves gestionadas por el cliente y borrado verificado en la baja (purga NIST SP 800-88).
NOC 24×7, arquitecto de soluciones asignado, respuesta P1 en 15 minutos, objetivo de sustitución de hardware en cuatro horas in situ e informes mensuales de SLA frente a la disponibilidad contratada.
Antes de la entrega: burn-in de GPU de 72 horas, validación de memoria y ECC, pruebas de ancho de banda NCCL, barrido de errores de fabric y un informe de aceptación firmado que puedes entregar a tus auditores.
Las GPU son suyas. Nosotros las operamos.
Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.
Preguntas frecuentes
¿Cómo se factura la nube GPU de Velyrix?
Las instancias bajo demanda se facturan por segundo, sin plazo mínimo ni cargos por salida de datos en los planes estándar. Los clústeres reservados se facturan mensualmente a una tarifa contratada fija para plazos de uno a treinta y seis meses. Las nubes privadas empresariales se presupuestan como una cuota mensual fija de plataforma más la capacidad.
¿Recibo bare metal o máquinas virtuales?
Ambos están disponibles. El valor por defecto para entrenamiento multinodo es bare metal de un solo inquilino con acceso directo a las GPU, las NIC y los NVMe. Las instancias virtualizadas con paso a través de GPU se ofrecen cuando las instantáneas y la reinstalación rápida importan más que el último porcentaje de rendimiento.
¿Qué red usan los clústeres de entrenamiento multinodo?
InfiniBand sin bloqueo optimizado por rail: NVIDIA Quantum-2 NDR a 400G o Quantum-X800 XDR a 800G por GPU, con reducción SHARP en red. NVIDIA Spectrum-X Ethernet con RoCEv2 está disponible cuando se requiere un modelo operativo únicamente Ethernet.
¿Puedo ejecutar Slurm y Kubernetes en el mismo clúster?
Sí. Velyrix suele particionar un clúster reservado para que una partición Slurm ejecute entrenamientos largos mientras una partición Kubernetes sirve inferencia, con un sistema de ficheros paralelo compartido entre ambas. Los tamaños de partición pueden ajustarse durante el plazo.
¿Hay un compromiso mínimo para clústeres grandes?
Los clústeres de más de 256 GPU se contratan normalmente por un mínimo de tres meses debido al trabajo de construcción y cableado del fabric. Se pueden acomodar ventanas más cortas en salas donde ya hay un pod equivalente construido y libre.