Início/Nuvem GPU

Nuvem GPU e supercomputação de IA

Nuvem GPU NVIDIA, de um nó a 4.096 GPUs

Provisione aceleradores NVIDIA de inquilino único por segundo, ou reserve um cluster inteiro conectado por InfiniBand pela duração da sua campanha de treinamento. Mesmo hardware, mesmo fabric, mesmos engenheiros — qualquer que seja a forma de compra.

Provisionamento
< 90 segundos
Cobrança
Por segundo, sem taxa de saída
Fabric
400G / 800G sem bloqueio
Cluster máximo
4.096 GPUs em um único fabric
SLA de disponibilidade
99,99% de infraestrutura
Catálogo de GPUs

Escolha seu acelerador

Cada SKU está disponível como instância bare metal de inquilino único ou como instância virtualizada com passthrough de GPU. As SKUs multinó incluem InfiniBand otimizado por rail como padrão.

GPUArquiteturaMemória / bandaInterconexãoIdeal paraA partir de (GPU-hora)
GB300 NVL72Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 rack-scale + XDR 800GTreinamento de trilhões de parâmetros, inferência de contexto longo$8.91
B300 SXM (HGX)Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 + XDR 800GPré-treinamento de fronteira, fine-tuning MoE$8.34
B200 SXM (HGX)Blackwell180 GB HBM3e · 8 TB/sNVLink 5 + NDR/XDRTreinamento em larga escala, inferência FP4$6.61
H200 SXM (HGX)Hopper141 GB HBM3e · 4.8 TB/sNVLink 4 + NDR 400GTreinamento 70B–400B e serving de alto throughput$3.79
H100 SXM (HGX)Hopper80 GB HBM3 · 3.35 TB/sNVLink 4 + NDR 400GTreinamento, fine-tuning e inferência gerais$3.10
H100 NVL / PCIeHopper94 / 80 GB · 3.9 TB/sNVLink bridge + 200GDensidade de inferência, cargas mistas$2.70
A100 SXM 80GBAmpere80 GB HBM2e · 2.0 TB/sNVLink 3 + HDR 200GTreinamento e inferência em lote com custo otimizado$1.90
A100 SXM 40GBAmpere40 GB HBM2 · 1.6 TB/sNVLink 3 + HDR 200GTreinamento e inferência em lote com custo otimizado$1.47
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 200GInferência, simulação, gráficos e Omniverse$2.18
L40SAda Lovelace48 GB GDDR6 · 864 GB/sPCIe Gen4 · 100GInferência, renderização, vídeo, VDI$1.35
RTX 5090Blackwell32 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 100GPesquisa, difusão, clusters de desenvolvimento$0.75

Preços de tabela indicativos sob demanda em USD por GPU-hora, sem impostos. Prazos reservados e comprometidos têm desconto; veja preços para as tabelas por prazo.

Modelos de consumo

Compre computação do jeito que seu projeto é financiado

Elástico

Sob demanda

Cobrança por segundo, sem compromisso. Ideal para experimentação, bancadas de avaliação e fine-tuning pontual.

  • 1 a 8 GPUs por instância
  • Provisionamento instantâneo por API ou console
  • Snapshot e retomada
  • Sem cobrança de saída
Mais escolhido

Clusters reservados

Pods dedicados conectados por InfiniBand reservados de 1 a 36 meses, com capacidade nominada e tarifa fixa pelo prazo.

  • 16 a 4.096 GPUs, fabric sem bloqueio
  • Slurm ou Kubernetes gerenciados
  • Até 55% abaixo do sob demanda
  • Garantia de capacidade em contrato
Corporativo

Nuvem de IA privada

Uma sala, um fabric e um armazenamento fisicamente isolados, operados pela Velyrix sob sua nomenclatura, suas políticas e seu regime de auditoria.

  • Jaula ou sala dedicada
  • Chaves de criptografia gerenciadas pelo cliente
  • Opção isolada da rede
  • SLA e controle de mudanças sob medida
Fabric do cluster

Rede otimizada por rail que mantém as GPUs ocupadas

Um cluster de treinamento é tão rápido quanto seu all-reduce mais lento. A Velyrix constrói cada pod multinó sobre uma fat-tree sem bloqueio otimizada por rail, com planos de armazenamento e gerenciamento dedicados.

  • Plano de computação: InfiniBand NVIDIA Quantum-2 NDR 400G ou Quantum-X800 XDR 800G, subscrição 1:1
  • Opção Ethernet: NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo e controle de congestionamento
  • Computação na rede: agregação SHARP para reduzir a latência de all-reduce em coletivos grandes
  • Plano de armazenamento: rede separada de 200/400G para que os checkpoints nunca disputem com os gradientes
  • Plano de gerenciamento: rede BMC fora de banda, isolada do tráfego do inquilino
  • Validação: banda de barramento NCCL e latência de all-reduce informadas antes da entrega
acceptance-report.txt
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised
nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8

size        busbw       algbw      status
1.00 GB     372.4 GB/s  198.1 GB/s  PASS
4.00 GB     381.9 GB/s  203.7 GB/s  PASS
8.00 GB     384.6 GB/s  205.1 GB/s  PASS

fabric      : 1:1 non-blocking, 0 link errors / 72h
gpu_burnin  : 72h @ 100% — 0 XID, 0 ECC row remaps
sustained   : 48.9% MFU, Llama-class 70B reference run

Números representativos de um teste de aceitação da Velyrix. Os resultados variam conforme topologia, modelo, tamanho de lote e pilha de software; seu cluster é medido e documentado individualmente.

Orquestração e software

Chegue com sua pilha, não com um projeto de migração

Slurm gerenciado

Slurm pré-configurado com Pyxis/Enroot, contabilidade fair-share, escalonamento ciente de topologia e ganchos de checkpoint-restart para longas campanhas de pré-treinamento.

Kubernetes gerenciado

Clusters conformes à CNCF com NVIDIA GPU Operator, Network Operator, perfis MIG, KubeRay e Kueue para escalonamento multi-inquilino.

API bare metal

Provider Terraform e API REST para implantação de imagens, boot iPXE, controle de BMC e particionamento de fabric — construa seu próprio plano de controle por cima.

📦

Registro de contêineres

Registro e cache locais por região para NGC, Docker Hub e imagens privadas, para que downloads de 40 GB não travem o início de um job de 512 GPUs.

📈

Observabilidade

DCGM, Prometheus e Grafana com utilização de GPU por job, consumo, temperaturas, eventos XID e contadores de fabric — exportáveis para seu próprio SIEM.

🔧

Frameworks

Imagens validadas para PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang e TensorRT-LLM, atualizadas mensalmente.

Incluído em cada cluster

O que você recebe antes do primeiro job

Armazenamento

Sistema de arquivos paralelo de alto desempenho (WEKA ou VAST) dimensionado ao seu orçamento de tokens, mais armazenamento de objetos compatível com S3 para datasets e checkpoints. 10 TB de NVMe local incluídos por nó.

Rede

Fabric de computação InfiniBand ou Spectrum-X sem bloqueio, trânsito de internet duplo de 100G, interconexão privada com AWS, Azure, GCP e Oracle, e opções de trânsito BGP/IP. Sem cobrança de saída nos planos padrão.

Segurança

Hosts de inquilino único, VLAN/VRF e partições de fabric isoladas, atestação de firmware com boot seguro, chaves gerenciadas pelo cliente e apagamento verificado no descomissionamento (purga NIST SP 800-88).

Suporte

NOC 24×7, arquiteto de soluções dedicado, resposta P1 em 15 minutos, meta de substituição de hardware em quatro horas no local e relatórios mensais de SLA frente à disponibilidade contratada.

Aceitação

Antes da entrega: burn-in de GPU de 72 horas, validação de memória e ECC, testes de banda NCCL, varredura de erros do fabric e um relatório de aceitação assinado que você pode entregar aos seus auditores.

Fale com um arquiteto de infraestrutura de IA

As GPUs são suas. Nós operamos.

Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.

Perguntas frequentes

Como a nuvem GPU da Velyrix é cobrada?

Instâncias sob demanda são cobradas por segundo, sem prazo mínimo nem cobrança de saída de dados nos planos padrão. Clusters reservados são cobrados mensalmente a uma tarifa contratada fixa para prazos de um a trinta e seis meses. Nuvens privadas corporativas são orçadas como uma taxa mensal fixa de plataforma mais a capacidade.

Recebo bare metal ou máquinas virtuais?

Ambos estão disponíveis. O padrão para treinamento multinó é bare metal de inquilino único com acesso direto às GPUs, NICs e NVMe. Instâncias virtualizadas com passthrough de GPU são oferecidas quando snapshots e reinstalação rápida importam mais do que os últimos pontos percentuais de desempenho.

Qual rede os clusters de treinamento multinó usam?

InfiniBand sem bloqueio otimizado por rail — NVIDIA Quantum-2 NDR a 400G ou Quantum-X800 XDR a 800G por GPU — com redução SHARP na rede. NVIDIA Spectrum-X Ethernet com RoCEv2 está disponível quando se exige um modelo operacional apenas Ethernet.

Posso rodar Slurm e Kubernetes no mesmo cluster?

Sim. A Velyrix costuma particionar um cluster reservado para que uma partição Slurm execute treinamentos longos enquanto uma partição Kubernetes atende inferência, com um sistema de arquivos paralelo compartilhado entre as duas. Os tamanhos das partições podem ser ajustados durante o prazo.

Existe compromisso mínimo para clusters grandes?

Clusters acima de 256 GPUs normalmente são contratados por no mínimo três meses, por causa do trabalho de construção e cabeamento do fabric. Janelas mais curtas podem ser acomodadas em salas onde já exista um pod equivalente construído e ocioso.