Início/Implantação de IA
Implantação e comissionamento de infraestrutura de IADos paletes na doca a um cluster validado
Os engenheiros de implantação da Velyrix constroem fábricas de IA para operadores, empresas e governos — em nossas salas ou nas suas. Todo projeto termina do mesmo jeito: um cluster com burn-in, benchmark e documentação, e um relatório de aceitação assinado que seus auditores podem ler.
Tudo entre a ordem de compra e o primeiro job de treinamento
A maioria dos projetos de GPU não falha no silício. Falha nos circuitos de líquido, num rail mal cabeado, na divergência de firmware entre oito nós, ou porque ninguém jamais mediu o que o fabric realmente faz.
Projeto e engenharia
Topologia do cluster, elevações de rack, planos de energia, projeto do circuito de líquido, peso e carga de piso, plano de cabeamento do fabric e lista de materiais.
Logística e recebimento
Coordenação de frete, apoio à documentação aduaneira, recebimento seguro, captura de ativos, registro de números de série e remoção de embalagens.
Rack & stack
Instalação mecânica de sistemas HGX, DGX, MGX e ORv3, kits de trilho, tubulação de CDU e manifold, fixação com torque controlado e manuseio com controle de ESD.
Energia e refrigeração
Terminação de busway e whips por eletricistas licenciados, balanceamento de alimentação A/B, enchimento de líquido e teste de pressão, comissionamento da detecção de vazamento.
Construção do fabric
Cabeamento InfiniBand ou Spectrum-X otimizado por rail, etiquetagem conforme o plano, assentamento de ópticas, treinamento de link, varredura de taxa de erro e verificação de topologia.
Padronização de firmware
BIOS, BMC, CPLD, NIC, NVSwitch e VBIOS de GPU alinhados a uma única linha de base validada em todos os nós, com relatório de divergência.
Pilha de software
Imagem do SO, driver NVIDIA, CUDA, Fabric Manager, DCGM, runtime de contêineres, Slurm ou Kubernetes, clientes de armazenamento e agentes de monitoramento.
Burn-in e validação
Estresse sustentado de 72 horas, saturação térmica, monitoramento de ECC e XID, verificação de remapeamento de linhas de memória, testes de throughput de armazenamento e fabric.
Aceitação e entrega
Resultados documentados do teste de aceitação, desenhos as-built, registro de ativos, runbooks, matriz de escalonamento e treinamento de operadores.
O método de implantação da Velyrix
Um programa repetível de nove estágios, com gerente de projeto nomeado, relatório semanal e um gate documentado ao fim de cada estágio.
Descoberta e revisão de projeto
Perfil de carga, tamanhos de modelo, orçamento de tokens e curva de crescimento traduzidos em topologia de cluster, envelope de potência e dimensionamento de armazenamento. Entregável: documento de projeto e BOM.
Avaliação de prontidão do site
Capacidade elétrica, carga de piso, disponibilidade de líquido, acesso para entrega, supressão de incêndio e caminhos de fabric avaliados contra o projeto. Entregável: relatório de prontidão com lista de lacunas.
Apoio a compras e logística
Acompanhamento de prazos do OEM, plano de staging, apoio à documentação de exportação e importação, e verificação do usuário final antes do envio de qualquer hardware controlado. Entregável: cronograma de entrega.
Instalação mecânica
Racks nivelados e aterrados, sistemas instalados, manifolds e placas frias conectados, líquido preenchido e testado sob pressão, gerenciamento de cabos conforme o plano. Entregável: elevações as-built.
Comissionamento elétrico
Terminação de circuitos, balanceamento de fases, coordenação de disjuntores e verificação de medição por eletricistas licenciados trabalhando sob procedimentos documentados. Entregável: aprovação elétrica.
Construção e verificação do fabric
Cabeamento otimizado por rail instalado e etiquetado, cada link treinado na taxa plena, varredura de taxa de erro de bit, mapa de topologia comparado ao projeto. Entregável: relatório de links e topologia.
Software e subida do cluster
Implantação da imagem golden, aplicação da linha de base de firmware, configuração do escalonador, montagens de armazenamento, integração de monitoramento e alertas. Entregável: linha de base de configuração.
Burn-in e validação de desempenho
Estresse de 72 horas em plena potência, benchmarks NCCL all-reduce e all-gather, throughput de armazenamento e um treinamento de modelo de referência na escala alvo. Entregável: resultados de benchmark.
Aceitação e entrega operacional
Relatório de teste de aceitação revisado e assinado, runbooks e caminhos de escalonamento entregues, treinamento de operadores realizado, transição opcional para operação gerenciada Velyrix. Entregável: ATP assinado.
O que medimos antes de considerar concluído
Os critérios de aprovação são acordados por escrito na fase de projeto e testados na entrega. Tudo o que falhar é corrigido e retestado por conta da Velyrix em contratos de preço fechado.
| Teste | Método | Critério típico de aprovação | Evidência |
|---|---|---|---|
| Inventário e saúde das GPUs | nvidia-smi, DCGM diagnostics level 3 | 100% das GPUs enumeradas, zero ECC incorrigível, zero remapeamentos de linha pendentes | Relatório DCGM por nó |
| Burn-in sustentado | 72 h de estresse combinado de GPU, CPU, memória e NVMe | Zero erros XID, zero eventos de throttling térmico, clocks estáveis | Exportação de telemetria em série temporal |
| NVLink / NVSwitch | nvbandwidth, teste de latência e banda p2p | Dentro de 5% da banda de referência da plataforma em cada par | Matriz de banda |
| Qualidade dos links do fabric | Treinamento de link, varredura de BER, contadores de erro de porta | Todos os links na taxa plena, taxa de erro de símbolo abaixo do limite do fornecedor, zero flaps em 72 h | Relatório de saúde do fabric |
| Desempenho de coletivos | NCCL all-reduce e all-gather, 8 MB – 8 GB | Banda de barramento dentro de 10% da referência de topologia em escala plena | nccl-tests output |
| Throughput de armazenamento | fio e IOR contra o sistema de arquivos paralelo | Leitura/escrita agregada e tempo de checkpoint contratados atingidos | Log de benchmark |
| Treinamento de referência | Modelo de referência classe Llama no número de nós alvo | Utilização de FLOPs do modelo e tempo de passo contratados atingidos | Log de treinamento e cálculo de MFU |
| Failover e resiliência | Corte de energia A/B, remoção de switch leaf, failover de bomba de CDU | Sem perda de job em caminhos redundantes, tempo de recuperação documentado | Folha de testemunho do teste |
| Térmica e energia | Saturação em plena carga com telemetria de entrada, saída e líquido | Todos os componentes dentro da especificação do OEM na temperatura ambiente de projeto | Levantamento térmico |
| Linha de base de segurança | Boot seguro, endurecimento de BMC, rotação de credenciais, segmentação de rede | Linha de base aplicada em 100% dos nós, sem credenciais padrão | Auditoria de configuração |
Feito para sobreviver a uma auditoria de OEM e de seguradora
O trabalho de implantação toca garantias de terceiros, salas de terceiros e instalações elétricas energizadas. A Velyrix conduz o projeto de acordo.
- Procedimentos e avaliações de risco emitidos e aprovados antes de qualquer trabalho em piso energizado
- Eletricistas licenciados para toda terminação elétrica, conforme código local e prática de arc-flash
- Manuseio com controle de ESD alinhado à ANSI/ESD S20.20 para proteger as condições de garantia do OEM
- Orientações de instalação do OEM seguidas para que a garantia do fabricante e os direitos de suporte permaneçam intactos
- Cadeia de custódia da doca ao rack, com captura de ativos no nível de número de série e registros fotográficos
- Controle de mudanças com janelas de trabalho documentadas, planos de rollback e aprovação do cliente
- Engenheiros segurados e verificados, com checagem de antecedentes e autorização de acesso por site
- Verificação de controle de exportação concluída antes do envio ou da instalação de hardware controlado
Modelos de contratação
Escopo acordado, critérios de aceitação acordados, preço acordado. O modelo mais comum para clusters greenfield.
Diárias de engenheiro para expansões, correções, migrações e diagnóstico de um parque existente.
Engenheiros Velyrix alocados no seu site por um período definido, para construir capacidade junto à sua equipe.
Nós construímos e depois operamos sob um serviço gerenciado com SLA de disponibilidade e desempenho.
As taxas de implantação por preço fechado vão de cerca de US$ 2.300 por nó em uma expansão simples refrigerada a ar até US$ 4.600–US$ 10.900 por nó em sistemas refrigerados a líquido em escala de rack, incluindo construção de fabric, validação e documentação. Todo projeto é orçado após a revisão de projeto.
Também somos a bancada de serviços de campo por trás dos negócios de outros
Estamos estruturados para entregar trabalho de implantação para fabricantes de hardware e seus parceiros — sob nossa marca ou, mais útil para você, sob a deles.
- Entrega white-label — sua marca no plano do projeto e no relatório de aceitação
- Manuais validados para plataformas Dell, Supermicro, GIGABYTE, HPE, Lenovo e NVIDIA DGX
- Suporte L1–L3 com caminho de escalonamento documentado até o fabricante
- Coordenação de RMA e depósitos de peças dimensionados à frota implantada
- Registro de oportunidade e uma política escrita de neutralidade de canal
Preserva a garantia por construção
Toda plataforma que implantamos tem um manual Velyrix derivado das orientações de instalação publicadas pelo fabricante.
- Manuseio ESD alinhado à ANSI/ESD S20.20
- Especificações de torque e procedimentos de kit de trilho seguidos
- Linhas de base de firmware correspondentes à pilha validada do fornecedor
- Registros por número de série e evidência fotográfica retidos
- Evidência de falha empacotada no formato exigido pelo fornecedor
Resultado: a garantia do fabricante e os direitos de suporte permanecem intactos, e disputas de RMA sobre prática de instalação simplesmente não acontecem.
Serviços de implantação além da primeira construção
Migração e realocação
Mova um parque GPU em produção entre salas ou provedores com plano de cutover em fases, mínima interrupção de treinamento e reconciliação completa de ativos.
Auditoria de saúde do cluster
Avaliação independente de um cluster existente: erros de fabric, divergência de firmware, folga térmica, eficiência do escalonador e MFU realizada, com plano de correção priorizado.
Ciclo de vida e renovação
Planejamento de capacidade, renovação escalonada de hardware, descomissionamento com sanitização de mídia NIST SP 800-88 e apoio ao descarte certificado ou revenda.
Operação gerenciada
Monitoramento 24×7, resposta a incidentes, ciclo de vida de firmware e drivers, gestão de peças e relatórios de capacidade frente ao seu SLA.
As GPUs são suas. Nós operamos.
Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.
Perguntas frequentes
O que o comissionamento de infraestrutura de IA inclui de fato?
Comissionamento é o processo formal de provar que um cluster funciona conforme a especificação antes da entrega: padronização de firmware, burn-in de 72 horas, verificações de saúde de GPU e NVLink, varreduras de qualidade de link do fabric, benchmarks de coletivos NCCL, testes de throughput de armazenamento, um treinamento de referência, testes de failover e um levantamento térmico - tudo registrado em um relatório de teste de aceitação assinado.
A Velyrix pode implantar no nosso próprio data center em vez do de vocês?
Sim. Boa parte do que fazemos é em sites de clientes ou de terceiros - data centers corporativos, instalações governamentais e salas de colocation de outros operadores. Trabalhamos conforme as regras de acesso, segurança e controle de mudanças do site anfitrião, e podemos atuar como subcontratados do seu integrador atual, se isso for mais simples.
Quanto tempo leva para entregar um cluster GPU greenfield?
Com o hardware no local, uma construção típica leva de três a seis semanas por pod. De ponta a ponta - projeto, obras no site, prazo de entrega do OEM, construção e comissionamento - uma fábrica de IA greenfield leva normalmente de 12 a 20 semanas, sendo o prazo do OEM a maior variável.
O trabalho de implantação por terceiros anula a garantia do nosso hardware OEM?
Não, quando o trabalho segue as orientações de instalação publicadas pelo fabricante. Os engenheiros da Velyrix trabalham conforme os procedimentos do OEM, com manuseio controlado de ESD, especificações de torque e registros documentados por número de série, de modo que a garantia do fabricante e os direitos de suporte permanecem intactos.
O que acontece se o cluster não passar em um teste de aceitação?
Em um contrato de preço fechado, a Velyrix corrige e reteste por nossa conta até que os critérios acordados sejam atendidos. Falhas atribuídas a hardware defeituoso são abertas junto ao OEM em garantia, e conduzimos esse processo em seu nome.
Vocês suportam sistemas refrigerados a líquido e em escala de rack, como o GB300 NVL72?
Sim. Implantações refrigeradas a líquido incluem instalação de manifold e placas frias, enchimento e teste de pressão do líquido, comissionamento de CDU, validação da detecção de vazamento e teste de failover de bombas, além do protocolo padrão de aceitação de computação e fabric.