Início/LLM privado
Implantação e otimização de LLM privadosSeu modelo, seu hardware, seu limite de dados
A Velyrix instala, quantiza, avalia e opera modelos de pesos abertos de fronteira em GPUs dedicadas — na nuvem Velyrix, na sua área de colocation ou totalmente isolado em suas instalações. Você recebe um endpoint compatível com OpenAI, com throughput, latência e disponibilidade contratados.
APIs públicas são convenientes até que os dados sejam seus
Dados regulados, código-fonte proprietário, prontuários, posições de mercado e cargas soberanas raramente pertencem à fila de inferência de outra pessoa. Modelos de pesos abertos agora suficientemente próximos da qualidade de fronteira tornam a implantação privada o padrão para cargas sérias.
- Os dados nunca saem do seu limite — sem retenção por terceiros, sem treinamento com seus prompts
- Economia unitária previsível — custo fixo de GPU em vez de cobrança por token que cresce com o sucesso
- Estabilidade de versão — o modelo que você validou continua sendo o modelo que você serve, até que decida o contrário
- Latência sob seu controle — endpoint na mesma região, ou no mesmo prédio, que a aplicação
- Personalização profunda — adaptadores LoRA, fine-tunes de domínio, esquemas de ferramentas e guardrails próprios
- Auditabilidade — registro completo de requisições no seu próprio SIEM, com sua própria política de retenção
# Before — public API client = OpenAI(api_key="sk-...") # After — your Velyrix private endpoint client = OpenAI( base_url="https://llm.internal.acme.com/v1", api_key=os.environ["VELYRIX_KEY"], ) resp = client.chat.completions.create( model="qwen3-235b-a22b-fp8", messages=[{"role": "user", "content": prompt}], tools=tools, stream=True, ) # Same SDK. Same schema. Your VPC, your logs, your keys.
Dez famílias de modelos de pesos abertos, implantadas e suportadas
A Velyrix mantém receitas de serviço validadas, perfis de quantização e linhas de base de benchmark para cada família, atualizados conforme novos checkpoints são lançados.
DeepSeek
Modelos MoE esparsos de topo e modelos de raciocínio, incluindo variantes densas destiladas para serviço sensível a custo.
Qwen
Séries densas e MoE da Alibaba, com fortes variantes multilíngues, de programação e de visão-linguagem, de 0,6B a 235B+.
Llama
A família de pesos abertos mais adotada da Meta — o padrão mais seguro para ferramentas, adaptadores e harnesses de avaliação do ecossistema.
OpenAI gpt-oss
Lançamento de pesos abertos da OpenAI, MoE com esforço de raciocínio configurável e forte uso de ferramentas com poucas GPUs.
Mistral
Modelos europeus com licenciamento permissivo em muitos checkpoints — densos, MoE, de código e pequenas variantes de borda.
GLM
Família MoE bilíngue da Zhipu, com forte desempenho agêntico e de programação, além de checkpoints mais leves da classe air.
Kimi
Modelos MoE esparsos da classe de um trilhão de parâmetros da Moonshot AI, feitos para contexto longo e agentes que chamam ferramentas.
MiniMax
Arquiteturas MoE de atenção eficiente voltadas a janelas de contexto muito longas com custo de serviço competitivo.
Gemma
Modelos abertos leves do Google — excelente qualidade por GPU para on-premise, borda e classificação de alto volume.
NVIDIA Nemotron
Família de modelos abertos otimizada da NVIDIA, ajustada para throughput em aceleradores NVIDIA e fluxos de agentes corporativos.
Os nomes de modelos são marcas de seus respectivos proprietários. A Velyrix é um provedor de infraestrutura independente, não afiliado nem endossado por esses publicadores de modelos. Cada modelo é implantado sob sua própria licença, que revisamos com você antes da implantação — veja licenciamento de modelos.
O que é preciso para servir cada classe de modelo
Dimensionamento indicativo de réplica única para serviço em produção, com espaço para cache KV em concorrência realista. O dimensionamento final vem do seu comprimento de contexto, concorrência e metas de latência.
| Classe de modelo | Precisão | GPUs mínimas | Recomendado | Throughput indicativo | Infraestrutura mensal a partir de |
|---|---|---|---|---|---|
| Denso pequeno (1B – 9B) | BF16 / FP8 | 1× L40S | 2× L40S / 1× H100 | 2,500 – 6,000 tok/s | $1,640 |
| Denso médio (12B – 32B) | FP8 / AWQ-INT4 | 1× H100 80GB | 2× H100 / 2× H200 | 1,800 – 4,500 tok/s | $3,300 |
| Denso grande (70B – 123B) | FP8 | 2× H200 | 4× H200 / 8× H100 | 1,400 – 3,200 tok/s | $10,400 |
| Denso muito grande (405B) | FP8 | 8× H200 | 8× B200 | 900 – 2,100 tok/s | $23,900 |
| MoE esparso (100B – 250B total) | FP8 | 4× H200 | 8× H200 | 3,000 – 9,000 tok/s | $18,400 |
| MoE esparso (400B – 700B total) | FP8 / FP4 | 8× H200 | 8× B200 / 16× H200 | 4,000 – 14,000 tok/s | $23,900 |
| MoE esparso (classe 1T total) | FP8 / FP4 | 16× H200 | 8× B300 / GB300 partition | 6,000 – 20,000 tok/s | $44,800 |
| Visão-linguagem (qualquer tamanho) | BF16 / FP8 | +1 GPU para a torre de visão | Réplica de encoder dedicada | Depende da carga | Sob consulta |
O throughput é o total de tokens de saída por segundo em requisições concorrentes, medido em hardware de referência Velyrix com prompts representativos de produção. Seus números são medidos na sua carga antes do contrato, e o valor acordado passa a ser uma meta de nível de serviço.
A diferença entre rodar um modelo e rodá-lo bem
Um contêiner padrão em oito GPUs costuma deixar de duas a cinco vezes o throughput na mesa. Os projetos de otimização da Velyrix ajustam todo o caminho, do tokenizador à NIC.
Quantização
Perfis FP8, NVFP4/MXFP4, AWQ, GPTQ e SmoothQuant com teste de regressão de acurácia contra o seu próprio conjunto de avaliação antes de qualquer coisa entrar no ar.
Estratégia de paralelismo
Layouts de paralelismo de tensor, pipeline, especialista e dados escolhidos por modelo e topologia de GPU, incluindo posicionamento de especialistas ciente de NVLink para MoE.
Batching contínuo
Atenção paginada, prefill em blocos e ajuste do escalonador para manter alta ocupação de GPU sem violar sua meta de tempo até o primeiro token.
Desagregação de prefill e decode
Pools separados de prefill e decode com transferência de KV, para que prompts longos deixem de bloquear a decodificação interativa em hardware compartilhado.
Decodificação especulativa
Modelos rascunho, especulação estilo EAGLE e n-grama ajustados à sua taxa de aceitação — comumente 1,5–2,5× em cargas interativas.
Engenharia de cache KV
Cache de prefixo e radix, descarga de cache para memória do host ou NVMe, e KV quantizado para estender o contexto sem GPUs adicionais.
Autoescala e roteamento
Roteamento multi-réplica com balanceamento ciente de cache, autoescala por profundidade de fila e classes de prioridade para tráfego interativo versus em lote.
Harness de avaliação
Seu próprio conjunto golden integrado ao CI, para que toda atualização de modelo, quantização ou motor seja avaliada por qualidade, e não apenas por velocidade.
Seleção de motor
vLLM, SGLang, TensorRT-LLM ou NVIDIA Dynamo escolhidos por carga e comparados lado a lado no seu tráfego antes de assumirmos compromisso.
Três formas de traçar o limite dos seus dados
Na nuvem GPU Velyrix
GPUs de inquilino único em uma região Velyrix, rede privada até sua VPC ou on-ramp, pilha operada pela Velyrix.
- No ar em dias
- Escala elástica de réplicas
- Operação Velyrix 24×7
- Residência regional de dados
Na sua área de colocation
Seu hardware, sua jaula, implantados e operados pela Velyrix sob contrato de serviço gerenciado.
- Os ativos são seus
- A Velyrix opera a pilha
- Modelo de capex
- Controle físico total
On-premises e isolado
Implantação totalmente desconectada, com espelhos offline de modelos e contêineres e sem telemetria de saída.
- Sem dependência de internet
- Registro e atualizações offline
- Pronto para dados classificados / regulados
- Treinamento de entrega no local
Adaptação, recuperação e agentes
- Pré-treinamento continuado em corpora de domínio, onde vocabulário e estilo importam mais que o seguimento de instruções
- Fine-tuning supervisionado e LoRA com serviço multi-adaptador, para que um modelo base hospede dezenas de adaptadores de tarefa
- Otimização por preferência — fluxos DPO, GRPO e de modelo de recompensa sobre seus próprios dados avaliados
- Destilação de um professor grande para um aluno pequeno, reduzindo o custo de serviço em uma ordem de grandeza
- Aumento por recuperação com busca vetorial e híbrida, estratégia de chunking, reranking e citação obrigatória
- Infraestrutura de agentes — esquemas de ferramentas, saída estruturada, execução em sandbox e servidores de ferramentas compatíveis com MCP
- Guardrails — classificação de entrada e saída, redação de PII, detecção de jailbreak e registro completo de auditoria de prompts
Licenciamento e governança de modelos
Pesos abertos não significam uso irrestrito. Antes da implantação, a Velyrix revisa a licença de cada modelo que você pretende executar e documenta as obrigações associadas.
- Classificação da licença — permissiva, comunitária ou termos específicos
- Restrições de uso aceitável e de campo de aplicação
- Obrigações de atribuição, nomenclatura e redistribuição
- Limiares de uso comercial e condições sobre obras derivadas
- Registro de procedência de cada checkpoint e de sua origem
A Velyrix fornece infraestrutura e serviços de engenharia e não concede direitos sobre qualquer modelo de terceiros. O cliente permanece licenciado dos modelos que escolher implantar e é responsável pela conformidade com essas licenças e com a regulação de IA aplicável, incluindo o AI Act da UE quando cabível. A Velyrix apoia esse processo com documentação e controles técnicos.
Como funciona um programa de LLM privado
Piloto
2–3 semanas
- Workshop de seleção de modelo
- Implantação de réplica única
- Benchmark contra seu conjunto de avaliação
- Modelo de custo e dimensionamento
- Relatório de go / no-go
a partir de US$ 27.000
Implantação em produção
6–10 semanas
- Arquitetura HA multi-réplica
- Quantização e ajuste de motor
- Gateway, autenticação, cotas, registro
- Guardrails e CI de avaliação
- Runbooks e treinamento da equipe
a partir de US$ 83.500
Serviço de LLM gerenciado
Contínuo
- Operação do endpoint 24×7
- SLA de throughput e latência
- Atualizações de modelo e motor
- Relatórios de capacidade e custo
- Revisão trimestral de otimização
a partir de US$ 10.500 / mês
Honorários indicativos de serviços profissionais, sem infraestrutura de GPU e sem impostos. O escopo é confirmado após uma sessão de descoberta.
As GPUs são suas. Nós operamos.
Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.
Perguntas frequentes
Quais LLMs a Velyrix pode implantar para nós?
A Velyrix mantém receitas de implantação validadas para dez famílias de pesos abertos: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma e NVIDIA Nemotron, incluindo suas variantes de visão-linguagem, programação e raciocínio. Outros modelos de pesos abertos podem ser incorporados sob consulta.
Quantas GPUs precisamos para rodar um LLM privado?
Um modelo de 7B-9B roda confortavelmente em uma única L40S ou H100. Um modelo denso de 70B costuma exigir duas a quatro H200 em FP8. Modelos MoE esparsos grandes, na faixa de 400B-700B, precisam de cerca de oito H200 ou oito B200, e modelos da classe 1T normalmente são servidos em partições B300 ou GB300. O dimensionamento final depende do comprimento de contexto, da concorrência e das metas de latência.
A quantização prejudica a qualidade do modelo?
FP8 é em geral praticamente sem perdas em checkpoints modernos, e NVFP4/MXFP4 e quantização de pesos em 4 bits trocam uma pequena perda de qualidade por grandes ganhos de throughput e memória. A Velyrix sempre mede a diferença contra o seu próprio conjunto de avaliação e a reporta antes que qualquer build quantizado vá para produção.
A implantação pode ser totalmente isolada da rede?
Sim. Implantações isoladas chegam com pesos de modelo offline, registro interno de contêineres, espelhos de pacotes offline e sem telemetria de saída. As atualizações são entregues como mídia assinada e verificada por meio do seu processo de controle de mudanças.
Vocês suportam fine-tuning além de inferência?
Sim - pré-treinamento continuado, fine-tuning supervisionado, adaptadores LoRA com serviço multi-adaptador, otimização por preferência como DPO e GRPO, e destilação de um modelo professor grande para um aluno menor, com serviço mais barato.
Quem é responsável pela licença do modelo?
O cliente é o licenciado de qualquer modelo de terceiros que escolher implantar. A Velyrix fornece infraestrutura e serviços de engenharia, revisa com você os termos de licença de cada modelo antes da implantação e documenta as obrigações resultantes, mas não concede direitos sobre modelos de terceiros.
Que desempenho vocês se comprometem a entregar?
Após uma fase de benchmark no seu próprio tráfego, a Velyrix contrata números específicos de throughput agregado em tokens por segundo, tempo até o primeiro token no p95, latência entre tokens no p95 e disponibilidade mensal do endpoint. Esses números são reverificados após cada atualização.