Accueil/LLM privé

Déploiement et optimisation de LLM privés

Votre modèle, votre matériel, votre frontière de données

Velyrix installe, quantifie, mesure et exploite des modèles à poids ouverts de frontière sur des GPU dédiés — dans le cloud Velyrix, dans votre propre espace de colocation, ou totalement isolé sur site — avec un endpoint compatible OpenAI et des objectifs contractuels de débit, de latence et de disponibilité.

Familles de modèles
10 prises en charge
Moteurs d'inférence
vLLM · SGLang · TensorRT-LLM
Temps jusqu'au premier token
Objectifs sous 250 ms
Déploiement
Cloud · colocation · isolé
API
Compatible OpenAI
Pourquoi auto-héberger

Les API publiques sont pratiques jusqu'à ce que les données soient les vôtres

Données réglementées, code source propriétaire, dossiers patients, positions de marché et charges souveraines n'ont généralement pas leur place dans la file d'inférence de quelqu'un d'autre. Les modèles à poids ouverts étant désormais assez proches de la qualité de frontière, le déploiement privé devient le choix par défaut pour les charges sérieuses.

  • Les données ne quittent jamais votre périmètre — aucune rétention par un tiers, aucun entraînement sur vos prompts
  • Économie unitaire prévisible — coût GPU fixe au lieu d'une facturation au token qui croît avec le succès
  • Stabilité de version — le modèle que vous avez validé reste celui que vous servez, jusqu'à ce que vous en décidiez autrement
  • Une latence que vous maîtrisez — endpoint dans la même région, voire le même bâtiment, que l'application
  • Personnalisation profonde — adaptateurs LoRA, fine-tunes métier, schémas d'outils propres et garde-fous
  • Auditabilité — journalisation complète des requêtes dans votre propre SIEM, avec votre politique de rétention
migration directe
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
Catalogue de modèles

Dix familles de modèles à poids ouverts, déployées et supportées

Velyrix maintient des recettes d'inférence validées, des profils de quantification et des lignes de base de benchmark pour chaque famille, actualisés à chaque nouveau checkpoint.

DeepSeek

Modèles phares MoE clairsemés et modèles de raisonnement, avec des variantes denses distillées pour une inférence sensible au coût.

MoEraisonnementFP8 natif8×H200

Qwen

Séries denses et MoE d'Alibaba, avec de solides variantes multilingues, de code et vision-langage, de 0,6B à plus de 235B.

dense + MoEmultilingueVLcode

Llama

La famille à poids ouverts la plus adoptée de Meta — le choix par défaut le plus sûr pour l'outillage, les adaptateurs et les bancs d'évaluation.

8B–405Bvariantes MoEécosystème immense

OpenAI gpt-oss

La publication à poids ouverts d'OpenAI, MoE avec effort de raisonnement configurable et bon usage d'outils sur peu de GPU.

120b / 20bMXFP4agentique

Mistral

Modèles européens avec licence permissive sur de nombreux checkpoints — denses, MoE, code et petites variantes edge.

niveau Apacheorigine UEcodeedge

GLM

Famille MoE bilingue de Zhipu, forte en agents et en code, avec des checkpoints plus légers.

MoEbilingueagentique

Kimi

Modèles MoE clairsemés de classe mille milliards de paramètres de Moonshot AI, conçus pour le contexte long et les agents à outils.

MoE de classe 1Tcontexte longagents

MiniMax

Architectures MoE à attention efficace visées sur de très longues fenêtres de contexte avec un coût d'inférence compétitif.

MoEcontexte 1Mattention efficace

Gemma

Modèles ouverts légers de Google — excellente qualité par GPU pour l'on-premise, l'edge et la classification à grand volume.

1B–27Bmultimodalprêt pour l'edge

NVIDIA Nemotron

Famille de modèles ouverts optimisée par NVIDIA, réglée pour le débit sur accélérateurs NVIDIA et les workflows d'agents d'entreprise.

Nano / Super / UltraTensorRT-LLMNIM

Les noms de modèles sont des marques de leurs propriétaires respectifs. Velyrix est un fournisseur d'infrastructure indépendant, ni affilié ni approuvé par ces éditeurs de modèles. Chaque modèle est déployé sous sa propre licence, que nous examinons avec vous avant le déploiement — voir licences de modèles.

Dimensionnement

Ce qu'il faut pour servir chaque classe de modèle

Dimensionnement indicatif d'une réplique unique pour un service en production, avec de la marge pour le cache KV à concurrence réaliste. Le dimensionnement final dépend de votre longueur de contexte, de votre concurrence et de vos objectifs de latence.

Classe de modèlePrécisionGPU minimumRecommandéDébit indicatifInfrastructure mensuelle à partir de
Dense petit (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/s$1,640
Dense moyen (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/s$3,300
Dense grand (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/s$10,400
Dense très grand (405B)FP88× H2008× B200900 – 2,100 tok/s$23,900
MoE clairsemé (100B – 250B au total)FP84× H2008× H2003,000 – 9,000 tok/s$18,400
MoE clairsemé (400B – 700B au total)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/s$23,900
MoE clairsemé (classe 1T au total)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/s$44,800
Vision-langage (toute taille)BF16 / FP8+1 GPU pour la tour visionRéplique d'encodeur dédiéeSelon la chargeSur devis

Le débit correspond au total de tokens de sortie par seconde sur des requêtes concurrentes, mesuré sur du matériel de référence Velyrix avec des prompts représentatifs de la production. Vos chiffres sont mesurés sur votre charge avant contrat, et le chiffre convenu devient un objectif de niveau de service.

Optimisation

La différence entre faire tourner un modèle et le faire tourner bien

Un conteneur par défaut sur huit GPU laisse généralement deux à cinq fois le débit sur la table. Les missions d'optimisation Velyrix règlent toute la chaîne, du tokenizer à la carte réseau.

Quantification

Profils FP8, NVFP4/MXFP4, AWQ, GPTQ et SmoothQuant avec tests de régression de précision sur votre propre jeu d'évaluation avant toute mise en production.

Stratégie de parallélisme

Dispositions de parallélisme tensoriel, pipeline, d'experts et de données choisies par modèle et par topologie GPU, y compris le placement d'experts conscient de NVLink pour les MoE.

🔄

Batching continu

Attention paginée, prefill par blocs et réglage de l'ordonnanceur pour maintenir une forte occupation GPU sans dépasser votre objectif de temps jusqu'au premier token.

🔁

Désagrégation prefill / decode

Pools de prefill et de decode séparés avec transfert de KV, afin que les longs prompts cessent de bloquer le décodage interactif sur du matériel partagé.

🏃

Décodage spéculatif

Modèles brouillons, spéculation de type EAGLE et n-grammes réglés sur votre taux d'acceptation — couramment 1,5 à 2,5× sur des charges interactives.

💾

Ingénierie du cache KV

Cache de préfixes et radix, déchargement du cache vers la mémoire hôte ou le NVMe, et KV quantifié pour étendre le contexte sans GPU supplémentaires.

📈

Autoscaling et routage

Routage multi-répliques avec équilibrage conscient du cache, autoscaling sur la profondeur de file et classes de priorité pour le trafic interactif face au batch.

🧪

Banc d'évaluation

Votre propre jeu de référence branché dans la CI, afin que chaque modèle, quantification ou mise à jour de moteur passe un contrôle de qualité, pas seulement de vitesse.

🔨

Choix du moteur

vLLM, SGLang, TensorRT-LLM ou NVIDIA Dynamo choisis par charge et comparés directement sur votre trafic avant tout engagement.

Topologies de déploiement

Trois façons de tracer votre frontière de données

Le plus rapide à démarrer

Sur le cloud GPU Velyrix

GPU mono-locataires dans une région Velyrix, réseau privé vers votre VPC ou point d'interconnexion, pile exploitée par Velyrix.

  • Opérationnel en quelques jours
  • Mise à l'échelle élastique des répliques
  • Exploitation Velyrix 24×7
  • Résidence régionale des données
Équilibré

Dans votre espace de colocation

Votre matériel, votre cage, déployés et exploités par Velyrix dans le cadre d'un service infogéré.

  • Vous possédez les actifs
  • Velyrix exploite la pile
  • Modèle capex
  • Contrôle physique total
Le plus strict

Sur site et isolé du réseau

Déploiement totalement déconnecté avec miroirs hors ligne des modèles et des conteneurs, et aucune télémétrie sortante.

  • Aucune dépendance à internet
  • Registre et mises à jour hors ligne
  • Adapté aux environnements classifiés ou réglementés
  • Formation sur site à la livraison
Au-delà de l'inférence

Adaptation, recherche et agents

  • Pré-entraînement continu sur des corpus métier où le vocabulaire et le style comptent plus que le suivi d'instructions
  • Fine-tuning supervisé et LoRA avec service multi-adaptateurs, pour qu'un seul modèle de base héberge des dizaines d'adaptateurs de tâche
  • Optimisation par préférences — workflows DPO, GRPO et modèle de récompense sur vos propres données notées
  • Distillation d'un grand modèle enseignant vers un petit modèle élève, divisant le coût d'inférence par un ordre de grandeur
  • Recherche augmentée avec recherche vectorielle et hybride, stratégie de découpage, reclassement et citations obligatoires
  • Infrastructure d'agents — schémas d'outils, sortie structurée, exécution en bac à sable et serveurs d'outils compatibles MCP
  • Garde-fous — classification des entrées et sorties, expurgation des données personnelles, détection de jailbreak et journalisation complète des prompts

Licences et gouvernance des modèles

Poids ouverts ne signifie pas usage sans restriction. Avant le déploiement, Velyrix examine la licence de chaque modèle que vous comptez exécuter et documente les obligations qui en découlent.

  • Classification de licence — permissive, communautaire ou termes spécifiques
  • Restrictions d'usage acceptable et de domaine d'application
  • Obligations d'attribution, de dénomination et de redistribution
  • Seuils d'usage commercial et conditions sur les œuvres dérivées
  • Traçabilité de provenance pour chaque checkpoint et sa source

Velyrix fournit des services d'infrastructure et d'ingénierie et n'accorde aucun droit sur un modèle tiers. Le client reste le licencié des modèles qu'il choisit de déployer et demeure responsable du respect de ces licences et de la réglementation IA applicable, y compris le règlement européen sur l'IA le cas échéant. Velyrix accompagne ce processus par de la documentation et des contrôles techniques.

Formules d'accompagnement

Comment se déroule un programme de LLM privé

Pilote

2 à 3 semaines

  • Atelier de sélection de modèle
  • Déploiement d'une réplique
  • Benchmark face à votre jeu d'évaluation
  • Modèle de coût et de dimensionnement
  • Rapport de décision

à partir de 27 000 $

Le plus courant

Déploiement en production

6 à 10 semaines

  • Architecture HA multi-répliques
  • Quantification et réglage du moteur
  • Passerelle, authentification, quotas, journalisation
  • Garde-fous et CI d'évaluation
  • Runbooks et formation des équipes

à partir de 83 500 $

Service LLM infogéré

En continu

  • Exploitation de l'endpoint 24×7
  • SLA de débit et de latence
  • Mises à jour de modèle et de moteur
  • Rapports de capacité et de coût
  • Revue d'optimisation trimestrielle

à partir de 10 500 $ / mois

Honoraires indicatifs de services professionnels, hors infrastructure GPU et hors taxes. Le périmètre est confirmé après une session de cadrage.

Échangez avec un architecte d'infrastructure IA

Les GPU sont à vous. Nous les exploitons.

Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.

Questions fréquentes

Quels LLM Velyrix peut-il déployer pour nous ?

Velyrix maintient des recettes de déploiement validées pour dix familles à poids ouverts : DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma et NVIDIA Nemotron, y compris leurs variantes vision-langage, code et raisonnement. D'autres modèles à poids ouverts peuvent être intégrés sur demande.

Combien de GPU faut-il pour exécuter un LLM privé ?

Un modèle de 7B à 9B tourne confortablement sur une seule L40S ou H100. Un modèle dense de 70B demande généralement deux à quatre H200 en FP8. Les grands MoE clairsemés de 400B à 700B nécessitent environ huit H200 ou huit B200, et les modèles de classe 1T sont servis sur des partitions B300 ou GB300. Le dimensionnement final dépend de la longueur de contexte, de la concurrence et des objectifs de latence.

La quantification dégrade-t-elle la qualité du modèle ?

Le FP8 est généralement quasi sans perte sur les checkpoints modernes, et NVFP4/MXFP4 ainsi que la quantification de poids sur 4 bits échangent un peu de qualité contre d'importants gains de débit et de mémoire. Velyrix mesure toujours l'écart sur votre propre jeu d'évaluation et le communique avant qu'une version quantifiée passe en production.

Le déploiement peut-il être totalement isolé du réseau ?

Oui. Les déploiements isolés sont livrés avec les poids de modèles hors ligne, un registre de conteneurs interne, des miroirs de paquets hors ligne et aucune télémétrie sortante. Les mises à jour sont livrées sur supports signés et vérifiés via votre processus de gestion du changement.

Proposez-vous du fine-tuning en plus de l'inférence ?

Oui — pré-entraînement continu, fine-tuning supervisé, adaptateurs LoRA avec service multi-adaptateurs, optimisation par préférences telle que DPO et GRPO, et distillation d'un grand modèle enseignant vers un élève plus petit pour réduire le coût d'inférence.

Qui est responsable de la licence du modèle ?

Le client est le licencié de tout modèle tiers qu'il choisit de déployer. Velyrix fournit des services d'infrastructure et d'ingénierie, examine avec vous les termes de licence de chaque modèle avant le déploiement et documente les obligations qui en découlent, mais n'accorde aucun droit sur des modèles tiers.

Sur quelles performances vous engagez-vous ?

Après une phase de benchmark sur votre propre trafic, Velyrix contractualise des chiffres précis de débit agrégé en tokens par seconde, de temps p95 jusqu'au premier token, de latence p95 entre tokens et de disponibilité mensuelle de l'endpoint. Ces chiffres sont revérifiés après chaque mise à jour.