Beranda/LLM Privat

Deployment & optimalisasi LLM privat

Model Anda, perangkat keras Anda, batas data Anda

Velyrix memasang, mengkuantisasi, mengukur, dan mengoperasikan model berbobot terbuka kelas frontier pada GPU dedikasi — di cloud Velyrix, di area kolokasi Anda, atau sepenuhnya air-gapped di lokasi Anda. Anda mendapat endpoint kompatibel OpenAI dengan throughput, latensi, dan ketersediaan yang dikontrakkan.

Keluarga model
10 didukung
Mesin serving
vLLM · SGLang · TensorRT-LLM
Waktu ke token pertama
Target di bawah 250 ms
Deployment
Cloud · kolo · air-gapped
API
Kompatibel OpenAI
Mengapa self-host

API publik nyaman sampai datanya milik Anda

Data teregulasi, kode sumber milik sendiri, rekam medis, posisi perdagangan, dan beban kerja berdaulat jarang layak berada di antrean inferensi orang lain. Model berbobot terbuka yang kini cukup mendekati kualitas frontier menjadikan deployment privat sebagai standar untuk beban kerja serius.

  • Data tidak pernah keluar dari batas Anda — tanpa retensi pihak ketiga, tanpa pelatihan atas prompt Anda
  • Ekonomi unit yang terprediksi — biaya GPU tetap, bukan tagihan per token yang membengkak seiring keberhasilan
  • Stabilitas versi — model yang Anda validasi tetap menjadi model yang Anda layani, sampai Anda memutuskan lain
  • Latensi yang Anda kendalikan — endpoint di kawasan yang sama, atau gedung yang sama, dengan aplikasinya
  • Kustomisasi mendalam — adapter LoRA, fine-tune domain, skema tool khusus, dan guardrail
  • Keterauditan — pencatatan permintaan penuh ke SIEM Anda sendiri, dengan kebijakan retensi Anda sendiri
migrasi langsung
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
Katalog model

Sepuluh keluarga model berbobot terbuka, di-deploy dan didukung

Velyrix memelihara resep serving tervalidasi, profil kuantisasi, dan baseline benchmark untuk setiap keluarga, diperbarui saat checkpoint baru dirilis.

DeepSeek

Model unggulan MoE jarang dan model penalaran, termasuk varian dense hasil distilasi untuk serving yang sensitif biaya.

MoEpenalaranFP8 native8×H200

Qwen

Seri dense dan MoE dari Alibaba dengan varian multibahasa, koding, dan visi-bahasa yang kuat, dari 0,6B hingga 235B+.

dense + MoEmultibahasaVLkoder

Llama

Keluarga berbobot terbuka Meta yang paling luas diadopsi — standar teraman untuk perkakas ekosistem, adapter, dan harness evaluasi.

8B–405Bvarian MoEekosistem besar

OpenAI gpt-oss

Rilis berbobot terbuka OpenAI, MoE dengan usaha penalaran yang dapat dikonfigurasi dan penggunaan tool yang kuat pada jumlah GPU sedikit.

120b / 20bMXFP4agentik

Mistral

Model Eropa dengan lisensi permisif pada banyak checkpoint — dense, MoE, kode, dan varian edge kecil.

Tier Apacheasal UEkodeedge

GLM

Keluarga MoE dwibahasa dari Zhipu dengan kinerja agentik dan koding yang kuat, plus checkpoint kelas air yang lebih ringan.

MoEdwibahasaagentik

Kimi

Model MoE jarang kelas triliun parameter dari Moonshot AI, dibuat untuk konteks panjang dan agen pemanggil tool.

MoE kelas 1Tkonteks panjangagen

MiniMax

Arsitektur MoE dengan atensi efisien yang menyasar jendela konteks sangat panjang dengan biaya serving kompetitif.

MoEkonteks 1Matensi efisien

Gemma

Model terbuka ringan dari Google — kualitas per GPU yang sangat baik untuk on-premise, edge, dan klasifikasi bervolume tinggi.

1B–27Bmultimodalsiap edge

NVIDIA Nemotron

Keluarga model terbuka NVIDIA yang dioptimalkan, disetel untuk throughput pada akselerator NVIDIA dan alur kerja agen perusahaan.

Nano / Super / UltraTensorRT-LLMNIM

Nama model adalah merek dagang pemiliknya masing-masing. Velyrix adalah penyedia infrastruktur independen dan tidak berafiliasi dengan atau didukung oleh penerbit model tersebut. Setiap model di-deploy di bawah lisensinya sendiri, yang kami tinjau bersama Anda sebelum deployment — lihat lisensi model.

Penentuan ukuran

Apa yang dibutuhkan untuk melayani tiap kelas model

Ukuran indikatif satu replika untuk serving produksi dengan ruang bagi cache KV pada konkurensi realistis. Ukuran akhir ditentukan panjang konteks, konkurensi, dan target latensi Anda.

Kelas modelPresisiGPU minimumRekomendasiThroughput indikatifInfrastruktur bulanan mulai
Dense kecil (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/dtk$1,640
Dense menengah (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/dtk$3,300
Dense besar (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/dtk$10,400
Dense sangat besar (405B)FP88× H2008× B200900 – 2,100 tok/dtk$23,900
MoE jarang (total 100B – 250B)FP84× H2008× H2003,000 – 9,000 tok/dtk$18,400
MoE jarang (total 400B – 700B)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/dtk$23,900
MoE jarang (kelas 1T total)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/dtk$44,800
Visi-bahasa (ukuran apa pun)BF16 / FP8+1 GPU untuk vision towerReplika encoder khususBergantung beban kerjaSesuai penawaran

Throughput adalah total token keluaran per detik di seluruh permintaan bersamaan, diukur pada perangkat keras referensi Velyrix dengan prompt representatif produksi. Angka Anda diukur pada beban kerja Anda sebelum kontrak, dan angka yang disepakati menjadi target tingkat layanan.

Optimalisasi

Beda antara menjalankan model dan menjalankannya dengan baik

Kontainer bawaan pada delapan GPU biasanya menyisakan dua hingga lima kali throughput yang tidak terpakai. Penugasan optimalisasi Velyrix menyetel seluruh jalur dari tokenizer sampai NIC.

Kuantisasi

Profil FP8, NVFP4/MXFP4, AWQ, GPTQ, dan SmoothQuant dengan uji regresi akurasi terhadap set evaluasi Anda sendiri sebelum apa pun dijalankan.

Strategi paralelisme

Tata letak paralel tensor, pipeline, expert, dan data dipilih per model dan topologi GPU, termasuk penempatan expert yang sadar NVLink untuk MoE.

🔄

Batching berkelanjutan

Paged attention, chunked prefill, dan penyetelan penjadwal untuk menjaga okupansi GPU tinggi tanpa melanggar target waktu ke token pertama.

🔁

Disagregasi prefill / decode

Kolam prefill dan decode terpisah dengan transfer KV, agar prompt panjang berhenti menghambat decoding interaktif pada perangkat keras bersama.

🏃

Decoding spekulatif

Model draf, spekulasi gaya EAGLE dan n-gram yang disetel untuk laju penerimaan Anda — umumnya 1,5–2,5× pada beban interaktif.

💾

Rekayasa cache KV

Cache prefix dan radix, pelimpahan cache ke memori host atau NVMe, serta KV terkuantisasi untuk memperpanjang konteks tanpa GPU tambahan.

📈

Penskalaan otomatis & routing

Routing multi-replika dengan penyeimbangan sadar cache, penskalaan otomatis berdasarkan kedalaman antrean, dan kelas prioritas untuk lalu lintas interaktif versus batch.

🧪

Harness evaluasi

Set emas Anda sendiri tersambung ke CI sehingga setiap peningkatan model, kuantisasi, atau mesin dinilai atas kualitas, bukan sekadar kecepatan.

🔨

Pemilihan mesin

vLLM, SGLang, TensorRT-LLM, atau NVIDIA Dynamo dipilih per beban kerja dan diadu langsung pada lalu lintas Anda sebelum kami berkomitmen.

Topologi deployment

Tiga cara menarik batas data Anda

Paling cepat dimulai

Di Velyrix GPU Cloud

GPU single-tenant di kawasan Velyrix, jaringan privat ke VPC atau on-ramp Anda, tumpukan dioperasikan Velyrix.

  • Aktif dalam hitungan hari
  • Penskalaan replika elastis
  • Operasi Velyrix 24×7
  • Residensi data regional
Seimbang

Di area kolokasi Anda

Perangkat keras Anda, cage Anda, di-deploy dan dioperasikan Velyrix di bawah perjanjian layanan terkelola.

  • Aset milik Anda
  • Velyrix menjalankan tumpukannya
  • Model capex
  • Kendali fisik penuh
Paling ketat

On-premise & air-gapped

Deployment sepenuhnya terputus dengan mirror model dan kontainer offline, serta tanpa telemetri keluar.

  • Tanpa ketergantungan internet
  • Registry & pembaruan offline
  • Siap untuk data terklasifikasi / teregulasi
  • Pelatihan serah terima di lokasi
Melampaui serving

Adaptasi, retrieval, dan agen

  • Pra-pelatihan lanjutan pada korpus domain tempat kosakata dan gaya lebih penting daripada kepatuhan instruksi
  • Fine-tuning terawasi & LoRA dengan serving multi-adapter, sehingga satu model dasar dapat menampung puluhan adapter tugas
  • Optimalisasi preferensi — alur kerja DPO, GRPO, dan reward model terhadap data berperingkat Anda sendiri
  • Distilasi dari guru besar ke murid kecil, memangkas biaya serving satu orde besaran
  • Augmentasi retrieval dengan pencarian vektor dan hibrida, strategi chunking, reranking, dan penegakan sitasi
  • Infrastruktur agen — skema tool, keluaran terstruktur, eksekusi tersandbox, dan server tool kompatibel MCP
  • Guardrail — klasifikasi masukan dan keluaran, redaksi PII, deteksi jailbreak, dan pencatatan audit prompt penuh

Lisensi & tata kelola model

Bobot terbuka tidak sama dengan penggunaan tanpa batas. Sebelum deployment, Velyrix meninjau lisensi setiap model yang hendak Anda jalankan dan mendokumentasikan kewajiban yang menyertainya.

  • Klasifikasi lisensi — permisif, komunitas, atau ketentuan khusus
  • Pembatasan penggunaan yang wajar dan bidang pemakaian
  • Kewajiban atribusi, penamaan, dan redistribusi
  • Ambang penggunaan komersial dan syarat karya turunan
  • Catatan provenans untuk setiap checkpoint dan sumbernya

Velyrix menyediakan infrastruktur dan layanan rekayasa serta tidak memberikan hak atas model pihak ketiga mana pun. Pelanggan tetap menjadi pemegang lisensi model yang dipilihnya untuk di-deploy dan bertanggung jawab atas kepatuhan terhadap lisensi tersebut serta regulasi AI yang berlaku, termasuk EU AI Act bila relevan. Velyrix mendukung proses itu dengan dokumentasi dan kendali teknis.

Paket penugasan

Bagaimana program LLM privat berjalan

Pilot

2–3 minggu

  • Lokakarya pemilihan model
  • Deployment satu replika
  • Benchmark terhadap set evaluasi Anda
  • Model biaya dan ukuran
  • Laporan go / no-go

mulai $27.000

Paling umum

Deployment produksi

6–10 minggu

  • Arsitektur HA multi-replika
  • Kuantisasi & penyetelan mesin
  • Gateway, autentikasi, kuota, pencatatan
  • Guardrail & CI evaluasi
  • Runbook dan pelatihan tim

mulai $83.500

Layanan LLM terkelola

Berkelanjutan

  • Operasi endpoint 24×7
  • SLA throughput & latensi
  • Peningkatan model dan mesin
  • Pelaporan kapasitas dan biaya
  • Tinjauan optimalisasi triwulanan

mulai $10.500 / bulan

Biaya jasa profesional indikatif, belum termasuk infrastruktur GPU dan pajak. Lingkup dikonfirmasi setelah sesi penemuan.

Bicara dengan arsitek infrastruktur AI

GPU milik Anda. Kami yang mengoperasikannya.

Beli server NVIDIA Anda dari OEM atau distributor mana pun, kirim langsung ke fasilitas Velyrix, dan kami menangani sisanya: implementasi, jaringan, pendinginan, pemantauan, dan dukungan. Atau sewa milik kami. Apa pun pilihannya, Anda menerima rencana dalam satu hari kerja.

Pertanyaan umum

LLM apa saja yang bisa Velyrix deploy untuk kami?

Velyrix memelihara resep deployment tervalidasi untuk sepuluh keluarga berbobot terbuka: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma, dan NVIDIA Nemotron, termasuk varian visi-bahasa, koding, dan penalarannya. Model berbobot terbuka lain dapat ditambahkan atas permintaan.

Berapa GPU yang kami butuhkan untuk menjalankan LLM privat?

Model 7B-9B berjalan nyaman pada satu L40S atau H100. Model dense 70B biasanya membutuhkan dua hingga empat H200 dalam FP8. Model MoE jarang besar pada kisaran 400B-700B membutuhkan sekitar delapan H200 atau delapan B200, dan model kelas 1T biasanya dilayani pada partisi B300 atau GB300. Ukuran akhir bergantung pada panjang konteks, konkurensi, dan target latensi.

Apakah kuantisasi menurunkan kualitas model?

FP8 umumnya nyaris tanpa kehilangan pada checkpoint modern, dan NVFP4/MXFP4 serta kuantisasi bobot 4-bit menukar sedikit kualitas dengan keuntungan throughput dan memori yang besar. Velyrix selalu mengukur selisihnya terhadap set evaluasi Anda sendiri dan melaporkannya sebelum build terkuantisasi masuk produksi.

Bisakah deployment sepenuhnya air-gapped?

Ya. Deployment air-gapped hadir dengan bobot model offline, registry kontainer internal, mirror paket offline, dan tanpa telemetri keluar. Pembaruan dikirim sebagai media bertanda tangan dan terverifikasi melalui proses kendali perubahan Anda.

Apakah Anda mendukung fine-tuning selain inferensi?

Ya - pra-pelatihan lanjutan, fine-tuning terawasi, adapter LoRA dengan serving multi-adapter, optimalisasi preferensi seperti DPO dan GRPO, serta distilasi dari model guru besar ke murid lebih kecil untuk serving yang lebih murah.

Siapa yang bertanggung jawab atas lisensi model?

Pelanggan adalah pemegang lisensi model pihak ketiga yang dipilihnya untuk di-deploy. Velyrix menyediakan infrastruktur dan layanan rekayasa, meninjau ketentuan lisensi setiap model bersama Anda sebelum deployment, dan mendokumentasikan kewajiban yang timbul, tetapi tidak memberikan hak atas model pihak ketiga.

Kinerja apa yang Anda komitmenkan?

Setelah fase benchmark pada lalu lintas Anda sendiri, Velyrix mengontrakkan angka spesifik untuk throughput agregat dalam token per detik, waktu ke token pertama p95, latensi antar token p95, dan ketersediaan endpoint bulanan. Angka-angka itu diverifikasi ulang setelah setiap peningkatan.