होम/प्राइवेट LLM
प्राइवेट LLM डिप्लॉयमेंट और ऑप्टिमाइज़ेशनआपका मॉडल, आपका हार्डवेयर, आपकी डेटा सीमा
Velyrix ओपन-वेट फ्रंटियर मॉडलों को समर्पित GPU पर स्थापित, क्वांटाइज़, बेंचमार्क और संचालित करता है — Velyrix क्लाउड में, आपके कोलोकेशन क्षेत्र में, या आपके परिसर में पूर्णत: एयर-गैप्ड। आपको अनुबंधित थ्रूपुट, लेटेंसी और उपलब्धता सहित OpenAI-संगत एंडपॉइंट मिलता है।
सार्वजनिक API तब तक सुविधाजनक हैं जब तक डेटा आपका न हो
विनियमित डेटा, स्वामित्व वाला सोर्स कोड, रोगी रिकॉर्ड, ट्रेड पोज़िशन और संप्रभु वर्कलोड शायद ही किसी और की इन्फ़रेंस कतार में होने चाहिए। अब फ्रंटियर गुणवत्ता के काफ़ी निकट ओपन-वेट मॉडल गंभीर वर्कलोड के लिए प्राइवेट डिप्लॉयमेंट को डिफ़ॉल्ट बना देते हैं।
- डेटा कभी आपकी सीमा नहीं छोड़ता — कोई तृतीय-पक्ष संधारण नहीं, आपके प्रॉम्प्ट पर कोई प्रशिक्षण नहीं
- पूर्वानुमेय इकाई अर्थशास्त्र — सफलता के साथ बढ़ने वाली प्रति-टोकन बिलिंग के बजाय निश्चित GPU लागत
- संस्करण स्थिरता — जिस मॉडल को आपने सत्यापित किया वही आपके सर्व करने का मॉडल रहता है, जब तक आप न बदलें
- आपके नियंत्रण में लेटेंसी — एंडपॉइंट उसी क्षेत्र में, या उसी भवन में, जहाँ एप्लिकेशन है
- गहन अनुकूलन — LoRA अडैप्टर, डोमेन फाइन-ट्यून, कस्टम टूल स्कीमा और गार्डरेल
- ऑडिट-योग्यता — आपके अपने SIEM में पूर्ण अनुरोध लॉगिंग, आपकी अपनी संधारण नीति के साथ
# Before — public API client = OpenAI(api_key="sk-...") # After — your Velyrix private endpoint client = OpenAI( base_url="https://llm.internal.acme.com/v1", api_key=os.environ["VELYRIX_KEY"], ) resp = client.chat.completions.create( model="qwen3-235b-a22b-fp8", messages=[{"role": "user", "content": prompt}], tools=tools, stream=True, ) # Same SDK. Same schema. Your VPC, your logs, your keys.
दस ओपन-वेट मॉडल परिवार, डिप्लॉय और समर्थित
Velyrix हर परिवार के लिए सत्यापित सर्विंग रेसिपी, क्वांटाइज़ेशन प्रोफ़ाइल और बेंचमार्क बेसलाइन रखता है, जो नए चेकपॉइंट जारी होने पर अद्यतन होते हैं।
DeepSeek
स्पार्स MoE प्रमुख मॉडल और रीज़निंग मॉडल, जिनमें लागत-संवेदनशील सर्विंग हेतु डिस्टिल्ड डेंस वैरिएंट शामिल हैं।
Qwen
Alibaba की डेंस और MoE शृंखला, 0.6B से 235B+ तक मज़बूत बहुभाषी, कोडिंग और विज़न-लैंग्वेज वैरिएंट के साथ।
Llama
Meta का व्यापक रूप से अपनाया गया ओपन-वेट परिवार — इकोसिस्टम टूलिंग, अडैप्टर और मूल्यांकन हार्नेस हेतु सबसे सुरक्षित डिफ़ॉल्ट।
OpenAI gpt-oss
OpenAI की ओपन-वेट रिलीज़, कॉन्फ़िगर करने योग्य रीज़निंग प्रयास और कम GPU पर मज़बूत टूल उपयोग वाला MoE।
Mistral
कई चेकपॉइंट पर उदार लाइसेंसिंग वाले यूरोपीय मॉडल — डेंस, MoE, कोड और छोटे एज वैरिएंट।
GLM
Zhipu का द्विभाषी MoE परिवार, मज़बूत एजेंटिक व कोडिंग प्रदर्शन और हल्के air-श्रेणी चेकपॉइंट के साथ।
Kimi
Moonshot AI के ट्रिलियन-पैरामीटर-श्रेणी स्पार्स MoE मॉडल, लंबे संदर्भ और टूल-कॉलिंग एजेंट हेतु बने।
MiniMax
प्रतिस्पर्धी सर्विंग लागत पर बहुत लंबी संदर्भ विंडो लक्षित करने वाली कुशल-अटेंशन MoE संरचनाएँ।
Gemma
Google के हल्के ओपन मॉडल — ऑन-प्रिमाइस, एज और उच्च-मात्रा वर्गीकरण हेतु प्रति GPU उत्कृष्ट गुणवत्ता।
NVIDIA Nemotron
NVIDIA का ऑप्टिमाइज़्ड ओपन मॉडल परिवार, NVIDIA एक्सेलेरेटरों पर थ्रूपुट और एंटरप्राइज़ एजेंट वर्कफ़्लो हेतु ट्यून किया गया।
मॉडल नाम उनके संबंधित स्वामियों के ट्रेडमार्क हैं। Velyrix एक स्वतंत्र इंफ्रास्ट्रक्चर प्रदाता है और इन मॉडल प्रकाशकों से संबद्ध या उनके द्वारा समर्थित नहीं है। हर मॉडल अपने स्वयं के लाइसेंस के तहत डिप्लॉय होता है, जिसकी समीक्षा हम डिप्लॉयमेंट से पहले आपके साथ करते हैं — देखें मॉडल लाइसेंसिंग.
हर श्रेणी के मॉडल को सर्व करने में क्या लगता है
यथार्थ समवर्तीता पर KV कैश हेतु स्थान सहित उत्पादन सर्विंग के लिए सांकेतिक एकल-प्रतिकृति आकार। अंतिम आकार आपके संदर्भ लंबाई, समवर्तीता और लेटेंसी लक्ष्यों से तय होता है।
| मॉडल श्रेणी | परिशुद्धता | न्यूनतम GPU | अनुशंसित | संकेतात्मक थ्रूपुट | मासिक इन्फ्रास्ट्रक्चर से |
|---|---|---|---|---|---|
| छोटा डेंस (1B – 9B) | BF16 / FP8 | 1× L40S | 2× L40S / 1× H100 | 2,500 – 6,000 टोकन/सेकंड | $1,640 |
| मध्यम डेंस (12B – 32B) | FP8 / AWQ-INT4 | 1× H100 80GB | 2× H100 / 2× H200 | 1,800 – 4,500 टोकन/सेकंड | $3,300 |
| बड़ा डेंस (70B – 123B) | FP8 | 2× H200 | 4× H200 / 8× H100 | 1,400 – 3,200 टोकन/सेकंड | $10,400 |
| अति बड़ा डेंस (405B) | FP8 | 8× H200 | 8× B200 | 900 – 2,100 टोकन/सेकंड | $23,900 |
| स्पार्स MoE (कुल 100B – 250B) | FP8 | 4× H200 | 8× H200 | 3,000 – 9,000 टोकन/सेकंड | $18,400 |
| स्पार्स MoE (कुल 400B – 700B) | FP8 / FP4 | 8× H200 | 8× B200 / 16× H200 | 4,000 – 14,000 टोकन/सेकंड | $23,900 |
| स्पार्स MoE (कुल 1T श्रेणी) | FP8 / FP4 | 16× H200 | 8× B300 / GB300 partition | 6,000 – 20,000 टोकन/सेकंड | $44,800 |
| विज़न-लैंग्वेज (कोई भी आकार) | BF16 / FP8 | विज़न टावर हेतु +1 GPU | समर्पित एन्कोडर रेप्लिका | वर्कलोड पर निर्भर | कोटेशन पर |
थ्रूपुट समवर्ती अनुरोधों में कुल आउटपुट टोकन प्रति सेकंड है, जो उत्पादन-प्रतिनिधि प्रॉम्प्ट के साथ Velyrix संदर्भ हार्डवेयर पर मापा गया है। आपके आँकड़े अनुबंध से पहले आपके वर्कलोड पर मापे जाते हैं, और सहमत आँकड़ा सेवा-स्तर लक्ष्य बन जाता है।
मॉडल चलाने और उसे अच्छी तरह चलाने का अंतर
आठ GPU पर डिफ़ॉल्ट कंटेनर आमतौर पर दो से पाँच गुना थ्रूपुट छोड़ देता है। Velyrix ऑप्टिमाइज़ेशन परियोजनाएँ टोकनाइज़र से NIC तक पूरा पथ ट्यून करती हैं।
क्वांटाइज़ेशन
लाइव होने से पहले आपके अपने मूल्यांकन सेट के विरुद्ध सटीकता प्रतिगमन परीक्षण सहित FP8, NVFP4/MXFP4, AWQ, GPTQ और SmoothQuant प्रोफ़ाइल।
समांतरता रणनीति
प्रति मॉडल और GPU टोपोलॉजी के अनुसार चुने गए टेन्सर, पाइपलाइन, एक्सपर्ट और डेटा समांतर लेआउट, जिसमें MoE हेतु NVLink-सचेत एक्सपर्ट प्लेसमेंट शामिल है।
निरंतर बैचिंग
पेज्ड अटेंशन, चंक्ड प्रीफ़िल और शेड्यूलर ट्यूनिंग, ताकि आपके पहले-टोकन-तक-समय लक्ष्य का उल्लंघन किए बिना GPU व्यस्तता ऊँची रहे।
प्रीफ़िल / डिकोड पृथक्करण
KV स्थानांतरण सहित अलग प्रीफ़िल और डिकोड पूल, ताकि लंबे प्रॉम्प्ट साझा हार्डवेयर पर इंटरैक्टिव डिकोडिंग रोकना बंद करें।
स्पेकुलेटिव डिकोडिंग
आपकी स्वीकृति दर के लिए ट्यून किए गए ड्राफ़्ट मॉडल, EAGLE-शैली और n-gram स्पेकुलेशन — इंटरैक्टिव वर्कलोड पर सामान्यतः 1.5–2.5×।
KV कैश इंजीनियरिंग
प्रीफ़िक्स व रेडिक्स कैशिंग, होस्ट मेमोरी या NVMe में कैश ऑफ़लोड, और अतिरिक्त GPU के बिना संदर्भ बढ़ाने हेतु क्वांटाइज़्ड KV।
ऑटोस्केलिंग और रूटिंग
कैश-सचेत लोड बैलेंसिंग, कतार-गहराई ऑटोस्केलिंग और इंटरैक्टिव बनाम बैच ट्रैफ़िक हेतु प्राथमिकता श्रेणियों सहित मल्टी-रेप्लिका रूटिंग।
मूल्यांकन हार्नेस
आपका अपना गोल्डन सेट CI में जुड़ा, ताकि हर मॉडल, क्वांटाइज़ेशन या इंजन अपग्रेड केवल गति नहीं, गुणवत्ता पर परखा जाए।
इंजन चयन
प्रति वर्कलोड चुने गए vLLM, SGLang, TensorRT-LLM या NVIDIA Dynamo, प्रतिबद्धता से पहले आपके ट्रैफ़िक पर आमने-सामने बेंचमार्क किए गए।
अपनी डेटा सीमा खींचने के तीन तरीके
Velyrix GPU क्लाउड पर
Velyrix क्षेत्र में सिंगल-टेनेंट GPU, आपके VPC या ऑन-रैंप तक निजी नेटवर्किंग, Velyrix-संचालित स्टैक।
- कुछ ही दिनों में लाइव
- लचीला रेप्लिका स्केलिंग
- Velyrix 24×7 संचालन
- क्षेत्रीय डेटा रेज़िडेंसी
आपके कोलोकेशन क्षेत्र में
आपका हार्डवेयर, आपका केज, प्रबंधित सेवा समझौते के तहत Velyrix द्वारा डिप्लॉय और संचालित।
- परिसंपत्तियाँ आपकी
- स्टैक Velyrix चलाता है
- कैपेक्स मॉडल
- पूर्ण भौतिक नियंत्रण
ऑन-प्रिमाइस और एयर-गैप्ड
ऑफ़लाइन मॉडल व कंटेनर मिरर सहित पूर्णत: विच्छेदित डिप्लॉयमेंट, और कोई आउटबाउंड टेलीमेट्री नहीं।
- इंटरनेट पर कोई निर्भरता नहीं
- ऑफ़लाइन रजिस्ट्री और अपडेट
- वर्गीकृत / विनियमित हेतु तैयार
- साइट पर हस्तांतरण प्रशिक्षण
अनुकूलन, पुनर्प्राप्ति और एजेंट
- निरंतर प्री-ट्रेनिंग उन डोमेन कॉर्पोरा पर जहाँ शब्दावली और शैली निर्देश-पालन से अधिक मायने रखती है
- पर्यवेक्षित फाइन-ट्यूनिंग और LoRA मल्टी-अडैप्टर सर्विंग के साथ, ताकि एक बेस मॉडल दर्जनों टास्क अडैप्टर होस्ट कर सके
- प्रेफ़रेंस ऑप्टिमाइज़ेशन — आपके अपने रेटेड डेटा पर DPO, GRPO और रिवॉर्ड-मॉडल वर्कफ़्लो
- डिस्टिलेशन बड़े शिक्षक से छोटे छात्र तक, सर्विंग लागत को एक क्रम से घटाते हुए
- रिट्रीवल ऑगमेंटेशन वेक्टर व हाइब्रिड सर्च, चंकिंग रणनीति, रीरैंकिंग और उद्धरण प्रवर्तन के साथ
- एजेंट इंफ्रास्ट्रक्चर — टूल स्कीमा, संरचित आउटपुट, सैंडबॉक्स्ड निष्पादन और MCP-संगत टूल सर्वर
- गार्डरेल — इनपुट व आउटपुट वर्गीकरण, PII रिडक्शन, जेलब्रेक पहचान और पूर्ण प्रॉम्प्ट ऑडिट लॉगिंग
मॉडल लाइसेंसिंग और शासन
ओपन वेट का अर्थ अप्रतिबंधित उपयोग नहीं है। डिप्लॉयमेंट से पहले Velyrix हर उस मॉडल का लाइसेंस देखता है जिसे आप चलाना चाहते हैं, और उसके साथ आने वाले दायित्व प्रलेखित करता है।
- लाइसेंस वर्गीकरण — उदार, सामुदायिक या विशेष शर्तें
- स्वीकार्य-उपयोग और उपयोग-क्षेत्र प्रतिबंध
- श्रेय, नामकरण और पुनर्वितरण दायित्व
- वाणिज्यिक-उपयोग सीमाएँ और व्युत्पन्न-कार्य शर्तें
- हर चेकपॉइंट और उसके स्रोत का उद्गम रिकॉर्ड
Velyrix इंफ्रास्ट्रक्चर और इंजीनियरिंग सेवाएँ देता है और किसी तृतीय-पक्ष मॉडल में कोई अधिकार प्रदान नहीं करता। ग्राहक अपने चुने हुए मॉडलों का लाइसेंसधारी बना रहता है और उन लाइसेंसों तथा लागू AI विनियमन, जिसमें दायरे में होने पर EU AI Act शामिल है, के अनुपालन हेतु उत्तरदायी है। Velyrix उस प्रक्रिया में प्रलेखन और तकनीकी नियंत्रणों से सहयोग करता है।
प्राइवेट LLM कार्यक्रम कैसे चलता है
पायलट
2–3 सप्ताह
- मॉडल चयन कार्यशाला
- एकल-प्रतिकृति डिप्लॉयमेंट
- आपके मूल्यांकन सेट के विरुद्ध बेंचमार्क
- लागत और आकार मॉडल
- गो / नो-गो रिपोर्ट
$27,000 से
उत्पादन डिप्लॉयमेंट
6–10 सप्ताह
- मल्टी-रेप्लिका HA संरचना
- क्वांटाइज़ेशन और इंजन ट्यूनिंग
- गेटवे, प्रमाणीकरण, कोटा, लॉगिंग
- गार्डरेल और मूल्यांकन CI
- रनबुक और टीम प्रशिक्षण
$83,500 से
प्रबंधित LLM सेवा
सतत
- 24×7 एंडपॉइंट संचालन
- थ्रूपुट और लेटेंसी SLA
- मॉडल और इंजन अपग्रेड
- क्षमता और लागत रिपोर्टिंग
- त्रैमासिक ऑप्टिमाइज़ेशन समीक्षा
$10,500 / माह से
सांकेतिक व्यावसायिक-सेवा शुल्क, GPU इंफ्रास्ट्रक्चर और कर को छोड़कर। दायरा खोज सत्र के बाद पुष्ट होता है।
GPU आपके। संचालन हमारा।
अपने NVIDIA सर्वर किसी भी अधिकृत OEM या वितरक से खरीदें, उन्हें सीधे Velyrix सुविधा भेजें, और बाकी काम हम संभालते हैं — तैनाती, नेटवर्किंग, कूलिंग, निगरानी और निरंतर सहायता। या हमारे GPU किराए पर लें। दोनों ही स्थितियों में आपको एक कार्यदिवस में योजना मिलती है।
अक्सर पूछे जाने वाले प्रश्न
Velyrix हमारे लिए कौन-से LLM डिप्लॉय कर सकता है?
Velyrix दस ओपन-वेट परिवारों के लिए सत्यापित डिप्लॉयमेंट रेसिपी रखता है: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma और NVIDIA Nemotron, उनके विज़न-लैंग्वेज, कोडिंग और रीज़निंग वैरिएंट सहित। अन्य ओपन-वेट मॉडल अनुरोध पर जोड़े जा सकते हैं।
प्राइवेट LLM चलाने के लिए हमें कितने GPU चाहिए?
7B-9B मॉडल एक ही L40S या H100 पर सहजता से चलता है। 70B डेंस मॉडल को सामान्यतः FP8 में दो से चार H200 चाहिए। 400B-700B श्रेणी के बड़े स्पार्स MoE मॉडलों को लगभग आठ H200 या आठ B200 चाहिए, और 1T-श्रेणी मॉडल सामान्यतः B300 या GB300 विभाजनों पर सर्व किए जाते हैं। अंतिम आकार संदर्भ लंबाई, समवर्तीता और लेटेंसी लक्ष्यों पर निर्भर है।
क्या क्वांटाइज़ेशन मॉडल गुणवत्ता घटाएगा?
आधुनिक चेकपॉइंट पर FP8 सामान्यतः लगभग हानि-रहित है, और NVFP4/MXFP4 तथा 4-बिट वेट क्वांटाइज़ेशन थोड़ी गुणवत्ता के बदले बड़ा थ्रूपुट व मेमोरी लाभ देते हैं। Velyrix हमेशा आपके अपने मूल्यांकन सेट के विरुद्ध अंतर मापता है और किसी भी क्वांटाइज़्ड बिल्ड के उत्पादन में जाने से पहले उसकी रिपोर्ट देता है।
क्या डिप्लॉयमेंट पूरी तरह एयर-गैप्ड हो सकता है?
हाँ। एयर-गैप्ड डिप्लॉयमेंट ऑफ़लाइन मॉडल वेट, आंतरिक कंटेनर रजिस्ट्री, ऑफ़लाइन पैकेज मिरर और बिना किसी आउटबाउंड टेलीमेट्री के आते हैं। अपडेट आपकी परिवर्तन-नियंत्रण प्रक्रिया के माध्यम से हस्ताक्षरित, सत्यापित मीडिया के रूप में दिए जाते हैं।
क्या आप इन्फ़रेंस के साथ फाइन-ट्यूनिंग भी समर्थित करते हैं?
हाँ - निरंतर प्री-ट्रेनिंग, पर्यवेक्षित फाइन-ट्यूनिंग, मल्टी-अडैप्टर सर्विंग सहित LoRA अडैप्टर, DPO व GRPO जैसी प्रेफ़रेंस ऑप्टिमाइज़ेशन, और सस्ती सर्विंग हेतु बड़े शिक्षक मॉडल से छोटे छात्र में डिस्टिलेशन।
मॉडल लाइसेंस के लिए कौन उत्तरदायी है?
ग्राहक ही उस तृतीय-पक्ष मॉडल का लाइसेंसधारी है जिसे वह डिप्लॉय करना चुनता है। Velyrix इंफ्रास्ट्रक्चर और इंजीनियरिंग सेवाएँ देता है, डिप्लॉयमेंट से पहले हर मॉडल की लाइसेंस शर्तें आपके साथ देखता है और परिणामी दायित्व प्रलेखित करता है, पर तृतीय-पक्ष मॉडलों में कोई अधिकार प्रदान नहीं करता।
आप किस प्रदर्शन की प्रतिबद्धता देते हैं?
आपके अपने ट्रैफ़िक पर बेंचमार्किंग चरण के बाद, Velyrix कुल थ्रूपुट (टोकन प्रति सेकंड), p95 पहले-टोकन-तक-समय, p95 अंतर-टोकन लेटेंसी और मासिक एंडपॉइंट उपलब्धता के विशिष्ट आँकड़ों का अनुबंध करता है। ये आँकड़े हर अपग्रेड के बाद पुन: सत्यापित होते हैं।