होम/प्लेटफ़ॉर्म
स्टोरेज, नेटवर्क और प्रबंधित संचालनवह प्लेटफ़ॉर्म जो महँगे GPU को व्यस्त रखता है
एक्सेलेरेटर आसान हिस्सा हैं। Velyrix वे स्टोरेज, फैब्रिक, शेड्यूलिंग और ऑब्ज़र्वेबिलिटी परतें बनाता है जो तय करती हैं कि आपका क्लस्टर 30% उपयोग पर चलता है या 55% पर — और यह सब 24×7 संचालित करता है।
GPU को खिलाइए, बिना रुके चेकपॉइंट कीजिए
मल्टी-टेराबाइट चेकपॉइंट लिखने वाली 512-GPU जॉब स्टोरेज पथ की हर कमज़ोरी उजागर कर देगी। Velyrix स्टोरेज का आकार क्रय आदेश पर लिखे क्षमता अंक से नहीं, बल्कि आपके चेकपॉइंट अंतराल और डेटासेट पठन पैटर्न से तय करता है।
| स्तर | तकनीक | सामान्य प्रदर्शन | उपयोग | से (प्रति TB/माह) |
|---|---|---|---|---|
| स्क्रैच | लोकल NVMe Gen4/Gen5 | प्रति नोड 60 GB/s तक | शफ़ल स्पेस, डेटालोडर कैश, अस्थायी | शामिल |
| पैरेलल FS — प्रदर्शन | NVMe पर WEKA या VAST | 1–10 TB/s कुल रीड | प्रशिक्षण डेटासेट, चेकपॉइंट | $42 |
| पैरेलल FS — क्षमता | हाइब्रिड NVMe + HDD स्तर | 200–800 GB/s | कोल्ड एपॉक, डेटासेट आर्काइव | $22 |
| ब्लॉक | NVMe-oF रेप्लिकेटेड | प्रति वॉल्यूम 10 लाख IOPS तक | डेटाबेस, वेक्टर स्टोर, बूट वॉल्यूम | $101 |
| ऑब्जेक्ट | S3-संगत, इरेज़र कोडेड | मल्टी-GB/s, 11 नाइन्स टिकाऊपन | डेटा लेक, मॉडल रजिस्ट्री, आर्टिफैक्ट | $20 |
| आर्काइव | कोल्ड ऑब्जेक्ट / टेप गेटवे | मिनटों से घंटों में पुनर्प्राप्ति | रिटेंशन, अनुपालन, कच्चा कॉर्पस | $6 |
सांकेतिक सूची मूल्य, कर रहित। पैरेलल फाइल सिस्टम प्रति क्लस्टर आकारित और कोट किए जाते हैं; प्रदर्शन आँकड़े डिप्लॉय किए गए कॉन्फ़िगरेशन पर निर्भर हैं।
तीन प्लेन, जो कभी एक साथ बुरा दिन नहीं देखते
- कंप्यूट प्लेन: NVIDIA Quantum-X800 XDR 800G या Quantum-2 NDR 400G InfiniBand, रेल-ऑप्टिमाइज़्ड, 1:1 नॉन-ब्लॉकिंग, SHARP सक्षम
- Ethernet विकल्प: RoCEv2, अनुकूली रूटिंग, कंजेशन नियंत्रण और BlueField-3 DPU ऑफ़लोड सहित NVIDIA Spectrum-X
- स्टोरेज प्लेन: समर्पित 200/400G ताकि चेकपॉइंट लेखन कभी ग्रेडिएंट all-reduce से न टकराए
- प्रबंधन प्लेन: जंप-होस्ट पहुँच और पूर्ण ऑडिट सहित पृथक आउट-ऑफ-बैंड BMC नेटवर्क
- बाह्य: ड्यूल-होम्ड 100G ट्रांज़िट, DDoS शमन, BYOIP और अनुरोध पर BGP सत्र
- इंटरकनेक्ट: AWS, Azure, Google Cloud और Oracle तक निजी लिंक, साथ ही Velyrix कैंपसों के बीच डार्क फ़ाइबर
512-GPU पॉड हेतु संदर्भ टोपोलॉजी। बड़े फैब्रिक में तीसरा स्तर जुड़ता है; रेल-ऑप्टिमाइज़्ड सिद्धांत अपरिवर्तित रहता है।
वह NOC जो NCCL समझता है, केवल ping नहीं
24×7 NOC
अनुबंधित 15-मिनट P1 प्रतिक्रिया, GPU-साक्षर इंजीनियरों और आपका क्लस्टर बनाने वाली टीम तक सीधे एस्केलेशन के साथ 24×7 ऑन-कॉल रोटेशन — कोई पहली-पंक्ति स्क्रिप्ट नहीं।
ऑब्ज़र्वेबिलिटी
Prometheus और Grafana में DCGM, node exporter, फैब्रिक काउंटर और जॉब टेलीमेट्री, प्रति-जॉब आरोपण और आपके SIEM में निर्यात के साथ।
सक्रिय स्वास्थ्य
जॉब के बीच स्वचालित नोड स्वास्थ्य जाँच, XID व ECC प्रवृत्ति विश्लेषण, और रन खोने से पहले पूर्व-निवारक ड्रेन व प्रतिस्थापन।
जीवनचक्र प्रबंधन
फर्मवेयर, ड्राइवर और इंजन अपग्रेड पहले स्टेजिंग पॉड में सत्यापित, फिर सहमत विंडो में उत्पादन में लागू।
शेड्यूलर संचालन
Slurm और Kubernetes ट्यूनिंग, कतार व कोटा नीति, फेयर-शेयर कॉन्फ़िगरेशन, और प्रति टीम या लागत केंद्र उपयोग रिपोर्टिंग।
SLA रिपोर्टिंग
अनुबंध के विरुद्ध मापी गई मासिक उपलब्धता, घटना और क्षमता रिपोर्ट, लक्ष्य चूकने पर स्वतः लागू क्रेडिट के साथ।
वह आइसोलेशन जिसे आप प्रमाणित कर सकें
- टेनेंसी: सिंगल-टेनेंट भौतिक होस्ट, समर्पित VLAN/VRF और समर्पित InfiniBand विभाजन
- पहचान: SAML/OIDC सिंगल साइन-ऑन, SCIM प्रोविज़निंग, हार्डवेयर MFA, स्कोप्ड API कुंजियाँ और भूमिका-आधारित पहुँच
- कुंजियाँ: HSM समर्थित ग्राहक-प्रबंधित एन्क्रिप्शन कुंजियाँ; Velyrix टेनेंट वॉल्यूम नहीं पढ़ सकता
- विश्राम में डेटा: ब्लॉक, ऑब्जेक्ट और पैरेलल स्टोरेज टियर पर AES-256
- पारगमन में डेटा: बाह्य रूप से TLS 1.3, निजी लिंक पर वैकल्पिक MACsec और IPsec
- फर्मवेयर अखंडता: हर प्रोविज़न पर सिक्योर बूट, हस्ताक्षरित फर्मवेयर बेसलाइन और अटेस्टेशन
- डीकमीशन: सैनिटाइज़ेशन प्रमाणपत्र सहित NIST SP 800-88 पर्ज, या ग्राहक-साक्षी विनाश
- लॉगिंग: हर कंसोल, API और भौतिक पहुँच घटना का अपरिवर्तनीय ऑडिट ट्रेल
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
GPU आपके। संचालन हमारा।
अपने NVIDIA सर्वर किसी भी अधिकृत OEM या वितरक से खरीदें, उन्हें सीधे Velyrix सुविधा भेजें, और बाकी काम हम संभालते हैं — तैनाती, नेटवर्किंग, कूलिंग, निगरानी और निरंतर सहायता। या हमारे GPU किराए पर लें। दोनों ही स्थितियों में आपको एक कार्यदिवस में योजना मिलती है।
अक्सर पूछे जाने वाले प्रश्न
बड़े प्रशिक्षण रन के लिए हमें कौन-सा स्टोरेज उपयोग करना चाहिए?
सक्रिय डेटासेट और चेकपॉइंट के लिए उच्च-प्रदर्शन पैरेलल फाइल सिस्टम - NVMe पर WEKA या VAST - जिसके पीछे व्यापक डेटा लेक हेतु S3-संगत ऑब्जेक्ट स्टोरेज हो, और शफ़ल स्थान हेतु हर नोड पर स्थानीय NVMe स्क्रैच। Velyrix प्रदर्शन टियर का आकार आपके चेकपॉइंट आकार व अंतराल से तय करता है ताकि चेकपॉइंटिंग कभी स्टेप समय पर हावी न हो।
क्या आप InfiniBand के बजाय Ethernet समर्थित करते हैं?
हाँ। जहाँ एकल Ethernet परिचालन मॉडल पसंद हो, वहाँ RoCEv2, अनुकूली रूटिंग और कंजेशन नियंत्रण सहित NVIDIA Spectrum-X उपलब्ध है। सबसे बड़े प्रशिक्षण फैब्रिक के लिए InfiniBand ही डिफ़ॉल्ट बना रहता है, क्योंकि SHARP इन-नेटवर्क रिडक्शन और परिपक्व सबनेट प्रबंधन है।
क्या हम Velyrix क्लस्टर को अपने मौजूदा क्लाउड परिवेश से जोड़ सकते हैं?
हाँ, AWS, Azure, Google Cloud और Oracle Cloud तक निजी इंटरकनेक्ट, आपके अपने डेटा सेंटरों तक IPsec या MACsec-सुरक्षित लिंक, और हमारे कैरियर-निरपेक्ष मीट-मी रूम में क्रॉस-कनेक्ट के माध्यम से।
रोज़मर्रा में क्लस्टर कौन संचालित करता है?
आप पूर्ण रूट और BMC पहुँच के साथ स्वयं संचालित कर सकते हैं, या मॉनिटरिंग, घटना प्रतिक्रिया, फर्मवेयर व ड्राइवर जीवनचक्र, शेड्यूलर नीति और SLA रिपोर्टिंग समेटे प्रबंधित सेवा के तहत संचालन Velyrix को सौंप सकते हैं।