الرئيسية/نموذج لغوي خاص

نشر وتحسين النماذج اللغوية الخاصة

نموذجك، وأجهزتك، وحدود بياناتك

تثبّت Velyrix النماذج مفتوحة الأوزان من الطراز الأول وتكمّمها وتقيسها وتشغّلها على وحدات GPU مخصصة — في سحابة Velyrix، أو داخل مساحة الكولوكيشن لديك، أو معزولة تمامًا في مقرّك. وتحصل على نقطة نهاية متوافقة مع OpenAI بإنتاجية وزمن استجابة وتوافر متعاقد عليها.

عائلات النماذج
10 مدعومة
محركات التشغيل
vLLM · SGLang · TensorRT-LLM
زمن أول رمز
أهداف دون 250 مللي ثانية
النشر
سحابة · كولوكيشن · معزول
API
متوافق مع OpenAI
لماذا الاستضافة الذاتية

الواجهات العامة مريحة حتى تصبح البيانات بياناتك

نادرًا ما تنتمي البيانات الخاضعة للتنظيم والشيفرة المملوكة وسجلات المرضى ومراكز التداول وأعباء العمل السيادية إلى طابور استدلال يملكه غيرك. والنماذج مفتوحة الأوزان التي باتت قريبة بما يكفي من جودة الطراز الأول تجعل النشر الخاص هو الخيار الافتراضي للأعباء الجادة.

  • البيانات لا تغادر نطاقك أبدًا — بلا احتفاظ لدى طرف ثالث، وبلا تدريب على مطالباتك
  • اقتصاديات وحدة يمكن التنبؤ بها — تكلفة GPU ثابتة بدل فوترة بالرمز تتضخم مع نجاحك
  • استقرار الإصدار — النموذج الذي تحققت منه يبقى النموذج الذي تشغّله، إلى أن تقرر خلاف ذلك
  • زمن استجابة تتحكم فيه — نقطة نهاية في المنطقة نفسها، أو المبنى نفسه، مع تطبيقك
  • تخصيص عميق — محوّلات LoRA، وضبط دقيق للمجال، ومخططات أدوات وحواجز حماية مخصصة
  • قابلية التدقيق — تسجيل كامل للطلبات في نظام SIEM الخاص بك، بسياسة احتفاظ تضعها أنت
ترحيل مباشر
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
كتالوج النماذج

عشر عائلات نماذج مفتوحة الأوزان، منشورة ومدعومة

تحتفظ Velyrix بوصفات تشغيل مُتحقَّق منها، وملفات تكميم، وخطوط أساس قياسية لكل عائلة، وتُحدَّث مع صدور نقاط تحقق جديدة.

DeepSeek

نماذج MoE متفرقة رائدة ونماذج استدلال منطقي، بما فيها نسخ كثيفة مقطّرة للتشغيل الحساس للتكلفة.

MoEاستدلال منطقي‏FP8 أصلي8×H200

Qwen

سلاسل Alibaba الكثيفة وMoE بنسخ قوية متعددة اللغات وللبرمجة والرؤية اللغوية، من 0.6 مليار إلى أكثر من 235 مليار معامل.

كثيف + MoEمتعدد اللغاتVLبرمجة

Llama

عائلة Meta مفتوحة الأوزان الأوسع اعتمادًا — الخيار الافتراضي الأكثر أمانًا لأدوات المنظومة والمحوّلات ومنصات التقييم.

8B–405Bنسخ MoEمنظومة ضخمة

OpenAI gpt-oss

إصدار OpenAI مفتوح الأوزان، وهو MoE بجهد استدلال قابل للضبط واستخدام قوي للأدوات بعدد محدود من وحدات GPU.

120b / 20bMXFP4وكيلي

Mistral

نماذج أوروبية بترخيص متساهل في كثير من نقاط التحقق — كثيفة، وMoE، وبرمجية، ونسخ طرفية صغيرة.

فئة Apacheمنشأ أوروبيشيفرةطرفي

GLM

عائلة Zhipu ثنائية اللغة من نوع MoE بأداء وكيلي وبرمجي قوي، إضافة إلى نقاط تحقق أخف من فئة air.

MoEثنائي اللغةوكيلي

Kimi

نماذج MoE متفرقة من فئة التريليون معامل من Moonshot AI، مصممة للسياق الطويل ووكلاء استدعاء الأدوات.

‏MoE بفئة تريليونسياق طويلوكلاء

MiniMax

بنى MoE بانتباه فعّال تستهدف نوافذ سياق طويلة جدًا بتكلفة تشغيل تنافسية.

MoEسياق مليون رمزانتباه فعّال

Gemma

نماذج Google المفتوحة الخفيفة — جودة ممتازة لكل وحدة GPU للاستخدام المحلي والطرفي والتصنيف عالي الحجم.

1B–27Bمتعدد الوسائطجاهز للطرف

NVIDIA Nemotron

عائلة NVIDIA المفتوحة المُحسَّنة، مضبوطة للإنتاجية على مسرّعات NVIDIA ولسير عمل الوكلاء في المؤسسات.

Nano / Super / UltraTensorRT-LLMNIM

أسماء النماذج علامات تجارية لأصحابها. وVelyrix مزوّد بنية تحتية مستقل وليست تابعة لناشري هذه النماذج ولا معتمدة منهم. ويُنشر كل نموذج بموجب ترخيصه الخاص الذي نراجعه معك قبل النشر — راجع تراخيص النماذج.

تحديد الحجم

ما يلزم لتشغيل كل فئة من النماذج

أحجام استرشادية لنسخة واحدة للتشغيل الإنتاجي مع مساحة لذاكرة KV عند تزامن واقعي. ويأتي الحجم النهائي من طول السياق والتزامن وأهداف زمن الاستجابة لديك.

فئة النموذجالدقةالحد الأدنى من الوحداتالموصى بهالإنتاجية التقديريةالبنية التحتية الشهرية ابتداءً من
كثيف صغير (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 رمز/ث$1,640
كثيف متوسط (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 رمز/ث$3,300
كثيف كبير (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 رمز/ث$10,400
كثيف ضخم (405B)FP88× H2008× B200900 – 2,100 رمز/ث$23,900
MoE متناثر (100B – 250B إجمالاً)FP84× H2008× H2003,000 – 9,000 رمز/ث$18,400
MoE متناثر (400B – 700B إجمالاً)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 رمز/ث$23,900
MoE متناثر (فئة تريليون إجمالاً)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 رمز/ث$44,800
رؤية ولغة (أي حجم)BF16 / FP8وحدة إضافية لبرج الرؤيةنسخة مشفّر مخصصةيعتمد على حمل العملحسب عرض السعر

الإنتاجية هي إجمالي رموز المخرجات في الثانية عبر الطلبات المتزامنة، مقاسة على أجهزة Velyrix المرجعية بمطالبات ممثلة للإنتاج. وتُقاس أرقامك على عبء عملك قبل التعاقد، ويصبح الرقم المتفق عليه هدفًا لمستوى الخدمة.

التحسين

الفرق بين تشغيل نموذج وتشغيله جيدًا

الحاوية الافتراضية على ثماني وحدات GPU تترك عادة ضعفين إلى خمسة أضعاف من الإنتاجية دون استغلال. وتضبط مشاريع التحسين لدى Velyrix المسار كاملًا من المُرمِّز إلى بطاقة الشبكة.

التكميم

ملفات FP8 وNVFP4/MXFP4 وAWQ وGPTQ وSmoothQuant مع اختبار انحدار الدقة مقابل مجموعة التقييم الخاصة بك قبل أي إطلاق.

استراتيجية التوازي

تخطيطات توازي على مستوى الموتّرات وخط الأنابيب والخبراء والبيانات تُختار لكل نموذج وطوبولوجيا GPU، بما يشمل توزيع الخبراء بوعي NVLink لنماذج MoE.

🔄

التجميع المستمر

انتباه مُصفَّح، وتعبئة مسبقة مقسّمة، وضبط المجدول للحفاظ على انشغال عالٍ لوحدات GPU دون تجاوز هدف زمن أول رمز.

🔁

فصل التعبئة المسبقة عن فك الترميز

مجموعات منفصلة للتعبئة المسبقة وفك الترميز مع نقل ذاكرة KV، كي تتوقف المطالبات الطويلة عن عرقلة فك الترميز التفاعلي على أجهزة مشتركة.

🏃

فك الترميز التخميني

نماذج مسوّدة، وتخمين بأسلوب EAGLE وبالـ n-gram مضبوط حسب معدل قبولك — عادةً 1.5–2.5× في الأعباء التفاعلية.

💾

هندسة ذاكرة KV

تخزين مؤقت للبادئات وبنية radix، وإنزال الذاكرة المؤقتة إلى ذاكرة المضيف أو NVMe، وKV مكمَّم لتمديد السياق دون وحدات GPU إضافية.

📈

التوسّع التلقائي والتوجيه

توجيه متعدد النسخ مع موازنة حمل واعية بالذاكرة المؤقتة، وتوسّع تلقائي حسب عمق الطابور، وفئات أولوية لحركة المرور التفاعلية مقابل الدفعية.

🧪

منصة التقييم

مجموعتك الذهبية موصولة بالتكامل المستمر، فلا تمرّ أي ترقية للنموذج أو التكميم أو المحرك إلا بمعيار الجودة لا السرعة وحدها.

🔨

اختيار المحرك

يُختار vLLM أو SGLang أو TensorRT-LLM أو NVIDIA Dynamo حسب عبء العمل، ويُقاس وجهًا لوجه على حركتك قبل أن نلتزم.

طوبولوجيات النشر

ثلاث طرق لرسم حدود بياناتك

الأسرع بدءًا

على سحابة GPU من Velyrix

وحدات GPU أحادية المستأجر في منطقة Velyrix، وشبكات خاصة إلى VPC أو منفذ الدخول لديك، وحزمة تشغّلها Velyrix.

  • تعمل خلال أيام
  • توسّع مرن للنسخ
  • تشغيل Velyrix 24×7
  • إقامة بيانات إقليمية
متوازن

داخل مساحة الكولوكيشن لديك

أجهزتك، وقفصك، تنشرها وتشغّلها Velyrix بموجب اتفاقية خدمة مُدارة

  • الأصول ملكك
  • ‏Velyrix تشغّل الحزمة
  • نموذج رأسمالي
  • سيطرة مادية كاملة
الأكثر صرامة

محلي ومعزول تمامًا

نشر منفصل تمامًا مع نسخ محلية للنماذج والحاويات، وبلا أي قياسات صادرة.

  • بلا اعتماد على الإنترنت
  • سجل وتحديثات محلية
  • جاهز للبيانات السرية والخاضعة للتنظيم
  • تدريب تسليم في الموقع
أبعد من التشغيل

التكييف والاسترجاع والوكلاء

  • تدريب مسبق متواصل على مدونات مجال تكون فيها المفردات والأسلوب أهم من اتباع التعليمات
  • ضبط دقيق خاضع للإشراف وLoRA مع تشغيل متعدد المحوّلات، ليستضيف نموذج أساس واحد عشرات المحوّلات المتخصصة
  • تحسين التفضيلات — مسارات DPO وGRPO ونماذج المكافأة على بياناتك المقيَّمة
  • التقطير من نموذج معلّم كبير إلى نموذج تلميذ صغير، بخفض تكلفة التشغيل بمرتبة كاملة
  • تعزيز بالاسترجاع مع بحث متجهي وهجين، واستراتيجية تقسيم، وإعادة ترتيب، وإلزام بالاستشهاد
  • بنية تحتية للوكلاء — مخططات أدوات، ومخرجات مهيكلة، وتنفيذ معزول، وخوادم أدوات متوافقة مع MCP
  • حواجز الحماية — تصنيف المدخلات والمخرجات، وحجب البيانات الشخصية، وكشف محاولات الالتفاف، وتسجيل تدقيق كامل للمطالبات

تراخيص النماذج وحوكمتها

الأوزان المفتوحة ليست كالاستخدام غير المقيَّد. قبل النشر تراجع Velyrix ترخيص كل نموذج تنوي تشغيله وتوثّق الالتزامات المرتبطة به.

  • تصنيف الترخيص — متساهل أو مجتمعي أو بشروط خاصة
  • قيود الاستخدام المقبول ومجال الاستخدام
  • التزامات الإسناد والتسمية وإعادة التوزيع
  • حدود الاستخدام التجاري وشروط الأعمال المشتقة
  • سجل منشأ لكل نقطة تحقق ومصدرها

توفر Velyrix بنية تحتية وخدمات هندسية ولا تمنح أي حقوق في أي نموذج لطرف ثالث. ويبقى العميل هو المرخَّص له في النماذج التي يختار نشرها، وهو المسؤول عن الامتثال لتلك التراخيص ولأنظمة الذكاء الاصطناعي السارية، بما فيها قانون الذكاء الاصطناعي الأوروبي عند انطباقه. وتدعم Velyrix تلك العملية بالتوثيق والضوابط التقنية.

حزم التعاقد

كيف يسير برنامج نموذج لغوي خاص

تجريبي

2–3 أسابيع

  • ورشة اختيار النموذج
  • نشر نسخة واحدة
  • قياس مقابل مجموعة التقييم لديك
  • نموذج التكلفة والحجم
  • تقرير المضي أو التوقف

من 27,000 دولار

الأكثر شيوعًا

نشر إنتاجي

6–10 أسابيع

  • بنية عالية التوافر متعددة النسخ
  • التكميم وضبط المحرك
  • بوابة ومصادقة وحصص وتسجيل
  • حواجز حماية وتكامل مستمر للتقييم
  • أدلة تشغيل وتدريب الفريق

من 83,500 دولار

خدمة نموذج لغوي مُدارة

مستمرة

  • تشغيل نقطة النهاية 24×7
  • اتفاقية مستوى خدمة للإنتاجية وزمن الاستجابة
  • ترقيات النموذج والمحرك
  • تقارير السعة والتكلفة
  • مراجعة تحسين ربع سنوية

من 10,500 دولار شهريًا

أتعاب خدمات مهنية استرشادية، غير شاملة البنية التحتية لوحدات GPU والضرائب. ويُؤكَّد النطاق بعد جلسة استكشاف.

تحدث إلى مهندس بنية تحتية للذكاء الاصطناعي

وحدات المعالجة ملكك. ونحن نشغّلها.

اشترِ خوادم NVIDIA من أي شركة مصنّعة أو موزّع معتمد، وأرسلها مباشرة إلى مركز بيانات Velyrix، ونتولى نحن الباقي: التركيب والشبكة والتبريد والمراقبة والدعم المستمر. أو استأجر خوادمنا. في الحالتين تحصل على خطة خلال يوم عمل واحد.

الأسئلة الشائعة

ما النماذج اللغوية التي يمكن لـ Velyrix نشرها لنا؟

تحتفظ Velyrix بوصفات نشر مُتحقَّق منها لعشر عائلات مفتوحة الأوزان: DeepSeek وQwen وLlama وOpenAI gpt-oss وMistral وGLM وKimi وMiniMax وGemma وNVIDIA Nemotron، بما في ذلك نسخها الخاصة بالرؤية اللغوية والبرمجة والاستدلال المنطقي. ويمكن إضافة نماذج أخرى مفتوحة الأوزان عند الطلب.

كم وحدة GPU نحتاج لتشغيل نموذج لغوي خاص؟

يعمل نموذج بحجم 7 إلى 9 مليارات معامل بسهولة على وحدة L40S أو H100 واحدة. ويحتاج نموذج كثيف بحجم 70 مليارًا عادةً إلى اثنتين أو أربع وحدات H200 بدقة FP8. أما نماذج MoE المتفرقة الكبيرة في نطاق 400 إلى 700 مليار فتحتاج نحو ثماني وحدات H200 أو ثماني B200، وتُشغَّل نماذج فئة التريليون عادةً على أقسام B300 أو GB300. ويعتمد الحجم النهائي على طول السياق والتزامن وأهداف زمن الاستجابة.

هل يضرّ التكميم بجودة النموذج؟

‏FP8 شبه عديم الخسارة عمومًا في نقاط التحقق الحديثة، بينما يقايض NVFP4/MXFP4 وتكميم الأوزان بأربع بتات قدرًا يسيرًا من الجودة مقابل مكاسب كبيرة في الإنتاجية والذاكرة. وتقيس Velyrix دائمًا الفارق مقابل مجموعة التقييم الخاصة بك وتُبلغ به قبل انتقال أي بناء مكمَّم إلى الإنتاج.

هل يمكن أن يكون النشر معزولًا تمامًا عن الشبكة؟

نعم. يأتي النشر المعزول بأوزان نماذج محلية، وسجل حاويات داخلي، ومرايا حزم محلية، وبلا أي قياسات صادرة. وتُسلَّم التحديثات كوسائط موقَّعة ومُتحقَّق منها عبر عملية ضبط التغيير لديك.

هل تدعمون الضبط الدقيق إضافة إلى الاستدلال؟

نعم - تدريب مسبق متواصل، وضبط دقيق خاضع للإشراف، ومحوّلات LoRA مع تشغيل متعدد المحوّلات، وتحسين التفضيلات مثل DPO وGRPO، والتقطير من نموذج معلّم كبير إلى تلميذ أصغر لتشغيل أرخص.

من المسؤول عن ترخيص النموذج؟

العميل هو المرخَّص له في أي نموذج لطرف ثالث يختار نشره. وتوفر Velyrix بنية تحتية وخدمات هندسية، وتراجع معك شروط ترخيص كل نموذج قبل النشر، وتوثّق الالتزامات الناتجة، لكنها لا تمنح أي حقوق في نماذج الأطراف الثالثة.

ما الأداء الذي تلتزمون به؟

بعد مرحلة قياس على حركتك الفعلية، تتعاقد Velyrix على أرقام محددة للإنتاجية الإجمالية بالرموز في الثانية، وزمن أول رمز عند p95، وزمن ما بين الرموز عند p95، وتوافر نقطة النهاية شهريًا. ويُعاد التحقق من هذه الأرقام بعد كل ترقية.