首頁/私有大模型

私有大模型部署與最佳化

你的模型、你的硬體、你的資料邊界

Velyrix 在專屬 GPU 上為你安裝、量化、基準測試並營運開源前沿模型 — 可以在 Velyrix 雲、你的託管機房,或完全物理隔離的本地環境。交付的是相容 OpenAI 介面的端點,並對吞吐、時延與可用性寫入合同。

模型家族
支援 10 個
推論引擎
vLLM · SGLang · TensorRT-LLM
首 token 時延
目標低於 250 ms
部署形態
雲 · 託管機房 · 完全離線
介面
相容 OpenAI
為什麼自建

公有 API 很方便,直到資料是你自己的

受監管資料、專有原始碼、病歷、交易頭寸與主權類業務,通常不適合排在別人的推論佇列裡。 如今開源權重模型的質量已經足夠接近前沿,自建部署正在成為嚴肅業務的預設選項。

  • 資料不出邊界 — 沒有第三方留存,也不會拿你的提示詞去訓練
  • 成本可預測 — 固定的 GPU 成本,而不是隨業務增長而膨脹的按 token 計費
  • 版本穩定 — 你驗證過的模型就是你一直在跑的模型,除非你自己決定升級
  • 時延可控 — 端點與應用在同一區域,甚至同一棟樓
  • 深度定製 — LoRA 介面卡、領域微調、自定義工具 schema 與護欄
  • 可審計 — 完整請求日誌寫入你自己的 SIEM,按你的策略保留
drop-in migration
# 遷移前 — 公有 API
client = OpenAI(api_key="sk-...")

# 遷移後 — 你的 Velyrix 私有端點
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# 同一個 SDK,同一套介面。你的 VPC、你的日誌、你的金鑰。
模型清單

十個開源權重模型家族,提供部署與長期支援

每個家族我們都維護經過驗證的部署方案、量化配置與基準基線,並隨新版本釋出持續更新。

DeepSeek

稀疏 MoE 旗艦與推理型模型,另有適合低成本部署的蒸餾稠密版本。

MoE推理型原生 FP88×H200

Qwen

阿里巴巴的稠密與 MoE 系列,從 0.6B 到 235B+,多語言、程式碼與視覺語言版本都很強。

稠密 + MoE多語言VL程式碼

Llama

Meta 應用最廣的開源權重家族 — 生態工具、介面卡與評測體系最完整,最穩妥的預設選擇。

8B–405BMoE 版本生態龐大

OpenAI gpt-oss

OpenAI 的開源權重版本,MoE 架構,推論強度可調,在較少 GPU 上也有出色的工具呼叫能力。

120b / 20bMXFP4智慧體

Mistral

歐洲模型,多數版本許可較為寬鬆 — 覆蓋稠密、MoE、程式碼與小型邊緣模型。

Apache 系歐洲來源程式碼邊緣

GLM

智譜的中英雙語 MoE 家族,智慧體與程式碼能力突出,另有更輕量的 Air 級版本。

MoE中英雙語智慧體

Kimi

月之暗面的萬億引數級稀疏 MoE 模型,面向長上下文與工具呼叫型智慧體構建。

萬億級 MoE長上下文智慧體

MiniMax

採用高效注意力的 MoE 架構,面向超長上下文視窗,同時保持有競爭力的推論成本。

MoE百萬上下文高效注意力

Gemma

Google 的輕量開源模型 — 單卡質量比出色,適合本地部署、邊緣與大批次分類任務。

1B–27B多模態邊緣可用

NVIDIA Nemotron

NVIDIA 最佳化過的開源模型家族,針對 NVIDIA 加速卡吞吐與企業智慧體流程做過調優。

Nano / Super / UltraTensorRT-LLMNIM

模型名稱為各自所有者的商標。Velyrix 是獨立的基礎設施服務商,與上述模型釋出方不存在關聯或 背書關係。每個模型都按其自身許可證部署,我們會在部署前與你一同審閱 — 詳見 模型許可

容量規劃

每一類模型大致需要多少算力

以下是單副本生產部署的參考配置,併為實際併發下的 KV Cache 預留了空間。最終規格取決於你的 上下文長度、併發量與時延目標。

模型類別精度最少 GPU推薦配置參考吞吐基礎設施月成本起
小型稠密(1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/s$1,640
中型稠密(12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/s$3,300
大型稠密(70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/s$10,400
超大稠密(405B)FP88× H2008× B200900 – 2,100 tok/s$23,900
稀疏 MoE(總引數 100B – 250B)FP84× H2008× H2003,000 – 9,000 tok/s$18,400
稀疏 MoE(總引數 400B – 700B)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/s$23,900
稀疏 MoE(萬億引數級)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/s$44,800
視覺語言模型(任意規模)BF16 / FP8視覺塔額外 +1 卡獨立編碼器副本取決於業務負載單獨報價

吞吐為併發請求下的總輸出 token 每秒,測試環境為 Velyrix 參考硬體並使用貼近生產的提示詞。 我們會在簽約前用你的真實業務負載實測,並把實測數字寫入服務水平目標。

效能最佳化

"能跑"和"跑得好"之間的差距

在八張卡上直接跑一個預設容器,通常會浪費掉兩到五倍的吞吐。Velyrix 的最佳化專案會從分詞器 一路調到網路卡。

量化

FP8、NVFP4/MXFP4、AWQ、GPTQ 與 SmoothQuant 方案,上線前先用你自己的評測集做精度迴歸測試。

並行策略

按模型與 GPU 拓撲選擇張量、流水線、專家與資料並行組合,包括 MoE 場景下 NVLink 感知的專家分佈。

🔄

連續批處理

PagedAttention、分塊 prefill 與排程器調優,在不突破首 token 時延目標的前提下保持 GPU 高佔用率。

🔁

Prefill / Decode 分離

把 prefill 與 decode 拆成獨立資源池並傳輸 KV,避免長提示詞阻塞互動式解碼。

🏃

投機解碼

草稿模型、EAGLE 類與 n-gram 投機,按你的接受率調優 — 互動式負載上常見 1.5–2.5 倍加速。

💾

KV Cache 工程

字首與 radix 快取、快取下沉到主機記憶體或 NVMe、KV 量化,不加卡也能延長上下文。

📈

彈性伸縮與路由

多副本路由、快取感知負載均衡、按佇列深度自動擴縮容,併為互動式與批次流量設定優先順序。

🧪

評測流水線

把你的黃金測試集接入 CI,任何模型、量化或引擎升級都必須先過質量關,而不只是看速度。

🔨

引擎選型

vLLM、SGLang、TensorRT-LLM 或 NVIDIA Dynamo,按業務負載選擇,並用你的真實流量做橫向評測後再定。

部署形態

三種劃定資料邊界的方式

上線最快

部署在 Velyrix GPU 雲

位於 Velyrix 區域的單租戶 GPU,透過專線連線你的 VPC,技術棧由 Velyrix 營運。

  • 數天內上線
  • 副本彈性伸縮
  • Velyrix 7×24 維運
  • 符合區域資料駐留要求
最均衡

部署在你的託管機房

硬體是你的、籠位是你的,由 Velyrix 按託管服務協議完成部署與營運。

  • 資產歸你
  • 技術棧由我們營運
  • 資本支出模式
  • 完全的物理控制權
最嚴格

本地與完全離線

完全斷網部署,配套離線的模型與容器映象源,不產生任何對外遙測。

  • 不依賴網際網路
  • 離線倉庫與更新
  • 適配涉密與強監管場景
  • 現場交付培訓
不止於推論

適配、檢索與智慧體

  • 繼續預訓練 — 當領域詞彙與語言風格比指令跟隨更重要時
  • 監督微調與 LoRA — 支援多介面卡服務,一個基座可承載數十個任務介面卡
  • 偏好最佳化 — 基於你自己的標註資料做 DPO、GRPO 與獎勵模型流程
  • 蒸餾 — 把大教師模型蒸餾成小學生模型,推論成本可降一個數量級
  • 檢索增強 — 向量與混合檢索、切分策略、重排序與強制引用
  • 智慧體基礎設施 — 工具 schema、結構化輸出、沙箱執行與相容 MCP 的工具服務
  • 安全護欄 — 輸入輸出分類、PII 脫敏、越獄檢測與完整提示詞審計日誌

模型許可與治理

開放權重不等於可以隨意使用。部署之前,Velyrix 會逐一審閱你打算執行的 每個模型的許可證,並把由此產生的義務寫成文件。

  • 許可證分類 — 寬鬆型、社群型或定製條款
  • 可接受使用範圍與領域限制
  • 署名、命名與再分發義務
  • 商用門檻與衍生作品條件
  • 每個模型檢查點及其來源的溯源記錄

Velyrix 提供基礎設施與工程服務,不授予任何第三方模型的權利。客戶始終是其所選模型的 被許可方,並負責遵守相應許可證與適用的 AI 監管要求(包括在適用範圍內的歐盟 AI 法案)。我們會以 文件與技術手段支援這一過程。

服務套餐

私有大模型專案怎麼推進

試點

2–3 周

  • 模型選型工作坊
  • 單副本部署
  • 對照你的評測集做基準
  • 成本與容量模型
  • 是否繼續的評估報告

$27,000 起

最常選

生產部署

6–10 周

  • 多副本高可用架構
  • 量化與引擎調優
  • 閘道器、鑑權、配額與日誌
  • 護欄與評測 CI
  • 維運手冊與團隊培訓

$83,500 起

託管大模型服務

長期

  • 7×24 端點維運
  • 吞吐與時延 SLA
  • 模型與引擎升級
  • 容量與成本報告
  • 季度最佳化評審

$10,500 / 月起

以上為專業服務的參考報價,不含 GPU 基礎設施費用與稅費。具體範圍在需求溝通後確定。

與 AI 基礎設施架構師洽談

GPU 由你擁有,維運交給我們

向任何一家 OEM 或經銷商採購你的 NVIDIA 伺服器,直接寄送至 Velyrix 機房,其餘交給我們 — 部署、組網、散熱、監控與長期支援。當然也可以直接租用我們的機器。無論哪一種方式,一個工作天內提供完整方案。

常見問題

Velyrix 可以為我們部署哪些大模型?

我們維護十個開源權重家族的驗證部署方案:DeepSeek、Qwen、Llama、OpenAI gpt-oss、Mistral、GLM、Kimi、MiniMax、Gemma 與 NVIDIA Nemotron,包含它們的視覺語言、程式碼與推理型版本。其他開源權重模型也可按需接入。

跑一個私有大模型需要多少張 GPU?

7B–9B 模型單張 L40S 或 H100 即可穩定服務。70B 稠密模型在 FP8 下通常需要 2 到 4 張 H200。400B–700B 的大型稀疏 MoE 一般需要約 8 張 H200 或 8 張 B200,萬億引數級模型通常部署在 B300 或 GB300 分割槽上。最終規格取決於上下文長度、併發量與時延目標。

量化會不會損失模型質量?

FP8 在現代檢查點上通常接近無損;NVFP4/MXFP4 與 4-bit 權重量化會用少量質量換取顯著的吞吐與視訊記憶體收益。Velyrix 一定會用你自己的評測集測出差異,並在量化版本上線前把結果告訴你。

可以做到完全物理隔離嗎?

可以。離線部署會隨附離線模型權重、內部容器倉庫、離線軟體源,並且不產生任何對外遙測。更新以簽名校驗後的介質形式,透過你的變更管理流程交付。

除了推論,你們也做微調嗎?

做。包括繼續預訓練、監督微調、支援多介面卡服務的 LoRA、DPO 與 GRPO 等偏好最佳化,以及把大教師模型蒸餾成更便宜的小模型。

模型許可證的責任由誰承擔?

客戶是其所選第三方模型的被許可方。Velyrix 提供基礎設施與工程服務,會在部署前與你一起審閱每個模型的許可條款並記錄相應義務,但不授予任何第三方模型的權利。

你們承諾什麼效能指標?

在用你的真實流量完成基準測試之後,Velyrix 會就總吞吐(tokens/s)、p95 首 token 時延、p95 token 間隔時延與月度端點可用率寫入具體數字,並在每次升級後重新驗證。