公有 API 很方便,直到数据是你自己的
受监管数据、专有源代码、病历、交易头寸与主权类业务,通常不适合排在别人的推理队列里。 如今开源权重模型的质量已经足够接近前沿,自建部署正在成为严肃业务的默认选项。
- 数据不出边界 — 没有第三方留存,也不会拿你的提示词去训练
- 成本可预测 — 固定的 GPU 成本,而不是随业务增长而膨胀的按 token 计费
- 版本稳定 — 你验证过的模型就是你一直在跑的模型,除非你自己决定升级
- 时延可控 — 端点与应用在同一区域,甚至同一栋楼
- 深度定制 — LoRA 适配器、领域微调、自定义工具 schema 与护栏
- 可审计 — 完整请求日志写入你自己的 SIEM,按你的策略保留
# 迁移前 — 公有 API client = OpenAI(api_key="sk-...") # 迁移后 — 你的 Velyrix 私有端点 client = OpenAI( base_url="https://llm.internal.acme.com/v1", api_key=os.environ["VELYRIX_KEY"], ) resp = client.chat.completions.create( model="qwen3-235b-a22b-fp8", messages=[{"role": "user", "content": prompt}], tools=tools, stream=True, ) # 同一个 SDK,同一套接口。你的 VPC、你的日志、你的密钥。
十个开源权重模型家族,提供部署与长期支持
每个家族我们都维护经过验证的部署方案、量化配置与基准基线,并随新版本发布持续更新。
DeepSeek
稀疏 MoE 旗舰与推理型模型,另有适合低成本部署的蒸馏稠密版本。
Qwen
阿里巴巴的稠密与 MoE 系列,从 0.6B 到 235B+,多语言、代码与视觉语言版本都很强。
Llama
Meta 应用最广的开源权重家族 — 生态工具、适配器与评测体系最完整,最稳妥的默认选择。
OpenAI gpt-oss
OpenAI 的开源权重版本,MoE 架构,推理强度可调,在较少 GPU 上也有出色的工具调用能力。
Mistral
欧洲模型,多数版本许可较为宽松 — 覆盖稠密、MoE、代码与小型边缘模型。
GLM
智谱的中英双语 MoE 家族,智能体与代码能力突出,另有更轻量的 Air 级版本。
Kimi
月之暗面的万亿参数级稀疏 MoE 模型,面向长上下文与工具调用型智能体构建。
MiniMax
采用高效注意力的 MoE 架构,面向超长上下文窗口,同时保持有竞争力的推理成本。
Gemma
Google 的轻量开源模型 — 单卡质量比出色,适合本地部署、边缘与大批量分类任务。
NVIDIA Nemotron
NVIDIA 优化过的开源模型家族,针对 NVIDIA 加速卡吞吐与企业智能体流程做过调优。
模型名称为各自所有者的商标。Velyrix 是独立的基础设施服务商,与上述模型发布方不存在关联或 背书关系。每个模型都按其自身许可证部署,我们会在部署前与你一同审阅 — 详见 模型许可。
每一类模型大致需要多少算力
以下是单副本生产部署的参考配置,并为实际并发下的 KV Cache 预留了空间。最终规格取决于你的 上下文长度、并发量与时延目标。
| 模型类别 | 精度 | 最少 GPU | 推荐配置 | 参考吞吐 | 基础设施月成本起 |
|---|---|---|---|---|---|
| 小型稠密(1B – 9B) | BF16 / FP8 | 1× L40S | 2× L40S / 1× H100 | 2,500 – 6,000 tok/s | $1,640 |
| 中型稠密(12B – 32B) | FP8 / AWQ-INT4 | 1× H100 80GB | 2× H100 / 2× H200 | 1,800 – 4,500 tok/s | $3,300 |
| 大型稠密(70B – 123B) | FP8 | 2× H200 | 4× H200 / 8× H100 | 1,400 – 3,200 tok/s | $10,400 |
| 超大稠密(405B) | FP8 | 8× H200 | 8× B200 | 900 – 2,100 tok/s | $23,900 |
| 稀疏 MoE(总参数 100B – 250B) | FP8 | 4× H200 | 8× H200 | 3,000 – 9,000 tok/s | $18,400 |
| 稀疏 MoE(总参数 400B – 700B) | FP8 / FP4 | 8× H200 | 8× B200 / 16× H200 | 4,000 – 14,000 tok/s | $23,900 |
| 稀疏 MoE(万亿参数级) | FP8 / FP4 | 16× H200 | 8× B300 / GB300 partition | 6,000 – 20,000 tok/s | $44,800 |
| 视觉语言模型(任意规模) | BF16 / FP8 | 视觉塔额外 +1 卡 | 独立编码器副本 | 取决于业务负载 | 单独报价 |
吞吐为并发请求下的总输出 token 每秒,测试环境为 Velyrix 参考硬件并使用贴近生产的提示词。 我们会在签约前用你的真实业务负载实测,并把实测数字写入服务水平目标。
"能跑"和"跑得好"之间的差距
在八张卡上直接跑一个默认容器,通常会浪费掉两到五倍的吞吐。Velyrix 的优化项目会从分词器 一路调到网卡。
量化
FP8、NVFP4/MXFP4、AWQ、GPTQ 与 SmoothQuant 方案,上线前先用你自己的评测集做精度回归测试。
并行策略
按模型与 GPU 拓扑选择张量、流水线、专家与数据并行组合,包括 MoE 场景下 NVLink 感知的专家分布。
连续批处理
PagedAttention、分块 prefill 与调度器调优,在不突破首 token 时延目标的前提下保持 GPU 高占用率。
Prefill / Decode 分离
把 prefill 与 decode 拆成独立资源池并传输 KV,避免长提示词阻塞交互式解码。
投机解码
草稿模型、EAGLE 类与 n-gram 投机,按你的接受率调优 — 交互式负载上常见 1.5–2.5 倍加速。
KV Cache 工程
前缀与 radix 缓存、缓存下沉到主机内存或 NVMe、KV 量化,不加卡也能延长上下文。
弹性伸缩与路由
多副本路由、缓存感知负载均衡、按队列深度自动扩缩容,并为交互式与批量流量设置优先级。
评测流水线
把你的黄金测试集接入 CI,任何模型、量化或引擎升级都必须先过质量关,而不只是看速度。
引擎选型
vLLM、SGLang、TensorRT-LLM 或 NVIDIA Dynamo,按业务负载选择,并用你的真实流量做横向评测后再定。
三种划定数据边界的方式
部署在 Velyrix GPU 云
位于 Velyrix 区域的单租户 GPU,通过专线连接你的 VPC,技术栈由 Velyrix 运营。
- 数天内上线
- 副本弹性伸缩
- Velyrix 7×24 运维
- 符合区域数据驻留要求
部署在你的托管机房
硬件是你的、笼位是你的,由 Velyrix 按托管服务协议完成部署与运营。
- 资产归你
- 技术栈由我们运营
- 资本支出模式
- 完全的物理控制权
本地与完全离线
完全断网部署,配套离线的模型与容器镜像源,不产生任何对外遥测。
- 不依赖互联网
- 离线仓库与更新
- 适配涉密与强监管场景
- 现场交付培训
适配、检索与智能体
- 继续预训练 — 当领域词汇与语言风格比指令跟随更重要时
- 监督微调与 LoRA — 支持多适配器服务,一个基座可承载数十个任务适配器
- 偏好优化 — 基于你自己的标注数据做 DPO、GRPO 与奖励模型流程
- 蒸馏 — 把大教师模型蒸馏成小学生模型,推理成本可降一个数量级
- 检索增强 — 向量与混合检索、切分策略、重排序与强制引用
- 智能体基础设施 — 工具 schema、结构化输出、沙箱执行与兼容 MCP 的工具服务
- 安全护栏 — 输入输出分类、PII 脱敏、越狱检测与完整提示词审计日志
模型许可与治理
开放权重不等于可以随意使用。部署之前,Velyrix 会逐一审阅你打算运行的 每个模型的许可证,并把由此产生的义务写成文档。
- 许可证分类 — 宽松型、社区型或定制条款
- 可接受使用范围与领域限制
- 署名、命名与再分发义务
- 商用门槛与衍生作品条件
- 每个模型检查点及其来源的溯源记录
Velyrix 提供基础设施与工程服务,不授予任何第三方模型的权利。客户始终是其所选模型的 被许可方,并负责遵守相应许可证与适用的 AI 监管要求(包括在适用范围内的欧盟 AI 法案)。我们会以 文档与技术手段支持这一过程。
私有大模型项目怎么推进
试点
2–3 周
- 模型选型工作坊
- 单副本部署
- 对照你的评测集做基准
- 成本与容量模型
- 是否继续的评估报告
$27,000 起
生产部署
6–10 周
- 多副本高可用架构
- 量化与引擎调优
- 网关、鉴权、配额与日志
- 护栏与评测 CI
- 运维手册与团队培训
$83,500 起
托管大模型服务
长期
- 7×24 端点运维
- 吞吐与时延 SLA
- 模型与引擎升级
- 容量与成本报告
- 季度优化评审
$10,500 / 月起
以上为专业服务的参考报价,不含 GPU 基础设施费用与税费。具体范围在需求沟通后确定。
常见问题
Velyrix 可以为我们部署哪些大模型?
我们维护十个开源权重家族的验证部署方案:DeepSeek、Qwen、Llama、OpenAI gpt-oss、Mistral、GLM、Kimi、MiniMax、Gemma 与 NVIDIA Nemotron,包含它们的视觉语言、代码与推理型版本。其他开源权重模型也可按需接入。
跑一个私有大模型需要多少张 GPU?
7B–9B 模型单张 L40S 或 H100 即可稳定服务。70B 稠密模型在 FP8 下通常需要 2 到 4 张 H200。400B–700B 的大型稀疏 MoE 一般需要约 8 张 H200 或 8 张 B200,万亿参数级模型通常部署在 B300 或 GB300 分区上。最终规格取决于上下文长度、并发量与时延目标。
量化会不会损失模型质量?
FP8 在现代检查点上通常接近无损;NVFP4/MXFP4 与 4-bit 权重量化会用少量质量换取显著的吞吐与显存收益。Velyrix 一定会用你自己的评测集测出差异,并在量化版本上线前把结果告诉你。
可以做到完全物理隔离吗?
可以。离线部署会随附离线模型权重、内部容器仓库、离线软件源,并且不产生任何对外遥测。更新以签名校验后的介质形式,通过你的变更管理流程交付。
除了推理,你们也做微调吗?
做。包括继续预训练、监督微调、支持多适配器服务的 LoRA、DPO 与 GRPO 等偏好优化,以及把大教师模型蒸馏成更便宜的小模型。
模型许可证的责任由谁承担?
客户是其所选第三方模型的被许可方。Velyrix 提供基础设施与工程服务,会在部署前与你一起审阅每个模型的许可条款并记录相应义务,但不授予任何第三方模型的权利。
你们承诺什么性能指标?
在用你的真实流量完成基准测试之后,Velyrix 会就总吞吐(tokens/s)、p95 首 token 时延、p95 token 间隔时延与月度端点可用率写入具体数字,并在每次升级后重新验证。