從採購單到第一個訓練任務之間的全部工作
大多數 GPU 專案並不是敗在晶片上。它們敗在冷卻液迴路、一根接錯的 rail、八個節點之間 不一致的韌體,或者根本沒有人真正測過這張網路到底跑出了什麼。
設計與工程
叢集拓撲、機櫃立面圖、配電方案、冷卻液迴路設計、重量與樓板承重、佈線圖與物料清單。
物流與收貨
貨運協調、報關單證支援、安全收貨、資產採集、序列號登記與拆包清運。
上架安裝
HGX、DGX、MGX 與 ORv3 系統的機械安裝、導軌、CDU 與分水器管路、按扭矩規範緊固,全程靜電防護。
供電與散熱
由持證電工完成母線與電源接入、A/B 路負載均衡、冷卻液灌注與壓力測試、漏液檢測系統除錯。
網路建設
rail-optimized InfiniBand 或 Spectrum-X 佈線、按圖貼標、光模組安裝、鏈路訓練、誤位元速率掃描與拓撲核對。
韌體基線
BIOS、BMC、CPLD、網路卡、NVSwitch 與 GPU VBIOS 在所有節點上統一到同一驗證基線,並提供偏差報告。
軟體棧
系統映象、NVIDIA 驅動程式、CUDA、Fabric Manager、DCGM、容器執行時、Slurm 或 Kubernetes、儲存客戶端與監控代理。
烤機與驗證
72 小時持續壓力、溫度浸泡、ECC 與 XID 監控、記憶體行重對映檢查、儲存與網路吞吐測試。
驗收與交付
書面驗收測試結果、竣工圖紙、資產臺賬、維運手冊、升級路徑與操作人員培訓。
Velyrix 的九階段部署流程
一套可複製的九階段流程,配有專屬專案經理、每週進度報告,以及每個階段結束時的書面 節點確認。
需求梳理與方案評審
把業務畫像、模型規模、token 預算與增長曲線轉化為叢集拓撲、功率包絡與儲存容量規劃。交付物:設計文件與物料清單。
場地就緒評估
對照設計核查電力容量、樓板承重、冷卻液供給、卸貨通道、消防與佈線路徑。交付物:就緒報告與差距清單。
採購與物流支援
跟蹤 OEM 交期、制定暫存方案、支援進出口單證,並在受管制硬體發運前完成終端使用者篩查。交付物:到貨排期表。
機械安裝
機櫃找平與接地、系統上架、分水器與冷板管路連線、冷卻液灌注與壓力測試、按圖理線。交付物:竣工立面圖。
電氣除錯
由持證電工按書面作業指導書完成迴路接入、相位平衡、斷路器級聯配合與計量校驗。交付物:電氣驗收簽字。
網路建設與驗證
rail-optimized 佈線與貼標、逐條鏈路滿速訓練、誤位元速率掃描、拓撲圖與設計逐項比對。交付物:鏈路與拓撲報告。
軟體與叢集啟用
標準映象部署、強制韌體基線、排程器配置、儲存掛載、監控與告警對接。交付物:配置基線。
烤機與效能驗證
72 小時滿載壓力、NCCL all-reduce 與 all-gather 基準、儲存吞吐,以及目標規模下的參考模型訓練任務。交付物:基準測試結果。
驗收與維運移交
驗收測試報告評審與簽署、維運手冊與升級路徑移交、操作人員培訓,並可選擇轉入 Velyrix 託管維運。交付物:簽署版 ATP。
我們憑什麼說"做完了"
合格標準在設計階段就以書面形式確定,並在交付時逐項測試。在固定總價專案中,任何不達標項 都由 Velyrix 自費整改並重測。
| 測試項 | 方法 | 典型合格標準 | 證據 |
|---|---|---|---|
| GPU 清點與健康 | nvidia-smi、DCGM Level 3 診斷 | 100% GPU 被識別,無不可糾正 ECC,無待處理行重對映 | 逐節點 DCGM 報告 |
| 持續烤機 | 72 小時 GPU、CPU、記憶體與 NVMe 聯合壓力 | 0 次 XID 錯誤、0 次溫度降頻、頻率穩定 | 時序遙測資料匯出 |
| NVLink / NVSwitch | nvbandwidth、點對點頻寬時延測試 | 每一對鏈路頻寬在平臺參考值 5% 以內 | 頻寬矩陣 |
| 鏈路質量 | 鏈路訓練、誤位元速率掃描、埠錯誤計數 | 全部鏈路滿速,符號錯誤率低於廠商閾值,72 小時無抖動 | 網路健康報告 |
| 集合通訊效能 | NCCL all-reduce 與 all-gather,8 MB – 8 GB | 滿規模下匯流排頻寬在拓撲參考值 10% 以內 | nccl-tests 輸出 |
| 儲存吞吐 | 對並行檔案系統執行 fio 與 IOR | 達到合同約定的總讀寫頻寬與 checkpoint 時間 | 基準測試日誌 |
| 參考訓練任務 | 目標節點規模下執行 Llama 級參考模型 | 達到合同約定的 MFU 與單步時間 | 訓練日誌與 MFU 計算 |
| 故障切換與冗餘 | A/B 路斷電、拔葉交換機、CDU 水泵切換 | 冗餘路徑下任務不中斷,並記錄恢復時間 | 測試見證表 |
| 溫度與功耗 | 滿載浸泡測試,記錄進風、出風與液溫遙測 | 設計環境溫度下所有部件在原廠規格範圍內 | 熱分佈測量報告 |
| 安全基線 | 安全啟動、BMC 加固、憑據輪換、網路分段 | 100% 節點執行基線,無預設憑據 | 配置審計報告 |
經得起 OEM 與保險公司稽核
部署工作會碰到別人的保修、別人的機房和帶電裝置。Velyrix 因此把流程做得非常嚴格。
- 作業指導書與風險評估在進入帶電機房作業前完成簽發與審批
- 持證電工負責所有電源接入,遵守當地規範與電弧防護規程
- 靜電防護符合 ANSI/ESD S20.20,保護 OEM 保修條件
- 遵循 OEM 安裝指南,確保原廠保修與支援權益不受影響
- 全程監管鏈:從卸貨到上架,逐臺記錄序列號並留存照片
- 變更管理:明確作業視窗、回退方案與客戶審批節點
- 投保並經背景審查的工程師,按站點單獨授權准入
- 出口管制篩查在受管制硬體發運或安裝前完成
合作方式
範圍、驗收標準與價格都事先約定。全新叢集最常用的方式。
按工程師日費計價,適用於擴容、整改、遷移與既有環境的問題排查。
Velyrix 工程師在約定週期內駐紮你的現場,與你的團隊並肩工作並完成能力轉移。
我們先建,再按可用性與效能 SLA 長期託管營運。
固定總價的部署費用,通常從簡單風冷擴容的每節點約 $2,300,到含組網、驗證與文件的液冷 整機櫃系統的每節點 $4,600–$10,900 不等。每個專案都在設計評審之後單獨報價。
我們也是別人專案背後的那支現場工程隊
我們的團隊本來就是按"為硬體廠商及其合作伙伴交付"來組織的 — 可以掛我們的品牌, 但對你更有用的往往是掛你們自己的品牌。
- 白標交付 — 專案計劃與驗收報告上是你的品牌
- Dell、Supermicro、GIGABYTE、HPE、Lenovo 與 NVIDIA DGX 平臺的驗證部署手冊
- L1–L3 支援,並有通往原廠的明確升級通道
- 按裝機量配置的 RMA 協調與備品庫
- 專案報備與書面的渠道中立政策
從施工方式上就不影響保修
我們部署的每一個平臺,都有一份基於原廠公開安裝指南編寫的 Velyrix 部署手冊。
- 符合 ANSI/ESD S20.20 的靜電防護
- 遵循扭矩規範與導軌安裝規程
- 韌體基線與廠商驗證版本一致
- 保留逐臺序列號記錄與照片證據
- 按廠商要求的格式整理故障證據
結果是:原廠保修與支援權益完整保留,也不會出現因安裝方式引發的 RMA 爭議。
第一次建設之後的部署服務
遷移與搬遷
在機房之間或服務商之間搬遷在執行的 GPU 機隊,制定分階段切換方案,把訓練中斷降到最低,並完成資產核對。
叢集健康審計
對既有叢集做獨立評估:鏈路錯誤、韌體偏差、散熱餘量、排程效率與實際 MFU,並給出按優先順序排序的整改方案。
生命週期與換代
容量規劃、分階段硬體換代、按 NIST SP 800-88 完成介質擦除的下架,以及合規處置或轉售支援。
託管維運
7×24 監控、故障響應、韌體與驅動程式生命週期、備品管理,以及對照 SLA 的容量報告。
常見問題
AI 基礎設施驗收具體包含什麼?
驗收是在交付前證明叢集達到設計標準的正式流程:韌體基線、72 小時烤機、GPU 與 NVLink 健康檢查、鏈路質量掃描、NCCL 集合通訊基準、儲存吞吐測試、參考訓練任務、故障切換測試與熱分佈測量 —— 全部彙總進一份簽署版驗收測試報告。
Velyrix 可以在我們自己的機房施工嗎?
可以。我們很大一部分工作就是在客戶或第三方場地完成的,包括企業機房、政府設施以及其他營運商的託管機房。我們會遵守場地方的准入、安全與變更管理規定;如果這樣更省事,我們也可以作為你現有整合商的分包方參與。
全新 GPU 叢集交付要多久?
硬體到場後,單個 pod 的建設通常為三到六週。從設計、場地施工、硬體交期到建設與驗收的端到端週期,全新 AI 工廠一般為 12 到 20 周,其中 OEM 交期是最大變數。
第三方施工會讓原廠硬體保修失效嗎?
只要按廠商公開的安裝指南施工就不會。Velyrix 工程師遵循 OEM 規程,執行靜電防護、扭矩規範與逐臺序列號記錄,因此原廠保修與支援權益完整保留。
如果叢集沒有透過驗收測試怎麼辦?
在固定總價專案中,Velyrix 會自費整改並重新測試,直到達到約定標準。若問題源於硬體缺陷,我們會代你向 OEM 走保修流程並全程跟進。
你們支援 GB300 NVL72 這類液冷整機櫃系統嗎?
支援。液冷專案除標準的計算與網路驗收流程外,還包括分水器與冷板安裝、冷卻液灌注與壓力測試、CDU 除錯、漏液檢測驗證與水泵切換測試。