NVIDIA AI Enterprise / NIM / 公式ブログ / 2026/07/24 / 重要
NVIDIA ModelExpressがモデル重み配布の初回起動を短縮
公式ブログ原文
NVIDIAがModelExpressを紹介しました。既にGPU上にあるモデル重みを再利用し、P2P RDMA、オブジェクトストレージストリーミング、分散キャッシュ、GPUDirect Storageを自動選択してLLM 複製先の起動を速めます。
要点
- 互換な重みがある場所を探し、最速経路を実行環境で選ぶ
- 配信 GPUから新しいGPUへNIXL P2P RDMAで直接転送する
- オブジェクトストレージの同一モデルを複製先ごとに重複ダウンロードしない
- vLLM、SGLang、Dynamo、llm-dやRL 再構成ワークフローと統合する
今回のブログ記事で語られていること
大規模モデルのチェックポイントは数百GBから1TBに達し、初回起動、自動拡縮、順次更新、強化学習後の重み配布で何度も移動します。ModelExpressは各複製先が独立してストレージから読み込む前提をやめ、互換な重みが既にどこにあるかを調べます。配信元ノードのGPUメモリーにあればNVIDIA 推論 Xfer ライブラリを使うP2P RDMAでGPUからGPUへ直接送り、オブジェクトストレージ、ローカルディスク、ホストメモリーを経由する重複を減らします。
最初のワーカーには転送元ノードがないため、オブジェクトストレージからセーフテンソル形式をストリームし、CPUのステージングバッファを再利用しながらGPU配置と読み取りを並行します。共有ディスクキャッシュがあるクラスターでは、メタデータストアの排他制御で一つの取得処理を選び、他の複製先は同じキャッシュ済み複製を使います。ローカルストレージではGPUDirect Storageが使える環境を自動検出し、NIXLの並列処理基盤でホストメモリーを経由しない転送を選びます。使えない環境ではモデル Streamerへ代替します。
記事の例ではDeepSeek-V4 Proの重みとJIT カーネルキャッシュ成果物を配信複製先から10秒未満で転送し、起動全体を8分から1分44秒へ短縮しました。重みだけでなくカーネルキャッシュ、RL 学習から展開ワーカーへの更新も対象です。vLLM、SGLang、Dynamo、llm-dとの連携を示しています。ただし同じ効果はネットワーク、ストレージ、GPU 構成、モデル配置、キャッシュヒットに依存します。P2P経路を開くセキュリティ境界、重みの版互換性、破損検証、代替時の処理能力も設計が必要です。
今回のブログ記事が関係する人
LLM 配信基盤、GPU クラスター、MLOps、RL 基盤を運用するチームに関係します。現在の初回起動をストレージ読み取り、ノード間複製、GPU転送、エンジン初期化へ分解し、ModelExpressが減らせる部分を測る必要があります。
結局、今回のブログ記事をどう読むべきか
ModelExpressは推論エンジンそのものより、モデル成果物移送を共通層として最適化します。ベンチマークの秒数だけでなく、自社クラスターで転送元ノードとキャッシュヒットが得られるかを確認することが導入判断の中心です。