NVIDIA AI Enterprise / NIM のロゴ

NVIDIA AI Enterprise / NIM / 公式ブログ / 2026/07/21 / 重要

Rubin GPUが長文脈・MoE・機密AI向けの演算とデータ移動を刷新

AIinfrastructurehardware

公式ブログ原文

NVIDIAは、Rubin GPUのアーキテクチャを公開しました。MoE、長文脈、エージェント処理のデータ移動を強化し、Blackwell比で高い処理量と電力効率を掲げます。

要点

  • Rubinは3360億トランジスター、224 SM、896 Tensor Core、NVFP4で50 PFLOPS、288GB HBM4と22TB/s帯域を備えます。
  • NVLink 6はGPUあたり3.6TB/s、CPU接続のNVLink-C2Cは1.8TB/s、PCIe Gen6は256GB/sです。
  • TMA descriptor、MoE、長文脈、TEE-I/Oを強化し、エージェントワークロードの通信と安全なデータ移動を重視します。
  • Blackwell比最大10倍のエージェント処理量/電力という値は、NVIDIA内部の2T MoE評価として読む必要があります。

今回のブログ記事で語られていること

Rubin GPUは、モデル演算だけでなく、MoEのexpert間通信、長いコンテキストのKVデータ、CPUとGPU間のツール処理を含むエージェントワークロードを対象にします。仕様は3360億トランジスター、224のストリーミングマルチプロセッサ、896のTensor Coreで、NVFP4演算は50 PFLOPSとされています。メモリーは288GBのHBM4、帯域は22TB/sです。大きなモデルを保持し、トークン生成中に大量の状態を動かすため、容量と帯域を同時に増やしています。

GPU間のNVLink 6は3.6TB/s、Vera CPUとのNVLink-C2Cは1.8TB/s、PCIe Gen6は256GB/sです。Tensor Memory Acceleratorのdescriptor処理を強化し、MoEや長文脈で繰り返されるデータ移動を演算と重ねやすくします。TEE-I/Oを含む機密実行も掲げ、CPU、GPU、ネットワークをまたぐ信頼境界を意識しています。エージェントワークロードでは、推論が終わるたびにCPU側のツールや外部システムへ移るため、これらの接続性能がGPU利用率へ直接影響します。

NVIDIAは、内部の2兆パラメーターMoEモデルでBlackwell比最大10倍のエージェント処理量/電力を達成すると説明しています。この倍率は特定モデル、精度、並列構成、ソフトウェアでのベンダー評価です。任意のLLMや検索・ツール中心のエージェントが10倍になるとは限りません。導入側はモデル適合率、系列長、バッチ、KVキャッシュ、GPU間通信、CPU待ち、消費電力を分解し、既存Blackwell環境と同じ品質条件で比較する必要があります。仕様の大きさより、端から端までの利用率と1タスク当たり費用が判断材料になります。

今回のブログ記事が関係する人

大規模モデルの推論・学習基盤、AIファクトリー、クラウドGPU、機密AI、エージェントプラットフォームを設計・調達するチームに関係します。

結局、今回のブログ記事をどう読むべきか

Rubinは演算器だけでなく、メモリーと接続をエージェント処理へ合わせて更新する世代です。公称倍率を採用理由にせず、自社モデルの品質条件とツール待ちを含むタスク単価で比較する必要があります。