NVIDIA AI Enterprise / NIM / 公式ブログ / 2026/07/21 / 通常
NVIDIA Vera CPUのOlympusコアがエージェント処理の逐次性能を強化
公式ブログ原文
NVIDIAは、Vera CPUのOlympusコアを、サンドボックス、ツール、検索、データベース処理が連鎖するAIエージェント向けに設計したと説明しました。
要点
- エージェント workloadではGPU推論以外に、分岐の多い逐次処理がCPU側の遅延を左右すると位置付けます。
- Olympusは10-wide decode、neural branch prediction、out-of-order実行、値・メモリー予測を備えます。
- Spatial multithreadingとScalable Coherency Fabricで、単一スレッド性能と多数コアのデータ移動を両立します。
- 最大1.2TB/sのSOCAMM2 LPDDR5X、NVLink-C2C、PCIe 6.4/CXL 3.1、機密コンピューティングを統合します。
今回のブログ記事で語られていること
記事は、AIエージェントの性能をGPUのトークン生成だけで測れないと論じています。エージェントはコードをサンドボックスで実行し、ツールを呼び、データベースへ問い合わせ、コンテキストを組み立て、結果に応じて次の処理を選びます。これらは分岐が多く、メモリー待ちが発生し、単一スレッドの遅延が全体の応答時間へ積み上がります。Vera CPUのOlympusコアは、このCPU側の経路を強化する目的で設計されています。
Olympusは10命令幅のデコード、neural branch prediction、out-of-order実行、値とメモリーアクセスの予測を組み合わせます。分岐先やデータを早めに推測し、処理待ちを減らす狙いです。Spatial multithreadingは実行資源を複数スレッドで空間的に割り当て、単一スレッドの速度を保ちながらスループットを高めます。コア間はScalable Coherency Fabricで接続され、3.4TB/sの帯域を掲げています。
メモリーはSOCAMM2のLPDDR5Xで最大1.2TB/s、GPUとはNVLink-C2Cで接続します。2ソケットを単一NUMAとして扱う構成、PCIe 6.4、CXL 3.1、機密コンピューティングも挙げられています。これらはCPU、GPU、メモリー、I/Oをエージェント基盤全体として設計する方向を示します。ただし、マイクロアーキテクチャの能力値だけで実アプリの速度は決まりません。ツール待ち、ネットワーク、モデル推論、サンドボックス起動、データベース遅延を分解し、自社の逐次区間がVeraの強みと一致するかを確認する必要があります。
今回のブログ記事が関係する人
エージェント実行基盤、AIサーバー、サンドボックス、データベース接続を設計するインフラ担当、CPUとGPUの費用配分を判断する人に関係します。
結局、今回のブログ記事をどう読むべきか
エージェント時代のCPUを「GPUへデータを渡す補助」ではなく、逐次的な意思決定の主要部として再定義する発表です。導入判断ではトークン速度だけでなく、ツール呼び出しを含む端から端までの遅延を測る必要があります。