AI注目記事のキュレーターページ

← 一覧へ戻る

重要度 高2026-07-17 15:00:14

NVIDIA Vera Rubinがポストトレーニングのコスト効率を最大化 — エージェントAIの重要な指標

サマリー

NVIDIA Vera Rubinは、エージェントAIのポストトレーニングにおける知性のコスト効率を最大化する新しいコンピュートパターンを導入します。ポストトレーニングは継続的なプロセスであり、環境の変化に適応しながら知性を向上させることが求められます。これにより、AIモデルの価値を高め、ビジネスにおける投資効果を測定する新たな指標が提供されます。

本文

プロのアスリートを考えてみてください。エリートパフォーマーを分けるのは、試合の合間に起こることです。継続的な洗練、新しい対戦相手への適応、そして前回の試合で明らかになったスキルの向上です。

エージェントAIも同様です。モデルは単に答えを求められるのではなく、目標が与えられ、環境が変化し、エッジケースが出現し、ツールが変わる中で適応し続けなければなりません。生成モデルがプロンプトに応じて反応するのとは異なり、エージェントモデルは計画を立て、異なるツールを使用し、実行中に遭遇する問題から回復しなければなりません。

そのため、ポストトレーニングは、初期の生データに基づくトレーニングの後にモデルを洗練させるフェーズであり、もはや一度きりの仕上げのステップではありません。エージェントモデルが動作する環境は急速に変化するため、継続的です。エージェントが使用するツールは週ごとに変わる可能性があります。生産環境では、テストセットが予測していなかったエッジケースが現れます。各デプロイメントは独自のコードベース、ポリシー、環境を持っています。

ポストトレーニングは、生産から新たな問題が浮上するたびにループバックします。コンピュートフットプリントは、単一の実行が大きくなるからではなく、実行が決して止まらないからです。エージェントAIは、ポストトレーニングのための新しいコンピュートパターンを導入し、エージェント時代の中心的なワークロードであり、コストあたりの知性の主要な推進力となります。

ポストトレーニングの目標は、継続的な学習サイクルにおけるすべての前方および後方パスの収益を最大化することによって、コストあたりの知性を最大化することです。前方パス(推論)は、トークンあたりのコストで測定されます。つまり、トークンあたりのコストの改善は、直接的にコストあたりの知性に流れ込みます。

ポストトレーニングは知性が構築される場所です。事前トレーニングでは、モデルは次のトークンを予測することを学び、流暢さを得ますが、知性は得られません。ポストトレーニングでは、コードを書くこと、複数のステップタスクを計画すること、検索ツールを使用すること、何かがうまくいかないときに回復することを学びます。推論はその後の作業であり、トークンあたりのコストで価格が設定されます。

答えのキーを暗記するのではなく、報酬のみが与えられるため、モデルは強化学習(RL)技術によって学習します。タスクが与えられると、モデルは試みを記述します — これは前方パスであり、仕事で行うのと同じ作業です。試みはスコアリングされ、その教訓がモデルの重みを更新します — これが後方パスです。数百万の試みを通じて、知性が成長します。

各ステップは計算集約的であり、このループをスケールで実行することはオーケストレーションの問題です。数千の環境が並行してロールアウトを生成し、報酬が検証され、更新された重みがトレーニングに流れ込む中で、アクセラレーターが完全に活用されます。NVIDIA NeMoオープンライブラリ、例えばトレーニング環境用のNeMo Gymや分散ポストトレーニング用のNeMo RLは、ポストトレーニングを特注の研究コードから再現可能なインフラストラクチャに変えます。

推論が収益エンジンであるなら、ポストトレーニングは乗数です。モデルがより能力を持つほど、提供される各トークンの価値は高くなります。

トークンあたりのコストは、推論ファクトリーの重要な指標です。100万トークンを提供するためのすべてのコストです。コストあたりの知性は一層上のレイヤーに位置し、モデルを構築するためのコストと、その環境が変化する中で提供し続けるためのコストを問います。これらは競合するのではなく、ネストされています。コストあたりのトークンを下げるAIインフラは、モデルに組み込まれたすべての知性のコストも下げます。そして、組み込まれたすべての知性のポイントは、推論ファクトリーが提供する各トークンの価値を高めます。言い換えれば、トークンあたりのコストは運用収益を測定し、コストあたりの知性はモデルの知性への投資が実を結んでいるかを測定します。

NVIDIA Nemotron 3 Ultra — オープンウェイトの5500億パラメータのMixture-of-Experts(MoE)モデルは、検証可能なベンチマークとNeMo RLで実行された完全に開示されたポストトレーニングレシピを提供します。これは、標準的な実世界のコーディングベンチマークで71.7%を記録し、オープンソースプロジェクトからの実際のソフトウェアバグの約7割に対して作業修正を生成しました。

NVIDIA Blackwellプラットフォームは、実行あたりのコストを下げ、エージェント時代が要求する頻繁なポストトレーニングを経済的に実現可能にします。その知性は、提供される各トークンにわたって収穫されます。

NVIDIA Vera Rubinプラットフォームは、Blackwell世代の4分の1のGPUで最大のモデルをトレーニングし、エージェントポストトレーニング負荷のコストあたりの知性を最大化するためにエンドツーエンドで共同設計されました。これにより、実行ごとのロールアウト数が増え、プレイ中の環境が増え、ポストトレーニングサイクルが決して停止しません。

Prime IntellectのLabは、NVIDIA Blackwell上でフロンティアオープンモデルを継続的にポストトレーニングし、推論オーケストレーションにはNVIDIA Dynamoを使用しています。Vera Rubinを使用して、Prime Intellectは強化学習環境をスケールし、実行ごとのロールアウトを増やし、知性あたりのコストを最大化するためのトレーニングから推論への反復ループを加速する計画を立てています。

Prime Intellectは、NVIDIA Vera CPUと統合するようにサンドボックスインフラを最適化し、低遅延でエネルギー効率の良い強化学習を実現しています。NVIDIA NemotronやNVIDIA NeMo Gymなどのオープンソースツールとモデルもソフトウェアスタックに統合されています。リアルなRLサンドボックスワークロードを代替のx86アーキテクチャと比較したところ、Prime IntellectはVeraが平均してCPUあたり30%のスループット向上を提供することを発見しました。

PerplexityのRLポストトレーニングスタックは、数百のNVIDIA GPUで非同期に実行され、トレーニングと推論のコンピュートノード間で1兆パラメータモデルを2秒未満で同期するRDMAベースの重み転送エンジンを備えています。その結果、ポストトレーニングされたQwen3 235Bモデルは、NVIDIA GB200 NVL72システム上で提供されます。

Together AIは、監視付きファインチューニング、RL、直接の好み最適化を含むポストトレーニングをサービスとして提供しています。このサービスは、機能豊富なアプリケーションプログラミングインターフェースとソフトウェア開発キットを介して提供され、AIネイティブクラウドプラットフォーム上でのポストトレーニングの全範囲をサポートします。NVIDIAのプラットフォームと最適化されたカーネルライブラリで運用されており、次にVera Rubinプラットフォームを活用する予定です。

NVIDIA Vera Rubinについて詳しく学び、ワークロード全体でコストあたりの知性を最大化するためのAIファクトリーのプラットフォームを探ってください。また、フロンティアモデルのトレーニングのためのNVIDIAのフルスタックプラットフォームもご覧ください。

Contact us

ご質問・ご相談等ございましたらお気軽にご相談ください。

  • フォームでのご相談
    フォームでのご相談

    ホームページ制作、運用・更新における
    ご相談はお気軽にご連絡ください。

    お問い合わせ・ご相談
  • お電話でのお問い合わせ
    お電話でのお問い合わせ

    お電話でのご相談も随時受け付けております。
    見積依頼などもお気軽にご連絡ください。

    052-700-8712 平日 10:00~19:00