NVIDIA BlackwellがMLPerf Training 6.0で最速・最大・最強を達成
サマリー
NVIDIA BlackwellプラットフォームがMLPerf Training 6.0で全てのベンチマークで最速のトレーニング時間を記録し、8,192 GPUsを使用した最大規模のトレーニングを実施しました。NVIDIAは、パフォーマンス、スケール、信頼性を兼ね備えたプラットフォームを提供し、AIモデルの迅速な開発を支援しています。エコシステムパートナーも参加し、様々なAIトレーニングワークロードが実行されています。
本文
すべての画期的なAIモデルは、トレーニング実行から始まります。そのトレーニングジョブを実行するインフラは、チームがどれだけ迅速に反復できるか、どの規模のモデルを構築できるか、そしてそのジョブが信頼性を持って完了するかを左右します。モデルが大きく、複雑で、知能が高まるにつれて、トレーニングインフラへの要求も高まっています。
MLPerf Training 6.0では、NVIDIA Blackwellプラットフォームがすべてのカテゴリーでリードし、以下の成果を示しました:
- すべてのベンチマークで最速のトレーニング時間
- NVIDIA Blackwell NVL72システムを使用した8,192 GPUsでの最大規模のトレーニング
- スイート内のすべての7つのベンチマークに対して提出された唯一のプラットフォーム
NVIDIAは、パフォーマンス、スケール、信頼性を一つのプラットフォームに統合し、AIモデルビルダーが最前線のモデルを迅速に立ち上げ、トレーニングコストを最小限に抑え、早期に収益を生み出すことを可能にします。
MLPerf Training 6.0では、2つの新しいMixture-of-Experts(MoE)事前トレーニングワークロードが追加され、NVIDIAプラットフォームはすべてのベンチマークで最速のトレーニング時間を記録しました。NVIDIAは、GB200 NVL72およびGB300 NVL72ラックスケールシステムで結果を提出し、各ラックスケールシステム内で第5世代のNVIDIA NVLinkスイッチがすべての72 GPUsを高帯域幅で接続し、1つの巨大なGPUとして機能させています。
NVIDIAは、分散トレーニングをサポートするために、NVIDIA Quantum InfiniBandとNVIDIA Spectrum-X Ethernetの2つの補完的なスケールアウトネットワーキングプラットフォームを提供し、データセンターがインフラに最適化された大規模クラスターを構築する柔軟性を提供します。NVIDIAは、MLPerf Trainingにおける最大規模のBlackwellベースの提出を行い、8,192 GPUsを使用したDeepSeek-V3 671Bのトレーニングを実施しました。
NVIDIAのプラットフォームは、パフォーマンスだけでなく、長期間にわたるトレーニングの再現性を確保するために設計されています。NVIDIAのGPUは、故障を未然に防ぐように設計されており、データセンターに到達する前に30以上の製造テストステージを通じて潜在的な欠陥を早期に検出します。NVIDIAのエコシステムパートナーもこのラウンドに参加し、19の組織からの魅力的な提出がありました。これにより、NVIDIAのインフラ上で最も要求の厳しいAIトレーニングワークロードが実行されています。
MLPerf Training 6.0では、NVIDIA Blackwellプラットフォームがすべてのカテゴリーでリードし、以下の成果を示しました:
- すべてのベンチマークで最速のトレーニング時間
- NVIDIA Blackwell NVL72システムを使用した8,192 GPUsでの最大規模のトレーニング
- スイート内のすべての7つのベンチマークに対して提出された唯一のプラットフォーム
NVIDIAは、パフォーマンス、スケール、信頼性を一つのプラットフォームに統合し、AIモデルビルダーが最前線のモデルを迅速に立ち上げ、トレーニングコストを最小限に抑え、早期に収益を生み出すことを可能にします。
MLPerf Training 6.0では、2つの新しいMixture-of-Experts(MoE)事前トレーニングワークロードが追加され、NVIDIAプラットフォームはすべてのベンチマークで最速のトレーニング時間を記録しました。NVIDIAは、GB200 NVL72およびGB300 NVL72ラックスケールシステムで結果を提出し、各ラックスケールシステム内で第5世代のNVIDIA NVLinkスイッチがすべての72 GPUsを高帯域幅で接続し、1つの巨大なGPUとして機能させています。
NVIDIAは、分散トレーニングをサポートするために、NVIDIA Quantum InfiniBandとNVIDIA Spectrum-X Ethernetの2つの補完的なスケールアウトネットワーキングプラットフォームを提供し、データセンターがインフラに最適化された大規模クラスターを構築する柔軟性を提供します。NVIDIAは、MLPerf Trainingにおける最大規模のBlackwellベースの提出を行い、8,192 GPUsを使用したDeepSeek-V3 671Bのトレーニングを実施しました。
NVIDIAのプラットフォームは、パフォーマンスだけでなく、長期間にわたるトレーニングの再現性を確保するために設計されています。NVIDIAのGPUは、故障を未然に防ぐように設計されており、データセンターに到達する前に30以上の製造テストステージを通じて潜在的な欠陥を早期に検出します。NVIDIAのエコシステムパートナーもこのラウンドに参加し、19の組織からの魅力的な提出がありました。これにより、NVIDIAのインフラ上で最も要求の厳しいAIトレーニングワークロードが実行されています。