SageMakerでの生成AI推論の監視とデバッグ:詳細なメトリクスとCloudWatchのインサイトダッシュボード
サマリー
Amazon SageMaker AIは、生成AI推論エンドポイントの監視とデバッグを容易にするために、詳細なメトリクスとCloudWatchのインサイトダッシュボードを提供します。これにより、GPUの健康状態やトラフィック分布を把握し、エンドポイントのパフォーマンスを最適化できます。新しいエンドポイントでは詳細な可視性メトリクスがデフォルトで有効になり、既存のエンドポイントでも簡単に設定可能です。
本文
生成AI推論エンドポイントをスケールで監視し、トラブルシューティングすることは困難です。大規模言語モデル(LLM)エンドポイントのP99レイテンシが急上昇した場合、GPUメモリの圧迫、KVキャッシュの飽和、アベイラビリティゾーン間のトラフィックの不均衡、または自動スケーリングポリシーが発動していないかを数分で特定する必要があります。トレーニングから提供への移行は、チームがLLMや他の生成AIモデルを本番環境にデプロイする方法を再構築しています。機械学習プラットフォームエンジニア、MLOpsチーム、サイト信頼性エンジニア(SRE)は、数十のモデルと数百のGPUインスタンスにわたって推論エンドポイントを健康で応答性が高く、コスト効率の良い状態に保つ必要があります。
Amazon SageMaker AIは、機械学習モデルのための完全に管理されたリアルタイム推論ホスティングを提供します。モデルをSageMakerエンドポイントにデプロイすると、SageMakerがプロビジョニングとスケーリングを処理します。SageMakerは複数のエンドポイントアーキテクチャをサポートしています。この投稿では、生成AIワークロードに最も関連する2つのアーキテクチャに焦点を当てます。
1. シングルモデルエンドポイント(SME) - 各エンドポイントが専用インスタンス上で1つのモデルをホストします。SMEは設定が簡単ですが、各モデルには独自のGPUインスタンスのフリートが必要です。
2. 推論コンポーネント(IC)エンドポイント - 複数のモデルが推論コンポーネントを介して同じインスタンスセットを共有します。各推論コンポーネントはモデル、そのリソース要件(CPU、GPU、メモリ)、およびスケーリングポリシーを定義します。ICエンドポイントは、共有GPUインフラストラクチャ上でのマルチモデルホスティングをサポートし、モデルごとの独立したスケーリングと高可用性を提供するため、生成AIワークロードの本番環境に推奨されるアーキテクチャです。
SageMakerエンドポイントは、呼び出し回数、モデルのレイテンシ、オーバーヘッドレイテンシなどのメトリクスをAmazon CloudWatchに送信します。これらの集約メトリクスは、全体的なエンドポイントの健康状態を理解するのに役立ちます。しかし、チームはGPUフリート上でのマルチモデルデプロイメントにスケールするため、より深い信号が必要です。Amazon SageMaker AIは、GPUの健康状態、トークンレベルのレイテンシ、KVキャッシュの圧力、アベイラビリティゾーン間のトラフィック分布、推論コンポーネントの配置、コールドスタートの診断など、100以上の詳細な推論メトリクスを発信します。これらのメトリクスは、CloudWatchのSageMaker Insightsダッシュボードに流れ込み、カスタムGrafanaダッシュボードやPrometheusの設定が不要な完全に管理された可視化ソリューションを提供します。SageMaker Insightsダッシュボードは、両方のエンドポイントタイプをサポートし、推論コンポーネントが検出されるとIC特有のパネルを自動的に表示します。
この投稿では、次のことを学びます:
- 新しいおよび既存のSageMaker推論エンドポイントで詳細な可視性メトリクスを有効にする方法。
- パフォーマンス、キャパシティ、信頼性のビューを通じてフリートの健康を監視するためのSageMaker Insightsダッシュボードのナビゲート方法。
- PromQL互換のエンドポイントを介して独自の可視化ツール(Grafana、Datadog)にメトリクスを接続する方法。
Amazon SageMaker AIは、機械学習モデルのための完全に管理されたリアルタイム推論ホスティングを提供します。モデルをSageMakerエンドポイントにデプロイすると、SageMakerがプロビジョニングとスケーリングを処理します。SageMakerは複数のエンドポイントアーキテクチャをサポートしています。この投稿では、生成AIワークロードに最も関連する2つのアーキテクチャに焦点を当てます。
1. シングルモデルエンドポイント(SME) - 各エンドポイントが専用インスタンス上で1つのモデルをホストします。SMEは設定が簡単ですが、各モデルには独自のGPUインスタンスのフリートが必要です。
2. 推論コンポーネント(IC)エンドポイント - 複数のモデルが推論コンポーネントを介して同じインスタンスセットを共有します。各推論コンポーネントはモデル、そのリソース要件(CPU、GPU、メモリ)、およびスケーリングポリシーを定義します。ICエンドポイントは、共有GPUインフラストラクチャ上でのマルチモデルホスティングをサポートし、モデルごとの独立したスケーリングと高可用性を提供するため、生成AIワークロードの本番環境に推奨されるアーキテクチャです。
SageMakerエンドポイントは、呼び出し回数、モデルのレイテンシ、オーバーヘッドレイテンシなどのメトリクスをAmazon CloudWatchに送信します。これらの集約メトリクスは、全体的なエンドポイントの健康状態を理解するのに役立ちます。しかし、チームはGPUフリート上でのマルチモデルデプロイメントにスケールするため、より深い信号が必要です。Amazon SageMaker AIは、GPUの健康状態、トークンレベルのレイテンシ、KVキャッシュの圧力、アベイラビリティゾーン間のトラフィック分布、推論コンポーネントの配置、コールドスタートの診断など、100以上の詳細な推論メトリクスを発信します。これらのメトリクスは、CloudWatchのSageMaker Insightsダッシュボードに流れ込み、カスタムGrafanaダッシュボードやPrometheusの設定が不要な完全に管理された可視化ソリューションを提供します。SageMaker Insightsダッシュボードは、両方のエンドポイントタイプをサポートし、推論コンポーネントが検出されるとIC特有のパネルを自動的に表示します。
この投稿では、次のことを学びます:
- 新しいおよび既存のSageMaker推論エンドポイントで詳細な可視性メトリクスを有効にする方法。
- パフォーマンス、キャパシティ、信頼性のビューを通じてフリートの健康を監視するためのSageMaker Insightsダッシュボードのナビゲート方法。
- PromQL互換のエンドポイントを介して独自の可視化ツール(Grafana、Datadog)にメトリクスを接続する方法。