Amazon SageMaker AIにおけるコンテナキャッシングの導入でモデルのスケーリングが加速
サマリー
Amazon SageMaker AIに新たに導入されたコンテナキャッシングにより、生成AIモデルのスケーリングが加速します。これにより、エンドツーエンドの起動レイテンシが最大51%改善され、トラフィックの急増にも対応可能になります。セキュリティとテナントの分離も維持され、安心して利用できます。
本文
本日、Amazon SageMaker AI推論におけるコンテナイメージキャッシングの導入を発表します。これにより、生成AIモデルのスケールアウト時のエンドツーエンドのレイテンシが最大2倍に短縮されます。これまで、Amazon SageMaker AIは、スケールアウトの必要性を検出し、インスタンスをプロビジョニングし、コンテナイメージをダウンロードし、モデルの重みを取得し、コンテナを起動するまでのレイテンシを削減してきました。新たに導入されたコンテナキャッシングは、新しいインスタンスを起動する必要があるシナリオにおいても、コンテナイメージのダウンロードレイテンシを排除します。これにより、スケールアウト時のボトルネックを解消し、パフォーマンスの向上が期待できます。具体的には、キャッシングを利用することで、エンドツーエンドの起動レイテンシが525秒から258秒に短縮され、約51%の改善が見込まれます。さらに、キャッシングはセキュリティとテナントの分離を維持し、各キャッシュは単一の顧客エンドポイントに専用されます。これにより、生成AIアプリケーションはトラフィックの急増に対応しやすくなり、低レイテンシと高可用性を維持できます。