AIエージェントの評価: StrandsとAgentCoreを用いたプロダクションブループリント
サマリー
MotorwayはAWSと協力して、ディーラーが車両を見つけるためのAIエージェントを開発しました。このエージェントは、手動フィルタリングを自然言語クエリに置き換え、信頼性を確保するための評価パイプラインを構築しました。評価は、ツールの使用、推論、出力品質の3層で行われ、品質ゲートを設けています。
本文
この投稿はMotorwayとAWSプロトタイピングおよびAIカスタマーエンジニアリング(PACE)チームと共同で執筆されました。Motorwayは、英国を拠点とするオンライン自動車マーケットプレイスで、最大8,000のディーラーが2,500台の車両に入札する日次オークションを運営しています。MotorwayはAWS PACEと協力して、ディーラーが車両を見つける方法を変えるAI駆動のディーラーストック検索エージェントを構築しました。このエージェントは、数時間の手動フィルタリングを自然言語クエリに置き換えます。
課題としては、エージェントが自信のある応答を返すものの、実際に信頼性があることをどう証明するかが挙げられます。ツール選択の誤りは誤った検索結果を引き起こし、ディーラーの信頼を損ないます。意味的検索の誤解は無関係な結果を返します。複数ターンの会話における文脈のずれは、ディーラーの修正を失わせます。非決定的な出力は単一試行のテストを信頼できないものにします。
MotorwayとAWSは、誤った結果を8件中1件から50件中1件に減少させ、問題検出時間を数時間から数分に短縮するエンドツーエンドの評価パイプラインを構築しました。このパイプラインは、Strands Agents SDKとAmazon Bedrock AgentCoreを組み合わせたもので、AIエージェントを大規模に展開・運用するための完全管理サービスです。この投稿では、自分のエージェント用にこのパイプラインを構築する方法を学ぶことができます。
評価戦略は、Strands Agents用のオープンソース評価ライブラリであるstrands-agents-evalsを用いたビルド時テストと、Amazon Bedrock AgentCore Evaluationsを用いたプロダクションモニタリングの2段階から成ります。ツールの使用、推論、出力品質を評価するための3層フレームワークがあり、メトリクスが閾値を下回るとリリースをブロックする品質ゲートを持つ5段階の展開パイプラインがあります。これにより、エージェントの信頼性と効率を向上させることができます。
課題としては、エージェントが自信のある応答を返すものの、実際に信頼性があることをどう証明するかが挙げられます。ツール選択の誤りは誤った検索結果を引き起こし、ディーラーの信頼を損ないます。意味的検索の誤解は無関係な結果を返します。複数ターンの会話における文脈のずれは、ディーラーの修正を失わせます。非決定的な出力は単一試行のテストを信頼できないものにします。
MotorwayとAWSは、誤った結果を8件中1件から50件中1件に減少させ、問題検出時間を数時間から数分に短縮するエンドツーエンドの評価パイプラインを構築しました。このパイプラインは、Strands Agents SDKとAmazon Bedrock AgentCoreを組み合わせたもので、AIエージェントを大規模に展開・運用するための完全管理サービスです。この投稿では、自分のエージェント用にこのパイプラインを構築する方法を学ぶことができます。
評価戦略は、Strands Agents用のオープンソース評価ライブラリであるstrands-agents-evalsを用いたビルド時テストと、Amazon Bedrock AgentCore Evaluationsを用いたプロダクションモニタリングの2段階から成ります。ツールの使用、推論、出力品質を評価するための3層フレームワークがあり、メトリクスが閾値を下回るとリリースをブロックする品質ゲートを持つ5段階の展開パイプラインがあります。これにより、エージェントの信頼性と効率を向上させることができます。