CouchbaseがAmazon Bedrockを活用してCapella iQのためのマルチモデルAIアーキテクチャを構築
サマリー
Couchbaseは、Amazon Bedrockを利用してCapella iQのためのマルチモデルAIアーキテクチャを構築しました。このアーキテクチャは、柔軟性と高可用性を提供し、複数のモデルプロバイダーをサポートします。Couchbaseは、モデルの選択を設定の選択として扱うことで、開発者体験を損なうことなく新しいモデルを迅速に採用できるようにしています。
本文
この投稿はCouchbaseのTushar Madaanと共同執筆されています。データベースクエリを生成し、インデックスを推奨し、マルチターンの会話ワークフローをサポートするAI駆動の開発者アシスタントを構築するには、単一の大規模言語モデル(LLM)以上のものが必要です。それには、柔軟でスケーラブル、かつレジリエントな推論アーキテクチャが求められます。Capella iQの企業採用が進む中、CouchbaseはAIアプリケーションを拡張し、複数の基盤モデル(FM)プロバイダーをサポートすることで、柔軟性を高め、運用のレジリエンスを向上させ、さまざまな顧客の展開ニーズに対応しました。Couchbaseは、トラフィックの急増に対応し、事前にプロビジョニングされたキャパシティなしでAWSリージョン全体で高可用性を維持できるモデル非依存の推論アーキテクチャを必要としました。この投稿では、CouchbaseがAmazon Bedrockを採用してCapella iQをAnthropicのClaudeモデル群で強化する方法、マルチモデルアプローチの背後にあるアーキテクチャ上の決定、および運用上の利点について説明します。
ソリューションの概要
以下の図は、Amazon Bedrockとの統合におけるCapella iQの生産アーキテクチャを示しています。
このアーキテクチャは、AWSのコントロールプレーン内にホストされ、2つのAWSリージョン(us-east-1およびus-west-2)にまたがって高可用性を実現しています。us-east-1内では、Amazon Elastic Kubernetes Service(Amazon EKS)クラスターがCapella iQのマイクロサービスを実行しています。
- cp-apiポッド:開発者からのリクエストを受け取り、推論呼び出しを調整する主要なAPIサービスです。このポッドは、仮想プライベートクラウド(VPC)インターフェースエンドポイントを介してAmazon Bedrockの呼び出しを転送します。
- cp-internal-apiポッド:内部サービス間の通信とモデルルーティングロジックを処理します。
- cp-nsポッド:モデルベンダー設定、テナントレベルのオーバーライド、組織の好みを含む名前空間レベルの設定を管理します。
Amazon VPCインターフェースエンドポイントは、EKSクラスターからAmazon Bedrockランタイムへのプライベート接続を提供します。このエンドポイントは、推論トラフィックをAWSが管理するBedrockのインフラストラクチャにルーティングし、米国の地理的範囲内でのクロスリージョン推論(CRIS)をサポートし、自動フェイルオーバー、負荷分散、需要の急増時の可用性向上を実現します。
動作の仕組み
開発者がCapella iQと対話する際、SQL++クエリの要求、インデックス推奨のリクエスト、またはマルチターンの会話を続ける場合、リクエストはこのパイプラインを通じてエンドツーエンドで処理されます。
- リクエストの取り込み:開発者の自然言語リクエストがcp-apiポッドに到着します。認証を処理し、セッションコンテキストを取得し、リクエストタイプに適したプロンプトテンプレートを決定します。
- 推論の調整:cp-apiポッドは推論ペイロードを組み立て、プロンプトを構築し、マルチターンのコンテキストのために会話履歴を注入し、cp-nsポッドからのテナント固有のモデル設定を適用します。cp-internal-apiポッドはモデルベンダーの選択と組織レベルのルーティングオーバーライドを解決します。
- プライベートモデルの呼び出し:cp-apiポッドはリクエストをVPCインターフェースエンドポイントを介してAmazon Bedrockランタイムに転送します。完全なプロンプトとレスポンスペイロードはAWSインフラストラクチャ内に留まり、公共のインターネットを通過することはありません。この設計は、企業のセキュリティおよびデータ居住要件を満たします。
- クロスリージョン推論:Amazon Bedrockは、クロスリージョン推論を使用して推論リクエストを最適な米国リージョン(us-east-1、us-east-2、またはus-west-2)に自動的にルーティングし、リクエストを米国の地理的境界内に保持します。需要の急増や地域の劣化時には、リクエストはアプリケーションレベルのロジックや手動の介入なしに利用可能なリージョンにルーティングされます。
- レスポンスの配信:モデルのレスポンス(生成されたSQL++、インデックス推奨、または会話の返信)は、同じプライベートパスを通じてストリーミングされます。cp-apiポッドはレスポンスの正規化とフォーマットを適用し、結果をCapella iQインターフェース内の開発者に提供します。会話の状態はマルチターンの継続性のために保持されます。
この設計により、モデルのアップグレードやプロバイダーの変更は、名前空間レイヤーでの設定更新のみで済み、コードの変更やダウンタイムは不要で、開発者体験に影響を与えません。
モデル評価
生産用のモデルを選定する前に、チームはSQL++生成、インデックス推奨、クエリ説明、iQインサイト生成、マルチターン会話をカバーするベンチマークスイートを確立しました。Bedrockで利用可能な複数のモデルが標準化されたプロンプト/レスポンステストセットを使用して評価され、スコアリングは機能的正確性、決定論、レイテンシ、フォーマットの一貫性の4つの次元に焦点を当てました。AnthropicのClaude Sonnet 4.5は、BIRDメソッドに基づく内部評価で約76%の精度を達成し、評価されたすべてのワークフローで生産品質基準を満たし、重大な後退は見られませんでした。これにより、Claude Sonnet 4.5がCapella iQの多様なワークロードプロファイルに対する初期の生産モデルとして検証され、構造化されたコード生成、自然言語説明、マルチターン推論を網羅しました。さらに重要なのは、Couchbaseが新しいモデルを迅速に評価し、Amazon Bedrockで利用可能になるにつれて採用するのを助けるモデル評価フレームワークが検証されたことです。
Amazon Bedrockの利点
Amazon Bedrockは、モデルインフラストラクチャを管理する必要を排除する完全に管理されたサーバーレス推論環境を提供します。成長する基盤モデルのカタログを提供し、Couchbaseは新しいモデル世代を評価し、採用することができます。
Couchbaseにとって、Amazon Bedrockを通じて複数のモデルファミリーへの単一APIアクセスは、プロバイダー非依存のアーキテクチャを構築するという目標に自然に適合しました。企業顧客は展開の柔軟性を求め、推論トラフィックが適切に管理されたAWSのフットプリント内に留まることに自信を持つ必要があります。Amazon Bedrockとの統合により、CouchbaseはCapella iQ内のAI支援ワークフローに対してAWSのセキュリティ姿勢、データ居住制御、およびコンプライアンス認証(SOC、HIPAA、ISO)の利点を顧客に提供します。
エンジニアリングの考慮事項
Amazon Bedrockはインフラストラクチャの複雑さを大幅に簡素化しましたが、企業規模での生産グレードのマルチモデル推論レイヤーを構築することは独自の課題をもたらしました。
- クロスリージョンのフェイルオーバーテスト:最も重要な課題は、クロスリージョンのフェイルオーバーシナリオの検証中に発生しました。us-east-1とus-west-2間で推論トラフィックが正しくルーティングされることを確認するために、部分的なエンドポイントの劣化や地域のスロットリングを含むさまざまな障害モードの下でテストを行う必要がありました。チームはAWSと密接に連携し、リクエストが健康なリージョンに自動的に再ルーティングされ、レスポンスの品質やレイテンシに影響を与えないことを確認し、プロダクションの準備のためにタイムアウトとリトライ設定を調整しました。
- スケールでのモデルベンチマーキング:複数の候補モデルにわたって包括的なベンチマークを実行することは、結果を公平に比較する上での複雑さをもたらしました。トークン化、コンテキストウィンドウの処理、レスポンスフォーマットの違いは、スコアを意味のあるものとして比較する前に慎重に正規化する必要がありました。チームは自動評価パイプラインを構築し、再現性を促進し、モデル選択時の手動のオーバーヘッドを削減しました。
学んだ教訓
- プロバイダーの抽象化は利益をもたらす:プロバイダーの抽象化レイヤーに早期に投資することで、Capella iQのユーザー体験を損なうことなくBedrock統合が可能になり、新しいモデルやプロバイダーを採用するための長期的な柔軟性を維持できます。
- クロスリージョン推論は運用を簡素化する:CRISは、事前にプロビジョニングされたキャパシティやカスタムフェイルオーバーロジックなしでリージョン間の変動するワークロードを処理し、サービスの可用性を向上させ、運用の複雑さを軽減しました。
- マルチモデルの準備には専用の投資が必要:生産グレードのマルチモデルサポートには、ベンチマーキングインフラストラクチャ、プロンプトエンジニアリング、可視性への持続的な投資が必要です。チームはこれを一度きりのセットアップではなく、継続的な作業ストリームとして計画すべきです。
今後の計画
Couchbaseは、Amazon Bedrockのカスタムモデルインポート機能を通じて、微調整された小型モデルの展開によるコスト最適化を積極的に探求しています。インデックス推奨やクエリ説明などの高ボリュームで明確に定義されたワークロード向けに、タスク固有の知識を軽量モデルに凝縮することで、チームは推論ごとのコストを削減しつつ、品質を維持することを目指しています。Claude Sonnet 4.5から始めて、新しいモデルが利用可能になるにつれて進化するこのアプローチは、マルチモデルアーキテクチャの価値を示しています:適切なタスクに対して適切なモデルを選択し、単一の管理されたインフラストラクチャ内で最新のモデルの進歩を継続的に採用することです。
結論
CouchbaseがCapella iQのためにAmazon Bedrockを採用したことは、SaaSアプリケーション内でレジリエントなマルチモデルAIアーキテクチャを構築する方法を示しています。生産環境では、Amazon Bedrock上のClaude Sonnet 4.5がCapella iQのコアワークフロー全体で約76%の精度を達成しました。レイテンシとスループットの目標は許容範囲内で達成され、制御されたトラフィックテスト中にユーザーに影響を与える品質の後退は観察されませんでした。エンドユーザーは、Capella iQから期待される同じ品質と応答性を体験し、今やAmazon Bedrockの管理されたインフラストラクチャとクロスリージョンのレジリエンスに支えられています。プロバイダー非依存のアーキテクチャと厳格な評価フレームワークを整備することで、Couchbaseは新しい基盤モデル(Claude Sonnet 5や将来の世代を含む)を迅速に評価し、採用するための良好な位置にあります。プロバイダーの抽象化、段階的な展開、標準化されたベンチマーキングに投資することで、Couchbaseはモデルの進化をコード変更ではなく設定の選択として扱う生産グレードの実装を提供し、開発者体験を損なうことなく実現しました。
ソリューションの概要
以下の図は、Amazon Bedrockとの統合におけるCapella iQの生産アーキテクチャを示しています。
このアーキテクチャは、AWSのコントロールプレーン内にホストされ、2つのAWSリージョン(us-east-1およびus-west-2)にまたがって高可用性を実現しています。us-east-1内では、Amazon Elastic Kubernetes Service(Amazon EKS)クラスターがCapella iQのマイクロサービスを実行しています。
- cp-apiポッド:開発者からのリクエストを受け取り、推論呼び出しを調整する主要なAPIサービスです。このポッドは、仮想プライベートクラウド(VPC)インターフェースエンドポイントを介してAmazon Bedrockの呼び出しを転送します。
- cp-internal-apiポッド:内部サービス間の通信とモデルルーティングロジックを処理します。
- cp-nsポッド:モデルベンダー設定、テナントレベルのオーバーライド、組織の好みを含む名前空間レベルの設定を管理します。
Amazon VPCインターフェースエンドポイントは、EKSクラスターからAmazon Bedrockランタイムへのプライベート接続を提供します。このエンドポイントは、推論トラフィックをAWSが管理するBedrockのインフラストラクチャにルーティングし、米国の地理的範囲内でのクロスリージョン推論(CRIS)をサポートし、自動フェイルオーバー、負荷分散、需要の急増時の可用性向上を実現します。
動作の仕組み
開発者がCapella iQと対話する際、SQL++クエリの要求、インデックス推奨のリクエスト、またはマルチターンの会話を続ける場合、リクエストはこのパイプラインを通じてエンドツーエンドで処理されます。
- リクエストの取り込み:開発者の自然言語リクエストがcp-apiポッドに到着します。認証を処理し、セッションコンテキストを取得し、リクエストタイプに適したプロンプトテンプレートを決定します。
- 推論の調整:cp-apiポッドは推論ペイロードを組み立て、プロンプトを構築し、マルチターンのコンテキストのために会話履歴を注入し、cp-nsポッドからのテナント固有のモデル設定を適用します。cp-internal-apiポッドはモデルベンダーの選択と組織レベルのルーティングオーバーライドを解決します。
- プライベートモデルの呼び出し:cp-apiポッドはリクエストをVPCインターフェースエンドポイントを介してAmazon Bedrockランタイムに転送します。完全なプロンプトとレスポンスペイロードはAWSインフラストラクチャ内に留まり、公共のインターネットを通過することはありません。この設計は、企業のセキュリティおよびデータ居住要件を満たします。
- クロスリージョン推論:Amazon Bedrockは、クロスリージョン推論を使用して推論リクエストを最適な米国リージョン(us-east-1、us-east-2、またはus-west-2)に自動的にルーティングし、リクエストを米国の地理的境界内に保持します。需要の急増や地域の劣化時には、リクエストはアプリケーションレベルのロジックや手動の介入なしに利用可能なリージョンにルーティングされます。
- レスポンスの配信:モデルのレスポンス(生成されたSQL++、インデックス推奨、または会話の返信)は、同じプライベートパスを通じてストリーミングされます。cp-apiポッドはレスポンスの正規化とフォーマットを適用し、結果をCapella iQインターフェース内の開発者に提供します。会話の状態はマルチターンの継続性のために保持されます。
この設計により、モデルのアップグレードやプロバイダーの変更は、名前空間レイヤーでの設定更新のみで済み、コードの変更やダウンタイムは不要で、開発者体験に影響を与えません。
モデル評価
生産用のモデルを選定する前に、チームはSQL++生成、インデックス推奨、クエリ説明、iQインサイト生成、マルチターン会話をカバーするベンチマークスイートを確立しました。Bedrockで利用可能な複数のモデルが標準化されたプロンプト/レスポンステストセットを使用して評価され、スコアリングは機能的正確性、決定論、レイテンシ、フォーマットの一貫性の4つの次元に焦点を当てました。AnthropicのClaude Sonnet 4.5は、BIRDメソッドに基づく内部評価で約76%の精度を達成し、評価されたすべてのワークフローで生産品質基準を満たし、重大な後退は見られませんでした。これにより、Claude Sonnet 4.5がCapella iQの多様なワークロードプロファイルに対する初期の生産モデルとして検証され、構造化されたコード生成、自然言語説明、マルチターン推論を網羅しました。さらに重要なのは、Couchbaseが新しいモデルを迅速に評価し、Amazon Bedrockで利用可能になるにつれて採用するのを助けるモデル評価フレームワークが検証されたことです。
Amazon Bedrockの利点
Amazon Bedrockは、モデルインフラストラクチャを管理する必要を排除する完全に管理されたサーバーレス推論環境を提供します。成長する基盤モデルのカタログを提供し、Couchbaseは新しいモデル世代を評価し、採用することができます。
Couchbaseにとって、Amazon Bedrockを通じて複数のモデルファミリーへの単一APIアクセスは、プロバイダー非依存のアーキテクチャを構築するという目標に自然に適合しました。企業顧客は展開の柔軟性を求め、推論トラフィックが適切に管理されたAWSのフットプリント内に留まることに自信を持つ必要があります。Amazon Bedrockとの統合により、CouchbaseはCapella iQ内のAI支援ワークフローに対してAWSのセキュリティ姿勢、データ居住制御、およびコンプライアンス認証(SOC、HIPAA、ISO)の利点を顧客に提供します。
エンジニアリングの考慮事項
Amazon Bedrockはインフラストラクチャの複雑さを大幅に簡素化しましたが、企業規模での生産グレードのマルチモデル推論レイヤーを構築することは独自の課題をもたらしました。
- クロスリージョンのフェイルオーバーテスト:最も重要な課題は、クロスリージョンのフェイルオーバーシナリオの検証中に発生しました。us-east-1とus-west-2間で推論トラフィックが正しくルーティングされることを確認するために、部分的なエンドポイントの劣化や地域のスロットリングを含むさまざまな障害モードの下でテストを行う必要がありました。チームはAWSと密接に連携し、リクエストが健康なリージョンに自動的に再ルーティングされ、レスポンスの品質やレイテンシに影響を与えないことを確認し、プロダクションの準備のためにタイムアウトとリトライ設定を調整しました。
- スケールでのモデルベンチマーキング:複数の候補モデルにわたって包括的なベンチマークを実行することは、結果を公平に比較する上での複雑さをもたらしました。トークン化、コンテキストウィンドウの処理、レスポンスフォーマットの違いは、スコアを意味のあるものとして比較する前に慎重に正規化する必要がありました。チームは自動評価パイプラインを構築し、再現性を促進し、モデル選択時の手動のオーバーヘッドを削減しました。
学んだ教訓
- プロバイダーの抽象化は利益をもたらす:プロバイダーの抽象化レイヤーに早期に投資することで、Capella iQのユーザー体験を損なうことなくBedrock統合が可能になり、新しいモデルやプロバイダーを採用するための長期的な柔軟性を維持できます。
- クロスリージョン推論は運用を簡素化する:CRISは、事前にプロビジョニングされたキャパシティやカスタムフェイルオーバーロジックなしでリージョン間の変動するワークロードを処理し、サービスの可用性を向上させ、運用の複雑さを軽減しました。
- マルチモデルの準備には専用の投資が必要:生産グレードのマルチモデルサポートには、ベンチマーキングインフラストラクチャ、プロンプトエンジニアリング、可視性への持続的な投資が必要です。チームはこれを一度きりのセットアップではなく、継続的な作業ストリームとして計画すべきです。
今後の計画
Couchbaseは、Amazon Bedrockのカスタムモデルインポート機能を通じて、微調整された小型モデルの展開によるコスト最適化を積極的に探求しています。インデックス推奨やクエリ説明などの高ボリュームで明確に定義されたワークロード向けに、タスク固有の知識を軽量モデルに凝縮することで、チームは推論ごとのコストを削減しつつ、品質を維持することを目指しています。Claude Sonnet 4.5から始めて、新しいモデルが利用可能になるにつれて進化するこのアプローチは、マルチモデルアーキテクチャの価値を示しています:適切なタスクに対して適切なモデルを選択し、単一の管理されたインフラストラクチャ内で最新のモデルの進歩を継続的に採用することです。
結論
CouchbaseがCapella iQのためにAmazon Bedrockを採用したことは、SaaSアプリケーション内でレジリエントなマルチモデルAIアーキテクチャを構築する方法を示しています。生産環境では、Amazon Bedrock上のClaude Sonnet 4.5がCapella iQのコアワークフロー全体で約76%の精度を達成しました。レイテンシとスループットの目標は許容範囲内で達成され、制御されたトラフィックテスト中にユーザーに影響を与える品質の後退は観察されませんでした。エンドユーザーは、Capella iQから期待される同じ品質と応答性を体験し、今やAmazon Bedrockの管理されたインフラストラクチャとクロスリージョンのレジリエンスに支えられています。プロバイダー非依存のアーキテクチャと厳格な評価フレームワークを整備することで、Couchbaseは新しい基盤モデル(Claude Sonnet 5や将来の世代を含む)を迅速に評価し、採用するための良好な位置にあります。プロバイダーの抽象化、段階的な展開、標準化されたベンチマーキングに投資することで、Couchbaseはモデルの進化をコード変更ではなく設定の選択として扱う生産グレードの実装を提供し、開発者体験を損なうことなく実現しました。