Flo Healthにおける医療コンテンツレビューのスケーリング – Amazon Bedrockを活用した事例(パート2)
サマリー
Flo Healthは、Amazon Bedrockを用いて医療コンテンツレビューと生成システムを構築し、レビュー時間を60%削減し、コンテンツスループットを3倍にしました。AIジャッジを導入し、構造化されたフィードバックループを通じて、医療専門家の効率を向上させています。今後は、信頼度スコアや視覚コンテンツへのアプローチの拡張を検討しています。
本文
この投稿は、Flo HealthのKonstantin Lekh、Sasha Zinchuk、Eugene Sergueev、およびAWSのLiza (Elizaveta) Zinovyevaによって書かれました。本記事では、Flo HealthのエンジニアリングチームがAWS Generative AI Innovation CenterのPoC(概念実証)を、Amazon Bedrockを基盤とした生産レベルのAI駆動の医療コンテンツレビューおよび生成システムに変換した方法を共有します。このシステムは、レビュー時間を60%削減し、医療チームを拡大することなくコンテンツのスループットを3倍にしました。具体的には、(1) Flo Healthのコンテンツパイプラインに合わせたPoCアーキテクチャの適応、(2) 異なるレビュー次元に特化したAIジャッジの実装、(3) Retrieval Augmented Generation (RAG)を用いたAIコンテンツ生成システムの構築、(4) プロンプトエンジニアリングと生産展開から得た教訓について説明します。Flo Healthでは、アプリ内のストーリーや記事からオンボーディングフロー、マーケティング資料に至るまで、数百万のユーザーの健康の旅をサポートする多様なコンテンツを作成しています。すべてのコンテンツは、厳格な医療精度基準を満たす必要があります。AIツールを統合してコンテンツ作成を加速させたものの、医療レビューは依然として重要なボトルネックでした。医療専門家は、記事ごとに平均7日間をかけて事実を確認し、信頼できる情報源と照らし合わせて参照をチェックし、10項目の医療精度チェックリストに従ってコンプライアンスを促進しています。この徹底したプロセスは、信頼と安全を維持するために不可欠ですが、コンテンツ生産のスケーリングを制限していました。医療レビューを拡大することは、資格を持つ医療専門家が不足しているため、採用が困難で時間がかかり、専門チームの拡大コストも高いため、持続可能ではありませんでした。一般的なAIツールは印象的な能力を示していますが、医療コンテンツレビューには重大なリスクがあります。これらのシステムは、基礎となる参照や事実に基づかない情報を生成することがあり、これを「幻覚」と呼びます。Floでは、数百万のユーザーが教育コンテンツを利用して自分の体や健康を理解しているため、正確性と信頼性が最も重要です。信頼できる医療情報源からのみ情報を提供し、提示する情報のすべてに明確な参照を持つように設計されたソリューションが必要でした。PoCの成功は、医療コンテンツレビューへのアプローチを変革するエキサイティングな機会を提供しました。私たちは、医療専門家の能力を拡張しながら、継続的な検証を通じて信頼を構築する段階的な採用戦略を選びました。私たちの生産実装は、三層の検証アプローチに従います。まず、システムは内部の医療ガイドラインに対してコンテンツをチェックし、潜在的な問題をフラグし、確立されたルールに基づいて修正を提案します。次に、信頼できる外部の医療情報源(エビデンスに基づく臨床意思決定ツールや査読付きジャーナル、規制機関など)に対してコンテンツを検証します。最後に、医療専門家がAIによって注釈されたコンテンツをレビューし、適用されたルールを強調表示し、関連する情報源への直接リンクを提供する簡素化されたインターフェースで確認します。私たちの主な成功指標は、レビュー時間の短縮と専門家による修正の必要数の最小化に焦点を当てています。AIレビューシステムの統合により、コンテンツ作成者と医療レビュー担当者の間のフィードバックループが短縮され、より質の高いコンテンツが人間のレビュー段階に到達し、反復回数が減少します。Flo Healthでは、MACROSアーキテクチャをFloのコンテンツモデルに合わせて調整し、各レビュー次元に特化したAIジャッジを作成しました。各ジャッジは特定のレビュー次元に焦点を当て、医療精度、法的コンプライアンス、ブランドスタイルなどに対応しています。私たちは、異なるモデルで各ジャッジをテストし、必要な品質基準、リスクレベル、レイテンシー、運用コストに基づいて最適なものを選択します。医療安全やその他の高リスクチェックの場合、正確性と信頼性が最優先されます。よりシンプルまたは低リスクのチェックの場合、必要なパフォーマンス基準を満たす場合は、軽量モデルが適切です。このアプローチにより、他のジャッジを変更せずに、各ジャッジを独立して改善することができます。Flo Healthのコンテンツパイプラインは、Amazonによって導入されたMACROSパターンを取り入れ、FloのContentful CMSでの実際の生産に適応しています。提案されたMACROS戦略は、テキストを管理可能なセクションに分割することにより、既存のアーキテクチャに適合します。各ステップは別々のコンテンツエントリとして保存されているため、各ステップを小さな部分に分割して評価に送信します。すべてのコンテンツは、1つのモノリシックなプロンプトではなく、一連のAIジャッジ評価を受けます。これにより、Floは各レビュー次元(医療精度、法的コンプライアンス、ブランドスタイルなど)に対して特化した大規模言語モデル(LLM)プロンプトを実行し、各コンテンツに対して詳細なコメントを得ることができます。ジャッジの回答を得た後、それをさらなる生成AIの修正の入力として使用し、MACROSフローに従います。Amazon Bedrockを使用して、見つかった懸念に対処するためのより良いテキストの提案を生成します。これらの提案は、ContentfulアプリのUIに直接表示され、変更が強調表示されるため、コンテンツ編集者や医療専門家は、好ましいバージョンをレビュー、選択、編集(または元のものを保持)できます。人間のレビュー担当者は、AIを専門のアシスタントとして使用しながら、最終的なコンテンツを決定します。コンテンツエントリは、最終的なコンテンツで更新されます。私たちのAIレビューの各ステージは、1つのフローに接続されており、各ステップの結果は準備ができ次第読み込まれ、ユーザーは遅延を感じることはありません。Amazon Bedrockを基盤としたAIコンテンツレビューのワークフローを成功裏に導入した後、コンテンツ作成を加速させるために同じサービスを再利用したいと考えました。私たちは、ルーチン作業を自動化し、認知負荷を軽減するためのAI生成ツールが必要でした。生成パイプラインは、マルチステージのチェーン・オブ・ソートプロンプトアプローチを使用しています。主要な最適化は、異なる仕事に対してAmazon Bedrock AIモデルの異なるClaudeを使用することでした。軽量な分類やルーチン分析(ユーザーが生成したいステップ数を決定するなど)には、より速く低コストのClaude Haikuモデルを使用します。一方、高忠実度のコンテンツ生成や複雑な推論(微妙な医療説明の草案作成や特定の共感的トーンで段落を再構成するなど)には、より強力なClaude Sonnetモデルを呼び出します。女性の健康のような分野で生成AIツールを構築するには、モデルの外に存在する多くのコンテキストを組み込む必要がありました。これをRAGで解決しました。実際には、LLMを用いた推論の際に、関連情報を知識ベースから収集し、モデルのコンテキストに供給します。例えば、コンテンツを作成する際に、システムは関連するガイドライン、ルール、医療知識、既存のテンプレートや視覚資産の参照を取得します。これらの知識ベースの資料は、製品、編集、医療レビューを含む反復プロセスを通じて開発および維持され、医療チームが安全性の範囲を所有します。また、エビデンスに基づく臨床意思決定ツール、査読付きジャーナル、規制機関の出版物など、信頼できる第三者の医療情報源も統合しました。システムは、生成された各コンテンツとともに使用された情報源のリストを保持し、医療レビュー担当者が手動で検索することなく参照を検証できるようにします。ユーザーエクスペリエンスにおいては、AI生成の各ステージを明確に示し、説明することに重点を置き、ユーザーが早期に不整合を特定できるようにしました。また、各ステージが完了するたびに中間結果を逐次表示することで、ユーザーがパイプラインが完了する前に出力をレビューできるようにし、コンテンツの各要素(画面)間の接続を視覚化することで、ユーザーが繰り返しコンテンツをエクスポートしてテストする必要を軽減しました。私たちのAIコンテンツ生成アーキテクチャは、コンテンツクリエイターが馴染みのあるContentfulアプリ環境から生成リクエストを開始することから始まります。システムは、医療に基づいたガイドラインに沿ったコンテンツを最小限の手動作業で生成するために設計された一連のステップを調整します。リクエストはAmazon API Gatewayを通じてルーティングされ、UIとのリアルタイム通信を維持し、クリエイターは進捗を瞬時に確認できます。コアパイプラインには3つのステップがあります。まず、システムはAmazon S3の知識ベースから関連する医療ガイドライン、ルール、コンテキスト情報をセマンティックサーチを使用して取得します。これにより、生成されたコンテンツは医療知識に基づいています。次に、システムはAmazon Bedrockを通じてAnthropicのClaude Foundation Modelsを使用してコンテンツを構造化し、Amazon S3のテンプレートと資産リポジトリから引き出して、一貫したフォーマットを維持しながら段階的なコンテンツフローを生成します。AWS Lambda関数がこのワークフローを調整します。最後に、生成されたコンテンツが医療精度とブランドガイドラインの遵守をチェックする検証ステップがあります。問題が検出された場合、フィードバックループが自動的に再処理をトリガーし、コンテンツクリエイターは検証された出力のみを受け取ります。私たちの知識ベース、医療参照文書、コンテンツテンプレート、視覚資産はAmazon S3に保存され、Amazon DynamoDBがパイプライン全体の状態とメタデータを管理します。AWS Step Functionsがエンドツーエンドのワークフローを調整し、モジュラー設計により、新しいコンテンツタイプや検証要件が出現した際に拡張可能です。これらの生成AIツールの開発は、プロンプトエンジニアリングの実際の適用に関する貴重な洞察を私たちに提供しました。YAMLはJSONよりも出力フォーマットとしてはるかに堅牢であり、そのインデントベースの構造はより寛容で、無効な出力が少なく、デバッグが容易です。初期の実装以来、Amazon Bedrockは構造化された出力を導入し、APIレベルでスキーマに沿ったJSONレスポンスを強制することができ、同様のフォーマットの一貫性の課題に直面しているチームにとっては実行可能な代替手段となる可能性があります。プロジェクトが進むにつれて、ルールセットが膨大になり、時には矛盾が生じ、モデルが正しく優先順位を付けることが難しくなりました。ルールを具体的な例で補強することで、モデルに実際に何を意味するのかを示すことができ、エラーの大幅な削減につながりました。少数の例が出力の遵守を一貫して改善しました。私たちの生産戦略は、AIが人間の専門知識を置き換えるのではなく、強化することに中心を置いています。AIは、医療主張の検証が必要な潜在的な問題をフラグし、専門家の注意が必要なセクションを特定し、医療ガイドラインに対する初期のコンプライアンスチェックを実行します。これにより、専門家の出発点が空白のページから、明確な焦点領域を持つ事前注釈付き文書に変わります。ライターは、医療精度、スタイルの遵守、引用要件に関する即時のフィードバックを受け取り、医療専門家のレビューに達する前に問題をキャッチします。医療専門家は、AIによって注釈されたコンテンツを受け取り、懸念点、提案された修正、関連する事前調査済みの情報源を強調表示し、AIの洞察と人間の判断を必要とする複雑な医療のニュアンスの検証に集中できます。すべての専門家の修正を再利用可能なルールや例としてキャプチャすることで、私たちは、各レビューサイクルごとに賢く成長するシステムを構築し、繰り返しのエラーを70%以上削減しました。このアプローチにより、ルーチンのコンプライアンス修正が80%削減され、コンテンツごとの平均レビュー時間が60%短縮されました。医療チームを拡大することなく、コンテンツのスループットを3倍にしました。具体性は一般化に勝ります。私たちの医療ガイドライン、情報源の階層、コンテンツ基準に特化して構築し、各ジャッジを合成および実際の匿名化されたケースを組み合わせた事前定義されたテストセットに対して測定することで、初回の正確性が一貫して改善され、AI出力の完全な再検証の必要性が減少しました。システムの能力を拡張するにつれて、コンプライアンスの履歴、ガイドラインの優先度、複雑さに基づいて医療専門家と共に定義された信頼度スコアの探索を進めています。特定の閾値を超えるコンテンツは迅速なレビューを受け、高リスクのコンテンツは追加の精査を受けます。また、視覚コンテンツへのアプローチを拡張し、インフォグラフィック、イラスト、その他の視覚資料が同じ厳格な基準を満たすことを確認することも検討しています。同様の実装を検討している組織に対しては、以下を推奨します。明確で文書化された基準から始めること。初日から継続的な学習を設計すること。効率と品質の両方を測定すること。ユーザーエクスペリエンスに投資すること。信頼が成功を示すことで構築されるため、段階的な展開を計画すること。Flo Healthでは、このアプローチにより、高いコンテンツ基準を維持しながら、能力を拡大することができました。この記事では、Flo HealthのエンジニアリングチームがMACROSの概念実証を、Amazon Bedrockを使用した生産準備が整った医療コンテンツレビューおよび生成システムに変換した方法を示しました。成功の鍵は、完全な自動化ではなく、特化したAIジャッジ、構造化されたフィードバックループ、および厳格な医療精度基準を維持しながらコンテンツスループットを増加させるための階層的なモデル選択戦略の組み合わせでした。類似のコンテンツレビューまたは生成システムを構築することを検討している場合は、まずドメイン固有の品質基準を定義し、その基準に対して特化したAIジャッジをプロトタイプするためにAmazon Bedrockを使用してください。