AI注目記事のキュレーターページ

← 一覧へ戻る

重要度 高2026-06-30 16:26:48

Amazon Novaモデルを微調整して正確なメールデータ抽出を実現する方法

サマリー

Amazon Novaモデルを微調整することで、eコマースメールからのデータ抽出精度を94.77%に向上させ、コストを50%削減する方法を紹介します。Parcel Performとのコラボレーションにより、モデルのハルシネーションを減少させ、推論レイテンシを30%以上削減しました。これにより、効率的なメール処理が可能になります。

本文

著者は、Karan Bhandarkar、Sue Cha、Yash Shah、Nieves Garciaに感謝の意を表します。毎日数百万通のメールを処理する場合、Amazon Novaモデルの微調整は、正確なデータ抽出を自動化し、コストとハルシネーションを削減するのに役立ちます。Parcel Performは、シンプルな通知から複雑なHTML文書まで多様なメール形式から構造化情報を抽出する際に直面した課題を解決しました。一般的な課題には、モデルのハルシネーション、類似データタイプ(注文番号と追跡番号など)間の混乱、HTML形式のメール処理時のトークンコストの高さが含まれます。この投稿では、Amazon SageMaker AIを使用してAmazon Novaモデルを微調整することで、これらの特定の問題に対処し、モデルが正確なデータパターンを認識し、類似フィールドを区別し、情報をより効率的に処理できるようにする方法を学びます。これにより、抽出精度は最大94.77%に達し、コストは50%削減されました。

Parcel Performは、顧客の旅全体にわたってビジネスおよび技術コンサルティングを提供するAWS Generative AI Innovation Center(GenAIIC)と協力しました。Parcel Performの問題文から逆算して、さまざまなカスタマイズ技術とパラメータ最適化を通じてNovaモデルを最適化するプロジェクトをスコープしました。このコラボレーションにより、精度、レイテンシ、コストの複数の指標を同時に改善することができました。Parcel PerformのAIチームリーダーであるLe Vyは、微調整されたNova Microモデルがテストデータセットで最大94.77%の抽出精度を達成し、ベースラインに対して最大16.6ポイントの改善を報告しました。微調整されたNova Microは、推論レイテンシを30%以上削減し、Parcel Performの以前のモデルと比較してコストを半分にしました。これらの結果を受けて、Parcel Performはソリューションを本番環境に移行し、eコマースの物流業務を改善しました。

このソリューションでは、Amazon SageMaker AIを使用して、eコマースメールからの専門的なエンティティ抽出のためにAmazon Nova LiteおよびAmazon Nova Microモデルを適応させることができます。このソリューションは、Low-Rank Adaptation(LoRA)を通じたパラメータ効率的微調整(PEFT)を使用した監視付き微調整(SFT)を利用します。PEFTを使用すると、限られたトレーニングデータでモデルを効果的にカスタマイズし、計算効率を維持できます。また、PEFTを使用してモデルをAmazon Bedrockにデプロイし、トークンごとに価格設定されたオンデマンド推論で呼び出すこともできます。Amazon Bedrockは柔軟なデプロイオプションを提供します:PEFTを使用すると、オンデマンド推論を使用してデプロイできますが、フルランクSFTはAmazon BedrockのプロビジョニングスループットまたはSageMaker AIエンドポイントを介してデプロイをサポートします。カスタムモデルの微調整は、Amazon Novaレシピを使用します。これは、モデルカスタマイズジョブを実行する方法に関する詳細をAmazon SageMaker AIに提供するYAML構成ファイルです。以下の図は、ソリューションアーキテクチャを示しています。

ワークフローは次のように機能します:
1. Amazon Bedrock会話形式でトレーニングデータを準備します。メールコンテンツを入力として、抽出されたエンティティを出力として使用します。
2. トレーニングデータをAmazon Simple Storage Service(Amazon S3)にアップロードします。
3. Low-Rank Adaptation(LoRA)構成を使用してSageMaker AIで微調整ジョブを作成します。
4. Amazon Bedrockを使用して微調整されたモデルをデプロイし、オンデマンド推論を実行します。
5. 新しいメールからエンティティを抽出するために推論を実行します。

このソリューションを実装するには、トレーニングデータを前述の形式で準備することから始めます。意味のある結果を得るためには、少なくとも1,300サンプルのデータセットから始めてください。最適な結果を得るためには、トレーニングデータが本番で遭遇するさまざまなメール形式を表していることを確認してください。類似のエンティティ抽出の課題に直面している場合は、SageMaker AIモデルのカスタマイズを使用して、正確で本番環境に適したソリューションを構築できます。このアプローチは、Nova MicroやNova Liteのような迅速かつコスト効果の高いモデルを本番使用ケースに適応させ、精度、速度、コスト効率を提供する方法を示しています。

Contact us

ご質問・ご相談等ございましたらお気軽にご相談ください。

  • フォームでのご相談
    フォームでのご相談

    ホームページ制作、運用・更新における
    ご相談はお気軽にご連絡ください。

    お問い合わせ・ご相談
  • お電話でのお問い合わせ
    お電話でのお問い合わせ

    お電話でのご相談も随時受け付けております。
    見積依頼などもお気軽にご連絡ください。

    052-700-8712 平日 10:00~19:00