コスト最適化された文書処理のためのNova 2 LiteとClaudeの連携
サマリー
Amazon Nova 2 LiteとClaude Sonnet 4.6を組み合わせることで、スキャンされた文書のデジタル化を効率化する方法を紹介します。2モデルパイプラインを用いることで、コストを大幅に削減しつつ高精度な名前と顔の関連付けを実現しました。336ページのテストで93%以上の高い信頼度を達成しました。
本文
スキャンされた年鑑ページには176の印刷された名前、4つのポートレート写真、そしてそれらを結びつける機械可読構造がありません。このページをデジタル化するには、信頼性の高い写真検出と正確な名前抽出が必要です。また、ページレイアウトに基づいてどの名前がどの顔に属するかを判断する方法も必要です。本記事では、Amazon Nova 2 LiteとAnthropicのClaude Sonnet 4.6を組み合わせることで、スキャンされた文書を効率的にデジタル化するソリューションを紹介します。私たちは、スキャンされた年鑑ページをデジタル化するための2モデルパイプラインをAmazon Bedrock上に構築しました。Amazon Nova 2 Liteは、写真の検出、可視名の抽出、ページレベルのメタデータの返却を単一の呼び出しで処理します。その後、Claude Sonnet 4.6がページレイアウトに基づいて名前と顔をマッチングするための空間推論を行います。このパイプラインを336ページのスキャンされた年鑑に対して実行した結果、3,122の名前と顔の関連付けを生成し、その93%が0.95以上の信頼度を示しました。この2モデルアプローチは、全てのタスクを1つのビジョン・ランゲージモデルに送信する単一モデルの代替案に比べて、ページあたり約3分の2のコストで済みます。