世界を埋め込む:大規模な検索可能な空中画像のためのマルチモーダルAI
サマリー
空中画像を自然言語で検索可能な知識ベースに変換するためのマルチモーダルAIの活用法を紹介。Vexcelとの協力により、空中画像の検索精度を向上させるための新しいアプローチが開発されました。これにより、手動での検査や個別のモデル訓練が不要になります。
本文
空中画像のライブラリを自然言語で検索可能な知識ベースに変換することは、地理空間データに依存するすべての業界(保険、不動産、政府、インフラ、農業など)に関わる問題です。従来の方法では、手動でタイルごとに検査するか、新しい質問ごとに特注のコンピュータビジョンモデルを訓練する必要があります。しかし、AWSのマルチモーダル埋め込み、大規模言語モデル(LLM)によるキャプション生成、ベクトル検索を使用することで、より迅速な代替手段が提供されます。私たちは、世界最大級の空中画像プログラムを運営するVexcelと協力し、埋め込みモデル、融合戦略、キャプション統合、マルチビュー空中画像における検索方法を評価しました。Vexcelは、45か国以上で高解像度データを収集し、オルソモザイク画像や複数の角度からの斜め画像、標高モデルを提供しています。このデータを活用することで、数十億のピクセルを現実世界に関する回答に変換するための迅速な方法が求められています。