「マルチモーダルAIとは」動画の書き起こし:
「AI Research Lab Explained、Salesforceシリーズへようこそ。このシリーズでは、私たちのチームが実験中の最先端AI技術を紹介しています。複雑な概念をかみ砕いて解説し、研究現場からの実践的なインサイトを共有します。Juan Carlos Nieblesです。SalesforceでAI研究チームを統括しています。
AIで注目される分野のひとつがマルチモダリティです。これは、AIモデルがテキストだけでなく音声や画像も理解する能力のことです。このセグメントではマルチモダリティに焦点を当てます。私たちの研究がマルチモダリティに注目しているのはなぜでしょうか?さて、皆さんが世界とどのように関わっているかを考えてみてください。テキストメッセージ、写真の共有、動画の録画、ボイスメモの送信など、毎日さまざまな種類のデータやモダリティをシームレスに切り替えています。AIも同じようにすべきではないでしょうか?現実の知性は一面的ではありません。
そこでマルチモーダルAIの出番です。テキストのみのチャットボットや画像分類など、1種類の入力しか処理できない従来のAIモデルとは異なり、マルチモーダルモデルは複数の情報源を融合し、より豊かでコンテキストに即した世界の理解を構築します。たとえば、マルチモーダルAIシステムに動画を見せて、「ここで何が起こっていますか?」と尋ねたとします。音声や1フレームだけを分析するのではなく、映像とフレームのシーケンスを同時に処理し、物体の特定、発話認識、シーン全体の理解を行ってから、意味のある回答を生成します。
では、実際にマルチモーダルAIをどのように構築するのか見ていきましょう。マルチモーダルAIは、視覚モデル、発話モデル、テキストモデルなど複数のモデルを統合し、効果的に相互接続するようトレーニングすることで動作します。概念的には、まずテキストトークンを理解するLLMのような言語モデルから始めます。マルチモーダル機能を有効にするために、トランスレーターとして機能するニューラルネットワークモジュールを導入します。各トランスレーターの役割は、画像のピクセルデータなど、特定のモダリティの入力をLLMが理解できる形式に変換することです。これで、LLMと追加モジュールを統合し、テキストと画像の両方を理解できるAIシステムになります。さらに、音声、動画、センサーデータなど、モダリティを追加するたびに、新しいモジュールを1つずつ導入することで、さまざまなタイプのデータを理解できるマルチモーダルAIシステムが実現します。
この概念を実現するには、AIシステムをトレーニングする必要があります。これは、サンプルデータでシステムを最適化する機械学習プロセスです。画像からトークンに変換するモジュールなどの各変換モジュールは、単独で、または他のモジュールと併せてトレーニングすることができます。このトレーニングにより、モジュールは画像コンテンツをLLMが理解できるベクトル空間に正確にマッピングできるようになります。トレーニングが完了すると、LLMは新しい入力経路を獲得し、画像を処理し、そのコンテンツにもとづいて応答を生成できるようになります。このプロセスを繰り返すことで、音声やセンサーデータなど、さらに多くのモダリティを追加することが可能です。
面白いことに、私たちのトレーニング後の研究によれば、このマルチモーダルAIシステムは各モダリティを個別に理解するだけでなく、モダリティを横断する質問にも答えることができます。たとえば、サッカー場の画像とギターの音声クリップを提示して、AIシステムに「どちらの入力がミュージシャンに関係していますか?」と尋ねることができます。このようなクロスモーダル推論は、マルチモーダルAIの重要な機能です。
では、マルチモダリティはAIエージェント型システムにどのように組み込まれるのでしょうか?マルチモーダルAI機能をAIエージェントフレームワークに統合することで、AIエージェントにさまざまな種類のデータと効果的にインタラクションさせることが可能になります。たとえば、マルチモーダルエージェントは画像を分析してその内容を推論できます。オブジェクトの数を数えたり、複数の画像にまたがるパターンを特定したりできます。その他にも、マルチモーダルエージェントはWebページと視覚的にインタラクションしたり、テキストを読んだり、ボタンをクリックしたり、リアルタイムでフォームに記入したりすることも可能です。さらに、このようなマルチモーダルAIエージェントは、将来的に便利なロボットを実現するためのロボットの頭脳として重要な役割を果たします。これらのロボットは、イメージセンサーで環境を知覚できるだけでなく、言語で人間のユーザーと会話することも可能になります。
これがマルチモーダルAIの力です。さまざまなタイプのデータを組み合わせることで、より深いインサイトとより良い成果を生み出します。マルチモーダルAIは、テキスト、画像、音声を超えた存在です。私たちが世界を解釈するのと同じように、AIが世界を理解できるよう支援することなのです。SalesforceのマルチモーダルAI研究の技術的詳細について、より深く知りたい方は説明欄のリンクをご確認ください。私たちのチームの特筆すべき研究成果の一つに、BLIPとしても知られるxGen-MMがあります。これは、高度な視覚言語理解を目的として、テキスト、画像、動画処理を統合したモデルであり、以下ですべて読むことができます。この動画が参考になりましたら、高評価ボタンとAI Research Labのチャンネル登録をお願いします。最後までご覧いただきありがとうございました。また次回お会いしましょう!」