本文へ移動

びじゅあるくえすちょんあんさりんぐ

Visual Question Answering

VQA

画像とそれに対する質問を入力して回答を得るマルチモーダルタスクです。

詳しい説明

Visual Question Answering(VQA)は、画像とそれに関する自然言語の質問を入力として、その質問に対する答えを自然言語で出力するマルチモーダルなタスクです。AIに画像を見せ、それについて人間が対話形式で問いかける状況を想定しています。

仕組みとしては、CNNなどで画像から特徴を抽出し、RNNやTransformerなどでテキストを処理します。これらを統合し、画像の情報とテキストの文脈を組み合わせて回答を推論します。視覚情報と言語情報の両方を深く理解する必要があるため、AIの統合的な知能を測るベンチマークとしても利用されます。

G検定では、マルチモーダル学習の代表的な応用例として問われます。画像認識技術と自然言語処理技術を「組み合わせる」ことがポイントです。単に画像を見るだけ、文章を読むだけではなく、両者を照らし合わせて推論するという、AIの応用の方向性を理解しておくことが重要です。

試験で問われること

G検定

  • 画像とテキストを組み合わせたマルチモーダル学習のタスクであることを理解する
  • AIの統合的な推論能力を測る指標として知る
  • 画像認識と自然言語処理の両方の技術が統合されている点を押さえる