本文へ移動

ゆにふぁいどあいおー

Unified-IO

画像やテキストなど異なるモダリティを統一的なトークンとして扱い、一つのモデルで多様なタスクをこなすマルチモーダルモデルです。

詳しい説明

Unified-IOとは、画像、テキスト、音声など、異なる種類の入力と出力を統一されたインターフェースで扱うマルチモーダルモデルです。一つのモデルが多様なタスクをこなす汎用的なAIを目指すアプローチから生まれました。

仕組みとして、様々な種類のデータ(画像、テキスト、音声)を共通のトークン表現に変換し、それをTransformerベースのモデルに入力します。これにより、画像分類、画像生成、文章生成、翻訳など、本来個別のモデルが必要だったタスクを、一つの汎用的なモデルで対応可能にします。

G検定では、AIのトレンドである「汎用的なモデル」への移行を象徴する用語として重要です。単一タスク特化型(特化型AI)から、様々な入力を受け取り回答を出力できるマルチモーダルなモデルへの進化の流れの中で理解しておくべき概念です。特定のタスクに限定されない柔軟な学習が強みであることを押さえてください。

試験で問われること

G検定

  • マルチモーダル学習の進化系モデルであることを理解する
  • 多様な入出力を共通化して扱うアーキテクチャを知る
  • 単一タスク特化型から汎用的なAIへのトレンドを押さえる