本文へ移動

てきすととぅいめーじ

Text-To-Image

テキスト記述から画像を生成する技術で、現在は拡散モデルが主流です。プロンプトを入力してノイズから画像を復元します。

詳しい説明

Text-To-Imageとは、テキストのプロンプトを入力として、それに適合する画像を生成する技術です。近年の深層学習の発展により、驚くほど高精細で意味的に整合性の取れた画像を生成できるようになりました。画像生成AIの代表的な用途として注目を集めています。

仕組みとしては、拡散モデル(Diffusion Model)が主流です。ノイズの除去過程を学習し、テキスト条件に従ってランダムなノイズから目的の画像を復元します。Stable DiffusionやDALL-Eといったモデルが登場し、専門的なスキルがなくても高品質なイラストや写真が作成可能になりました。

G検定では、生成モデルの代表的なタスクとして理解しておく必要があります。従来のGANとの違いや、拡散モデルがどのように確率分布からデータを生成するかの基礎的な概念が問われます。また、著作権や倫理的な課題といった、実務で重要となる社会的な側面とセットで把握しておくことが推奨されます。

試験で問われること

G検定

  • 拡散モデルを利用した画像生成技術として分類されることを理解する
  • テキストを条件とした画像生成が現在の主流である背景を知る
  • 倫理的な課題や著作権との関係性を実務的な視点で押さえる