本文へ移動

びじょんとらんすふぉーまー

Vision Transformer

ViT = Vision Transformer

自然言語処理で成功したTransformerを画像認識に応用したモデルです。画像を小さなパッチに分割してトークンとして扱い、CNNを使わずに画像内の長距離の依存関係を学習します。

詳しい説明

自然言語処理で大きな成功を収めたTransformerモデルを、画像認識に応用したモデルです。画像を小さなパッチ(断片)に分割し、それをトークンとして扱うことで、CNNを使わずに画像内の長距離の依存関係(画像の異なる領域同士のつながり)を学習します。CNNよりも大規模なデータセットで学習させた場合に高い精度を発揮する傾向があり、画像認識の新しい潮流となっています。

試験で問われること

G検定(ジェネラリスト検定)

  • Transformerを画像処理に転用したものであることを理解する
  • CNNのように畳み込みを行わず、画像をパッチに分割して処理する
  • 大規模なデータセットで学習させることで高い性能を発揮する