びじょんとらんすふぉーまー
Vision Transformer
ViT = Vision Transformer
自然言語処理で成功したTransformerを画像認識に応用したモデルです。画像を小さなパッチに分割してトークンとして扱い、CNNを使わずに画像内の長距離の依存関係を学習します。
詳しい説明
自然言語処理で大きな成功を収めたTransformerモデルを、画像認識に応用したモデルです。画像を小さなパッチ(断片)に分割し、それをトークンとして扱うことで、CNNを使わずに画像内の長距離の依存関係(画像の異なる領域同士のつながり)を学習します。CNNよりも大規模なデータセットで学習させた場合に高い精度を発揮する傾向があり、画像認識の新しい潮流となっています。
試験で問われること
G検定(ジェネラリスト検定)
- Transformerを画像処理に転用したものであることを理解する
- CNNのように畳み込みを行わず、画像をパッチに分割して処理する
- 大規模なデータセットで学習させることで高い性能を発揮する