はんきょうしいしゅうがくしゅう
半教師あり学習
少量のラベル付きデータと大量のラベルなしデータを組み合わせてモデルを学習させる手法です。ラベル作成コストを抑えつつ、データの分布情報を活用して精度向上を図ることが可能です。
詳しい説明
半教師あり学習とは、正解ラベル付きのデータと、ラベルなしの大量のデータを組み合わせてモデルを学習させる手法です。一般的に機械学習ではラベル付きデータを集めるコストが非常に高いため、少量のラベル付きデータに、低コストで手に入るラベルなしデータを加えることで、効率よく学習精度を向上させようという考え方に基づいています。
仕組みとしては、まず少量のラベル付きデータでモデルをある程度学習させ、そのモデルを用いてラベルなしデータの予測を行います。その予測結果を擬似的なラベルとして利用し、さらにモデルを学習させるなどのアプローチがあります。データの分布構造を捉えることで、ラベル付きデータだけでは見えなかった特徴を学習できるのが強みです。
G検定では、機械学習の学び方の分類(教師あり学習、教師なし学習、強化学習)の文脈に関連して問われます。特に、ラベル付きデータが希少であるという現実的な制約に対してどうアプローチするかという課題解決の文脈で登場することが多いため、定義をしっかり押さえておきましょう。
試験で問われること
G検定
- ラベル付きデータとラベルなしデータを併用する手法であることを理解する
- ラベル作成コストの削減と精度向上が目的であることを押さえる
- 教師あり学習と教師なし学習の中間に位置するアプローチであることを理解する