けいまんずほう
k-means 法
k-means法は、教師なし学習でデータをk個のグループに分けるクラスタリング手法です。各データを最も近い重心のグループに割り当て、平均位置を更新する処理を繰り返します。
詳しい説明
教師なし学習における代表的なクラスタリング手法であり、似た特徴を持つデータをk個のグループに分ける方法です。あらかじめ決定したクラスタ数kを用いて、データポイントを最も近い重心を持つグループへ割り当てます。
具体的には、まずk個の重心をランダムに配置し、各データを最も近い重心のグループに割り当てます。次に、割り当てられたグループ内のデータの平均位置を計算して重心を更新する、という手順を繰り返します。重心の位置が変化しなくなったら終了です。
G検定では、教師なし学習の基本アルゴリズムとして頻出します。計算が高速で実装が容易ですが、最初にクラスタ数kを人間が指定する必要がある点や、初期値によって結果が不安定になる可能性がある点が問われます。探索的データ分析の初期段階で、データの全体像を把握するために広く使われます。
試験で問われること
G検定
- 教師なし学習に分類される代表的なクラスタリング手法である
- 事前にクラスタ数kを指定する必要がある
- 重心の更新とデータの割り当てを繰り返すことでグループ分けを行う