本文へ移動

けいまんずほう

k-means 法

k-means法は、教師なし学習でデータをk個のグループに分けるクラスタリング手法です。各データを最も近い重心のグループに割り当て、平均位置を更新する処理を繰り返します。

詳しい説明

教師なし学習における代表的なクラスタリング手法であり、似た特徴を持つデータをk個のグループに分ける方法です。あらかじめ決定したクラスタ数kを用いて、データポイントを最も近い重心を持つグループへ割り当てます。

具体的には、まずk個の重心をランダムに配置し、各データを最も近い重心のグループに割り当てます。次に、割り当てられたグループ内のデータの平均位置を計算して重心を更新する、という手順を繰り返します。重心の位置が変化しなくなったら終了です。

G検定では、教師なし学習の基本アルゴリズムとして頻出します。計算が高速で実装が容易ですが、最初にクラスタ数kを人間が指定する必要がある点や、初期値によって結果が不安定になる可能性がある点が問われます。探索的データ分析の初期段階で、データの全体像を把握するために広く使われます。

試験で問われること

G検定

  • 教師なし学習に分類される代表的なクラスタリング手法である
  • 事前にクラスタ数kを指定する必要がある
  • 重心の更新とデータの割り当てを繰り返すことでグループ分けを行う