本文へ移動

かくりつぶんぷ

確率分布

確率変数がとる値と、その発生確率の対応関係を表す法則です。データのばらつきを数学的に記述し、機械学習アルゴリズムにおける前提やモデルの挙動を理解する土台となります。

詳しい説明

確率分布とは、ある事象が起こる確率を、その事象が発生する値に対応させて表したものです。統計学や機械学習において、データのばらつきを数学的に記述するために欠かせない概念です。何らかのデータが得られたとき、それがどの範囲にどの程度の頻度で発生するかを知ることで、データ生成の背後にある仕組みを推定できます。

具体的には、離散的な確率分布としてコイン投げのようなベルヌーイ分布や、整数値を扱うポアソン分布があります。一方で連続的な確率分布としては、自然界や社会現象で頻出する正規分布などが有名です。機械学習のモデルがどのようなデータの分布を想定しているかによって、最適な手法や損失関数が選択されるため、アルゴリズムの挙動を理解する土台となります。

G検定では、ベイズ統計や確率モデルに関連してこの概念が登場します。確率分布を単なる数値のリストではなく、データの生成過程を表現する数理モデルとして捉えることが重要です。特定の分布を確率密度関数と混同しないよう、分布は確率の割り当て全体を指し、密度関数はそのグラフの形状を定義する数式であることを区別して覚えます。

試験で問われること

G検定

  • データのばらつきを数学的に表現するモデルであることを理解する。
  • 離散型と連続型があることを区別する。
  • 機械学習アルゴリズムが仮定するデータの分布を知ることが学習の前提となる。