かくりつみつど
確率密度
連続的な値をとる確率変数において、特定の値付近にデータが存在する可能性の濃さを表す概念です。積分を通じて区間の確率を求め、生成モデル等の分布推定で使われます。
詳しい説明
確率密度とは、連続的な値をとる確率変数において、ある特定の値付近にデータが存在する可能性の濃さを表す概念です。離散的な値とは異なり、連続的な値では一点における確率がゼロになるため、確率そのものではなく、ある区間における確率を積分で求めるための密度として定義されます。この密度を記述する関数が確率密度関数です。
機械学習のモデル構築において、データの分布を推定する際に非常に重要です。例えば、生成モデルである変分オートエンコーダや正規化流などの手法では、入力データがどのような確率密度分布に従っているかを学習します。データが密集している場所は確率密度が高く、データが存在しにくい場所は低くなるように関数を調整することで、未知のデータを生成可能です。
G検定での試験対策としては、離散確率分布における確率質量との対比がポイントです。確率密度は面積である積分値を求めることで確率になるため、グラフの縦軸の高さがそのまま確率ではないという点に注意が必要です。確率密度関数が正規分布などの分布形状を規定していることを理解しておくと、モデルのパラメータ推論に関する設問に回答しやすくなります。
試験で問われること
G検定
- 連続確率分布において、ある区間の確率を積分で求めるための概念である。
- 一点の確率ではなく濃さを表す。
- 離散型の確率質量関数と混同しないよう注意する。