ほうさくこうばいほう
方策勾配法
強化学習において、エージェントがとるべき行動の確率分布である方策を直接最適化する手法です。価値関数を経由せず報酬を最大化する行動の確率を高めます。
詳しい説明
強化学習において、エージェントがとるべき行動の確率分布である方策を直接最適化する手法です。報酬が高くなる行動の確率を上げるように学習します。
価値関数を介さず、方策そのものをパラメータ化して更新します。環境の変化に柔軟に対応しやすく、連続的な行動空間にも適用可能です。
G検定では、DQNなどの価値ベースの手法と対比して問われることがあります。方策を直接学習するため、収束が不安定になりやすい側面も持ちます。
試験で問われること
G検定
- 行動の確率分布を直接学習する特徴。
- 価値関数を使わない手法であること。
- 連続的な行動空間への適応性。