こうどうかちかんすう
行動価値関数
強化学習において、ある状態での特定の行動に対する将来の期待報酬を表す関数です。Q値とも呼ばれ、この値を最大化するように更新することで、エージェントの最適な行動を学習します。
詳しい説明
行動価値関数とは、強化学習において、ある状態のときに特定の行動をとった場合、将来にわたって得られる報酬の期待値を表す関数です。Q値とも呼ばれます。エージェントがどの行動を選択すべきかを判断するための基準として機能します。
学習の過程では、この行動価値関数を更新していくことで、エージェントは「どの行動が最も報酬を得やすいか」を学習します。Q学習などのアルゴリズムでは、環境との相互作用を通じて得た報酬と、次の状態での推定値を組み合わせて、行動価値関数を徐々に最適化していきます。
G検定では、強化学習のメカニズムとして問われます。行動価値関数が直接的に最適化されるのか、それとも方策(policy)が最適化されるのかという違いが重要です。Q学習のように行動価値関数を最適化する手法と、方策勾配法のように方策を最適化する手法の違いを整理しておく必要があります。
試験で問われること
G検定
- ある状態における特定行動の期待報酬を表すものであると理解する
- Q値として知られ、Q学習の最適化対象であることを把握する
- 方策(Policy)とは異なる概念であることを区別する