さーさ
SARSA
強化学習のTD学習アルゴリズムです。状態、行動、報酬、次の状態、次の行動を用いて価値を更新します。方策オン型の手法であり、Q学習との違いがG検定で頻出します。
詳しい説明
SARSAは、強化学習におけるTD学習の一種です。状態、行動、報酬、次の状態、次の行動という5つの要素を使って価値を更新します。
現在の方策に基づいて次の行動を選択するため、方策オン型学習と呼ばれます。学習中に得られた実際の行動結果に基づいて価値を調整するため、安定した学習が期待できます。
G検定では、Q学習との違いが頻出します。Q学習が方策オフ型で最適な行動を推定するのに対し、SARSAは現在の方策を評価し続けるという点での対比を整理します。
試験で問われること
G検定
- SARSAがTD学習の一種であることを理解する。
- SARSAが方策オン型学習であることを押さえる。
- Q学習(方策オフ型)との違いを比較して理解する。