わりびきりつ
割引率
強化学習で将来の報酬を現在価値に換算する係数です。0に近いと短期的な利益を、1に近いと長期的な報酬を重視するようになり、エージェントの行動戦略を決定づける重要なパラメータです。
詳しい説明
強化学習において、将来得られる報酬をどの程度の価値として現在の判断に反映させるかを決める係数です。通常0から1の間の値をとります。
割引率が0に近いと、目の前の短期的な報酬を重視する「近視眼的」な行動をとります。逆に1に近いと、先々の報酬まで見据えた「長期的な」利益を最大化する行動をとるようになります。
G検定では、Q学習の数式における役割として重要です。現在の行動が将来の報酬に与える影響を計算する際に、この係数がどのように機能するのか、エージェントの戦略にどう影響するのかという基本概念が問われます。
試験で問われること
G検定
- 強化学習における報酬の現在価値を調整する係数です。
- 短期的な報酬と長期的な報酬の優先度のバランスを制御します。
- Q学習などの強化学習アルゴリズムの文脈で登場します。