ほうしゅうせいけい
報酬成形
Reward Shaping
報酬成形は、強化学習で学習を加速させるため、本来の報酬に加えて補助的な報酬を設計する手法です。
詳しい説明
報酬成形は、強化学習において学習を効率化させるための手法です。環境から与えられる本来の報酬に加えて、人間が設計した補助的な報酬を与えることで、エージェントが望ましい行動をとりやすくします。
強化学習では、ゴールにたどり着くまでの報酬が極端に少ない場合、探索が困難になります。報酬成形を行うことで、目標に近づく途中段階の行動にも報酬が与えられるため、効率的な学習が促されます。
G検定では、強化学習の学習効率を上げる工夫として問われます。補助的な報酬の設計を誤ると、エージェントが本来の目的とは異なる行動に執着してしまうという副作用がある点も注意点です。この現象は報酬ハッキングとも関連します。
試験で問われること
G検定
- 強化学習の学習効率を高めるための手法であることを理解します。
- 補助的な報酬を与えるメリットと、副作用(ハッキングのリスク)の可能性が問われます。
- 強化学習における報酬設計の難しさがポイントです。