本文へ移動

まるこふけっていかてい

マルコフ決定過程

MDP

強化学習における意思決定プロセスを数学的にモデル化した枠組みです。

詳しい説明

強化学習において、エージェントと環境の相互作用を数学的に記述するための枠組みです。状態、行動、遷移確率、報酬という要素によって、意思決定プロセスをモデル化します。

未来の状態が現在の状態のみに依存するマルコフ性を仮定します。エージェントは環境から報酬を得ながら、累積報酬を最大化するような最適な行動方針を学習していく過程を表現しています。

G検定では、強化学習の基礎となる理論として問われます。動的計画法やQ学習といった手法の背景にある考え方であり、エージェントがどのように環境を認識し、行動を選択して報酬を最大化するかのメカニズムとして重要です。

試験で問われること

G検定

  • 強化学習のモデル化に用いられる概念として問われます。
  • マルコフ性が未来の状態の依存先に関わる点が重要です。
  • 状態、行動、報酬の関係性を理解しておく必要があります。