本文へ移動

きゅーがくしゅう

Q 学習

強化学習における代表的なアルゴリズムです。

詳しい説明

Q学習は、強化学習における代表的なアルゴリズムの一つです。エージェントが環境の中でどのような行動をとるのが最適かを学習する手法で、行動価値関数(Q関数)を更新していくことで方針を決定します。強化学習の基礎理論を理解する上で避けて通れない重要な手法です。

仕組みは、状態と行動の組み合わせに対して「Q値」という報酬の期待値を割り当て、テーブル形式で保持します。エージェントは行動の結果得られた報酬を基に、このQ値をベルマン方程式を用いて繰り返し更新します。最終的に、各状態で最も高いQ値を持つ行動を選択するように学習が進みます。

G検定では、強化学習の仕組みを問う問題として頻出です。TD学習の一種であることや、Q値の更新ルールについて基本的な理解が求められます。また、環境とエージェントの関係性や、報酬の設計が学習に与える影響についても、基礎的な概念として押さえておく必要があります。

試験で問われること

G検定

  • 強化学習の代表的なアルゴリズムであり、行動価値関数を学習する手法であることを理解する
  • Q値をテーブルで保持し、報酬を基に更新していく仕組みを押さえる
  • TD学習(時間的差分学習)の一種として位置づけられていることを知る