本文へ移動

ゆーしーびーほうさく

UCB 方策

UCB = Upper Confidence Bound

強化学習のバンディット問題で、探索と活用のバランスをとる手法です。報酬期待値に信頼区間の上限を加えることで、未知の行動を適度に探索しつつ、利益の大きい行動を優先します。

詳しい説明

UCB方策は、強化学習におけるバンディット問題において、探索と活用のトレードオフを解決するための手法です。未知の行動を試す「探索」と、現在最も報酬が得られそうな行動をとる「活用」のバランスを最適化します。

仕組みとしては、各行動の期待報酬の推計値に、その不確実性(信頼区間)の値を加算した値を選択します。まだ試行回数が少ない行動は不確実性が高く評価されるため、自動的に選ばれやすくなります。これにより、報酬が得られそうな選択肢を逃さず、かつ未知の選択肢も適度に試すことができます。

G検定では、強化学習の導入部分で「探索と活用」という概念とともに問われます。ε-greedy法と異なり、信頼区間という統計的な指標を用いる点が特徴です。バンディット問題における賢い選択基準として、確率的なバランスの取り方を理解しておく必要があります。

試験で問われること

G検定

  • 探索と活用のトレードオフを解消する手法であることを理解する
  • 不確実性(信頼区間)を用いて選択基準を決める仕組みを知る
  • ε-greedy法と比較して、より系統的な探索ができる点を押さえる