本文へ移動

ばんでぃっとあるごりずむ

バンディットアルゴリズム

Multi-armed Bandit

スロットマシンのように、複数の選択肢から報酬を最大化するものを選ぶ手法です。未知の選択肢を試す探索と、報酬が高いものを選ぶ活用のバランスを学習します。

詳しい説明

バンディットアルゴリズムは、強化学習の枠組みの中でも、状態遷移を考慮しない簡易的な問題を解くための手法です。多腕バンディット問題とも呼ばれ、複数あるスロットマシンのどれを引けば最も利益が出るかを推定します。

このアルゴリズムの核心は、未知の選択肢を試す「探索」と、これまでの結果から報酬が高いとわかっている選択肢を選ぶ「活用」のバランスをどうとるかにあります。どちらか一方に偏ると、最適解を見失う可能性があります。

強化学習との違いは、行動によって次の状態が変化しない点にあります。G検定では、探索と活用のトレードオフという概念の代表例として、このアルゴリズムが頻出します。

試験で問われること

G検定

  • 多腕バンディット問題が強化学習の基礎的なモデルであることを押さえる。
  • 探索と活用のトレードオフについて説明できるようにする。
  • 状態遷移を含まないという特徴を理解する。