本文へ移動

だぶるでぃーきゅーねっとわーく

ダブル DQN

DQNにおける行動価値(Q値)の過大評価問題を解消するための改良手法です。行動選択を行うネットワークと評価するネットワークを分けて価値推定の偏りを抑え、学習の安定性を高めます。

詳しい説明

ダブル DQNとは、DQNにおける行動価値(Q値)の過大評価問題を解消するための改良手法です。行動選択を行うネットワークと、その行動を評価するネットワークを別にすることで、価値推定の偏りを抑えます。DQNの安定性を高め、学習効率を向上させる重要な手法です。

試験で問われること

G検定(ジェネラリスト検定)

  • 過大評価問題というDQNの弱点を解決する手法として問われます。
  • 2つのネットワークを利用する仕組みが理解のポイントです。
  • 標準的なDQNよりも安定して学習できる点がメリットです。