本文へスキップ
Studied
S!
G検定
/
演習問題集
知る
カリキュラム
学ぶ
学習教材
解く
演習問題集
模擬試験
覚える
単語カード
クイズ
用語集
振り返る
学習状況
習得マップ
論点別正答率
復習
出題カバレッジ
ブックマーク
ホーム
状況
教材
演習
模試
用語集
確認問題 深層強化学習
この論点の解説を読む
DQN の安定化の工夫を選ぶ
DQN が学習を安定させるために使う工夫として、最も適切な選択肢を1つ選べ
経験をためて混ぜて使う経験再生と、目標の値を固定した目標ネットワーク
更新の前と後で方策が離れすぎないよう、動かせる幅に制限をかける
人が好ましいと選んだ記録から、報酬モデルを作る
にせのデータを作る生成器と、見分ける識別器を競わせる
採点する
オリジナル問題(スタディードが作成)
前へ
←
次へ
→