以下の文章を読み、空欄に最もよく当てはまる選択肢を1つ選べ
Q 学習の行動価値関数を畳み込みニューラルネットワークで近似し、ゲーム画面の画像を入力にして行動を学べるようにした深層強化学習の先駆けの手法は( )である
オリジナル問題(スタディードが作成)