以下の文章を読み、空欄に最もよく当てはまる選択肢を1つ選べ
次の状態で取りうる行動のうち、最も価値の高い行動をとると仮定して行動価値関数を更新していく、価値ベースの代表的な強化学習手法は( )である
オリジナル問題(スタディードが作成)