以下の文章を読み、空欄に最もよく当てはまる選択肢を1つ選べ
モデルの出力のどちらが好ましいかという人間の評価をもとに報酬のしくみを作り、強化学習でモデルの出力を人の好みに合うように調整する手法は( )である
オリジナル問題(スタディードが作成)