本文へスキップ
Studied
S!
G検定
/
演習問題集
知る
カリキュラム
学ぶ
学習教材
解く
演習問題集
模擬試験
覚える
単語カード
クイズ
用語集
振り返る
学習状況
習得マップ
論点別正答率
復習
出題カバレッジ
ブックマーク
ホーム
状況
教材
演習
模試
用語集
確認問題 深層強化学習
この論点の解説を読む
RLHF の進め方を選ぶ
RLHF の進め方の説明として、最も適切な選択肢を1つ選べ
人の好みを集めて報酬モデルを作り、その報酬を手がかりに強化学習で大規模言語モデルを好ましい受け答えへ調整する
正解の文章を大量に用意し、次の単語を予測させるだけで受け答えを決める
生成器と識別器を競わせて、人が好む文章を作り出す
模擬環境で学んだ結果を現実のロボットへ移し替える
採点する
オリジナル問題(スタディードが作成)
前へ
←
次へ
→