本文へスキップ
Studied
S!
G検定
/
演習問題集
知る
カリキュラム
学ぶ
学習教材
解く
演習問題集
模擬試験
覚える
単語カード
クイズ
用語集
振り返る
学習状況
習得マップ
論点別正答率
復習
出題カバレッジ
ブックマーク
ホーム
状況
教材
演習
模試
用語集
確認問題 自然言語処理
この論点の解説を読む
DPO が RLHF と異なる点を選ぶ
DPO が RLHF と異なる点として、最も適切な選択肢を1つ選べ
報酬モデルと強化学習の反復を省き、好みの比べ方から直接に好まれた応答を作りやすく調整する
報酬モデルを作り、その報酬が高くなるよう強化学習を回す3段階を踏む
人の好みをいっさい使わず、次の言葉の予測だけで受け答えを仕上げる
画像と言葉を同じ空間に配置する対照学習で、応答を調整する
採点する
オリジナル問題(スタディードが作成)
前へ
←
次へ
→