本文へ移動

あーるえるえいちえふ

RLHF

RLHF = Reinforcement Learning from Human Feedback

人間のフィードバックを基に強化学習を行う手法です。

詳しい説明

RLHFは、人間のフィードバックを用いて強化学習を行う手法です。特に大規模言語モデルの微調整において、モデルの出力が人間の意図や価値観に沿うように制御するために不可欠な技術となっています。モデルを安全で有用なものへと整えるアライメントに大きく貢献しています。

仕組みは、まず人間がAIの回答をランク付けし、そのデータを使って報酬モデルを学習させます。次に、その報酬モデルを評価関数として用いて、強化学習アルゴリズム(PPOなど)でモデルを微調整します。これにより、人間が好ましいと判断するような回答を生成する確率を最大化します。

G検定では、生成AIの安全性や倫理的な配慮、品質向上に関する文脈で登場します。単に大量のデータを学習させるだけでは制御できない、モデルの挙動を人間の基準に合わせるための重要なプロセスとして理解しておく必要があります。LLMのアライメント手法として非常に注目度が高い用語です。

試験で問われること

G検定

  • 人間の評価を報酬として利用する強化学習であることを理解する
  • 大規模言語モデルを人間の意図に沿うように微調整する(アライメント)目的があることを知る
  • 報酬モデルを構築し、それを用いて強化学習を行うプロセスを認識する