G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第17問: 人間のフィードバックによる強化学習(RLHF)に関する説明として、最も不適切なものはどれか。
この科目 –/27 解いた
中級推定正答率 約 48%
人間のフィードバックによる強化学習(RLHF)に関する説明として、最も不適切なものはどれか。
解答と解説を先に見る
正解: 2. 人が報酬を計算する数式を直接書き下し、その数式の値が大きくなるように方策を最適化する手法で、人による比較の評価は使わない。
肢2が不適切です。人の選好から学ぶ深層強化学習を示した論文(Christiano ほか, 2017)は、報酬関数を使わずに、人が2つの軌跡の断片を比べてどちらが良いかを選んだデータで報酬を推定し、その報酬で方策を学習しました。報酬の数式を人が直接書くのではなく、書きにくい目標を人の比較から学ぶ点がこの手法の要です。肢1と肢3はこの論文の内容どおりです。肢4はInstructGPTの論文(Ouyang ほか, 2022)の報告どおりで、パラメータ数がはるかに少ないInstructGPTの出力が、調整していない大きなGPT-3の出力よりも人の評価で好まれました。この論文では、モデルの出力に人が付けた順位のデータを使ってRLHFでモデルを調整しています。
関連キーワード: RLHF・報酬モデル・InstructGPT・深層強化学習
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告