メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第17問: 人間のフィードバックによる強化学習(RLHF)に関する説明として、最も不適切なものはどれか。

この科目 –/27 解いた
中級

人間のフィードバックによる強化学習(RLHF)に関する説明として、最も不適切なものはどれか。

解答と解説を先に見る

正解: 2. 人が報酬を計算する数式を直接書き下し、その数式の値が大きくなるように方策を最適化する手法で、人による比較の評価は使わない。

肢2が不適切です。人の選好から学ぶ深層強化学習を示した論文(Christiano ほか, 2017)は、報酬関数を使わずに、人が2つの軌跡の断片を比べてどちらが良いかを選んだデータで報酬を推定し、その報酬で方策を学習しました。報酬の数式を人が直接書くのではなく、書きにくい目標を人の比較から学ぶ点がこの手法の要です。肢1と肢3はこの論文の内容どおりです。肢4はInstructGPTの論文(Ouyang ほか, 2022)の報告どおりで、パラメータ数がはるかに少ないInstructGPTの出力が、調整していない大きなGPT-3の出力よりも人の評価で好まれました。この論文では、モデルの出力に人が付けた順位のデータを使ってRLHFでモデルを調整しています。

関連キーワード: RLHF・報酬モデル・InstructGPT・深層強化学習

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック