生成AIパスポート試験 生成AIの仕組みと歴史 練習問題 第22問: InstructGPTで用いられたRLHFの主要な手順を、実施順に並べたものとして最も適切なのはどれか。
問題 22 / 36あと 4 問で 70% に到達
中級生成AIの仕組みと歴史難易度目安 約 55%
InstructGPTで用いられたRLHFの主要な手順を、実施順に並べたものとして最も適切なのはどれか。
解答と解説を先に見る(クリックで展開)
正解: 2. 人間の実演で教師あり調整する → 応答の順位付けから報酬モデルを学ぶ → その報酬を高めるよう強化学習する
InstructGPTは人間の望ましい応答例で教師あり調整し、複数応答の順位データから報酬モデルを作り、その報酬を最大化するようPPOで方策を調整した。「無作為選択を正解扱い」は選好学習にならない。「畳み込みと識別器」は別モデルの要素であり、「URLを暗記して返す」はRLHFの手順ではない。
関連キーワード: InstructGPT・RLHF・報酬モデル・教師ありファインチューニング
解答すると次へ進めます
次のステップ
この問題が解けたら、本試験はどうですか?
本番形式の模擬試験で実力チェックPremium (月480円)Premium (ご利用中)本番と同じ制限時間
広告

