メインコンテンツへスキップ
ぴよパス

生成AIパスポート試験 生成AIの仕組みと歴史 練習問題 第22問: InstructGPTで用いられたRLHFの主要な手順を、実施順に並べたものとして最も適切なのはどれか。

問題 22 / 36あと 4 問で 70% に到達
中級生成AIの仕組みと歴史

InstructGPTで用いられたRLHFの主要な手順を、実施順に並べたものとして最も適切なのはどれか。

解答と解説を先に見る(クリックで展開)

正解: 2. 人間の実演で教師あり調整する → 応答の順位付けから報酬モデルを学ぶ → その報酬を高めるよう強化学習する

InstructGPTは人間の望ましい応答例で教師あり調整し、複数応答の順位データから報酬モデルを作り、その報酬を最大化するようPPOで方策を調整した。「無作為選択を正解扱い」は選好学習にならない。「畳み込みと識別器」は別モデルの要素であり、「URLを暗記して返す」はRLHFの手順ではない。

関連キーワード: InstructGPT・RLHF・報酬モデル・教師ありファインチューニング

解答すると次へ進めます
PRGUGA監修。2026年版を1冊で学ぶテキスト&問題集

最短攻略!生成AIパスポート 公認テキスト&問題集

Amazon でテキストを見る
お急ぎ便・対象本の還元もまとめてAmazonプライム 30日無料(PR)

次のステップ

この問題が解けたら、本試験はどうですか?

本番形式の模擬試験で実力チェックPremium (月480円)Premium (ご利用中)本番と同じ制限時間

模擬試験を始める
広告

他の科目もチェック