生成AIパスポート試験 AIの基礎 練習問題 第5問: ロボットが環境内で行動し、成功には正の値、失敗には負の値を受け取りながら行動方針を改善する学習方法はどれか。
問題 5 / 36あと 3 問で 20% に到達
初級AIの基礎難易度目安 約 75%
ロボットが環境内で行動し、成功には正の値、失敗には負の値を受け取りながら行動方針を改善する学習方法はどれか。
解答と解説を先に見る(クリックで展開)
正解: 2. 行動結果の報酬から方策を改善する強化学習
強化学習では、エージェントが環境と相互作用し、行動に対する報酬を手掛かりに方策を改善する。「教師なし学習」は正解ラベルなしのデータ構造を探る総称で、報酬による行動学習ではない。「次元削減」は変数を圧縮する。「クラスタリング」は似たデータを群に分ける手法であり、成功・失敗の報酬を使わない。
関連キーワード: 強化学習・報酬・エージェント
解答すると次へ進めます
次のステップ
この問題が解けたら、本試験はどうですか?
本番形式の模擬試験で実力チェックPremium (月480円)Premium (ご利用中)本番と同じ制限時間
広告

