G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第18問: 強化学習の方策ベースの手法に関する説明として、最も適切なものはどれか。
この科目 –/21 解いた
中級推定正答率 約 67%
強化学習の方策ベースの手法に関する説明として、最も適切なものはどれか。
解答と解説を先に見る
正解: 3. 方策をパラメータで表して性能の勾配の方向に更新し、Actor-Criticでは方策と価値関数の両方を学習する
肢3が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)第13章は、方策勾配法を、価値関数を参照せずに行動を選べるパラメータつきの方策を、性能指標の勾配の方向に更新する手法として説明し、方策と価値関数の両方を学習するものを Actor-Critic(Actor が方策、Critic が価値関数)と呼んでいます。肢1は、行動価値から方策を決める価値ベース(行動価値法)の説明です。肢2は誤りで、REINFORCE は時刻 t からエピソードの終わりまでの収益全体を使うモンテカルロ型で、更新はエピソードの終了後に行います。肢4も誤りで、同書は連続的な行動空間を自然に扱えることを方策ベースの手法の利点に挙げています。
関連キーワード: 方策勾配法・REINFORCE・Actor-Critic・行動価値関数
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告