メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第18問: 強化学習の方策ベースの手法に関する説明として、最も適切なものはどれか。

この科目 –/21 解いた
中級

強化学習の方策ベースの手法に関する説明として、最も適切なものはどれか。

解答と解説を先に見る

正解: 3. 方策をパラメータで表して性能の勾配の方向に更新し、Actor-Criticでは方策と価値関数の両方を学習する

肢3が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)第13章は、方策勾配法を、価値関数を参照せずに行動を選べるパラメータつきの方策を、性能指標の勾配の方向に更新する手法として説明し、方策と価値関数の両方を学習するものを Actor-Critic(Actor が方策、Critic が価値関数)と呼んでいます。肢1は、行動価値から方策を決める価値ベース(行動価値法)の説明です。肢2は誤りで、REINFORCE は時刻 t からエピソードの終わりまでの収益全体を使うモンテカルロ型で、更新はエピソードの終了後に行います。肢4も誤りで、同書は連続的な行動空間を自然に扱えることを方策ベースの手法の利点に挙げています。

関連キーワード: 方策勾配法・REINFORCE・Actor-Critic・行動価値関数

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック