メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第16問: 深層強化学習の手法に関するAからDまでの記述のうち、適切なものをすべて挙げた組合せはどれか。 A ダブルDQNは、行動の選択と行動価値の評価を分けることで、Q学

この科目 –/27 解いた
上級

深層強化学習の手法に関するAからDまでの記述のうち、適切なものをすべて挙げた組合せはどれか。 A ダブルDQNは、行動の選択と行動価値の評価を分けることで、Q学習で起こる行動価値の過大評価を抑える。 B デュエリングネットワークは、状態の価値と各行動のアドバンテージを別々の流れで推定し、組み合わせて行動価値を出す。 C ノイジーネットワークは、ネットワークの重みにノイズを加えることで探索を減らし、学習を安定させる手法である。 D Ape-Xは、多数のアクターが集めた経験を共有の再生メモリにため、優先度に応じて取り出して学習する分散型の手法である。

解答と解説を先に見る

正解: 4. A、B、D

Aは適切です。ダブルDQNの論文(van Hasselt ほか)は、DQNでも行動価値の過大評価が起きることを示し、行動の選択と評価を分けるDouble Q学習の考え方を取り入れて過大評価を減らしました。Bも適切で、デュエリングネットワーク(Wang ほか)は状態価値関数と行動のアドバンテージ関数の2つの推定器を持ちます。Dも適切で、Ape-X(Horgan ほか)は行動と学習を分け、多数のアクターの経験を共有の再生メモリにため、優先度付き経験再生で学習します。Cは誤りで、ノイジーネットワーク(Fortunato ほか)は重みに学習可能なノイズを加え、方策のゆらぎで探索を効率よく行う手法です。A〜Cの3手法を含むDQNへの6つの拡張を組み合わせたのがRainbow(Hessel ほか)で、Ape-Xは含まれません。したがって適切なものはA、B、Dで、正解は4です。

関連キーワード: ダブルDQN・デュエリングネットワーク・ノイジーネットワーク・Ape-X・Rainbow

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック