メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第17問: Q学習とSARSAの違いの説明として、最も適切なものはどれか。

この科目 –/21 解いた
中級

Q学習とSARSAの違いの説明として、最も適切なものはどれか。

解答と解説を先に見る

正解: 1. Q学習は次の状態で最大の行動価値を使う方策オフ型、SARSAは次に実際に選ぶ行動の価値を使う方策オン型である

肢1が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)第6章によると、SARSA は Q(S_t, A_t) を R_(t+1) + γQ(S_(t+1), A_(t+1)) に近づけるように更新し、実際に次にとる行動 A_(t+1) を使う方策オン型の手法です(名前は S、A、R、S、A の5つ組に由来します)。Q学習は R_(t+1) + γ max_a Q(S_(t+1), a) を使い、実際にとる行動とは関係なく最適な行動価値を直接近似する方策オフ型です。肢2は両者を逆にしています。肢3はモンテカルロ法の説明で、どちらも1ステップごとに更新する TD 学習の手法です。肢4も誤りで、どちらも状態と行動の組の価値 Q を学習します。

関連キーワード: Q学習・SARSA・行動価値関数・方策オフ・方策オン

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック