メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第15問: 強化学習の収益に関する次の文の( A )( B )に入る語句の組合せとして、最も適切なものはどれか。 エージェントは、時刻 t より後に受け取る報酬を G_t

この科目 –/21 解いた
中級

強化学習の収益に関する次の文の( A )( B )に入る語句の組合せとして、最も適切なものはどれか。 エージェントは、時刻 t より後に受け取る報酬を G_t = R_(t+1) + γR_(t+2) + γ²R_(t+3) + … のように足し合わせた収益を最大にするように行動を選ぶ。γ は( A )と呼ばれて0以上1以下の値をとり、γ を( B )ほど、遠い将来の報酬を重く見る行動の選び方になる。

解答と解説を先に見る

正解: 1. A:割引率 B:1に近づける

肢1が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)3.3節は、収益を G_t = R_(t+1) + γR_(t+2) + γ²R_(t+3) + … と定義し、0 ≤ γ ≤ 1 のパラメータ γ を割引率と呼びます。k ステップ先の報酬は、すぐに受け取る場合の γ^(k−1) 倍の価値と評価されます。γ = 0 なら直後の報酬だけを気にする近視眼的なエージェントになり、γ が1に近づくほど将来の報酬を強く考慮するようになります。肢2は B の向きが逆です。肢3の学習率(ステップサイズ)は推定値を1回の更新でどれだけ動かすかを決める値、肢4の ε は ε-greedy 方策で行動を無作為に選ぶ確率で、どちらも収益の式の γ ではありません。

関連キーワード: 割引率・収益・マルコフ決定過程

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック