G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第15問: 強化学習の収益に関する次の文の( A )( B )に入る語句の組合せとして、最も適切なものはどれか。 エージェントは、時刻 t より後に受け取る報酬を G_t
強化学習の収益に関する次の文の( A )( B )に入る語句の組合せとして、最も適切なものはどれか。 エージェントは、時刻 t より後に受け取る報酬を G_t = R_(t+1) + γR_(t+2) + γ²R_(t+3) + … のように足し合わせた収益を最大にするように行動を選ぶ。γ は( A )と呼ばれて0以上1以下の値をとり、γ を( B )ほど、遠い将来の報酬を重く見る行動の選び方になる。
解答と解説を先に見る
正解: 1. A:割引率 B:1に近づける
肢1が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)3.3節は、収益を G_t = R_(t+1) + γR_(t+2) + γ²R_(t+3) + … と定義し、0 ≤ γ ≤ 1 のパラメータ γ を割引率と呼びます。k ステップ先の報酬は、すぐに受け取る場合の γ^(k−1) 倍の価値と評価されます。γ = 0 なら直後の報酬だけを気にする近視眼的なエージェントになり、γ が1に近づくほど将来の報酬を強く考慮するようになります。肢2は B の向きが逆です。肢3の学習率(ステップサイズ)は推定値を1回の更新でどれだけ動かすかを決める値、肢4の ε は ε-greedy 方策で行動を無作為に選ぶ確率で、どちらも収益の式の γ ではありません。
関連キーワード: 割引率・収益・マルコフ決定過程
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック