G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第16問: 多腕バンディット問題と、そこで使われる行動選択の方策に関する説明として、最も不適切なものはどれか。
この科目 –/21 解いた
中級推定正答率 約 59%
多腕バンディット問題と、そこで使われる行動選択の方策に関する説明として、最も不適切なものはどれか。
解答と解説を先に見る
正解: 3. ε-greedy方策は、確率εで推定値が最も高い行動を選び、残りの確率1−εで全行動の中から無作為に行動を選ぶ
肢3が不適切です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)第2章では、ε-greedy 方策は、ほとんどの場合は推定値が最大の行動(貪欲な行動)を選び、小さな確率 ε で推定値に関係なく全行動から等確率に選ぶ方法です。肢3は ε と 1−ε を逆にしています。肢1は正しく、k 本のレバーを持つスロットマシンにたとえられる問題です。肢2も正しく、活用と探索を1回の選択で両立できないことが、両者の「対立」と呼ばれます。肢4も正しく、UCB 方策は推定値に ln t と選択回数 N_t(a) から作る不確かさの項を加え、あまり選ばれていない行動ほど試されやすくします。ε は「探索する確率」と押さえると取り違えません。
関連キーワード: バンディットアルゴリズム・ε-greedy方策・UCB方策・探索と活用
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告