メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第16問: 多腕バンディット問題と、そこで使われる行動選択の方策に関する説明として、最も不適切なものはどれか。

この科目 –/21 解いた
中級

多腕バンディット問題と、そこで使われる行動選択の方策に関する説明として、最も不適切なものはどれか。

解答と解説を先に見る

正解: 3. ε-greedy方策は、確率εで推定値が最も高い行動を選び、残りの確率1−εで全行動の中から無作為に行動を選ぶ

肢3が不適切です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)第2章では、ε-greedy 方策は、ほとんどの場合は推定値が最大の行動(貪欲な行動)を選び、小さな確率 ε で推定値に関係なく全行動から等確率に選ぶ方法です。肢3は ε と 1−ε を逆にしています。肢1は正しく、k 本のレバーを持つスロットマシンにたとえられる問題です。肢2も正しく、活用と探索を1回の選択で両立できないことが、両者の「対立」と呼ばれます。肢4も正しく、UCB 方策は推定値に ln t と選択回数 N_t(a) から作る不確かさの項を加え、あまり選ばれていない行動ほど試されやすくします。ε は「探索する確率」と押さえると取り違えません。

関連キーワード: バンディットアルゴリズム・ε-greedy方策・UCB方策・探索と活用

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック