G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第14問: ビルの空調を強化学習で制御する例について、強化学習の要素の対応や学習の仕方の説明として、最も適切なものはどれか。
この科目 –/21 解いた
初級推定正答率 約 69%
ビルの空調を強化学習で制御する例について、強化学習の要素の対応や学習の仕方の説明として、最も適切なものはどれか。
解答と解説を先に見る
正解: 2. 空調の設定を変える操作が行動、室温や時刻などが状態、快適さと消費電力から決めた評価値が報酬に当たる
肢2が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)は、学習し意思決定する主体をエージェント、それ以外を環境とし、エージェントは環境の状態を受け取って行動を選び、環境は次の状態と報酬(数値)を返すと説明します。空調の例では、設定の操作が行動、観測される室温や時刻が状態、目的に照らして決めた評価値が報酬です。肢1は状態と報酬を取り違えています。肢3は正しい行動をラベルとして与える教師あり学習の説明で、強化学習では正しい行動は教えられず、試行錯誤で見つけます。肢4は誤りで、行動は次の状態を通じて後の報酬にも影響するので、強化学習では将来にわたる報酬の合計(収益)を大きくするように学びます。
関連キーワード: 強化学習・マルコフ決定過程・エージェント・報酬
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告