メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) 機械学習の概要 練習問題 第14問: ビルの空調を強化学習で制御する例について、強化学習の要素の対応や学習の仕方の説明として、最も適切なものはどれか。

この科目 –/21 解いた
初級

ビルの空調を強化学習で制御する例について、強化学習の要素の対応や学習の仕方の説明として、最も適切なものはどれか。

解答と解説を先に見る

正解: 2. 空調の設定を変える操作が行動、室温や時刻などが状態、快適さと消費電力から決めた評価値が報酬に当たる

肢2が正解です。Sutton と Barto の Reinforcement Learning: An Introduction(第2版)は、学習し意思決定する主体をエージェント、それ以外を環境とし、エージェントは環境の状態を受け取って行動を選び、環境は次の状態と報酬(数値)を返すと説明します。空調の例では、設定の操作が行動、観測される室温や時刻が状態、目的に照らして決めた評価値が報酬です。肢1は状態と報酬を取り違えています。肢3は正しい行動をラベルとして与える教師あり学習の説明で、強化学習では正しい行動は教えられず、試行錯誤で見つけます。肢4は誤りで、行動は次の状態を通じて後の報酬にも影響するので、強化学習では将来にわたる報酬の合計(収益)を大きくするように学びます。

関連キーワード: 強化学習・マルコフ決定過程・エージェント・報酬

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック