G検定(ジェネラリスト検定) AIの社会実装と数理・統計 練習問題 第4問: 次の文は、データリーケージが起きる手順の例である。( A )( B )に入る語の組合せとして、最も適切なものはどれか。 ・翌日の来店者数を予測するモデルで、予測
この科目 –/15 解いた
中級推定正答率 約 53%
次の文は、データリーケージが起きる手順の例である。( A )( B )に入る語の組合せとして、最も適切なものはどれか。 ・翌日の来店者数を予測するモデルで、予測を行う時点より( A )に記録される値を特徴量に加えて学習する。 ・標準化に使う平均と標準偏差を( B )から求め、その値で学習データとテストデータの両方を変換する。
解答と解説を先に見る
正解: 4. A:後 B:全データ
肢4が正解です。scikit-learnの解説(Common pitfalls)は、データリーケージを、予測の時点では手に入らない情報がモデルの構築に使われることとし、交差検証などの見積もりが楽観的になり、本番の新しいデータで性能が落ちると説明しています。Aは「後」です。予測を行う時点より後に記録される値は、予測する時点ではまだ手に入らないので、特徴量に使うとリーケージになります。Bは「全データ」です。同解説は、前処理の平均などは学習データだけから求めるべきで、全データで求めるとテストデータの情報がモデルに入り込むとしています。肢1はA・Bとも問題のない手順です。肢2はBが正しい手順で、肢3はAが問題のない手順です。データの分割は前処理より先に行う、と覚えておきましょう。
関連キーワード: データリーケージ・前処理・時系列データ
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告