G検定(ジェネラリスト検定) AIの社会実装と数理・統計 練習問題 第5問: 機械学習の学習データの準備に関する説明として、最も適切なものはどれか。
この科目 –/15 解いた
初級推定正答率 約 68%
機械学習の学習データの準備に関する説明として、最も適切なものはどれか。
解答と解説を先に見る
正解: 3. 正解ラベルなどを付けるアノテーションは人が行うことが多く、付ける人の偏りがデータに入り込むことがある。
肢3が正解です。AI事業者ガイドライン(第1.2版)の別添は、学習データのラベルは多くの場合人が作成・付与するため、付与する人のバイアスが入り込むことに留意するよう求めています。肢1は誤りで、コーパスは文章を大量に集めたものです。Manningらの『Introduction to Information Retrieval』も、文書の集まりをcorpus(a body of texts)と呼んでいます。肢2は誤りで、同ガイドラインの別添はデータの利用制約(他の権利に由来する制約など)をデータセットの情報に挙げ、本編も、事前学習済みモデルに事後学習を行う場合のモデル選びとして、商用利用できるライセンスかの確認を挙げています。肢4は誤りで、同じ別添は、データ提供者がアノテーション付与基準や利用制約などを開発者に提供することを期待しています。公開データも、利用条件と作り方を確かめてから使います。
関連キーワード: アノテーション・コーパス・オープンデータセット
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告