メインコンテンツへスキップ
ぴよパス

G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第23問: 画像と言語を組み合わせて扱うモデルに関する説明として、最も適切なものはどれか。

この科目 –/27 解いた
中級

画像と言語を組み合わせて扱うモデルに関する説明として、最も適切なものはどれか。

解答と解説を先に見る

正解: 4. CLIPは、画像と文章の組でどの文章がどの画像に合うかを当てる事前学習を行い、文章で指定したクラスに画像を分類できる。

肢4が正解です。CLIPの論文(Radford ほか, 2021)は、インターネットから集めた画像と文章の組を使い、どの文章がどの画像に対応するかを当てる事前学習を行い、学習後は視覚の概念を自然言語で参照することで、追加の学習なしに下流のタスクへ移せることを示しました。肢1は誤りで、DALL-Eの論文は文章から画像を生成するモデルです。肢2は誤りで、基盤モデルは広いデータで大規模に学習し、多様な下流のタスクに適応できるモデルを指します(Bommasani ほか)。肢3は誤りで、Flamingoは画像と文章を入力に取る視覚言語モデルで、少数の例から新しいタスクに適応します。

関連キーワード: CLIP・DALL-E・Flamingo・基盤モデル・マルチモーダル

登録なし・無料で​全問解けます
やめる(試験トップへ戻る)
広告

模試 (60問)

8分野を横断して、知識の穴を見つける

オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック

模試を始める
広告

他の科目もチェック