G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第24問: ある美術館が、来館者が作品の写真を撮り「この絵に描かれている鳥は何羽ですか」のように文章で質問すると、答えを文章で返す案内アプリを作りたい。このアプリの中心とな
この科目 –/27 解いた
初級推定正答率 約 78%
ある美術館が、来館者が作品の写真を撮り「この絵に描かれている鳥は何羽ですか」のように文章で質問すると、答えを文章で返す案内アプリを作りたい。このアプリの中心となるタスクとして、最も適切なものはどれか。
解答と解説を先に見る
正解: 2. Visual Question Answering(VQA)
肢2が正解です。論文「VQA: Visual Question Answering」は、画像とその画像についての自然言語の質問を与えられて、正確な自然言語の答えを返すタスクとしてVisual Question Answeringを定めました。写真と文章の質問から文章の答えを返すこのアプリはこれに当たります。肢1のImage Captioningは画像の内容を説明する文を生成するタスク(Vinyals ほか『Show and Tell』)で、利用者の質問には答えません。肢3のText-To-Imageは文章から画像を生成するタスクです。肢4の音声合成は文章から音声を作るタスクで、画像の内容を理解する部分を担いません。入力と出力が何かを整理すると区別しやすくなります。
関連キーワード: Visual Question Answering・Image Captioning・Text-To-Image・マルチモーダル
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告