G検定(ジェネラリスト検定) ディープラーニングの応用例 練習問題 第6問: 次の文の( )に入る語句として、最も適切なものはどれか。 Vision Transformer(ViT)は、画像を( )に分割し、それぞれを線形に埋め込んで位置
この科目 –/27 解いた
初級推定正答率 約 84%
次の文の( )に入る語句として、最も適切なものはどれか。 Vision Transformer(ViT)は、画像を( )に分割し、それぞれを線形に埋め込んで位置の情報を加えた列を、Transformerのエンコーダに入力して画像を分類する。
解答と解説を先に見る
正解: 2. 固定サイズのパッチ
肢2が正解です。ViTの論文(Dosovitskiy ほか)は、画像を固定サイズのパッチに分け、各パッチを線形に埋め込んで位置の埋め込みを加えたベクトルの列を、標準的なTransformerのエンコーダに入力しています。論文は、画像のパッチを自然言語処理のトークン(単語)と同じように扱うと述べています。肢1のように画素ごとに自己注意を計算すると、計算量が画素数の2乗で増えて現実的な大きさの画像に使えないと論文は述べています。肢3の物体の候補領域はR-CNN系の物体検出の考え方、肢4の周波数ごとの成分は音声の特徴量などの考え方です。畳み込みに頼らずTransformerで画像を扱う点がCNNとの違いです。
関連キーワード: Vision Transformer・パッチ・Transformer・位置エンコーディング・画像分類
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告