G検定(ジェネラリスト検定) ディープラーニングの要素技術 練習問題 第20問: Transformer の原論文の big モデルでは、埋め込みの次元 d_model = 1024 を h = 16 個のヘッドに等分し、各ヘッドのキーの次元
この科目 –/24 解いた
中級推定正答率 約 50%
Transformer の原論文の big モデルでは、埋め込みの次元 d_model = 1024 を h = 16 個のヘッドに等分し、各ヘッドのキーの次元を d_k = d_model ÷ h とする。Scaled Dot-Product Attention では、クエリとキーの内積を √d_k で割る。この割る数として、最も適切なものはどれか。
解答と解説を先に見る
正解: 4. 8
肢4が正解です。 d_k = 1024 ÷ 16 = 64 √d_k = √64 = 8 Transformer を提案した論文 (Vaswani ら, 2017) は、d_k が大きいとクエリとキーの内積の値が大きくなり、ソフトマックス関数の勾配が極端に小さい領域に入ってしまうことを防ぐため、内積に 1/√d_k を掛けるとしています。big モデルの d_k も、論文の表3で基本モデルと同じ64です。肢1の4はヘッドの数16の平方根、肢2の32は d_model = 1024 の平方根、肢3の64は d_k の平方根をとり忘れた値です。割るのは、ヘッドの数でも d_model でもなく、ヘッドごとのキーの次元 d_k の平方根です。
関連キーワード: Transformer・Scaled Dot-Product Attention・クエリ・キー
広告
模試 (60問)
8分野を横断して、知識の穴を見つける
オンライン試験とほぼ同じペース(1つあたり約41秒)で、技術分野から法律・倫理まで8分野を混ぜて解きます。JDLAは分野ごとの出題数と合格ラインを公表していないため、配分と70%の目安はぴよパスの設定です。Premium (月480円)Premium (ご利用中)時間制限つきの実力チェック
広告