逆伝播なしでTransformerを学習する「Dust」は何を変えるのか
Transformerの学習は、ふつう backpropagation(誤差逆伝播)を前提に組み立てられています。ところが Q Labs Research の新しい論文「Dust」は、その前提をかなり乱暴にひっくり返そうとしています。重みを直接いじるのではなく、各トークンの activation にノイズを入れて、損失がどれだけ下がったかで学習信号を作る。しかもそれを「1回の forward pass で大量の仮想個体を評価する」形にして、Transformer の pretraining にまで持ち込んだのが面白いところです。単なる変わり種ではなく、著者らは backprop と競争できる、とかなり強い主張をしています。 論文の中心は、Dust という zeroth-order optimization の方法です。zeroth-order は、微分を直接使わず、試行錯誤から更新方向を推定するやり方だと思えば近いです。Dust では、Transformer の各 linear layer の出力に Gaussian noise を加え、その token に対する loss の変化を報
papoo.work