gzipを言語モデルにしてみたら何が見えたのか
圧縮ソフトを「文章の続きを当てる装置」として使えるのか。そんな、少し変わっていて、それでいて情報理論の芯を突く実験を紹介したのが今回の話です。元記事は、機械学習の重みも学習済みモデルも使わず、OSに入っている gzip だけでテキスト生成を試しています。しかも単なる思いつきではなく、圧縮と予測が実は同じものだという見方を前提にしているのが面白いところです。結果は完璧な文章ではありませんが、意外なほど「何かを知っている」出力になっています。 著者は以前、ニューラルネットワークを使わずに言語モデルを作る話を書いていて、その流れで「Language Modeling is Compression」という論文に出会います。そこで示されるのが、予測と圧縮は表裏一体だという考え方です。ある文字や単語が起こりそうだと予測できるなら、その情報は短く符号化できる。逆に、圧縮アルゴリズムは「よく出る並び」を安く扱うので、裏返せば予測器でもある、というわけです。そこから著者は、ならば gzip でも言語モデルっぽいことができるのではないか、と考えます。 やり方はかなり素朴です。学習済みのネットワークはなく、
papoo.work