著者団体のAuthors Guildが、OpenAIとMicrosoftを相手取った訴訟で、両社の上層部が「自分たちのやり方は違法だ」と理解しながら大量の書籍を使っていたと主張する新たな文書を公表しました。争点は、AIの学習データとして本を無断利用したのか、それとも法の許す範囲で使ったのか、という点です。今回の文書は、単なる技術や契約の話ではなく、社内で何が分かっていたのかまで掘り下げているのが重いところです。生成AIをめぐる著作権訴訟が、いよいよ「知っていてやったのか」という局面に入った、というのが今回のニュースです。
Authors Guildが21日に公表したのは、Authors Guild v. OpenAIに関する未封印のbrief、つまり裁判所に提出された主張書面です。訴えは、OpenAIとMicrosoftが著作権のある書籍を違法に使って自社の製品を訓練したというもの。今回の文書では、両社の社員や幹部が、その行為が著者に損害を与えうること、そして法的にも問題があることを認識していた、と原告側は述べています。文中では、OpenAIのGPTモデルが「本を書き、出版する人々にとって存亡に関わる脅威だ」と見ていたことまで示されたとされています。
原告にはAuthors Guildのほか、David Baldacci、Taylor Branch、Michael Connelly、Sylvia Day、Jonathan Franzen、Christopher Golden、Andrew Sean Greer、John Grisham、David Henry Hwang、Matthew Klam、George R.R. Martin、Jodi Picoult、Stacy Schiff、James Shapiroらが含まれています。彼らの主張の中心は、OpenAIとMicrosoftが書籍を正規に買うのではなく、無断で集め、しかもその危うさを社内で把握していたという点です。
文書に挙げられた発言はかなり生々しいものです。OpenAIのPolicy DirectorだったJack Clarkは2020年5月、AIとCreativityの取り組みが、徐々に「人の労働の代わりになるシステム」を生むと語り、GPT-Xが進むほどジャンル小説の著者は「Amazonで自分たちの代わりをするもの」に不安を抱くだろうと述べたとされています。さらに彼は、「私たちのこの分野の仕事は人を失業させる」とも書き、反発が出ても「無視して出す」ことになるだろう、としたと原告側は主張します。
またOpenAIは2022年、モデルの文章品質改善を率いるためTarun Gogineniを採用しましたが、彼は自分の研究ミッションを、George R.R. Martinの『A Song of Ice and Fire』の最後の2冊をGPTで“完成”させることだと語り、もしMartinが早く亡くなっても「GPT-5がシリーズをオートコンプリートするなら安心だ」とまで考えていたとされます。さらに彼は、著者が「データセットは盗まれたものだ」と不満を述べ、AI生成の競争で仕事を失っていると訴えているのを知りながら、その反応を「それほど同情できない」とみなし、「受け入れ可能な経済的混乱」と表現したとされています。
Microsoftについても、OpenAIが違法性の疑われるデータを使っていたことを早い段階から把握していた、と原告側は言います。2019年4月には、Sam AltmanとDario AmodeiがGPT-3の初期版をBill Gatesに見せ、その場でLibGenの利用についてGatesやMicrosoftのCTO Kevin Scottらに説明していたというのです。LibGenは、しばしば著作権侵害の疑いで語られるサイトです。OpenAI内部では、これを「sketchy Russian website」と呼ぶのは見た目が悪い、つまり「optics」の問題だと心配する声が出ていたとも書かれています。法的に大丈夫かより、世間にどう映るかを気にしていた、という描写です。
さらに原告側は、OpenAIが証拠隠しを図ったとみています。社内で「Project Clear」と呼ばれた作業の一環として、2022年夏にLibGenのファイルを削除したというのです。Slack上では、LibGenへの言及がどれほど広がっているかを心配するやり取りがあり、6月15日には「今こそシステムや保存領域からLibgenを除去するのに適切な時期だ」といったメッセージもあったとされています。今回の書面は、こうした発言や行動をつないで、単なる無意識の混入ではなく、違法性を意識しながら進めた大規模な利用だった、と描いています。
この話でまず目を引くのは、著作権侵害そのものの有無だけでなく、社内に「これはまずい」という認識があったかどうかを、原告側がかなり強く前面に出してきたことです。AI企業はしばしば、学習は変形的利用だ、あるいは技術的に見れば入力処理にすぎない、と説明してきました。でも裁判では、その理屈が通るか以前に、「自分たちでも違法性を警戒していたではないか」と見られるとかなり苦しい。今回の文書は、その弱点をえぐる構成になっています。法廷では、行為の是非だけでなく、会社の意図や認識がかなり効いてくるからです。
もうひとつ気になるのは、ここで語られている言葉が、かなり露骨に“置き換え”を示していることです。GPTが著者の仕事を代替する、シリーズ作品を“完成”させる、人を失業させる。これらは技術の進歩を語る言い回しにも見えますが、同時に、書き手の側から見るとかなり荒っぽい発想です。AIの便利さは否定できませんが、少なくともこの文書が示す社内会話は、創作の補助ではなく、創作者そのものの代替へとかなり傾いています。そこに著者たちが強く反発するのは自然だと思いますし、裁判官や陪審員にも伝わりやすいはずです。
ただ、ここで注意したいのは、原告側の主張はあくまで原告側の主張だという点です。引用されている発言は強烈ですが、裁判では文脈や証拠能力が問われます。社内メモの一節だけで全体像を決めつけるのは危険です。それでも、OpenAIやMicrosoftのような巨大企業が、少なくとも一部の時点では「法的リスク」と「評判への悪影響」を並べて悩んでいたことは、もし事実認定されればかなり重い意味を持つでしょう。AIの競争が激しくなるほど、こうした過去の判断が後から効いてくるのではないかと思います。
さらに、今回の件は著者だけの問題にとどまりません。新聞社や出版社、写真、音楽、映像など、学習データをめぐる争いは同じ形で広がっています。もし「見た目が悪いから隠す」「あとで整理する」という運用が本当にあったなら、業界全体にとってかなり悪い前例です。便利なAIを作ることと、他人の仕事を当然のように吸い上げることは別物です。そこを曖昧にしたまま市場を拡大すると、結局は訴訟と不信だけが残る。今回の文書は、その危うさをかなりはっきり見せていると思います。
最後に、著者側がこの訴訟で狙っているのは、単なる損害賠償ではないはずです。社内文書に「無断利用を承知で進めた」と読める材料を積み上げることで、今後のAI企業に対しても、データの取り扱いをもっと厳しく見ろという圧力をかけている。これは本の世界だけの話ではありません。AI開発が当たり前になった今、誰の作品をどう使ったのかを説明できない企業は、いずれどこかで詰まる。そういう局面に、今回の文書は差しかかっているように見えます。