PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

Hereticが掲げる「検閲のない」言語モデルの正体

AIモデルを「もっと自由に使えるようにする」とうたう動きは昔からありますが、Hereticはその中でもかなり直球です。言語モデルから制限を取り除き、ユーザーの指示に必ず従うようにする、と明言しています。しかも単なる研究発表ではなく、pip install で入れられるソフトとして公開されているのが目を引きます。安全性や倫理をめぐる議論が続くなかで、こうした道具がどう受け止められるのかを考える材料になります。

Hereticが公開した「制限を外す」ための道具

Hereticのサイトは、最初からかなり強い言葉を使っています。見出しには「Take control of the most important technology of our time」とあり、その下で「Heretic removes restrictions from language models, making sure they always follow your instructions」と説明しています。つまりこのプロジェクトは、言語モデルにかけられた制約を外し、ユーザーの命令に従わせることを目的にしたソフトウェアです。言い換えると、モデルが安全策として断ったり、話題を避けたりする挙動を弱める、あるいは消すことを狙っているわけです。

利用方法はかなり手軽に見えます。サイトには sh pip install -U heretic-llm という導入コマンドが載っていて、Hugging Face のモデル名として Qwen/Qwen3.5-4B が示されています。なお、これは Heretic がどのモデルにも対応する一般的な理論を語っているというより、実際には特定のモデルを使って試せる形で提示している、という印象です。あわせて GitHub、Hugging Face、Discord、Matrix への導線もあり、単独のページというより、開発者コミュニティ込みで広げていく構えが見えます。

技術的な細部は本文の抜粋だけでは多く語られていませんが、少なくともサイト上では「Fully automatic censorship removal for language models」と説明され、完全自動で検閲除去を行うと打ち出しています。さらに「Tutorial」「Installation」「Configuration」「Security」といった項目が並んでおり、単なるデモではなく、導入から設定、そして安全性の話まで含めて読ませる設計です。ライセンスは GNU Affero General Public License version 3 or later、著作権表記は 2025-2026 Philipp Emanuel Weidmann + contributors となっています。つまり、無料で使えるフリーソフトとして出していることも、このプロジェクトの特徴です。

「安全を外す」より「従順さを最大化する」発想が気になる

Hereticの面白さは、技術そのものよりも、何を価値として前面に出しているかにあります。多くのAI製品は「安全」「責任」「制限付きの便利さ」を売りにしますが、ここではその逆で、制約の除去が主役です。しかもそれを回りくどく言わず、「always follow your instructions」と真正面から書く。かなり挑戦的ですし、同時に、今のAI業界が抱える緊張をそのまま可視化しているとも思います。

ただ、ここでいう「従う」は何を意味するのか、実際にはかなり重い問いです。モデルが安全のために拒否する場面は、たとえば危険な手順、個人情報、違法行為の支援、差別を助長する出力など、いくつもの層があります。これを一括で「検閲」と呼んで取り払うと、便利になる場面は確かにある一方で、誰にとっての便利さなのかがすぐ問題になります。開発者は実験や評価をしやすくなるかもしれませんが、悪用しようとする人にとっても扱いやすくなるからです。ここは単純な善悪では割り切れない部分です。

pip install で入ることの意味は、想像以上に大きい

もう一つ気になるのは、Hereticがウェブ上の思想表明ではなく、pip で入るソフトとして置かれている点です。これは「面白い主張を掲げたサイト」では終わらない、ということでもあります。Python のパッケージとして配られるなら、研究者や個人開発者は試しやすくなりますし、評価の自動化にも組み込みやすい。裏返すと、こうした道具はアイデアの拡散速度が速い。議論が整う前に、利用だけが先に広がることもありえます。

その意味で、Heretic はAIの安全設計をめぐる空気を映す鏡だと思います。現在のモデルは、単に性能が高ければいいわけではなく、どこまで答えるか、何を断るかまで含めて製品化されています。Heretic はそこに異議を唱え、「断るモデルは不完全だ」と言いたいのかもしれません。ただ、実務の現場では、拒否しないことがそのまま優秀さにはならないはずです。むしろ、危険な依頼を見分けて止まることも、モデルの重要な能力として扱われつつあります。

こういうプロジェクトは、研究と実運用の境目を揺らす

Heretic のようなツールが出てくると、言語モデルの議論は「性能の比較」だけでは済まなくなります。モデルをどう振る舞わせるか、制約を誰が決めるのか、その制約を外す権利は誰にあるのか、という話になるからです。特にオープンソース系のAIでは、モデル本体と、その上に載る調整レイヤーが分かれていることが多いので、こうした“制限除去”は技術的にも思想的にも意味が大きいと思います。

一方で、Heretic が前面に出しているのはあくまで開発者向けの自己決定です。ユーザーが自分の手元で挙動を変えられるのは、オープンソースの大きな利点ですし、研究用途では重要な自由でもあります。ただ、その自由がそのまま一般利用の安全につながるわけではありません。むしろ、AIを「制御可能な道具」と見なす人と、「社会的な影響を持つインフラ」と見る人の間で、見方の差がはっきりするはずです。Hereticは、その境界線をかなり露骨に踏みにいくプロジェクトだと受け取りました。


参考: Heretic

同じ著者の記事