Aleph Alphaが、新しい大規模言語モデル「Kolibri」を公開した。単にモデル名を発表したという話ではなく、Apache 2.0で重みを開放し、しかも「主権性」を前面に出しているのが特徴だ。企業や政府機関が、外部の推論サービスにデータを出さずに使えること、規制産業で扱いやすいことを強く意識している。性能の数字もかなり攻めていて、研究色の強い発表でありながら、実運用をにらんだ宣言にもなっている。
Aleph Alphaは、独英対応のMixture-of-Experts(MoE)型Transformer「Kolibri」を発表した。総パラメータ数は78B、実際に推論時に動くのは3Bで、コンテキスト長は最大1M tokensまで扱える。モデルの重みはHugging Faceからダウンロードでき、ライセンスはApache 2.0だ。公開日は記事上では2026年10月3日になっている。
このモデルは、いきなり完成したわけではない。同社はまず「Kolibri Origin」という30B総・3B active、65k tokensの短いコンテキスト窓を持つモデルで訓練パイプラインを検証した。その後、同じ流れをKolibriに適用している。データの取り込みと選別、ablation実験、pre-training、post-training、最終評価までをひと続きで回し、途中でハードウェア障害や回線断が起きても人手を介さず継続できるようにしたという。監視指標も標準化し、独自ベンチマークの評価まで含めて運用した結果、短い期間で前モデルから大きく改善できたと説明している。
性能面では、Kolibriは英語とドイツ語の両方で、コストと品質の釣り合いがよい位置にいるとされる。数学、コード、grounding、長文コンテキスト、agenticタスクといった幅広い領域で、最大で自分の4倍のactive parameterを持つモデルに匹敵すると主張している。記事内の比較では、AIME 2025やAIME 2026、GPQA、LiveCodeBench、HumanEval+、LongBench Proなどのベンチマーク結果が示され、たとえばAIME 2025では96.9、AIME 2026では96.0、HumanEval+では92.7を記録している。ドイツ語版の指標も並び、英独の双方で競争力があることを見せている。
ただし、Aleph Alphaが強調しているのは一般的な総合性能だけではない。政府、製造、航空宇宙、自動車などの規制が強い分野向けに、社内で用意した内部評価も使っている。顧客データには触れず、合成環境で学習や改善を回すことで、現場の業務に近い条件で性能を上げたという。さらに、答えが文脈にないときは「わからない」と返すように訓練している。Merlin-Arthur protocolと呼ぶ仕組みで、groundingを重視した設計だ。
安全面と統制も売り文句になっている。モデルはEU AI Act、General-Purpose AI Code of Practice、GDPRを意識して設計され、著作権への配慮も重視したとしている。データの選別や学習、評価の判断を公開し、推論の理由もある程度追えるようにした。開発はドイツで行い、学習インフラはドイツとフィンランドに置き、欧州法とドイツ法の下で完結させたという。顧客側も、オンプレミスで動かせる小ささと、推論の負荷を調整しやすい点を得る。要するに、Kolibriは「ただ強いモデル」ではなく、「制御でき、持ち込め、監査できるモデル」として売り出されている。
この記事で目を引くのは、モデルそのものの数字より、3か月という短さで30Bから78Bへ、65k tokensから1Mへ持っていった開発の進め方だと思う。大規模モデル開発は、派手なベンチマークだけを見ると「最後に学習を回したら勝った」で済んでいるように見えがちだが、実際にはパイプラインの安定性がかなり効く。Aleph Alphaは、学習をコード化して、担当者の記憶や個別スクリプトに散らさず、再現可能なレシピに落としたと説明している。ここは地味だが重要で、企業向けAIではしばしば「新しいモデル」より「再学習を安全に回せるか」が本体だからだ。
一方で、この速さがそのまま優位性を保証するわけではないとも感じる。短期間で大きく伸びたことは確かに強いが、重要なのはその改善が一過性ではなく、次の世代でも再現できるかどうかだ。Aleph Alphaはその点を、Model Factoryという言い方で仕組みに閉じ込めようとしている。私はこの姿勢はかなり筋がいいと思う。モデル単体を売るというより、改善の回し方を製品化しているからだ。逆に言えば、もしこのパイプラインが本当に効いているなら、今後の更新速度が同社の競争力そのものになるはずだ。
1M tokensの長文コンテキストは、数字だけ見るとかなり派手だが、実務に落とすと意味合いが少し違う。大量の契約書、仕様書、調査資料、ログをまとめて読ませる場面では便利だろうが、単に長ければよいわけではない。長い文脈を扱うモデルは、最後まで読めるかより、途中の情報を落とさず、必要な箇所を参照できるかが大事になる。Kolibriはそこに加えて、grounding、つまり根拠が文脈にないなら答えない訓練を入れている。これは企業利用ではかなり効く。
私がここで面白いと思うのは、生成AIの競争軸が「何でも答える」から「答えない判断ができる」に少しずつ寄っていることだ。とくに法務、行政、航空、製造のような領域では、もっとも危ないのは自信満々の誤答である。Kolibriが「I don't know」を言えるようにしたのは、性能を落としてでも事故を減らす設計だと読める。もちろん、実際にどの程度の精度で abstention できるのかは、公開ベンチマークだけでは判断しきれない。だが、少なくともAleph Alphaが狙っている顧客層にとっては、ここがチャットの賢さよりずっと大事だろう。
Kolibriの発表は、AIモデルのニュースでありながら、実は調達や法令対応の話でもある。データを外部推論サービスに出さず、欧州法の下で完結し、重みが公開され、どこでどう作られたかを説明できる。これは性能競争とは別の軸で、公共部門や大企業の購買担当に刺さる条件だと思う。特にドイツやEU圏では、「最先端かどうか」だけでなく「その先に誰が介在するか」が導入可否を左右する。主権性をモデルの属性として掲げるのは、技術の話に見えて、実際には営業の武器でもある。
ただし、ここには少し慎重に見るべき点もある。主権性は便利な言葉で、何をもって主権と呼ぶかは会社ごとにかなり違う。Aleph Alphaは、供給網の透明性、学習基盤の所在地、顧客の自由なデプロイを挙げているが、最終的にはどれも「その条件を満たせる顧客にとって意味がある」という話になる。つまり、万能な価値ではない。私はむしろ、このモデルは米国系の巨大基盤モデルと正面衝突するためのものというより、規制産業で「ここなら通せる」と言える選択肢を作る試みだと見る。そう考えると、Kolibriの勝負はベンチマーク表より、実際の導入案件でどれだけ選ばれるかにある。
Kolibriは英語とドイツ語の両方に対応するが、そこにかなり意図がある。Aleph Alphaは、独自のトークナイザーを作り、pre-training tokenの21.3%をドイツ語にしたと述べている。翻訳データは全体の6%に抑え、元言語の文化的な癖が混ざりやすいから多用しなかったという説明もある。これは単なる多言語対応ではなく、「英語モデルに少しドイツ語を読ませた」のではない、という主張だ。
この設計は、グローバル標準の巨大モデルとは違う戦い方だと思う。世界中の言語を広く薄く扱うより、最初から特定市場での品質を取りにいく。特に行政や産業用途では、英語の広さより、現場文書の言い回しや業務フローに合うかどうかが効く。もちろん、これは市場を絞るリスクでもある。英独以外の利用者にはそのまま魅力が届きにくいからだ。ただ、Aleph Alphaはそこで無理に世界市場を全部取りにいくのではなく、強みが出る領域に集中しているように見える。私はこの割り切りのほうが、今の生成AI市場では現実的だと思う。万能を装うより、誰の何を解くのかを明確にしたモデルのほうが、結局は使われやすい。
参考: Kolibri Has Landed: A Sovereign Open-Weight Model — Aleph Alpha