GPUを積んだふつうのWindows機やLinux機で、大きめのAIモデルをローカル実行できるようにするのが「Strata」です。GitHub上で公開されているこのプロジェクトは、Qwen3.8-Flash-Nextを消費者向けハードウェアに載せることを目標にしていて、しかもワンクリック寄りの導入手順や、OpenAI/Anthropic互換のAPIまで用意しています。クラウドに投げず、手元で完結させたい人にはかなり刺さる内容です。ここで面白いのは、単に「動きます」と言うだけでなく、どのGPUならどの程度の速さで、どのくらいのメモリが要るのかまでかなり具体的に示している点です。
Strataは、Niko1221がGitHubで公開しているオープンソースの推論エンジンで、Qwen3.8-Flash-Nextを一般向けのPCで動かすための土台として位置づけられています。対応OSはWindowsとLinuxで、NVIDIAかAMDのグラフィックスカードを使う前提です。READMEでは、チャット、コード生成、画像の読み取り、さらにアプリやcoding agentとの連携までこなせると説明されています。しかも、処理はPCの外に出さない、というのが売りです。
性能の説明もかなり細かいです。作者は2台のゲーム用PCで測定した結果を載せていて、NVIDIA側はRTX 5070(12 GB)、Ryzen 5 7600、64 GB RAM、AMD側はRX 9070 XT(16 GB)、Ryzen 9 3900X、47 GB RAMという構成でした。NVIDIA環境では、Q2_0が「答えを書く速度」で94 tokens/s、「プロンプトを読む速度」で2,650 tokens/s。IQ2_XSは79 tokens/sと2,090 tokens/s、IQ3_XXSは62 tokens/sと1,750 tokens/s、IQ3_Sは53 tokens/sと1,620 tokens/s、Coderは55 tokens/sと2,180 tokens/sでした。AMD環境では、Q2_0が60 tokens/sと1,160 tokens/s、IQ2_XSが52 tokens/sと1,110 tokens/s、Coderが44 tokens/sと1,420 tokens/sです。READMEには、RTX 3090(24 GB)なら100〜140 tokens/sくらいで書けるはずだ、という見込みも書かれています。
必要条件もかなり現実的です。GPUはNVIDIA GeForce RTX 20/30/40/50 series、またはAMD Radeon RX 7900 XT/XTX、RX 7800 XT/7700 XT、RX 9060 XT、RX 9070/9070 XT、Radeon AI PRO R9700、RX 6800/6900 seriesで、VRAMは12 GB以上。RAMは32 GB以上が必要で、64 GBなら「すべてのサイズが動く」としています。ディスクは約80 GB空き容量が必要で、SSD推奨。Windows 10/11またはLinuxと、最新のNVIDIA/AMDドライバも前提です。導入は、WindowsならSTART-HERE.bat、Linuxならsetup.shを実行し、installerがGPUやRAMを見て適切なengineとモデルサイズを選びます。初回は約70 GBのモデルをダウンロードし、起動時には35〜55 GBをRAMに読み込むため、1〜3分ほどPCが重くなることがある、とも明記されています。
使い方の説明も実務寄りです。ブラウザでは http://127.0.0.1:8080 を開くと、Chat、Monitor、Aboutが使えます。ほかのアプリからはOpenAI互換のproviderとして http://127.0.0.1:8080/v1 を指定でき、Anthropic API系なら /v1/messages、Codex CLIなどResponses API系なら /v1/responses にも対応します。加えて、MCP server経由でAI coding assistant自身がインストールや起動停止を行える、と案内しています。画像入力を使いたければセットアップ時に「Images?」を有効にする必要があり、AMDカードはLinuxではCPU経由で画像を読むがWindowsではまだ未対応です。READMEでは、モデル選びの目安として32 GB RAMならCoder、48 GBならIQ2_XSまたはQ2_0、64 GBならIQ2_XS推奨でIQ3_XXSやIQ3_Sも候補、96 GB以上ならIQ3_SやUnslothのUD-IQ4_XSが挙げられています。さらに、Swift 1.5やUnslothの派生、OrcaRouterのUncensored IQ3_XXSなど、複数のモデル系統にも触れています。
このプロジェクトでいちばん興味深いのは、モデルそのもののすごさより、導入の摩擦を削ろうとしているところです。ローカルLLMは「動くかどうか」より「どのGPUで、どの量のRAMで、どのサイズを選べば、ちゃんと実用になるか」が壁になりやすい。Strataはそこを、インストーラが自動判定して埋めにいっています。これは地味ですが、かなり重要だと思います。多くの人はモデル名より先に、VRAMやRAM不足でつまずくからです。
しかも、OpenAI互換APIやAnthropic互換APIまで用意しているのがうまい。ローカルLLMの便利さは「単体でチャットできること」ではなく、既存のツールチェーンにそのまま差し込めることにあります。ChatGPT風の画面だけだと、試して終わる人も多い。でもAPIが同じなら、CursorやClaude Code、Codex CLIのような道具とつながり、日常の開発環境の中で使われる余地が出る。ここは単なるデモと実用品を分ける差だと思う。
一方で、READMEを読むほど「消費者向けハードウェア」と言いながら、必要条件はかなり上澄みだとも感じます。12 GB VRAM以上といっても、実際には32 GB RAM、できれば64 GB、ディスク空き80 GBがいる。初回起動で35〜55 GBをRAMに載せるという説明も含めると、普通のノートPCや廉価デスクトップが気軽に触れる範囲ではありません。つまり、これは「誰でも」ではなく、「ある程度の自作PC層なら届く」ローカルAIです。
ここで大事なのは、期待値の置き方だと思います。ローカルで大きめのモデルを回すと、外部送信が不要でプライバシー面は安心しやすい。けれど、その代わりにユーザーは電力、発熱、メモリ占有、初回ダウンロード時間を負担する。Strataはその負担を隠さず、むしろ数字で見せています。これは誠実ですが、同時に「簡単に使える」とは少し違う。ワンクリック風ではあっても、現実にはハードウェアの条件がかなり効いてきます。
性能表は、見方によってはかなり印象的です。NVIDIAのRTX 5070でQ2_0が94 tokens/s、IQ2_XSが79 tokens/sなら、少なくとも短文の対話では待たされすぎる感じにはなりにくい。READMEでも「60 tokens per second is faster than you can read」と説明していて、回答生成の速度は実用圏に入っています。もちろんこれは量子化の種類やモデルサイズで変わりますし、32Kトークンの長文入力での速度も別ですが、それでも「ローカルだと遅い」という昔の印象はかなり薄れています。
ただし、こうした速度表はそのまま一般家庭への普及を意味しないとも思います。むしろ、ハードウェアを持っている人にとっての選択肢が増えた、という読み方が近い。AIをクラウドに預けるか、手元で回すか、という分岐で、後者が「遅いがロマンがある」から「十分速いから選べる」へ少し寄ってきた。その変化を示す資料として、このREADMEは価値があります。Strataはモデルの新しさだけでなく、ローカル実行の敷居がどこまで下がったかを具体的に見せているのが面白いところです。
こういうプロジェクトで最後に効いてくるのは、スペックより運用のしやすさではないかと思います。READMEには、再実行すれば途中から再開できるダウンロード、起動中に閉じないようにという注意、アップデート用のUPDATE.batやupdate.sh、複数GPU対応、旧GPUやIntel Arcの実験的サポートまで書かれています。つまり作者は、性能だけではなく、途中で止まる・失敗する・再開する、といった現実の面倒をかなり意識している。
ローカルLLMは一度動けば終わりではなく、更新やモデル追加、API接続、複数マシンからのアクセスまで含めて「道具」になります。そこまで面倒を見ている点で、Strataは単なるデモ以上のものに見えます。一方で、これだけ機能が多いと、使う側には「どのモデルを選ぶか」「どのAPIをつなぐか」「どのくらいメモリを空けるか」という判断が残る。だからこそ、このプロジェクトは“初心者向けに見えて、実はかなり自覚的な中級者向け”だと感じます。手元でAIを持ちたい人には魅力的ですが、導入したあとに自分の環境を理解する覚悟も必要です。