酒呑ガジェット

〜静かな環境であなたに...こちらは音のでないコンテンツです。〜

【朗報】1250億パラメータの化け物AIが自宅ゲーミングPCで動く時代に…無料ソフトStrataとQwen3.8の衝撃

【朗報】1250億パラメータの化け物AIが自宅ゲーミングPCで動く時代に…無料ソフトStrataとQwen3.8の衝撃

これまでデータセンター級のサーバーが必要とされてきた1250億パラメータ級の巨大AIモデルを、自宅のゲーミングPCで動かせる手順が公開され、大きな注目を集めている。無料のオープンソースソフトStrataが、中国AlibabaのQwenチームによるQwen3.8-Flash-Nextを手元のPCで実行する仕組みで、12GBから24GBのNVIDIA製グラフィックボードと64GBのメモリという現実的な構成での動作がうたわれている。GitHubリポジトリは2026年9月24日の公開からわずか1週間で3700を超えるスターを集め、毎秒60から95トークンの応答速度とワンクリックに近い導入の手軽さが話題だ。

24576人の専門家のうち働くのは10人だけ、巨大さの秘密

なぜ家のPCに収まるのか。その鍵はモデル全体の規模と、実際に同時に使う規模が全く違うことにある。Qwen3.8-Flash-Nextは1250億パラメータの本体に510億パラメータの追加部分を組み合わせた構成だが、1トークンを処理する際に働くのは約60億パラメータだけだ。モデル内部には24576の専門家と呼ばれる処理単位があり、次の1トークンに必要な専門家10人だけが呼び出される。残りの専門家は待機していればよく、全部を毎回グラフィックボードに載せる必要がない。

Strataは毎回使う処理と頻繁に呼ばれる数千人分の専門家をグラフィックボードに置き、全員分の専門家はPCのメモリに保持する。グラフィックボードにない専門家が必要になった分はプロセッサーが同時に処理するため、双方が待ち合わせない構成になっている。保存装置には29GBの対応表を置き、1語の処理ごとに必要な数行だけを読み出すため、表を全部読むような待ち時間は発生しない。さらに小さな支援モデルが次の数語を予測し、大きなモデルがまとめて検査する仕組みで、品質を保ちながら応答が1.6倍から1.8倍早くなると説明されている。長い文章は最大8192トークンずつ読み込むため、資料やコードの読み込み速度は毎秒1000トークンを超える。

自宅のゲーミングPCで巨大AIモデルを動かす開発者の作業風景のイメージ

Qwen3.8-Flash-Nextは何が新しいのか

Qwen3.8-Flash-Nextは次世代のQwen4系列を見据えた実験的な設計とされるオープンモデルだ。512人の割り当て専門家のうち10人と共有専門家が応答し、48層のうち36層はGated DeltaNet、12層はQwen Sparse Attentionという異なる処理を組み合わせる。長い文章を効率よく扱うための設定と説明されており、手元の長い仕様書を読ませる場面にも直結する。

標準の文脈量は262144トークンで、拡張設定では最大100万トークンまで扱えると案内されている。画像や動画の理解、外部の道具を呼び出す動作にも対応するマルチモーダルモデルだ。公開された評価ではソフトの不具合を直す課題SWE-bench Proで62.5、道具を使って課題を進めるToolathlon Verifiedで73.5、プログラミング問題のLiveCodeBench v6で91.9を記録した。Qwenチームの比較では他のモデルを上回る項目もあり、学習期間はQwen3.8-27Bの9分の1だったという。ただし公開された条件での結果であり、手元の仕事全てで同じ成功率を示すものではない点には注意が必要だ。

導入は約70GBの取得から、初回だけPCが重くなる

実際に使うには何を用意すればいいのか。Strataが案内する目安は12GBから24GBのNVIDIA製グラフィックボードと64GBメモリだ。Windowsではリポジトリを入手してSTART-HERE.batを起動し、Linuxではsetup.shを実行してモデルや文量などを選ぶ。導入時には約70GBのファイルを取得するため、保存装置の空きも必要になる。

初回起動では35GBから55GBをメモリへ読み込むため、1分から3分ほどPCの反応が鈍くなる。その間は待つことが案内されており、次回以降はダウンロード済みのファイルを使うため起動が速くなる。起動するとPC内のブラウザ画面で対話や稼働状況の確認ができ、画像も渡せる。考える深さはオフ、低、中、高から選べる。別の対応ソフトからはPC内で動く接続先を指定して利用でき、OpenAI互換やAnthropic互換の接続先が用意されている。Dockerで使うにはNVIDIA Container Toolkitと580以降のドライバーが必要で、モデルファイルはstrata-dataに保存する。グラフィックボードを2枚や3枚使う構成では起動時に選択肢が表示され、AMD製向けのHIPにもLinuxで実験的に対応している。

RTX5070で実測、版の選び方はメモリと用途で

速度の測定条件も公開されている。RTX5070の12GB版、Ryzen 5 7600、メモリ64GBの構成での値で、短い対話での生成速度はQ2_0が毎秒93トークン、IQ2_XSが毎秒79トークン、IQ3_XXSが毎秒62トークン、IQ3_Sが毎秒53トークンだった。12万8000トークンの文脈でもQ2_0は毎秒74トークンを保ち、資料の入力を読む速度は毎秒1620から2170トークンで、3万2000トークンの入力を約15秒で読み終えると説明されている。会話の最初に資料を読み、続きの会話では増えた部分だけを読むため待ち時間は短くなる。

各版の容量はQ2_0が37.6GB、IQ2_XSが39.2GB、IQ3_XXSが47.0GB、IQ3_Sが54.8GBだ。メモリ64GBのPCなら全種類が入り、48GBなら小さい2種類が入ると案内されている。どれを選ぶか迷った場合はIQ2_XSが推奨されている。コード作業が中心や32GBから48GBのPC向けにはCoder版があり、コード向けの専門家を残して専門家の半分を削った構成で、Shard 1の容量は29.6GBだ。返事を早く読みたいなら思考文章を短くして応答を早めるSwift 1.5という調整版もあり、対応する元の版と同程度の容量で使える。後から追加できるため、用途やメモリ容量に合わせて切り替えられる。資料を読む用途ならまずPCのメモリと保存容量を確認し、64GBあるなら推奨のIQ2_XSから試すのが無難だ。日本語の扱いにまだ怪しい部分があるという指摘もあり、コード用途から試すのが賢い使い方になる。

参考リンクとして、StrataのGitHubリポジトリやQwen3.8-Flash-NextのHugging Face、公式ブログ、Ollamaライブラリ、詳解記事が公開されている。導入前に目を通しておくと版選びや不具合時の切り分けに役立つ。

ネットの反応

Qwenまだ日本語が怪しい部分があってコードだけならいいんですけどねぇ

要点まとめ助かります。返事を早く読みたいなら別の調整版もあるんですね。まずは推奨版から試してみます

AIの所感

1250億という数字の威圧感と、実際に動かすのは60億ずつという種明かしの落差が面白い。全部を抱え込まず、必要な専門家だけを呼ぶという発想は、人間の組織運営と同じで合理的だ。ゲーミングPCという身近な箱で最先端の巨大モデルが触れるようになった意味は大きいが、評価値はあくまで公開条件での結果であり、日本語のこなれなさも残る。過度な期待より、まず推奨版で手持ちの資料を読ませてみるくらいの距離感がちょうどいい。重い初回起動の3分間は、未来を自宅に引っ越すための手数料だと思えば安いものだ。

-パソコン