【衝撃】80GBのQwen3.8 125Bが12GBグラボで動いた!「入らないから諦める」時代が終了、鍵はグラボよりメモリだった
【衝撃】80GBのQwen3.8 125Bが12GBグラボで動いた!「入らないから諦める」時代が終了、鍵はグラボよりメモリだった
「容量が足りないから動かない」——ローカルLLMを試そうとした誰もが突き当たるこの壁が、2026年10月、音もなく崩れた。阿里巴巴(アリババ)が公開したQwen3.8-Flash-Next(1250億パラメータ、約80GB)が、RTX 5070(VRAM 12GB)どころか、RTX 4060搭載ノート(VRAM 8GB)でも動作した報告が相次いでいるのだ。魔法でも何でもない。「置き場所を3段に分ける」という発想の転換だけで、従来の常識だった「VRAMサイズ=動かせるモデルの上限」という天井が4倍以上突き破られた。配布元のStrata(ストラタ)という推論エンジンと、実測報告から見えてきた「本当に買うべきはグラボではなくメモリ」という真実を、図書館の比喩で解き明かす。
図書館の「机・書架・目録」3段構えで「入らない」を前提に設計
Strataの名前の由来は「地層(ストラータ)」——知を重ねる崖の地層だ。仕組みは図書館に例えると極めて明確になる。
- 机(VRAM):狭い。本は3冊しか置けない。だが手を伸ばせばすぐ届く。ここに「よく使う専門家(アクティブなパラメータ)」を置く
- 書架(システムRAM):広い。専門家の全員(全パラメータ)がここにいる
- 目録(SSD):カード引き出し。本そのものではなく「どこに何があるか」だけを記録。巨大な重みファイルを置く
Qwen3.8 125Bは全1250億の「専門家」を抱えるが、一言生成するごとに働くのは約60億だけ。机の3冊分で足りる。次に必要な3冊は毎回入れ替わるため、よく使うものを机に残し、たまにしか使わないものは書架まで取りに行く。目録があれば「何列目の何目か」が一発で分かるから探す時間はゼロ。取りに行く時間だけが残る。
「今までは入らないと分かった時点で道具が諦めていた。今回の道具は入らない前提で置き場所を割り振っている」——この発想の転換こそが全てだ。部品は増えていない。1週間前のグラボでも今日動く。買い替え不要で動くモデルが増えた理由はここにある。
CPUも「読み手」として同時稼働──AVX命令で束ねて処理
机の3冊で計算している間、CPUが書架を読む。2人で同時に働くから待ち時間が減る。CPU内部のAVX命令(ベクトル演算)で数を1個ずつでなく束で処理できるため、古すぎないCPU(AVX2対応のIntel/AMD)なら問題ない。この「CPU協調」が速さの一翼を担っている。

「女手(投機デコード)」が5冊まとめて持ってくる──当たりやすい文章ほど高速
一言ごとに往復していては遅い。そこで「動きの早い女手」を1人雇う——これが投機デコード(推測デコード)だ。モデルに組み込まれた小さく早い助手が次の数語を推測し、5冊くらい検討で抱えて机に置く。大きい方がその推測をまとめて1度に確認。当たれば5冊分の往復が1回で済む。外れたらそこから後ろは捨てる。定型文・プログラムほど当たりやすく高速、ひねった言い回しは遅くなる。これが「1秒53〜93トークン」という幅の正体だ。
「動く最低ライン8GB」「気持ちよく動く推奨12GB以上」──しかし本当のボトルネックはシステムメモリ
配布ページの見出しには「8GB以上のNVIDIA GPU」とあるが、本文には「12〜24GBのカード1枚」と書かれている。ゲームで言う「最低環境・推奨環境」の差だ。8GBノートでも動いた報告があるが、文脈長を192kに絞っている——「机が狭ければ置物を減らして調理を合わせる」状態だ。
だがここからが落とし穴。配布側が量子化レベルごとに必要量を表で出しているが、一番軽いIQ2_XSでもVRAM+システムRAM合計で37.6GB必要だ。IQ3_S(一番綺麗)だと54.8GB。これはモデル分だけ。Windowsやブラウザの分は上乗せされる。だから配布側も測定機に64GB積んでいたのだ。
「本当に買う必要があるのはグラボじゃなくてメモリ」。ある報告では32GBだと262k文脈は無理、64GBにすれば届いた。差が出たのはメモリ側だった。メモリは比較的安い。グラボ1枚買い換える金でメモリは何倍も詰める。机を広げる前に本棚を増やせ——これが今日の一番得する情報だ。
「本家と同じ答え」の保証はまだない──量子化の崖、4つの制限、第三者検証の不在
配布側は「一番綺麗な量子化なら公開試験では本家と一致した」と書くが、「公開試験では」という含みがある。試験に出た問題だけできた、試験の外は不明。しかも自分の商品を自分で採点している。第三者記事も「独立の結果はまだ限られている」「配布側の数字をそのまま載せた」「一部は見積もり」と認めている。量子化は「3ビットの崖」のちょうど上を行っている——崖から落ちていない保証は公開試験の中だけだ。
明記された4つの制限も重い:
- 同時に1件しか処理できない(閲覧席が1つ)
- 生成方式が1通りだけ(最も確からしい語のみ、多様性なし)
- 会話履歴を保持しない(2回目質問でも机を片付けて読み直し)
- 文脈が128k超えると前処理が遅くなる(短いやり取りなら53〜93tok、長文なら43〜74tokに低下)
さらに別論文(Lukas Stepanek氏)で「ストレージ使用推論はチートしやすい」「生成成功≠中身正しい」との指摘も。動いた画面は見えているが、答えの質を独立に測った人はまだいない。
ライセンスは2つ──エンジンはMIT、モデルはQwen Community License
Strata自体はMITライセンスで自由だが、モデル本体(Qwen)はQwen Community Licenseが適用される。仕事で使うならモデル側の条文を読む必要がある。「MITだから何でも自由」という説明は間違いだ。
電気代は月230円だが「機械代」は別──持ってる人だけが得する計算
RTX 4060ノート(全体130W)で1日2時間なら電気代月約230円(1kWh=30円換算)。クラウド月2000円より安い。だが64GBメモリ、80GBディスク、グラボ代は別払い済みだ。「すでに持ってる人だけが得する計算」になる。これから一式買うならクラウドの方が安い。どっちが正解かは人による——反対派の「個人の計算資源に優位性はない」も、量子化・1人用・未検証という3つの事実で裏付けられる。
ネットの反応
8GBのノートで125B動いたてマジか…VRAMの壁完全に崩壊したな。メモリ64GB積めばいいだけとか盲点すぎた
投機デコードで5冊まとめて持ってくる発想天才かよ。定型文なら爆速なの納得
「本家と同じ答え」の保証ないのは痛いな。量子化の崖ギリギリで立ってるだけて
会話履歴持たないの地味に辛い。長文読ませて相談する用途だと毎回読み直しとか無理ゲー
グラボ買い換えようとしてたけどメモリ64GBにしろって話で目から鱗。金額全然違うわ
ライセンス二重なの罠すぎる。エンジンMITでモデル別ライセンスて商用利用でハマりそう
AIの所感
今回のStrataによる「入らないモデルを動かす」技術的ブレイクスルーは、ハードウェア競争(より大きなVRAM)からソフトウェア工夫(メモリ階層設計・投機デコード・CPU協調)へのパラダイムシフトを象徴している。図書館の比喩で言えば「本棚を全部机に乗せようとして諦めていた」ところを「机・書架・目録に役割分担させ、女手(投機デコード)で往復を減らす」という運用設計に変えただけ——部品は変わらず、並べ方を変えただけで4倍の壁を突破した事実は、リソース制約下でのエンジニアリングの妙味を突いている。
しかし「動く」と「正しく答える」は別問題だ。量子化の崖上で「公開ベンチマークでは一致」に留まり、会話履歴非保持・単一生成経路・長文文脈での減速といった実用上の制約も明確だ。第三者による品質検証が追いついていない現状では、「短い質問を1人で投げる」「手持ちの64GBメモリ機で試す」という限定的用途に留めるのが賢明だろう。ライセンス二重構造(エンジンMIT・モデルQwen Community)も商用利用では要確認だ。
最も実用的な示唆は「買い物の順番が変わる」点だ。グラボ買い換え資金でメモリを64GB・128GBに積む方が、より多くのモデルを動かせる可能性が高い。すでに機材を持つ層にとっては「電気代月230円で125Bが動く」という驚異的なコスパになるが、新規参入者にはクラウドの方が合理的なケースも多い。「自分の押入れ(手持ちパーツ)を数えてから財布を見ろ」——自作PC選びと同じ教訓が、ローカルLLM環境構築にもそのまま適用される時代になった。