サイトアイコン 酒呑ガジェット

【衝撃】容量4分の1が7倍速い訳、128GBの箱が32GBのグラボに負ける理由

【衝撃】容量4分の1が7倍速い訳、128GBの箱が32GBのグラボに負ける理由

AIを自分のパソコンで動かす時、お店の説明で一番大きく書いてあるのはメモリ何GBだ。ところが2026年9月29日、Artificial Analysisが公開した実測がその常識を正面から否定した。128GBを積んだ4000ドルのAI専用機が34分かかった同じ作業を、32GBのグラボ1枚は5分弱で終えた。容量は4分の1なのに7倍速い。答えは容量ではなくメモリ帯域だった。食材倉庫付きの厨房という一つの例えで、4台の機械と4つのモデルの数字を最後まで読み解いていく。

測り方からして新しい。従来は1回質問して1回答える速さを測っていたが、実際のエージェントは1つの仕事で何十回もAIに話しかける。今回は8本の実際の作業を録画してそのまま再生する方式で、AIの応答回数は168回、道具呼び出しは172回、文脈は約5万6000トークンまで伸びる。毎回それまでの会話を全部付けて送り直す本物と同じ挙動で、出す文字数は1文字まで揃え、道具の実行時間は除外してある。測定ツールAA-AgentPerf-LocalはApache-2.0で公開され、自分の機械でも同じ数字を出せる。測ったのはGeForce RTX 5090の32GB、DGX Sparkの128GB、Ryzen AI Halo系の128GB、MacBook ProのM5 Pro 64GBという土台の違う4台だ。CUDAとROCmとMetalを一つの表に並べたこと自体が珍しい。

39秒待つか2秒か、廊下の幅が体感を決める残酷な仕組み

Qwen3系27B級での完了時間はRTX 5090が4.91分、DGX Sparkが24.19分、Ryzen AI Haloが34.46分、MacBook Proが37.63分だった。帯域を並べるとRTX 5090が毎秒1792GB、Macが毎秒307GB、DGX Sparkが毎秒273GB、Ryzenが毎秒256GBと7倍差で、完了時間の差とほぼ同じ倍率になる。AIが1文字作るたびに重みの全部を使うため、1皿出すたびに倉庫の端から端まで一周運ぶようなもので、廊下が細ければコンロが多くても止まる。調査会社自身もデコード速度は帯域に強く左右されると書いている。実測のデコードはMac毎秒23トークン、Ryzen毎秒23トークン、DGX Spark毎秒28トークンに対しRTX 5090は毎秒151トークンと5倍以上だ。長い添付を読み終えて返し始めるまでの待ちもRyzen最大24秒、Mac最大39秒に対しRTX 5090は約2秒で、39秒なら席を立つが2秒なら待てるという体感の差になる。速さに関しては容量ではなく帯域を見るべきで、ただし32GBの倉庫に材料が収まっていればという条件付きだ。

36Bが27Bより3倍速い謎、動くのは3Bだけという種明かし

2つ目の疑問は36Bが27Bより3倍速い理由だ。同じMacで27B級が38分近くに対し36B級のMoEモデルは12分弱、DGX Sparkでも24分が7分強、Ryzenでも34分が12分弱、RTX 5090でも5分弱が2分になり、2.5倍から3.3倍とまとめられた。種明かしは末尾のA3Bで、36B分を置きながら一皿で使うのは3B分だけ、料理人36人中3人しか動かないMoEという作りだ。27B級は全員毎回働く密モデルで毎回9倍量を運ぶため、運ぶ量で決まるという整理になる。ところが反例もある。全体124Bで動作部5.1Bのモデルは、動作部9.65Bの9B級よりDGX Sparkで15分弱対13分、Ryzenで25分対13分と逆に遅い。動く数だけでは説明しきれないと調査会社も認める。理由の一つは置き場所で、124Bは4ビット圧縮でも77GBあり32GBには入らずRTX 5090とMacでは測れていない。出番待ちも含め全員分の控室が要る。速さは毎回運ぶ量で決まるが、置ける量も要るという両面が要る。

同じ値段同じ容量で1.7倍差、読む速さと成熟度の壁

寄り道として同じ4000ドル同じ128GBで帯域差7パーセントの2台の差がある。4モデルのうち3つでDGX Sparkが1.4倍から1.7倍早い。廊下だけでは説明できず、効くのが計算力だ。文字を作るデコードの前工程にプリフィルという読み込みがあり、エージェントでは新規入力約19万6000トークン対出力約3万1000トークンと読む方が6倍多く、全体の22から41パーセントを占める。読む作業は廊下よりコンロが効き、27B級を読む速さはDGX Spark毎秒612トークン対Ryzen毎秒261トークンと2倍以上開く。CUDAの成熟差も指摘され、使うソフトもRTXはllama.cpp系とCUDA、DGXはvLLM系、Ryzenはllama.cpp系とROCm、MacはMetalと最適組合せで、設定14通りが公開されている。投機デコードという見習いに先作りさせる高速化も使われ、理論限界を3割から倍超で上回る。一往復で2皿運ぶような工夫だ。

では大きい箱の役割は何か。三つある。一つ目は入らない物は1秒も動かないという点で、124B級はRTXでもMacでも測れず、遅くても24分で答えが出るのと起動すらしないのは別物だ。二つ目は同時置きの余地で、今回は1エージェント独占前提だが今後複数同時の追加が予告され、広さの意味が変わる可能性がある。ただし未測定で何も言えない。三つ目は今の日本の値段だ。RTX 5090は希望39万3800円に対し実売94万円から110万円と3倍近く、DGX Sparkも84万円から108万円、128GBミニPCは38万円から55万円、MacBook Proは36万9800円からで積み増しが要る。今はAMDの箱が一番安く、市場価格ではRTX構成が飛び抜けて高いとされる。グラボ単体に本体代や電源、置き場所と音も要る。Macは持ち運びという別価値があり、Ryzenと2から9パーセント差に並ぶ場面もある。結論は分かれ目が32GBに入るかだけという一点で、収まるならRTX圧勝、収まらないなら128GBしかない。使いたい物の4ビット版の大きさを調べ、27Bまでなら32GB、124B級は77GBで128箱という具合だ。容量は大きく帯域は小さく書かれるため、廊下の幅を先に見るのが収穫になる。

ネットの反応

EVO-X5 Proなら106万円コースか。あとは頑張って200万円のMac Studioか悩むな

5090もSparkも持ってるから適材適所だよ。Sparkは並列6まではほぼn倍で回せる

AIの所感

速さは倉庫ではなく廊下という整理が気持ちいい。運ぶ量と置く量、作る力と読む力という四つの視点が要ることも分かる。値段が毎週動く今、買う前の他人数字より買った後の自分数字を出せる公開測定の意義が大きい。収まるかどうかだけ見て選ぶ単純さが、かえって買い物の失敗を減らすのだろう。

モバイルバージョンを終了