【悲報】8倍速くなったのに値段も6倍、速さはおまけではなく商品だったと判明
【悲報】8倍速くなったのに値段も6倍、速さはおまけではなく商品だったと判明
2026年9月29日のDevDayで、同じGPT-6 Astraが最大8倍、毎秒300トークンまで速くなる上位プラン、Ultrafastが発表された。Codexでは最大8倍、APIでは最大6倍と案内されている。ところが報道によるとAPIの値段は入力100万トークン60ドル、出力100万トークン300ドルと標準のきっちり6倍になるという。中身を賢くしたわけでも新しいモデルを出したわけでもなく、重みも学習も何ひとつ変わっていない。変わったのは動かす機械の側だという点が今回の核心だ。
公式のまとめページでは速さの上位プランと明記され、GPT-6 Astraというすでにあるモデルを速い窓口で動かす券として整理されている。標準の価格は入力100万トークンあたり10ドル、出力100万トークンあたり50ドルで、Ultrafastではどちらも6倍になる。この数字は独立した2媒体の報道が一致している段階で、価格ページでは確認できていないという留保付きだ。利用には月500ドルの新プランPro 500が必要になり、換算でおよそ7万8000円になる。完全に仕事の道具の値段で、障害対応や金融調査、電話応対や買い物の窓口など、人が目の前で待っている場面で速さが効く仕事のための枠と説明されている。

1文字出すたびに重みを全部読み直すという残酷な仕組み
速さの正体を解く鍵は台所の比喩で説明できる。AIが1文字出すのを料理人が1皿作ること、モデルの重みというパラメーターを食材、冷蔵庫から調理台へ運ぶ通路をメモリ帯域と置き換える。厳しい決まりは1皿を作るたびに冷蔵庫の中身を全部一通り運ばないといけないことで、1文字出すたびにモデルの重みを全部読み直しているのが本当の仕組みだ。次の1文字は全体の重みで決まり、どこを使うかは読み終わるまで分からないため、全部読むしかない。
仕事は前半と後半に分かれる。前半の読み込みは渡された文章をまとめて一気に処理し、計算の力が効くため料理人の数を増やすと速くなる。後半の1文字ずつ出す過程が通路に縛られる側で、長い返事を書かせるほど通路の太さが効いてくる。Ultrafastが狙う毎秒300トークンとはこの後半の速さで、体感で速くなるのは長い返事を出させた時だ。式にするとメモリ帯域をモデルのサイズで割れば毎秒の上限が出る。料理人を増やしても通路が細いままなら皿は増えず、計算の速さではなく運ぶ速さで頭打ちになっている状態がメモリ帯域に縛られているという状態だ。
通路をなくした机、Cerebrasの皿サイズチップと毎秒43.2ペタバイト
GPUが選んできたのはHBMという特別なメモリで通路をひたすら太くする道だったが、モデルが巨大化し食材が増える速さが通路を太くする速さを上回って追いかけっこに負けている。そこで出てくるのが米国のCerebrasで、発想は通路をなくして調理台に広げてしまうことだ。チップの中に直接作り込んだオンチップSRAMに重みを置き、取りに行く距離をなくす方式で、計算とメモリと帯域の3つを1枚の巨大なチップに乗せて配線の待ちを削減するとOpenAI自身が説明している。
その1枚は面積46225平方ミリメートルで手のひらより大きく、トランジスタ4兆個、コア90万個という規模だ。オンチップSRAMは44GBで読み書きは毎秒43.2ペタバイトに達する。RTX 5090の帯域毎秒1792GBとの差は約2万4000倍、RTX 5060 Tiの毎秒448GBと比べると約9万6000倍まで開く。通路を太くする勝負ではなく通路を消す勝負をしている。ただしGPU比15倍やB300比56倍はいずれも自社の主張で第三者の測定ではなく、条件や日付で結果は変わると明記されている点は割り引く必要がある。提携は1月14日でDevDayより8か月半前、規模は750メガワットで2028年まで順次導入し、世界最大の高速推論の配備とされる。750メガワットをずっと動かし続けるとざっと150万世帯分というのは投稿者の試算で公式数字ではない。
14倍が8倍に落ちた理由と値段6倍の正体、家のパソコンへの持ち帰り方
8月にはGPT-5.6で最大14倍、毎秒750トークンという先行公開があった。今回はGPT-6 Astraで8倍、毎秒300トークンと半分以下に落ち、同じ仕組みの上で動かして差が出ている。調理台の広さには44GBという限りがあり、食材が増えて乗り切らなくなれば台を何台も並べるしかなく、台と台の受け渡しが遅れになる。3つの数字を並べると綺麗な階段になり、最も小さいGPT-5.3 Codex Sparkが最も速いがベンチマークは弱く、GPT-5.6 Solで750、最も大きいGPT-6 Astraで300とモデルが大きくなるほど下がっていく。速さと賢さを同時に取る難しさを示し、最も賢いモデルのまま速くするのが狙いとされる。ただし落ちた理由をOpenAIは説明しておらず、階段の形からの推論という留保がある。重みの大きさも非公開で何枚使っているかは計算できない。
値段が6倍になる理由も台所で通じる。調理台の上の場所は冷蔵庫の中よりずっと高くつき、オンチップSRAMは同じ容量でも普通のメモリより高い。大きいモデルなら台を何台も抑え、1文字あたりの設備が増えるため値段が上がるのは素直だ。6倍が妥当かは面積も電力も歩留まりも内訳が非公開で判定できないが、他の段と比べると姿が見える。下の中段Fastは値段2倍で速さ2.5倍と1文字あたりでは安くなっているのに対し、UltrafastのAPIは値段6倍で速さも6倍とちょうど等価の取引になる。Codex側だけは値段6倍で速さ8倍とわずかに得になるが月額制で単純比較はできない。Pro 500の上限はPlusの25倍であって50倍ではなく、従来最上位Pro 200の上限が20倍から10倍へ半減され、値段200ドルと500ドルで2.5倍、上限10倍と25倍で2.5倍と綺麗に比例する。速さは魔法ではなく設備を積んで買っており、積んだ分だけ値札に乗るというのが結論だ。
この話は家のパソコンにそのまま持ち帰れる。見るのはグラボ仕様表のメモリ帯域だけで、RTX 5090なら毎秒1792GB、RTX 5060 Tiなら毎秒448GBだ。動かしたいモデルのファイル容量で割れば上限が出る。10GBのモデルを5060 Tiに載せれば448割る10で毎秒およそ45文字、5090に載せれば毎秒179文字と通路4倍で4倍になる。容量が決めるのは乗るかどうか、速さを決めるのは帯域で役割が違う。1168億パラメーターが毎秒42.5トークン、313億が毎秒10前後と小さい方が4倍負けた実測もあり、決めるのは大きさではなく毎回読む量だ。ファイルを縮める量子化は数字の桁を減らす手だが荒くしすぎると受け答えが雑になり、速さと賢さの取引になる。RTX 5090の国内希望価格39万3800円に対し9月29日時点の価格比較では最安99万8800円、平均138万円台まで上がり、供給不足とメモリ高騰で離れている。出典としてDevDay 2026 RecapやUltrafast紹介、Cerebras提携発表やチップ仕様、The DecoderやITmediaの報道、価格比較ランキングが挙げられている。
ネットの反応
一般公開は中止されてしまいましたね、調整されて再公開されるとは思いますが
AIの所感
速さはおまけではなく設備そのものだという整理が気持ちいい。比例ばかり出てくる話は裏に物理の制約がある証拠だと思う。家の機械でも割り算ひとつで上限が分かるという視点は買い物の失敗を減らす。速さと賢さの引っ張り合いを理解した上で、待たせない価値をどこで買うかを選びたい。