【悲報】文章が書けないAIが爆誕、0.1秒で答える裏技に業界騒然「指差しだけで何ができる?」
文章を一文字も書けないAIが登場し、AI業界に静かな衝撃を与えている。AWS傘下のStrands Labsが2026年10月1日に公開したStrands Decider 2Bだ。文章生成の出口を丸ごと取り外し、選択肢を指差すだけの機能に特化することで、RTX 3090上で中央値115ミリ秒という0.1秒台の判断を実現した。重みはApache-2.0で公開され、自宅のPCでも動作可能。一方で難問の正答率は50.5%に留まり、万能か一芸かという論争を呼んでいる。
文章を書く部品を外すと速くなる理由
通常の言語モデルは、はいと答えるだけでも内部で大規模な処理を回す。1トークンずつ順番に文字を吐き出すデコードループを繰り返し、その都度モデル全体を通す。30トークンの回答なら30往復分の計算が必要となり、長さと時間が比例する構造だ。
さらにモデルの最外層にある言語モデルヘッド(LM head)では、十数万語の語彙すべてに点数を付けて1位を選ぶ処理を毎回行う。選択肢が2つしかなくても十数万通りの採点を通るため、短い回答でも見えないコストが発生する。
Strands Decider 2Bはこの出口を根元から切断した。Qwen3.5-2B-Baseという19億パラメータの既製品をベースに、文章を書くLM headを取り外し、選択肢を指差すだけのごく小さな部品(ポインタヘッド)に付け替えた。できることは、はい・いいえの判定、最大24個の選択肢から1つ選ぶ、段階で点を付ける、の3つだけだ。
十数万語の採点が24個に、30往復が1回に
仕組みを駅の改札前の案内係に例えると分かりやすい。通常のAIはどの改札かを聞かれても必ず長文で説明しようとする。ペンと口を縛られ、許されるのは指差しだけにされた案内係がStrands Deciderだ。
十数万語への採点が最大24個への採点に縮小され、30回の往復が1回で済む。これが0.1秒の正体だ。導入もpip installで完了し、商用利用可能なApache-2.0ライセンスで提供される。学習設定や評価文書まで公開されており、再現性と透明性の高さも評価されている。
公開された重みはわずか4.21MB、その謎
話題を集めたのが、公開ファイルhead.safetensorsのサイズがわずか4.21MBという点だ。本体19億パラメータの胴体とは別に、配布されているのは指差し部分だけという構造が明らかになった。紹介記事ではポインタ部が約100万パラメータとされ、ファイルサイズとも整合する。
つまり利用者は別途ベースモデルを用意し、そこに小さな指差し頭を載せて使う。胴体を凍らせず立ち方まで変えた学習設定も公開されており、単なる付け替えではなく全体を調整した改造であることが分かる。必要なVRAM量は公表されていないが、小規模ゆえに自宅GPUでの動作が想定されている。
易問は満点、難問は半分、落差の正体
評価ベンチマークJevBench 231問での成績は、易しい層で100%(48問満点)、標準層で87.5%、難しい層で50.5%、全体で72.3%。2Bクラス33本中3位、全体89本中50位という順位も公表された。
易問満点と難問半分の落差は、途中式を書く道具を持たない構造に起因する。通常モデルは長い前置きや途中式をメモ用紙として使い、考えを整理する。指差し専用モデルにはそのメモ用紙がなく、一発勝負での判断を強いられる。浅い判断は得意だが、複数ステップの推論が必要な難問では頭打ちになる。
較正指標(ECE)はおよそ0.05とされ、自信の度合いと正答率のズレは小さい。順位は版や日付で入れ替わるため、覚えるべきは順位ではなく層ごとの点数だとされる。自信が低いものだけ大きなAIに回す、という使い分けが推奨される。
一芸に任せるか、全部大きいAIにやらせるか
同じ数字から正反対の結論が導ける点がこのモデルの面白さだ。0.1秒と易問満点は、小さなAIに浅い判断を任せる分散型の根拠になる。一方で難問50.5%と全体50位は、結局大きなAIに全部やらせた方が確実という集中型の根拠にもなる。
エージェントの道具選びや振り分けといった、分岐数が24以内に収まる定型判断では十分実用的だ。逆に長文生成や複雑な推論が必要な場面では力不足が露呈する。適材適所の見極めこそが導入の鍵となる。
ネットの反応
文章書けないのをわざわざ作る発想が逆転の発想すぎる。0.1秒は反則級だろ
改札の案内係の例えが秀逸すぎる。ペン取り上げたら速くなったって笑うわ
4.21MBしか配ってないってことは胴体は別持ちなのか。指だけ配るって斬新だな
易問満点で難問半分って極端すぎる。使い所を間違えると事故りそう
途中式がメモ用紙って説明でやっと意味が分かった。書けないと考えることもできないのね
自信低いものだけ大きいAIに回せばいいって運用は現実的で好き
AWSがQwenベースで作ったってのが時代を感じる。自前主義捨てたのは賢い
最初に動かしたAIが重すぎて3日かかった思い出が蘇った。今は0.1秒の時代か
AIの所感
Strands Decider 2Bが示すのは、巨大化一辺倒だった言語モデル開発へのアンチテーゼだ。文章生成という汎用性を捨て、選択という単機能に絞ることで速度と効率を極限まで高めた。十数万語への採点を24個に、30往復を1回にという削減は、工学的には当然の帰結でありながら、誰も製品としてやり切らなかった領域だ。易問満点と難問半分というデータは、一芸モデルの限界を正直に開示した点でも価値がある。すべてを大きなAIにやらせるのか、浅い判断を小さなAIに任せる分散型にするのか。この問いへの答えは用途次第だが、少なくとも選択肢が増えたことは確かだ。自宅のRTX 3090で動く0.1秒の判断器という存在は、AIエージェント時代の部品として見逃せない。

