【悲報】激安AIは下書きの神、仕上げの死神だった…半分の落差の正体
【悲報】激安AIは下書きの神、仕上げの死神だった…半分の落差の正体
2026年10月7日に公開されたClaude Haiku 5.5が、安さと性能の常識を同時に壊している。最も安く最も小さい段のモデルでありながら、上位のSonnet 5.5を100とした時の取り分で見ると、知識労働が88.0パーセントと86.5パーセント、人類最後の試験が80.7パーセントと89.0パーセント、画面操作のOSWorld 2.1が86.3パーセントと、ほとんどが8割から9割に並ぶ。ところが1項目だけきれいに半分まで落ちる。ターミナルで作業を最後まで仕上げさせるTerminal-Bench 4.0で取り分55.5パーセントだ。Haiku 5.5が39.2パーセント、上位が70.6パーセントという内訳である。
さらに奇妙なのは1年前の姿だ。Haiku 4.5はこの項目が0パーセントだった。他項目では1桁や10数パーセントがついていたのに、ここだけ丸ごとの0だった。それが1年で0から39.2パーセントまで来た。料金は100万トークンあたり入力0.10ドル、出力0.50ドルで、1年前の1ドルと5ドルから10分の1になった。10万トークンを超えると単価が5倍になる区切りはあるが、公式は要求の約9割が10万未満としている。読み直し時の料金は100万で1セントとほぼ無料に近い。安さが前提にある中での半分の落差は、頭の良さでは説明がつかない。
答えは採点の仕方が違ったという点にある。作業をドミノの列に例えると分かりやすい。並べた枚数が工程の数、1枚が次を倒せる確率が1工程あたりの精度だ。そして同じ列を見ていても採点には2通りある。何枚倒れたかを数える部分点と、最後の1枚まで届いたかだけを見る完走式だ。途中まで片付いた仕事は大抵ついていないのと同じで、半分だけ終わった引っ越しにはまだ住めない。

66問全テスト合格だけが正解の鬼ルール
Terminal-Bench 4.0は完走式だった。課題は66個あり、ソフトや機械学習、科学、運用保守、安全まで幅広い。課題ごとの専用テストが全部通った時だけ合格で、部分点はない。1課題を3回やって平均を取り、持ち時間は全課題一律8時間にそろえられている。4.0では流出課題など8個を削り19個を修正しており、古い数字との単純比較はできない。
一方のOSWorld 2.1は物差しを2本持っている。開発側の論文には最も良かったモデルでも完走は20.6パーセント、同じ実行の部分点は54.8パーセントと書かれている。問題は1問も変わらない。物差しだけで2.7倍動く。完走式の世界最高記録が20.6パーセントである以上、Haiku 5.5の72.4パーセントも上位の83.9パーセントもそこには収まらない。あれは部分点側の数字で、意味は7割の仕事が終わるではなく7割の工程まで進むということだ。20枚のドミノのうち14枚倒れた状態であり、仕事としては終わっていない。
長いから苦手は間違いだった
当初の見立てである工程の数が多いほど差が開くという説明は、一次資料を読み直すと逆だった。OSWorld 2.1の方が1課題あたり平均318回の操作と工程はずっと多い。上限500手で、人が解く時間の中央値は1時間半だ。それでも86.3パーセント取れている。長さでは説明がつかない。公式一覧のオフラインという表記も短縮版という意味ではなく、全108課題のうちネット接続が要る26課題を外した82課題という意味で、1課題の長さは変わらない。
効いているのは工程数と採点方式の掛け合わせだ。仮の試算では20枚のドミノで1枚95パーセントなら完走35.8パーセント、90パーセントなら12.2パーセント、85パーセントなら3.9パーセントになる。1枚の精度は5ポイントしか動いていないのに完走率は3倍近く動く。1年分の改善の正体は1工程あたりの小さな向上であり、0パーセントは1枚も倒せなかったという意味ではなく、端まで届いた回が1度もなかったという意味だ。同じHaiku 4.5がOSWorldでは15.7パーセントを取っており、部分では進めて完走では0点という両立が成立する。
任せていい基準は人が最後に見るかどうか
安いモデルに任せていい仕事の基準は値段でも性能でもなく、その仕事を最後に人が見るかどうかだ。人が最後に見る仕事は部分点でいい。下書きや要約、翻訳、分類はそちら側で、7割の工程まで進んでいれば残りは人が直せば済む。一方で人が見ない仕事は丸ごと完走式になる。夜中に走る自動化やまとめて処理するバッチがそれで、止まったことにも気づけない。Terminal-Benchの39.2パーセントは6割が最後まで通らない数字であり、人が見ない場所に置くのは怖い。混ぜて使い、工程を切って人が見る部分だけ安い方に回すのが現実解だ。20枚を10枚ずつに割るだけで完走率は大きく上がり、任せ方を変えることは精度を上げるのと同じ効果がある。
比較の相手として並ぶGPT-6 LunaはTerminal-Benchで16.4パーセントとHaikuの半分以下だが、これは自社ページの一覧であり第三者が同条件で測り直した結果ではない。Lunaも最安段で料金は100万あたり入力10セント、出力50セントと同額だ。第三者評価ではSonnet 5.5が63.6パーセントと公式70.6パーセントと食い違い、走らせ方で数字が動くことも示されている。総合知能指数43で1年前から26ポイント上昇という評価もある。数字は1年で腐るが、読み方は腐らない。
主な出典
Anthropic Claude Haiku 5.5 公式ページ 2026年10月7日
https://www.anthropic.com/claude-haiku-5-5
Terminal-Bench 4.0 公式告知
https://www.tbench.ai/news/terminal-bench-4-0
Artificial Analysis 評価一覧
https://artificialanalysis.ai/evaluations/terminalbench-4-0
OSWorld 2.1 公式サイトおよび論文
https://osworld-v2.xlang.ai/
取り分の割合や72.4パーセントの解釈、ドミノ試算は公開資料を基にした独自計算を含む。
ネットの反応
用途や翻訳、要約など全部書いてある作業なら全然いける。資料を見て検討系は厳しい
完走作業に向かないのは働かせすぎなのではと思ってしまう
手順を細かく分ける発想は家事と同じで腑に落ちる
AIの所感
9割と半分の差は能力差ではなく物差し差という発見が核心だ。部分点で輝く才能を完走の場に立たせれば潰れるし、完走型に下書きをさせれば割高になる。適材適所と工程分割こそが最も安い改善であり、モデルを買い換える前に任せ方を変えるべきだ。72.4パーセントを7割できたと読むか7割進むと読むかで運用は全く変わる。数字の裏にある採点を読めるかどうかが、これからのAI使いの分岐点になる。