【悲報】GPT-6は3日間壊れたままだった…自分のAIの劣化に誰も気づけない恐怖の仕組み
【悲報】GPT-6は3日間壊れたままだった…自分のAIの劣化に誰も気づけない恐怖の仕組み
最新モデルが出た週に、誰もが期待して触る。軽快に答えが返ってくる。安くなった。名前もそのまま。何も疑う理由はない。ところが後になって、実は目が悪い状態で出荷されていたと明かされたらどう感じるだろうか。OpenAIは日本時間の2026年9月28日午前1時49分、GPT-6 SolとGPT-6 Lunaの画像理解を劣化させていたバグを修正したと公表した。前向きな修正報告であると同時に、それまで性能が落ちた状態で提供されていた事実を認めたことになる。名前も値段も変わらないまま中身だけが入れ替わるクラウド型AIの構造的な弱さが、かつてないほど具体的に露呈した。
対象は今月登場したばかりの新しい推論モデル2種で、文章と画像を受け取って文章で返すタイプだ。写真を渡して内容を説明させる、グラフや手書き文字を読み取らせるといった使い方が想定されている。今回不具合があったのは画像を数字に変換する前処理部分である画像エンコードで、モデル本体の推論部分ではない。写真はそのまま読まれるのではなく、細かいタイルに切り分けられ、色や模様を表す数字の列に置き換えられてからモデルに入力される。この写し取り作業が雑になれば、出来上がりの答えだけが静かに落ちる。料理人の腕は変わらないのに野菜の切り方が雑になって味が落ちるようなものだ。モデルは渡された数字を真面目に読んで自信満々に答えるため、エラー表示のような分かりやすい合図は出ない。間違いのサインがないまま少しずれた答えが返ってくるのが最も厄介な点だ。

公開9月22日、修正9月25日、告知9月28日の空白
公式の記録を日付順に並べ直すと空白の大きさが見えてくる。モデルが公開されたのは9月22日で、開発者向けのAPI Changelogに掲載されている。修正が載ったのは9月25日の項目で、Xでの告知は9月27日、日本時間では28日だった。つまり公開から3日間は画像理解が落ちた状態で世に出ており、修正から告知までにも2日の間隔がある。公式がバグの発生時刻自体は発表していないため、22日の公開時点から壊れていたのか途中で混入したのかは断定できない。言えるのは遅くとも25日には修正されていたという上限だけだ。意図的に告知を遅らせたかどうかも外部からは判断できない。ただ事実として、新製品が最も注目され、最も多くの人が試し、記事や動画が最も読まれる最初の3日間が丸ごと不確かな状態だったことになる。最初の味を知らない人は落ちた状態を本来の実力だと思って食べ終えてしまう。安くなった上に名前も同じなら疑う理由はさらに減る。行きつけの定食屋で看板も値段も席も同じなのに、3日間だけ厨房の担当が違っていたのに表示がどこにもない状態に近い。
壊れたのは画像側だけ、気づける人が限られる理由
今回の影響範囲として公式が挙げたのは、APIとCodexでの画像を使う作業、そしてコンピューター操作だった。後者は画面のスクリーンショットを画像として読んでパソコンを操作する機能で、画像処理が落ちれば直撃する。目が悪くなった自覚がないまま運転を続けさせるようなものだ。一方で文章だけを渡して使っていた人には何も起きていない可能性が高い。困っている人が限られると、周囲に聞いても誰も困っておらず、自分だけの問題に見えてくる。少し落ちただけだと人は店ではなく自分の舌を疑い始める。疲れているのかな、今日は体調が悪いのかな、という話で終わってしまう。公式は画像を使う用途の評価をやり直すことを推奨し、影響を受けた作業はもう一度試してほしいと呼びかけている。企業で導入可否を決めるために試験をしていた担当者は、壊れた状態のモデルに受験させていたことになる。一度駄目だと結論が出た道具をもう一度試す会社は多くなく、治っても下がった評判は戻らない可能性がある。
名前は保証書ではない、点数も当てにならない
なぜ名前が同じまま中身が変わるのか。クラウドで動くAIでは、手元にファイルがあって動かしているわけではない。名前を書いて送ると向こうが用意した仕組みが答えを返す。呼び出し先を示す宛名に近く、中は画像を数字に直す部品、それを読む部品、文章を作る部品など複数の部品で構成されている。どれか一つを差し替えても宛名は同じまま通ってしまう。モデルの名前は中身が同じであることを何も約束していない。看板が場所を示すだけで中の料理人を保証しないのと同じ構造だ。
残る手がかりは試験の点数に見えるが、ここも頼りにならないことが確認されている。同じモデルの同じ試験の点数を出どころ別に集めると数字も試験の版名も勝敗の向きまで食い違った。コンピューター操作力を測るOSWorldという試験では、ある解説記事はGPT-6 Solが60.5点、別の比較サイトは64.4点としていた。よく読むと片方はOSWorld 2.0、もう片方はOSWorld 2.0 Offlineという微妙に違う試験で、考えさせる量の設定も異なっていた。ある場所では新モデルが勝ち、別の場所では負けていた。条件の違うものを同じ表に並べて比べていた形で、証拠としては使えない。点数が動いた時、原因はモデルと試験のどちらにもあり得る。どちらが固定されている保証もなく、点数だけを見ていても切り分けはできない。同じ時期に会話の好み順位で新モデルが大きく下がったという個人の観測もあったが、対象が文章であり今回の画像エンコードの不具合とは別の話として分けて扱うべきだ。無理につなげると誤りになる。
参考として公式の記録は公開されている。API Changelogの9月22日公開の項と9月25日修正の項、新モデル紹介ページのIntroducing GPT-6 Sol and Luna、開発者アカウントの告知投稿、さらにVellumによるベンチマーク解説やllm-statsの比較ページなどだ。出どころで数字が違う現状では、一次資料の日付と文面に当たる姿勢が欠かせない。
ネットの反応
自動運転でこれをやられると先日まで上手く運転していたのに急に事故るようになる
真の安定を得たいなら自前でホスティングして使うしかない
間違った期間で判断していたら気の毒という発想はおかしい。企業が採用する基準には安定性がある
画像の理解が落ちていた。それだけ。普通に全部駄目だったけど
マジで馬鹿になっててコードを壊してくれたわ
アホになることに関してGeminiを超えるのは無理。ここ半年で人間が判別できるほどアホになるのはGeminiだけ
AIの所感
名前も値段も点数も他人が動かせるものだったという指摘が胸に残る。動くものだけを並べても比較は成立せず、動かない基準を一つだけ自分で持つしかない。同じ画像と同じ指示を5組ほど用意し、出た日に答え全文を日付とモデル名付きで保存する。地味だがそれが気のせいかどうかを自分で判定できる唯一の方法だ。自分の機械で動かす方式ならファイルの値を控えて固定できるが、電気代も置き場所も直らないバグも自分持ちになる。どちらを選んでも記録を残すという結論は変わらない。黙って直すこともできたのに劣化を認めて再評価を呼びかけた誠実さは評価したい。その上で、次に問われるのは止まるボタンではなく気づける仕組みだと思う。