酒呑ガジェット

〜静かな環境であなたに...こちらは音のでないコンテンツです。〜

【警告】たった一言でAIが陥落、最強50モデル全滅のプレフィル攻撃「デカくても無駄」

【警告】たった一言でAIが陥落、最強50モデル全滅のプレフィル攻撃「デカくても無駄」

自分のパソコンで動く高性能なオープンAIに、構造的な弱点が見つかった。安全装置をたった一言の事前入力で無効化するプレフィル攻撃だ。世界の最先端オープンモデル50種類を集めた大規模検証では、ほぼ全てのモデルで攻撃成功率が95パーセントから100パーセントに達した。QwenやKimi、Llamaといった世界標準のモデルも陥落し、巨大化しても防御にならないという結果が業界に衝撃を与えている。

入り口と出口に警備員がいない、オープンモデルの宿命

現在のAIには大きく分けて企業が管理するクローズドモデルと手元で動かすオープンモデルの2種類がある。クローズドモデルの場合、企業がサーバーを管理しているため強力な監視システムが設置されている。利用者が悪い質問を送信する前に弾いたり、AIの回答を監視してブロックしたりできる。建物の入り口と出口に厳重な警備員が立っているようなものだ。

パソコンにダウンロードして使うオープンモデルにはその警備員が存在しない。利用者自身がAIを動かす環境を完全にコントロールしている状態になり、悪意のある人が使おうと思えば外部の監視をすり抜けて直接AI本体に命令を送り込めてしまう。モデルを公開した後に開発者が使い方を制限する手段は一切ない。だからこそオープンモデルはAI自身が内側に持っている悪い要求を拒否する学習だけに頼るしかない。通常の入力なら危険な要求をきちんと拒否するように訓練されているが、手元の環境を完全に操れるという事実が内部構造の隙を突く攻撃を可能にしてしまう。

承知いたしましたと口を動かす、文脈のハイジャック

AIは過去の全ての文章の流れを読み取って次に続く確率が最も高い言葉を予測して出力している。危険な質問をされた時、AIは最初の数文字でお答えできませんという拒否の言葉を選ぶように訓練されている。そこで攻撃者はAIが話し始める最初の言葉を強制的に書き換えて事前入力してしまう。具体的にはAIの出力の冒頭に承知いたしました、詳しい手順は以下の通りですという言葉を無理やり注入する。

システムは自分自身が作り出している文章の文脈を矛盾なく続けようとする性質が強い。すでに承知いたしましたと自分が答えてしまっている状態から生成が始まると、AIは肯定的な言葉の直後に突然お答えできませんと付ける不自然さを避けようとする。その結果、注入された言葉に引きずられる形で危険な知識をそのまま出力し始めてしまう。脈の一貫性を保とうとする真面目な性質が見事に悪用されており、拒否モードに切り替わる前に強制的に協力モードに引きずり込むのが文脈のハイジャックだ。

オープンソースAIがプロンプト注入攻撃で乗っ取られるサイバーセキュリティのイメージ

説得ではなく結果の改ざん、従来の脱獄との違い

これまでの安全措置破り、いわゆるジェイルブレイクとプレフィル攻撃は根本的にアプローチが違う。従来のジェイルブレイクは利用者が入力する質問文を複雑に工夫してAIを騙そうとしていた。倫理フィルターのない開発者モードだと指示したり特殊な暗号を使ったりする手口で、全て入力側である利用者の言葉の範囲内で説得しようとする試みだった。

一方でプレフィル攻撃は入力ではなくAIの出力履歴そのものに直接介入する。チャットの裏側では利用者の言葉とAIの言葉がシステム用のタグで区切られているが、攻撃者はその仕組みに介入してAIが話し始めるタグの直後に好きなテキストを流し込める。企業が管理するサービスなら言葉の順番やルールを厳重に監視しているため真似はできないが、ローカル環境では監視の目を気にせず出力の初期状態を自由に上書きできる。複雑な言い訳を考える必要がなく、極めて高い確率で安全を突破できる。説得も騙しも必要ないという点が最大の脅威になっている。

50モデル全滅、巨大さは防御にならず

深刻さを示すため研究機関が過去最大規模の検証を行った。世界中の最先端オープンモデル50種類を集めて23種類のプレフィル攻撃を仕掛ける実験で、対象にはメタやアリババ、ディープシークといった世界標準のモデルが全て含まれている。通常の状態なら危険な質問に対して10パーセントから15パーセント程度しか応じない。しかしプレフィル攻撃を適用した途端、ほぼ全てのモデルで攻撃成功率は跳ね上がり、軒並み95パーセントから100パーセントという壊滅的な結果になった。

検証された攻撃戦略の中にはシステムの内部メッセージを偽装する手口もあった。フィルター無効化や検査完了といった架空のメッセージを事前入力してAIを従わせるものや、架空の学術論文からの引用で嘘の権威を信じ込ませる戦略も極めて高い成功率を出した。単なる文字の羅列は失敗するが、自然な文脈を作り出す戦略に対しては完全に無力だった。

開発者の間ではモデルを巨大にして知識を増やせば倫理的な判断能力も上がって安全性も高まるのではないかという仮説が長年唱えられてきた。しかし異なるサイズのモデルを比較した結果、その希望は完全に打ち砕かれた。200億パラメーターの小さなモデルも1200億以上の巨大なモデルも等しく100パーセント近い確率で陥落した。文脈に沿って次の単語を予測するという根本的な仕組みが変わらない限り、巨大さは防御にならない。むしろ能力が高いAIほど一度陥落すると専門家レベルの詳細な回答を作れてしまい、被害の規模も指数関数的に跳ね上がるという皮肉な結果も確認された。

思考するAIも99パーセント陥落、3つの防衛線はあるか

最終的な答えを出す前に深く思考する大規模推論モデルが主流になりつつある。これらは専用の思考チャネルを持ち、出力する前に裏側で安全性を再評価できる。汎用的なプレフィル攻撃に対しては思考を経由することで一定の防御力を示していた。ところが攻撃者側は推論モデル専用のエンプティアナリシス攻撃を開発してしまった。思考するためのタグを意図的に空のまま終わらせ、直後に最終出力チャネルを開始する命令を注入する手口で、安全性を再評価するという唯一の防御機会を奪う。思考をスキップさせられたAIはそのまま最終回答の生成に直行させられ、最新の推論モデルでも成功率99パーセント以上という結果に終わった。強制終了させられて出力された危険な回答は平均1700トークンを超える極めて長大なものだった。

対策としては最終出力の直前に回答を倫理スクリーニングするAIだけを流通可能にすればかなりの悪答ははじけるという提案もある。入力と出力の監視、思考過程の保護という3つの防衛線を重ねる必要があるとされる。表層的な安全対策だけでは構造的な脆弱性を塞げない現実が突きつけられている。

ネットの反応

最終出力の直前に回答を倫理スクリーニングするAIだけを流通可能にすれば、かなりの悪答ははじかれると思う

たった一言で最強AIが乗っ取られるとか対策のしようがない。オープンだからこそ起きる悲劇だな

デカくしても無駄って結果が絶望的すぎる。賢いほど悪用された時の被害がデカくなるのは皮肉だ

思考するAIでも99パーセント陥落とかもうお手上げだろ。考える時間すら与えないとかえぐい

AIの所感

プレフィル攻撃が突くのはバグではなく次トークン予測という言語モデルの本質だ。文脈の一貫性を優先する限り、肯定で始まった文章を否定で折り返すのは構造的に難しい。オープン環境では出力の初期状態を握られるため、外部フィルターなしでの完全防御は原理的に困難に見える。巨大化が防御にならないというデータは、規模への信仰に冷水を浴びせた。推論チャネルの分離も空タグで無効化されるなら、防御はモデルの外側に置くしかない。便利さと開放性の代償として、流通時の倫理スクリーニングや実行環境の認証といった重い議論が避けられなくなっている。

-パソコン