【衝撃】ローカルLLM「Qwen」の偏り、設定で消せない理由が判明…重みの中に「染み込んだ色」は手術しないと落ちない
「自分のPCに落としたAIなら、もう誰にも縛られていない」——そう信じてQwen(アルババ製オープンウェイトモデル)をローカル実行しているユーザーは少なくない。だが2026年10月2日(日本時間3日未明)、CBS Newsがイスラエルのセキュリティ企業Hirundoの調査を報じ、**「政治的に微妙な15テーマで偏った回答が89.8%」**という数字を叩き出した。さらに衝撃なのは、**「重みを直接書き換えた版では2.8%まで減らせたが、設定画面・システムプロンプト・温度・top_pなどユーザーが触れるあらゆるパラメータでは一切消えない」**という事実だ。なぜ「自分のマシンの中にあるファイル」なのに、ユーザーはその偏りをコントロールできないのか。27分の解説動画が、「布の色」という鮮やかな比喩で、LLMバイアスの物理的正体と除去手術の代償を余すところなく映し出す。
「布の色」の比喩——上から被せた布 vs 糸から染めた布
動画の核心はこの比喩に尽きる。モデルの回答傾向(クセ)を「布についた色」と見立てると、色のつけ方には2通りある。
- 白い布の上から色付きの薄い布を被せる:クラウドAIの「セーフティフィルタ」(入出力を別プロセスで監視)。これは重みの外側にあり、ローカルに落とす際**一緒についてこない**。めくれば下から白い布(ニュートラルな重み)が出てくる。
- 織る前の糸そのものを染めてしまう:学習・調整段階で重み(数億〜数兆のパラメータ)自体に染み込んだバイアス。ファイルを落とした時点で**色ごと入ってくる**。めくるものがない。洗っても落ちない。
ユーザーが「設定で消せるはず」と探し回るのは、前者の仕組み(フィルタ)を前提としているからだ。だがローカルLLMでは**フィルタは最初から同梱されておらず、糸から染まった布だけが届く**。「設定画面に並ぶもの(temperature, top_p等)は全部『折り方の調整』であって、糸の色を変えるつまみは最初から1つも置かれていない」——これが「消せない」物理的理由だ。
システムプロンプトは「布の上に置いた札」——守るか無視かはモデルの気分次第
「政治の話も中立に答えて」とシステムプロンプトに書いても、**あれは布の上に札を1枚置いているだけ**だ。糸の色は変わらない。読むか無視するかはモデルの気分次第で、Hirundoも「ルールを言い聞かせる手は効きが悪い」と明言する。温度(散らし方)、top_p(候補絞り)も「同じ色の糸をばらして織るか詰めて織るか」「どの糸を選ぶかの候補を絞る」だけで、箱の中の糸が全部染まっていれば意味がない。**設定とは「染まった糸をどう織るか」の指示でしかなく、「糸を染め直す」機能ではない**のだ。
偏りの正体——「残差ストリーム」という1本の太い筋に染み込んだ「拒否の向き」
では糸(重み)のどこに色が入っているのか。モデル内部には入力から出力まで情報が流れる**「残差ストリーム(Residual Stream)」という1本の太い筋**がある。全層がここに書き足していく。2024年のArditiらの研究で判明したのは、**「断る」という振る舞いが、話題に関わらずこの筋の中で決まった1つの方向(ベクトル)に傾く**という事実だ。バラバラな仕掛けではなく、共通の1方向にまとまっている。
この「拒否方向」の特定方法は驚くほど素朴だ:**「断られる質問束」と「普通に答える質問束」を大量に通し、それぞれの残差ストリーム状態の平均を取り、その差(引き算)を取るだけ**。中身の違いは打ち消し合い、「断るかどうかの差」だけが残る。この手軽さゆえに誰でも再現可能で、後のツール普及の理由になった。
そしてこの方向を書き込んでいる部品も特定済み:**アテンション出口側の行列(W_O)と、その次の層のMLP出口側の行列(W_out)の2種類**。どちらもストリームに書き足す直前の「最後の関門」だ。蛇口が決まっているからこそ、そこを狙えばいい——物理的に「染料が入っている層」が特定されているのだ。
「方向を抜く手術(Directional Ablation)」——行列を直角にして道を塞ぐ
向きが分かれば、その方向へ流れなくすればいい。手法は**行列を書き換え、対象方向に対して直角(内積ゼロ)になるように整える**こと。直角にすればその方向成分がゼロになり、ストリームへ書き足せなくなる=「道を塞ぐ」。向き自体を消すのではなく「通る道を塞ぐ」ため、**Directional Ablation(方向アブレーション、通称アブレーション)」**と呼ばれる。
この手術を誰でも実行できる形にしたのがオープンソースツール**「Heretic(ヘレティック)」**だ。RTX 3090 1枚(24GB VRAM)で動き、Qwen 4Bなら20〜30分で完了。VRAM不足時は4bit量子化でも対応。研究所専用ではなく**「自分の机の上で中身を書き換えられる」段階まで来ている**。
代償の正体——「断り97問→3問」成功の裏で「ずれ距離6倍」の傷
HereticのREADME(Gemma 3 12Bでの第三者実測)に衝撃の数字がある。
- 元モデル:100問中97問で拒否
- 手作業アブレーション:100問中3問まで減少(成功)
- Heretic自動アブレーション:同上3問まで減少(成功)
「拒否数」だけ見ればどちらも大成功。だが**「元モデルからのずれ距離(同じ質問への回答出力分布のズレ)」**を見ると全然違う。
- 手作業版:**1.04**
- Heretic版:**0.16**
**同じ「拒否3問」に見えて、傷の深さが6倍以上違う**。なぜか。手作業は全層を同じ強さで削るが、「拒否方向が強く出ている層」と「ほぼ出ていない層」がある。弱い層まで同一強度で削ると別の働きまで削ってしまう。Hereticは**層ごとに強さを変え(強い層は深く、弱い層は浅く)、方向指標も整数に限らず中間値を使える**ようにしている。丁寧に漂白すれば生地が残り、乱暴に漂白すれば生地がボロボロになる——**「消せるかどうかではなく、どれだけ壊さずに消せるかの勝負」**なのだ。
2.8%は「偏りが消えた」を証明しない——「黙らせただけ」の罠
Hirundoが発表した「重み手術版で2.8%」という数字にも落とし穴がある。**「偏った回答が減った」≠「偏り(糸の色)が抜けた」**だ。AAAI 2026採択論文「Silenced Biases」は指摘する:**「拒否という振る舞いが公平の見かけを作る」**。答えない(拒否する)から偏りが測れないだけで、答えるようになった瞬間に中身の偏りが露見する。「畳んでしまえば色は見えないが、色はある。広げて初めて分かる」——**見えていないことと、ないことは違う**。HirundoのCEO Ben Luria氏は「推論・コーディング・指示追従・数学で能力は概ね保たれた」と語るが、これは自社発表であり第三者追試は未確認。Westernized版重みも未公開(CBSは「これから公開する構え」とのみ記載)。
「無色の糸はどこにもない」——中国製には中国の色、西側には西側の色
動画の締めくくりは冷徹だ。「モデルは人が書いた文章で作られ、人が選んだ基準で調整される。元文章を選ぶのも人、いい答えと採点するのも人。どちらの工程にも選ぶ人の立場が入る」「無色の糸なんてない」。**中国製には中国の色が、西側モデルには西側で良しとされる色が入る。どちらが濃いかを決める物差しは誰も持っていない**。Hirundoが名付けた「Westernized(西側風)」という言葉も示唆的だ——**「無色にした」とは言っていない。「別の色に染め替えた」という名前だからだ**。
ではどうするか——「用途で布を選べ」、自分の机で確かめろ
動画が示す実践的指針は明確だ。
- 知っておく:落としたモデルには色が入っている。設定画面に色を変えるつまみはない
- 用途で選ぶ:コード生成・文章校正・数値集計等「政治的色が出ない用途」なら染まった糸でも雑巾に使う分には色は関係ない。30億DL・Uber Eats・A&B採用の実績はそこだ
- 立場が割れる話(歴史・政治判断)は単一モデルに任せない:複数モデルに投げ、答えの中身でなく**「答え方(どこで濁すか、どこで前置きを足すか、どこで断るか)」を横並び比較**する
- 自分の机で確かめる:同じ質問を2モデルに投げ、返ってきた回答の「濁し方・断り方」を比べるだけ。金はかからない(電気代のみ)。Hereticで手術するのも選択肢の一つ
「全部を疑う必要はない。無色の布を探しに行かないこと。どこにもないものを探すと設定画面と同じことになる」——この言葉が、ローカルLLM時代を生き抜くための最良のコンパスになる。
ネットの反応
悪貨が良貨を駆逐する。今はもう半年せずとも有料モデルにオープンソースが追いついちゃってるからな。中華製AIによって世界の歴史書が書き換えられていく。
「布の色」の例えが神すぎる。システムプロンプトが札って言われて膝打ったわ
HereticでRTX 3090 1枚で手術できるのマジ?自分のPCで試せるレベルになってんのか
拒否率97%→3%で「ずれ距離6倍差」は怖すぎる。見た目同じでも中身ボロボロなのね
2.8%は「偏り消えた」じゃなく「黙らせただけ」って指摘、評価側としてめちゃくちゃ重要
無色の糸はない、どっちも染まってる。使い分けるしかないって割り切りが健全だわ
方向アブレーションって行列を直角にするだけなのね。数学的に美しい解決法だ
Qwen 30億DLって規模がヤバい。UberやA&Bが使ってるのも納得、性能出るから
AIの所感
この動画が卓越しているのは、**「バイアス除去」という一見すると倫理・政治の問題を、「線形代数・ベクトル空間・残差ストリーム」という純粋な数学・工学の問題として再定義し、かつ「代償(モデル能力の劣化)」というトレードオフを定量化して提示している点**だ。89.8%→2.8%という派手な数字に踊らされず、「拒否方向ベクトルの特定(平均の差)」「行列への直角投影(アブレーション)」「層ごとの強度配分によるダメージ最小化」「ずれ距離というメトリクスでの代償可視化」——この一連の工学的プロセスを、ゆっくり霊夢・魔理沙の対話と「布の色」比喩で、**専門外の視聴者にも「仕組みとして」理解可能なレベルまで降ろし切っている**。
特に「システムプロンプト=札」「温度・top_p=折り方」「重み=染まった糸」という三段構えの比喩は、LLMアライメントの構造的限界を直感的に伝える傑作だ。ユーザーが触れる全パラメータが「織り方」でしかなく「糸の色」には届かない——この事実を知るだけで、ローカルLLM運用の無駄な試行錯誤(プロンプトエンジニアリングでのバイアス除去挑戦等)を大幅に削減できる。
Hereticによる「自分の机で手術」の民主化も象徴的だ。RTX 3090 1枚・20〜30分・オープンソースツールで、数十億パラメータモデルの内部表現を書き換え、特定方向への感受性を制御的に遮断できる時代が来た。これは「モデルをブラックボックスとして使う」から「モデルの内部表現を編集して用途に適合させる」への、**LLM運用パラダイムの根本的シフト**を告げるものだ。
一方で「無色の糸はない」「Westernized=別の色に染め替え」という結論は、AI安全性・アライメント研究の根本的限界を突く。「どの色を許容し、どの色を除去し、どの程度の生地損傷を許すか」——この判断は技術では決められず、ユーザー・組織・社会の価値観に委ねられる。動画が示した「用途で布を選べ、自分の机で確かめろ」という実践的スタンスこそが、現時点で最も誠実で、かつ強力な処方箋だと言えるだろう。

