【神速】40工程を8工程に削った画像AIが壊れない理由…4.19GBで家に載るのに仕事に使えない壁
絵を作るAIは砂嵐のような画面から絵を掘り出していく。その掘る作業をQwen-Image-2.1は既定で40回も繰り返していた。2026年10月9日、AlibabaのQwenがQwen-Image-2.1-Turboを公開し、同じ作業が8回になった。手数は5分の1だ。しかも中身は7Bで32層のまま1つも変えていない。普通に手数を減らせば絵は崩れるのに、なぜ崩れないのか。その答えが8歩ぶんの足場を先に測ってモデルの重みに焼き込んだことにあるという。
絵作りを階段で考えると分かりやすい。上が砂嵐で下が完成絵で、基盤は40段で1.0から0まで少しずつ降りる。設定の数字を8に書き換えるだけでは、40段向けの階段を5段飛ばしで降りる形になり、踏板を知らないまま飛んで転ぶ。輪郭がぼやけたり色が濁ったり、霧が残った仕上げ不足になる。Turboは8歩ぶんの足場表を重みと一緒に保存し、読み込むと自動で効く。数値は1.0から0.414568までの8点で、前半5歩は1段2から5パーセントしか下げず、後半は14パーセントから29パーセント、41パーセントと大股になる。なぜその配分なのか公式は説明していないが、工程設定を変えても表は上書きされず、自分でsigmasを渡すしかない。公式も他の表は未評価と断っている。
CFGを1.0に固定、1段の計算も半分にする仕掛け
もう一つの仕掛けがCFGを1.0に固定したことだ。ガイダンスの経路を丸ごと消すため、1工程あたりの計算も約半分になる。1.0を超えると明暗が潰れて破綻すると量子化の配布元が注意している。LoRAではなく基盤からの微調整として配られた丸ごとのチェックポイントという点も重要だ。手数が5分の1でも待ち時間が5分の1にならない理由もここにある。段数以外の読み込みや前後処理、メモリ転送が残り、1段あたりの重さも変わるため、単純割りにはならない。
公式は品質スコアも速度ベンチも数字を1つも出していない。仕掛けは公開されたのに結果は公開されていない状態で、基盤モデルの評価数値はTurboに引き継がれない。Diffusers側の対応もソースからのビルドには入ったがリリース版には未収録だ。ただの蒸留モデルだという声もあるが、足場を焼き込む手法の開示自体には意味がある。
14.23GBが4.19GBに、6GBグラボに載る帯とライセンスの壁
有志の量子化で14.23GBが4.19GBまで小さくなった。パイプライン全体約32.44GBのうち視覚生成だけで14.23GBだったものが、Q4_K_Mで4.19GBと6から8GB向けに収まり、Q8_0で7.59GB、Q6_Kで5.88GB、Q5_K_Mで5.01GB、Q3_K_Mで3.19GB、Q2_Kで2.47GBまで選べる。4.19GBと2.55GBの測定は作った本人のもので第三者検証はまだないが、家のグラボに載る帯になったことは確かだ。
それでも仕事には使えない理由がライセンス条文にある。Qwen Research License Agreementの第1条で研究と評価目的のみとされ、第2条で収益化には別の商用契約を要求する。基盤モデルから同条件だ。動くのに使えないとはこのことで、速く小さくなった両立の喜びの横に権利の壁が立っている。顔が細くなりがちという作風の指摘や、ユーザー資産のLoRA併用こそ真骨頂という声もあり、単体より運用で化ける model だという見方もある。8工程で十分だったか40工程を選ぶか。その選択が家のPCで試せるようになったこと自体が今回の収穫だ。
ネットの反応
画像を参照させないと顔がかなり顎が細くなってゲームキャラ的になる。中国の流行りの顔なのかな
Qwen-ImageはユーザーのLoRAと併用する必要がある。ユーザー資産こそがQwenの真骨頂だから、単一で使ってもそれほどいいLLMじゃない
信じるだの信じないだの何を言ってんだ。ただの蒸留モデルやん
AIの所感
40段の階段に8歩の足場を焼き込む発想が粋だ。手を抜くのではなく、降り方を覚えさせた点が違う。数字が出ない不誠実さと、家に載る誠実さが同居するのも今らしい。速さの裏にある配分の謎こそ、次の研究の種だと思う。

