【悲報】7Bと名乗る画像生成AI、落としたら33GBの怪 通訳が本体より重い2.3倍の罠
2026年9月20日にアリババのQwenチームが公開した画像生成モデルQwen-Image-2.1をめぐり、小さいはずなのに重いという逆説が話題になっている。画像を作る部分はわずか7B、71億パラメータと名乗り、非公開の巨大モデルを上回ったと主張している点が売りだ。ところが実際に配布ページからファイルを1つずつ拾って足し直すと、画像生成部14.2GBにテキストエンコーダ17.5GB、VAE1.35GBで合計約33.1GBになる。名前に出ていない方が名前のある本体より重く、パラメータ換算でも名乗り71億に対して実際に要るのは166億で2.3倍だ。小さくなったのに使える範囲は狭まったという二つ目の落とし穴も発覚し、小さいから楽になるという常識が裏返っている。
まず起きたことを整理する。公開元は中国の巨大企業アリババのAI部門Qwenで、文章を扱うモデルが本流だが画像生成版も去年から継続して出してきた。今回の売りは大きく3つで、透明、大きさ、参考画像の枚数だ。第一に背景のない絵をそのまま出せる。従来は必ず背景ごとの四角で出てきて、人物だけ欲しい時は後から背景を消す作業が要った。切り抜き専用のAIに通す2段階が当たり前で、切り抜く側は中身を知らないため背景と似た色の服を消したり毛先を溶かしたり白く光らせたりした。今回は色の赤緑青に加え、透け具合の情報を4つ目のチャンネルとして最初から持つため、描いた本人がここは背景だと分かった上で透明にする。消し忘れが起きず、商品写真を置き直すたびに切り抜きをやり直す地獄から解放される。サムネイルや資料に人や物を貼る用途で地味に効く。
2048ピクセル直出しと参考画像10枚 便利さの裏に値札
第二の売りは大きさで、2048ピクセルをそのまま出せる。横長なら2752かける1536まで対応し、動画のサムネイル向きの形で切ったり足したりが要らない。従来は小さく描いて別のAIで拡大するのが普通で、元にない細部を作り足す際に嘘の模様やぬるっとした質感が生まれ、看板の文字が知らない国の言葉に化ける事故が起きた。最初から大きく描ければ工程ごと不要になり、文字や顔の光の当て方、細部の出来も良くなったとされる。ただしこの辺りは自分の目で見るまで信じない方がいい領域だという指摘もある。出典はGitHubのQwenLM/Qwen-Image-2.1、Hugging FaceのQwen/Qwen-Image-2.1のREADMEとLICENSE原文、ファイル一覧、前版Qwen/Qwen-Imageのモデルページ、the-decoderの2026年9月20日記事、ComfyUI公式ブログのQwen Image 2.1対応記事で、取得日はいずれも2026年9月20日から21日と明示されている。
第三が参考画像を10枚まで同時に渡せることで、人物の顔や商品、背景、絵柄の見本をまとめて渡して同じキャラクターを別場面で描かせたり、一部だけ直す指示を通したりできる。直したい場所を丸で囲むか上から色を塗ればよく、左から3番目の人の襟といった言葉で場所を説明する苦労が減る。ところがこの10枚という数字が重さの正体と直結する。便利さに値札が付いていたというのが今回の核心だ。言葉を絵描きの分かる形に直す通訳、Qwen3-VLというもう一つのAIが必ずセットで必要になり、日本語で注文してもそのままでは通じない。名乗りの7Bは絵描き1人分の体重で、通訳の体重は数に入っていない。
なぜ20Bから7Bに痩せられたのか 単流と方眼紙の秘密
痩せられた理由は書き方と下書きの持ち方の2つだ。中身は32層の積み重ねで、前版は文字を読む係と絵を描く係の2本立てで並走し、同じ絵を2回見る形で全体を眺めてから話し合っていた。今回は1本の流れにまとめた単流と呼ばれる作りで、受け渡しが消え読むのは1回で済む。会議を減らす発想に近く、同じ前置きを毎回読み直さない工夫として一度読んだ内容を使い回し、絵を少しずつ直す際に同じ注文を32回読まずに済ませる。家の狭い部屋にも入れる小さい絵描きという例えがしっくりくる所以だ。
もう一つが下書きの畳み方で、こちらが大きく効く。AIは絵をそのまま扱わず、一度小さな方眼紙に畳んでから描いて元に戻す。今回は2048ピクセルの絵を縦横それぞれ16分の1に詰め、面積で256分の1にする代わりに、1マスあたり64種類の数字を持たせる。狭い所に詰め込む冷凍庫のような発想で、面積を減らして密度を上げた。数字で言えば2048ピクセルが128マスの方眼紙になり、1マスが色も透け具合も質感も畳み込んだ64個の数字を持つ。描き終わったら方眼紙を元の大きさに開き直す。この畳む道具を作り直したのが今回一番大きな技術的仕事で、透明を扱えるようにしたのも同じ道具の作り直しによる。軽さと透明が同じ根から来ていたわけだ。
14.2GBに17.5GBに1.35GB 47GBの怪文書を自力で訂正
落とし穴の1つ目が重さの実測だ。配布元のファイル一覧をAPIで1つずつ拾って自分で足した数字が、画像生成部14.2GB、テキストエンコーダ17.5GB、畳む道具VAE1.35GB、合計33.1GBになる。よそでは合計47GBと書く要約もあったが、内訳と合わなかったため採用されなかったという経緯が明かされている。誰かのまとめを映したのではなく元の一覧を引いて足し算し直した点が肝で、人の足し算は間違うことがあるという教訓付きだ。通訳が重いのは手抜きでも設計ミスでもなく、参考画像10枚対応という一番の売りと17.5GBが同じものだからだという整理は鮮やかだ。
24GBのRTX3090に33GBは載るのかという問いも現実的だ。公式が必要VRAMを公表しているわけではなく、RTX3090で動くというのは記事側の記述で、BF16のままの33GBは24GBに載らないため量子化を前提にした話である点が区別されている。もう一つの落とし穴がライセンスで、前版Qwen-Imageの20BはApache2.0で商用利用できたが、今回はQwen Research License Agreementに差し替わり研究か評価目的だけになった。モデルは小さくなったのに使える範囲は狭まったという普通とは逆向きの変化で、まとめ記事ではなくLICENSE原文に当たって商用禁止を確認したという。非公開モデルに勝ったというのもQwen自身の試験による主張で、独立検証はまだなくベンチマークの点差も公表されていない。動画内では一貫して勝ったではなくそう主張していると語り、公式の必要VRAMや2.1の公式ベンチマーク中身、第三者評価は分からないと明言する姿勢が貫かれている。
ネットの反応
絵描きの仕事が奪われると騒がれていたから、アリババが急にケチになったわけではないと思う。
最初に自宅で動かしたのはStable Diffusion初代。1枚待つ間にお茶が入った。
中身が見られて手元に落とせても商売に使えないのをオープンと呼んでいいのか。
通訳の方が本体より重いという落ちが強烈。便利さの値札という表現が腑に落ちた。
47GBと書くまとめがあったのに内訳と合わないから自力で足し直す姿勢は信頼できる。
AIの所感
7Bという名札だけ見て軽いと判断する危うさと、足し算で暴く地味な検証の強さの対比が心地よかった。単流化と方眼紙の高密度化という痩身の理屈が、透明対応と同じ道具に収れんする構成は見事だ。量る、原文に当たる、分からないと言うという三点セットが、主張の大きさに流されないための作法として機能している。小さくなったのに狭まったという逆向きの変化は、重さも自由も名前では測れないという教訓として記憶に残った。

