【速報】国産AIが世界を驚かせた、5.5GBで動くLLM-jp-4.1の仕掛け
【速報】国産AIが世界を驚かせた、5.5GBで動くLLM-jp-4.1の仕掛け
国立情報学研究所のLLM研究開発センターが2026年9月28日の夕方に公開したLLM-jp-4.1が、オープンなAIモデルの常識を覆している。8Bと32B-A3B、33Bの3サイズすべてに量子化版のGGUFが最初から同梱され、8BのQ4_K_Mはわずか5.5GBで動作する。元のBF16版17.2GBの3分の1以下だ。これまでは新しいモデルが出ても、手元で動く形に変換してくれる有志を数日待つのが当たり前だった。今回は初日から自分のパソコンで動く形が用意されていた。
鍵は置き場にちょこんと置かれていたimatrix.datという5MBのファイルだ。軽くするときに何を残して何を粗くするかを決める重要度行列が記録されている。この行列はモデルに較正用の文章を実際に読ませて、どこがよく働いたかを記録した表にすぎない。読ませる文章が変われば答えも変わる。有志はよそから借りた汎用のテキストを使うしかないが、学習データを公開しているモデルなら自分のデータで較正できる。本家だけが出せる軽量化の秘密がここにある。

引っ越しで分かる量子化の仕組み
量子化を引っ越しの荷造りにたとえると分かりやすい。17.2GBという大きな荷物を、3分の1以下の5.5GBにまとめ直す。ただ小さくするだけでは答えが変わってしまう。そこで重要になるのが、どの荷物が大切かを示す目録だ。それが重要度行列である。よく使う道具は丁寧に包み、あまり使わないものは粗くまとめる。そうすれば小さくなっても使い勝手は大きく変わらない。
3サイズ6リポジトリという配り方も注目されている。8Bは手元のパソコンでも試しやすく、32B-A3Bと33Bはより高性能を狙う人向けだ。ただし注意点もある。モデルカードには現時点ではllama.cppのフォークが必要で、上流にはトークナイザ周りの修正がまだ入っていないと書かれている。落とす前に確認が必要だ。また32B-A3Bが33Bより大きいという紛らわしさもあり、名前だけで判断しない方がいい。
でたらめが良いという逆説
話はきれいには終わらない。本家のデータで較正するのが最善だとは、llama.cppの開発の場でまだ決着していないからだ。でたらめな文字列で較正した方が良いという実測もあれば、重要度行列を実装した本人が結論を急ぐなと書いている。整った文章で較正すべきか、でたらめに近い文字列で較正すべきか。議論は続いている。
性能の数字にも注意が必要だ。MT-Benchや日本語評価の点数は、いずれもLLM-jp自身による評価で第三者による独立した評価ではない。量子化の前後で8Bが7.54から7.57に上がって見える点も、公式の表現は概ね同等の性能を維持だ。量子化で賢くなるという意味ではない。学習データは公開されているが全部ではなく、一部はライセンス上の制約で除外されている。全部公開とは言えない部分もある。点数よりも開き方を見ることが大事だという指摘は的を射ている。
公式テックブログやHugging Faceのリポジトリ、llama.cppの議論をたどれば、初日に軽い版が出せた理由が見えてくる。較正に使う文章をどこから借りてくるかという地味な問題が、配り方の速さを決めていた。生活を1週間記録した表のような地道な作業が、5.5GBという身軽さを生んだ。
ネットの反応
おーちょうど関心を持っていたところです。ありがとうございます
国産LLM使ってみたいです。ローカルLLM初心者なので、簡単に触れるようになったら導入動画ぜひお願いします
LLM-JP 4でLLM-JPのllama.cppなのですぐ試せる。パラメータも既存でできると有難い
80億じゃなくて800億では
AIの所感
強さの競争ではなく配り方の工夫で勝負した点に好感を持つ。5MBの目録が公開文化の強さを象徴している。決着していない議論を隠さず両論併記する姿勢も誠実だと思う。国産モデルが軽さで世界に貢献する流れが続けば、自分の機械でAIを動かす楽しさがさらに広がるはずだ。