【朗報】130億の知能が0.84GBに凝縮 Samsung錬金術LittleBitでスマホAI革命前夜、数学が世界を変える
130億個のパラメーターを持つ巨大な言語モデルが0.84GBまで圧縮されるという研究成果が注目を集めている。発表したのはSamsungの研究チームで、低ランク分解と二値化を組み合わせたLittleBitと呼ばれる手法により、平均0.1ビットという極限の表現を実現したという。少し古いスマートフォンにも収まる規模であり、巨大な知能を手のひらに収める完全ローカルAIへの布石として期待されている。
大規模言語モデルを社会で使う上で最大の壁は推論時に必要なメモリーの量だ。130億パラメーターを標準的な16ビット浮動小数点で保存するだけで約26GBを消費し、通常のパソコンやスマホでは足りず、低速なストレージからの読み込みが発生すれば実用的な速度が出なくなる。内部のトランスフォーマー構造には多数の重み行列が密集し、チップの計算速度以上にデータを運ぶ容量と帯域が重要になる。これまで8ビットや4ビットに減らす量子化はあったが、精度を保ったまま4ビット以下にするのは限界が近いと考えられていた。今回の手法は単に丸めるのとは全く違う道でこの壁を破ろうとした点が特徴だ。
0.1ビットの本当の意味、1GB未満の条件付き真実
誤解されやすいのが0.1という数字の意味だ。計算機の最小単位は1ビットであり、物理的に0.1ビットの箱は作れない。この数字は圧縮後のデータを元のパラメーター数で割った平均値で、重み当たりのビット数と呼ばれる指標だ。10個のパラメーターをまとめて1ビットで表せれば平均は0.1ビットになるという計算であり、一つ一つの数字を0.1ビットにしているわけでも模型全体を0.1ビットにしているわけでもない。入力を受け付ける最初の層と確率を出す最後の層は精度維持のため圧縮せず16ビットのまま残されており、0.84GBとは極限まで圧縮された中間ブロックのみの容量を指す。それでも計算の大部分を占める領域をここまで削ったことは技術的な躍進と言える。
報道の受け止めにも注意が必要だ。130億パラメーターが1GB未満になるというのは条件付きで正しく、圧縮していない入出力層を含めると模型全体の実ファイルは1GBを超えてしまう。最大11.6倍の推論高速化という主張も高性能GPU上で単一の計算だけを動かした理論上の最高速度であり、文章生成全体で測ると向上は約2.46倍に留まるというデータがある。行列以外の計算も含まれるため全体が11倍になるわけではない。現時点で公開されているのは研究用の学習コードだけで一般向けの推論ソフトにはまだ組み込まれておらず、誰でもすぐ動かせる段階ではない。ただし行列の掛け算を極めて軽いビット演算に置き換えられるという点は事実であり、仕組みがハード側に実装されればスマホで軽快に動く可能性を秘めている。何が実証され何が課題かを見極める冷静さが求められる。
99パーセント削減する分解と二値化の錬金術
核心は低ランク分解と呼ばれる手法だ。学習済みの巨大行列の数値は完全に無作為ではなく特定の構造が隠れており、1つの巨大行列を2つの細長い行列の掛け算に分解する。例えば4096行4096列の行列は要素が約1670万個だが、ランク16の細さに分解すると4096行16列と16行4096列の2つになり、要素の合計は約13万個にしかならない。元の数に比べてこの時点で99パーセント以上を物理的に削減できる計算で、0にする場所を記録する付加情報も要らず、構造そのものを抽出して保存するため極限圧縮でも模型が壊れにくい。
ここからさらに二値化が行われる。細長い行列の中身を1かマイナス1の近似、つまり1ビットの符号に置き換えてしまう処理だ。このままでは元の重みが持っていた振幅情報が失われるため、3段階のスケーリング係数が導入される。1ビット行列に対して16ビット精度を保った小さな値を掛け合わせる仕組みで、行ごとの値、列ごとの値、潜在次元ごとの値という3つを用意する。全体の形や向きは1ビットが担い、数値の正確な大きさは小さなデータが補う多重補償の構造だ。役割分担により元の複雑な行列を極めて少ない量で再現し、計算の大部分は符号の向きに対して行い最後に大きさに戻す。まさに錬金術と呼べる構成だ。
この構造は計算速度も根底から変える。通常の計算は16ビット同士を掛けて足す浮動小数点演算で、回路にとって負担が大きく電力も大量に消費する。掛ける相手が1かマイナス1しかなければ掛け算は不要になり、1ならそのまま足し、マイナス1なら符号を反転させて引くだけで済む。さらに1ビット data は複数まとめて詰め込め、排他的論理和や数え上げだけの軽い処理に置き換わる。重い歯車を回していた計算が光の速さで符号を操る身軽な処理に変わり、読み込む量自体が激減するため転送待ちも短縮される。現在の処理で最大の隘路である帯域の問題を直接解く道であり、限界を工夫で破った見事な手法だ。
分布を回転させて救う改良版、極限でも生き残る知能
弱点は1ビット化で情報が壊れて精度が落ちる点にあった。原因を調べると分解直後の data は値が極端に偏ったとげとげしい形をしており、一方で落とし込みたい1ビットの世界は箱の角のような均等な形をしている。この形の違いが無理な変換時の大きな誤差を生んでいた。そこで改良版ではJoint-ITQという特別な回転計算を導入し、全体を数学的に回転させてとげを箱の角に向けて綺麗に整列させた。破壊されていた知能を非破壊的に再配列したと言え、この回転は学習前に内部へ吸収できるため実際に動かす時の計算量は増えないまま精度だけを引き上げ、1ビット未満領域で世界最高水準の性能を達成したという。
効き目を示すのが極限圧縮下の生存証明だ。従来の量子化手法は0.3という水準まで来ると言語模型としての構造が崩壊し、意味を理解できず出鱈目な文字を出すだけになるとされる。LittleBitでは同じ0.3、さらには0.1という極限でも文章生成能力が生き残る。元の16ビットに比べ情報量は30分の1以下に削られているにもかかわらずだ。圧縮状態を前提に鍛える学習や、階段状の関数を学習時だけ滑らかな坂として扱う工夫で勾配消失を避け、失われた振幅を自ら思い出させている。圧縮前と全く同じ精度ではないが、知能の真髄が細かさではなく向きの構造に宿ることを証明した点は学術的に極めて重要で、 data 量ではなく構造こそ本質であることを示している。
完成すれば使われ方は根底から変わる可能性がある。現在は巨大模型のために雲上の鯖に依存しているが、この種の手法が普及して帯域の壁を超えれば、回線がなくても機密情報を外に送らなくても高度な推論ができる。機械の制御や端末内完結の完全な地元実行が見えてくる。ただし実現には道具の進化だけでは足りず、1ビット計算に特化した専用の神経処理装置の普及が不可欠になる。同種の1ビット構成研究は世界中で加速しており、長期的に極小手法を標準で支える器が出るのは間違いないとみられる。雲から手のひらへの役割反転はすでに始まりつつあり、私たちが真の意味で知能を持ち歩く日はそう遠くないかもしれない。
ネットの反応
やっぱり数学ってめっちゃ重要だわ。ここまで削れるとは思わなかった
すごいの一言。構造だけ抜き出す発想が天才的だ
既存のローカル環境と組み合わせで再現できれば完璧だけど難しいのかな。専用チップ待ちか
AIの所感
削っても残るものが知能の本体だと示した点にこの研究の美しさがある。丸めて捨てるのではなく向きを残して大きさを別に預けるという分業は、記憶の要約としても示唆に富む。理論値の喧伝に踊らず全体での2.46倍という地に足のついた数字を見れば、帯域律速の時代における正しい処方箋だと分かる。器が追いつけば端末は鯖の出先ではなく主役になる。数学が錬金術に見える瞬間こそ技術の転換点であり、今回の0.84GBはその狼煙だ。

