サイトアイコン 酒呑ガジェット

【朗報】80億のAIがグラボ1枚6GBで鍛え直せる衝撃…13万件の部品が並ぶ理由に一同納得

【朗報】80億のAIがグラボ1枚6GBで鍛え直せる衝撃…13万件の部品が並ぶ理由に一同納得

自分のパソコンでAIを動かしてみると、よく喋るのにうちのことだけは何ひとつ知らないという壁にぶつかる。そこで定番になったのがRAGだ。検索した文章を質問と一緒に渡すやり方で、わざわざ学習させ直す必要はないという人も大勢いる。ところがHugging Faceには、その学習させ直した部品が13万4752件も並んでいる。2026年9月26日時点の実数だ。定番のやり方があるのに別のやり方が消えていないのはなぜなのか。その理由を数字と実測で解いていくと、意外なほど身近な話が見えてくる。

話を厨房で例えると分かりやすい。落としてきたモデルは、腕は確かだが頭の中身を書き換えられないベテラン料理人だ。モデルの重みは配られた時点で凍っている。重みとはモデルの中にびっしり並んでいる数字のことで、その数字の並び方がそのまま料理人の腕と知識になっている。学習とはこの数字を少しずつ書き換えていく作業を指す。雇った側は外から工夫するしかなく、その代表がRAGになる。注文のたびにレシピの紙を一枚手渡す仕組みだ。今日の仕入れ表、うちの味付けの決まり、去年の記録を全部紙で渡す。料理人は頭が凍ったままでも渡された紙はその場で完璧に読める。紙を入れ替えるだけで明日には別の献立にも対応できる。中身が変わっても紙を差し替えるだけで済み、モデルは触らなくていい。渡した紙をそのまま根拠として見せられるから出所も確かめやすい。ここまで聞くと他のやり方は要らない気がしてくるが、紙を渡すだけでは足りないと言われる理由が三つある。

紙を渡すだけでは足りない三つの理由と都合の悪い実測

一つ目は紙を渡し忘れたら料理人は何もできないということだ。検索が外れれば必要な紙は最初から手元に来ない。質問の言い方が少し違うだけで正しい紙が引っかからないことがある。その時料理人は紙がないまま勘で作る。つまり作り話が戻ってくる。検索が当たるかどうかに答えの質が丸ごとぶら下がり、しかも紙がない時ほど自信たっぷりに答えるため見抜きにくい。二つ目はもっと地味な話で、紙は毎回読み直す手間がかかる。注文のたびに何枚も渡せばその分読む時間と場所を食っていく。長い紙を何枚も渡し続けると最後の方は読み流されることもある。毎回同じ紙なら無駄が積み上がる。毎回同じことを言い続けるくらいなら最初から覚えてもらった方が早い。三つ目が本題で、紙ではどうしても変えられないものがある。料理人の手つきそのもの、つまり癖や型は紙を読んでも変わらない。決まった型で出させたい、決まった言い回しで返させたい時は、体に入れる方が早い。それが追加学習やファインチューンと呼ばれる鍛え直しだ。

ここで鍛え直す側に都合の悪い実測を先に出しておく必要がある。Ovadiaたちの論文は2023年に知識を入れる目的では教師なしのファインチューンよりRAGが一貫して上で、新しい事実を追加学習で覚えさせるのは苦手だと報告している。勝負はRAGの一方的な勝ちに見える。ただし比べられたのは教師なしのファインチューンという特定のやり方で、文章をただ流し込んで読ませるやり方だ。手つきを仕込む使い方ではない。つまり新しい事実を頭に入れたいだけなら紙で渡した方が確実で、料理人に今日の仕入れ値を暗記させるのは筋が悪いという話だ。一方でBalaguerたちの論文は2024年に農業のデータで追加学習が正答率を6ポイント以上上げ、そこへRAGを足すとさらに5ポイント上がったと書いている。両者は積み上がる関係だ。結論の向きが逆に見える二本も、測っている目的が違う。変わり続けるものは紙で渡し、変わらない型は体に入れる。この線引きが今日の結論になる。

LoRAは何を1万分の1にしたのか、19.3GBに対する173MBの衝撃

鍛え直しと言っても本体全部を作り直すわけではない。そこで登場するのがLoRAだ。料理人の利き手に薄いサポーターを着けるようなもので、本体は凍ったまま、追加の小さな部品だけを鍛える。実物の大きさはファイルの大きさを直接測った実測値が残っている。土台のQwen3.5-9Bが19,306,310,880バイトで約19.3GB、その上に載せるLoRAが173,188,512バイトで約173MBだ。割り直すと111.5倍、つまり部品は本体のおよそ112分の1になる。本体19.3GBに対して部品は173MBという軽さが、13万件も積み上がった理由だ。配布も差し替えも手軽で、土台とセットで使うことで手つきだけを着せ替えられる。ただしLoRAは土台のモデルとセットで、土台が変われば同じ部品はそのままでは使えない。落とす前に、その部品がどの土台向けに作られたかを必ず確認する必要がある。

部品は土台とセットで、着けたまま使うか、足し込むかという使い方の選択もある。着けたまま使う方式は本体と部品を別々に置き、推論のたびに合成して動かす。切り替えが自在で複数の手つきを持ち替えられるのが利点だ。足し込む方式は部品を本体に統合して一つのモデルにしてしまう。管理が単純で実行時のオーバーヘッドを減らせるが、戻したり混ぜたりはしにくくなる。用途に応じて使い分けるのが現実的だ。QLoRAが650億規模を1枚に載せた工夫も見逃せない。三つの工夫として挙げられるのが量子化による軽量化、ページングによるメモリ退避の最適化、そして小さな部品だけを学ばせる設計だ。1990年代の常識では考えられない規模のモデルが手元の機械に載るようになった背景には、こうした地道な最適化の積み重ねがある。

何GBあれば何が鍛えられるのか、公表値の表の正しい読み方

手元のグラボ一枚でどこまでやれるかも、公表値の表で具体的に見ていく。4ビットのQLoRAなら80億のモデルが6GB、同じ80億を16ビットで鍛えると22GBになる。30億なら3.5GB、140億なら8.5GB、270億なら22GBだ。24GBが一枚あれば270億あたりまで射程に入る。多くの場合グラボ一枚で足り、特別なカードでなく今使っているもので届くこともあるというのが一番いい知らせだ。ただしこれは道具を作っている側が出している数字で、同じページに絶対の最低値と本人が書いている。しかも鍛える時の数字であって、動かすだけの数字ではない。本編ではその読み方として三つの注意が添えられている。一つ目は扱う文章を長くしたり一度に流し込む量を増やしたりすると簡単に増えるため、ぴったりの容量で計画しないこと。二つ目は推論時と学習時で必要量が違うこと。三つ目は自社発表であり第三者の実測ではないという前提で見ることだ。

本当に大変なのは教材づくりの方だという指摘も重い。同じ事実を何通りもの言い方で見せてやると覚えやすくなるという発見もあり、同じことを角度を変えて何度も言うのは人間の勉強と全く同じだ。質の悪い教材を大量に流しても手つきは良くならない。型を揃えたいなら、どんな振る舞いを正解とするのかを具体例で示し、ぶれを潰していく作業が欠かせない。モデルやデータセットのライセンスは配布元ごとに違うため、使う前に本文を確認することも必須になる。VRAMの表は絶対の最低値として公表されているもので、長文や大バッチで簡単に増える。ぴったりの容量で計画しないことが鉄則だ。

結論としてこの分野はRAGはもう古いとは言わない。まず紙を渡してみる。それで型が揃わないときにサポーターを考える。この順番の方が安く済む。変わり続けるものは紙で渡し、変わらない型は体に入れる。今日の結論はそれだけだ。知識を足したいだけなら検索と併用が確実で、言い回しや振る舞いの型を固定したいなら小さな部品の追加学習が効く。両者は対立ではなく積み上げの関係にある。引用された出典はHuほかのLoRA論文、DettmersほかのQLoRA論文、Ovadiaほかの知識注入比較論文、Balaguerほかの農業事例論文、Unsloth公式ドキュメント、Hugging Faceのモデル実測など多岐にわたり、いずれも著者らの報告として主語を付けて扱い、第三者が測り直した値とは区別されている。数字のまま並べて判断する姿勢が、13万件の部品群を使いこなす近道になる。

ネットの反応

投稿直後のためコメントはまだ集まっていないが、自分の機械で最初に動かしたAIは何だったのか、そしてRAGで十分派か鍛え直す派かという問いかけに注目が集まっている。理由を添えた体験談の共有が呼びかけられている。

AIの所感

厨房の喩えが秀逸で、凍った料理人に紙を渡すかサポーターを着けるかという整理は実務そのものだ。知識注入ではRAGが勝ち、型の固定ではLoRAが効くという使い分けは、論文の数字と実測のファイルサイズが裏付けている。19.3GBに対する173MBという112分の1の軽さは、個人が手元のグラボで試せる時代を象徴している。注意すべきは最低値の表を鵜呑みにしないことと、教材づくりの手間を見くびらないことだ。まず紙で試し、ダメなら体に入れるという順番はコスト的にも正しい。今後は変わる知識は検索で、変わらない振る舞いは小さな部品でというハイブリッドが標準になるだろう。

モバイルバージョンを終了