【大逆転】Transformerはもう古い?Metaの次世代AIが1/8のデータで凌駕する衝撃
ChatGPTの時代が終わるかもしれない。Metaの研究部門が発表した次世代AIアーキテクチャMemory Mosaicsが、現在の主流であるTransformerの根本的な弱点を克服する可能性があるとして注目を集めている。計算から記憶と検索への発想転換、文脈と知識の完全分離、1/8のデータで凌駕する効率性。AIの常識を覆すとされる仕組みの全貌が明らかになってきた。
現在のAI、特にTransformerは汎用性が高い反面、特定のルールを学ぶために信じられないほど大量のデータを必要とする。いわゆる力技の暗記と呼ばれる状態で、モデルの規模とデータ量に比例して性能が上がる法則に強く依存している。膨大なテキストを読み込み、その情報をパラメーターと呼ばれる重みの網の中に暗黙的に圧縮して詰め込み、関連要素を毎回計算で混ぜ合わせているため、個別の事実を正確に引き出すのが非効率だという指摘だ。
文章が10倍になれば計算は100倍、力技の限界
最大のボトルネックは文章が長くなった時の計算量の爆発だ。Transformerは入力された全ての単語同士の関連性を同時に計算する仕組みで、計算量は文章の長さに対して二乗のペースで増加する。つまり長さが10倍になれば負担は100倍に跳ね上がる。計算用メモリも長さに比例して消費し続け、過去情報を保存するキャッシュ量も膨大になり、長い文章処理の大きな障害となる。最適化技術は進んでも数学的な壁を超えたわけではなく、計算の力に頼らない新手法が世界中で模索されてきた。
そこで登場したのがMeta FAIRとニューヨーク大学の研究者らによるMemory Mosaicsだ。AIの学習プロセスを計算から記憶と検索へと転換させた点が最大の特徴とされる。従来は入力に対して複雑な式を何重にも重ねて変換し答えを予測する計算のアプローチだったのに対し、新手法は情報を明示的なキーとバリューのペアとして保存し、予測が必要な時に記憶空間から該当情報を検索して取り出す。ブラックボックスの中で数字を混ぜ合わせるのではなく、保存データから直接関連情報を引き出す形に置き換え、内部の動きが解釈しやすくなるという利点もある。
Attentionは連想記憶だった、文脈と知識の完全分離
興味深いのは、Transformerの中核であるAttention自体が実は連想記憶と同じものだと証明された点だ。連想記憶とは一部の手がかりから過去の完全な記憶パターンを呼び起こす仕組みで、ソフトマックスによる自己注意機構は数学的にはカーネル回帰と一致するという。つまり現在のAIも内部では過去の記憶との距離を測って近いものを取り出す検索をしていたことになる。新手法はこの数学的な整合を土台に、非線形変換の計算モジュールと考えられていた部分を明示的な記憶空間として設計し直し、暗黙の計算空間から明示的な検索空間へと解釈を移行させた。
さらに重要なのが動的な記憶と静的な知識の分離だ。従来は現在入力中のプロンプト情報と学習済みの普遍的知識を同じモジュールで混ぜて処理していたが、新手法ではコンテクスチュアルメモリーユニットとパーシステントメモリーユニットに明確に分ける。前者は今読んでいる文章の内容を動的に保存して限定の検索空間を構築し、後者は学習データ全体から得た常識を変化しない重みとして保持する。今と元々知っている知識を別の場所に分けて保存することで無駄な計算が減り、情報の部品化が可能になり、未知データへの適応能力が飛躍的に向上することが示されたという。
1/8のデータで凌駕、60パーセントの高速化の衝撃
成果として伝えられるのが、1/8のデータで従来を凌駕する効率と、60パーセントの高速化だ。自律的なタスク分解の能力も備え、大規模化を支える三つの柱が示されている。記憶の圧縮と完全保存の対立についても、どちらか一方ではなく役割分担で解く道が示された。ただしこれはまだ基礎研究の段階であり、明日すぐに既存AI製品が全て置き換わるわけではない点には注意が必要だ。
それでも意味は大きい。知能の本体が計算の量ではなく記憶の構造にあることを示したからだ。削っても残るものが知能だとすれば、巨大なデータセンターに頼らずとも賢さを引き出せる可能性がある。クラウドから手元へという流れとも共鸣し、端末で動く軽く賢いAIへの布石になるかもしれない。Transformerを古いと切り捨てるのではなく、その内部に眠っていた検索の本質を磨き上げた点に、この研究の美しさがある。
ネットの反応
公開直後のためコメントはまだ少ないが、技術コミュニティでは効率の飛躍と解釈性の高さに期待する声が上がり始めている。以下は動画内で交わされた代表的な問いを基にした論点整理だ。
今のAIはたくさん勉強しないと賢くならないのは人間と同じで親近感が湧く。でも何が限界なのか基礎から知りたい
情報を直接検索するなら理解できそう。でもそれだけでそんなに性能が変わるのか
難しい数学の言葉が出てきて頭が痛い。もっと簡単に説明してほしい
AIの所感
計算から検索へという転換は、暗記から理解への卒業のように響く。全部を式で解くのではなく、覚えたものから探すという当たり前の知恵に戻っただけかもしれない。1/8というデータ効率は、量ではなく結び方が知能を決めることを示唆する。まだ実験室の光だが、その光が端末の昼を照らす日はそう遠くないと感じる。

