【朗報】NVIDIAが土下座して採用、日本発の数学マジックがGPUの常識を破壊「専用回路はもういらない」
世界中のAI開発者が毎日使うNVIDIAの開発基盤CUDA 13.4に、日本発のアルゴリズムが標準搭載された。千葉工業大学の尾崎教授や理化学研究所のチームが開発したOzaki Scheme IIだ。AI向けに特化して進化した最新のGPUを、そのまま高精度な科学計算のスーパーコンピューターに変えてしまう技術として、計算機科学の世界に衝撃が走っている。専用ハードウェアを増やさず、ソフトウェアの更新だけで物理的な限界を突破した点が、極めて異例とされている。
AIが賢くなるほど科学計算が追い出される矛盾
現在のAI、特に深層学習の計算は、細かな小数点以下の数字を多少切り捨てても結果に影響が出にくい性質がある。そのためNVIDIAなどのメーカーは、精度は低いが一度に大量の計算を並列処理できる低精度回路にGPUの面積の大半を割いている。細かい数字は気にせず、とにかく速く大量に計算させることがAIを賢くする近道になっている。
一方で気象予測や新薬開発、構造シミュレーションといった厳密な科学技術計算では、わずかな丸め誤差が致命的な結果の崩壊を招く。そのため科学計算には有効数字が16桁もあるFP64と呼ばれる倍精度の計算専用回路が絶対に必要とされてきた。しかし小さなシリコンチップに載せられる回路量や消費電力には物理的な限界がある。世界中のAI市場からの強烈な需要に応えるため、メーカーは面積を大きく占める高精度FP64の専用回路を削り、低精度なAI用回路の強化に振り切り始めた。
つまりAIが賢くなるほど、真面目な科学計算のための居場所がGPUの中から追い出されてしまう。高精度な計算を行えば非常に遅くなり、速さを求めればAI用の荒い計算しかできないという深刻な二択に陥っていた。このままではスーパーコンピューターを用いた最先端の科学研究の歩みが止まってしまう可能性すら、業界全体で危惧されていた。物理的な面積を増やせない以上、この問題をハードウェアの力だけで解決するのは不可能に近い状態だった。
低精度回路だけで高精度の答えを作り出す手品
この分厚い壁を壊したのが、物理的な回路ではなく数学の力に基づくアプローチだ。仕組みを極端に言えば、AI用の低精度な計算回路だけを使い回して、科学計算に必要な超高精度の結果を疑似的に作り出す技術である。
まず科学計算で使う小数点を含んだ巨大で精密な数字の桁を揃えて、無理やり巨大な整数の集まりに変換する。巨大な整数をそのまま計算するのではなく、いくつかの小さな数で割った時の余りを求める。例えばある巨大な数を255で割った余り、253で割った余りといった具合に、小さな断片に細かく分割していく。この小さな余り同士であれば、AI用の低精度回路の中にすっぽり収まるため、猛烈なスピードで並列に掛け算ができる。余り同士を掛け合わせても回路の制限内であれば数字が溢れることはなく、完全に丸め誤差ゼロの状態で計算は進む。
ここで登場するのが中国剰余定理だ。互いに共通の約数を持たない複数の数で割った余りの情報さえ揃っていれば、元の巨大な数字をずばりと一つに特定できるという数学の定理である。バラバラに高速計算した小さな余りの結果をかき集めて、この定理の公式に当てはめると、元の巨大で高精度な計算結果が完璧に復元される。途中の計算過程では丸めによる情報の欠落が一切発生しないため、最終的に復元された答えは本物の高精度回路で計算したものと同等品質になる。AI回路の圧倒的な計算速度と、数学の定理による誤差のないデータ復元を見事に融合させた手法と言える。
計算量が二乗から線形へ、初代の弱点を克服
実はこの技術には2012年に発表された初代のOzaki Scheme Iが存在していた。初代は計算時の誤差を切り刻んで分割し、それを足し合わせていくという全く別の原理に基づいていた。しかし初代には、精度を上げようとして元の数字を細かく分割すればするほど、掛け算の組み合わせの数が爆発的に増えてしまうという重大な弱点があった。分割数をSとした時、計算回数がSの2乗に比例して増えていく二次的な増加になっていた。さらに計算途中の膨大なデータを保存しておくためのメモリ空間も大量に必要になるため、最新のハードウェアで実用化するには非常に高いハードルがあった。
2025年に発表された第2世代のOzaki Scheme IIがこの問題を劇的に解決した。中国剰余定理を使うことで全体の計算回数が分割数に対して線形、つまり単純な比例で済むようになった。例えば15個の余りのパターンを作る場合なら、必要な掛け算の回数もきっちり15回分で完了する。これによりAI用の超高速な回路を無駄に何度も回すための時間的、そしてメモリ的なロスが極限まで削ぎ落とされた。さらに途中の余りの計算はそれぞれが完全に独立して行えるため、GPUが最も得意とする並列処理とも非常に相性が良い。この計算量が線形になるというアルゴリズムの劇的な進化こそが、最新GPUで実用レベルの実行性能を引き出した最大の要因となった。
実測175TFLOPS、専用回路の4倍を記録
NVIDIAのB200という強力なGPUを使った実測値では、高精度な行列の掛け算において最大175テラフロップスという値を記録した。B200に物理的に搭載されている本物のFP64回路をそのまま使った場合の性能は約40テラフロップスとされる。つまりソフトウェアの力でAI用の低精度回路をフル回転させることで、ハードウェア本来の高精度計算能力の4倍以上の速度を記録したことになる。
さらに驚くべきは、複素数というより複雑な数字の計算においては最大195テラフロップスという数値を記録している点だ。これは複素数の掛け算の手間を減らす別の数学的なテクニックと今回の剰余の手法が見事に噛み合った結果とされる。もちろんこれは実行性能と言って実際にその速度の専用回路があるわけではなく、あくまでソフトウェア上の処理速度の換算値だが、それでも出てくる結果の精度は専用回路とほぼ同じでありながら、処理速度は物理的な限界を完全に上回ってしまった。これまでの高精度な計算をしたければ大きな専用回路を作らなければならないという常識が、実測値として完全に破壊された瞬間である。
スパコン界の頂点が宣言、高価な専用回路の終焉
この圧倒的な実測値を背景に、日本のスーパーコンピューター界の頂点である理化学研究所の松岡センター長がある重要な論文を発表した。その要旨は科学計算に必要な高精度の専用ハードウェアはもはや必須ではないという極めて強いメッセージだ。
理由を説明するのがテンサーメモリルーフラインモデルと呼ばれる考え方だ。現在の高度な計算の多くは、計算回路の処理速度そのものよりも、メモリから大量のデータを読み書きするスピードが追いつかずに渋滞を起こしている。これをメモリ律速と呼ぶが、超高速なAI用計算回路はデータが届くのを待っている暇な時間を大量に発生させている状態だ。Ozaki Schemeのような技術は計算のステップ数は増えるが、このデータ待ちの暇な時間の隙間を使って処理を終わらせることができる。待っている時間があるなら、その間に別の複雑な変換処理を済ませてしまおうという発想である。
導入の容易さも衝撃的だ。既存の科学計算のプログラムコードを大きく書き換える必要はなく、環境設定のフラグを一つ有効にするだけで自動的に動作する仕組みになっている。GPUの中で計算対象のデータの性質を自動で分析し、この技術を使うべきか標準の機能を使うべきかを裏側で賢く判断してくれる。最新のAI特化型GPUを買ってきたその日から、そのまま精密計算マシンとして使うことが可能になり、ハードウェアの物理的な欠点をソフトウェアのアップデートだけで覆い隠してしまった。大学の学術的な論文で終わらず、世界トップクラスの企業の商用プラットフォームに直接実装されたという点で、14年にわたる基礎研究の勝利として高く評価されている。開発中の富岳NEXTへの取り入れや公式ライブラリ化への期待も高まっている。
ネットの反応
RSAの演算でも使われているよね。演算のビット数が半分で済むという方法。サムネイルを見たときにはカラツバ法かなって思ってた。これも掛け算を短い幅の掛け算に変換して計算する方式。
松岡さんが食いついてるってことは、開発中の富岳NEXTでも取り入れられそうと思ってたら公式ライブラリ作るんか。そりゃそうだよな。
HPC分野の最高峰の賞を受賞するとよいですね。
もう半導体は、FP4だけ実装しておけばOKって事。
肝心のアルゴリズムの説明がないな。
AIの所感
Ozaki Scheme IIが示すのは、ハードウェアの微細化に頼り切ってきた計算機の進化への強烈なカウンターパンチだ。AIバブルが生んだ低精度回路の余剰を、2000年以上前からある整数論の定理で高精度計算に転用する発想は、工学的には泥臭い最適化でありながら、数学的には極めてエレガントだ。計算量を二乗から線形に落としたことで実用化の扉が開き、175TFLOPSという数字が専用回路不要論に現実味を持たせた。特にメモリ律速という現代計算のボトルネックを逆手に取り、待ち時間を計算に充てる視点は示唆に富む。日本発の基礎研究が14年越しに世界標準になったという事実は、短期的な成果主義へのアンチテーゼとしても重い。高価な専用回路を作らずに済む未来は、スパコンの設計思想そのものを変える可能性がある。

