【衝撃】日本の古本50トンが海を渡る謎、米AI企業が本を破壊する黒いカラクリ
日本の古本市場で異変が起きている。50トン規模ともされる古書がアメリカへ輸出され、巨大AI企業の学習データになっているというのだ。しかも買われた本は丁寧に保存されるのではなく、背表紙を断裁して高速スキャンした後に廃棄されるという。なぜわざわざ紙の本をかき集めては壊すのか。その裏には世界の技術覇権と法律の抜け道をめぐるデータ争奪戦がある。
発端は高品質データの枯渇である。インターネット上の良質なテキストは2026年にも枯渇するとの予測があり、実際に大規模言語モデルの学習にはLlama 3で15兆トークン、GPT-4系で6兆ワード超ともされる規模が必要とされる。SNSのような低品質データでは性能が上がらず、新聞や論文、書籍といった編集済みの高品質データが奪い合いになっている。海外では新聞社と提携する動きも進むが、手っ取り早く大量に確保できるのが紙の本だ。特に2022年以前の印刷本はAI生成文に汚染されていない純粋テキストとして価値が高い。
破壊スキャンと合法性という武器
手法は破壊的スキャンと呼ばれる。油圧裁断機で綴じを切り落とし、工業用スキャナーで一気に電子化し、原本はシュレッダー行きになる。2025年6月の米連邦地裁判決では、正規購入した紙書籍をスキャンして原本を破棄する行為がフェアユースに当たるとされ、この流れを後押しした。原本を残さず置き換えるからこそ変容的で合法という理屈で、保管コストも要らない。Anthropicの社内計画パナマ文書では世界中の本を破壊的にスキャンする努力と記されていたと報じられ、1000冊から100万冊単位の匿名大量調達を仲介する業者まで現れた。古書店では週20冊が数百冊に跳ね上がり、乱丁に見えるISBN付きのまとめ買いが相次いだという。
日本語の本が狙われる理由も明確だ。各社が日本語能力の獲得競争を繰り広げる中で、質の高い日本語テキストは世界的に希少だ。絶版や低流通の学術書、外国語書籍ほど狙われ、最後の1冊が企業のサーバー内にだけ残る事態も起きる。属地主義の壁もあり、日本の著作権下にある本を米国内で処理すれば米法のフェアユースで押し切れるという抜け道が指摘されている。即廃棄とフォーマット変換を組み合わせれば、外部に複製を出さずに学習だけできるというわけだ。
モデル崩壊を避けるための種データ
技術的にはモデル崩壊の回避が目的とされる。AI生成文ばかり学ぶと統計分布が現実から乖離し、出力が劣化して使い物にならなくなる。純粋な人間由来テキストで種モデルを鍛え、そこから欠陥のない合成データを大量生成できれば、人間テキスト依存から脱却できるという青写真だ。ただこれはスケールしないとの批判も強い。希少本を切り刻む文化破壊であり、公共図書館に残るわけでもなく、将来の研究者が原本に触れられなくなる。15億ドルの和解金を払ってでも海賊版より正規購入破棄を選ぶという損得勘定が、倫理との溝を広げている。
インドのように原本を残して電子化する国もある。日本でも出版社や新聞社、放送局との提携で学習データを確保する動きが重要になる。高品質データの争奪は国家間の供給網問題でもあり、値札より先に動くものとして古書の流れを見ておく必要がある。
ネットの反応
保存ではなく破壊前提なのがショックだ
絶版本の最後の1冊が消えるのは文化の損失だ
日本語の良質テキストが狙われるのは分かる気がする
AIの所感
本を捨てるために買うという倒錯に、データ枯渇の深刻さが表れていると思う。合法と倫理は別物で、判決が破壊にインセンティブを与えた形になったのは皮肉だ。モデル崩壊を防ぐためという大義は理解できるが、不可逆な文化財の喪失と引き換えにするのは短絡的に見える。原本を残す電子化と正当な提携こそが持続可能な道で、そこに日本の出版社や図書館の出番があるはずだ。紙の知がサーバーの中にだけ残る未来は避けたい。

