サイトアイコン 酒呑ガジェット

【衝撃】「グラボにHDMI挿すな」26万表示の真実…VRAM数百MBがAI速度を崖から落とす理由

【衝撃】「グラボにHDMI挿すな」26万表示の真実…VRAM数百MBがAI速度を崖から落とす理由

2026年9月24日、X(旧Twitter)で「グラボにHDMIを挿すな」という一言が26万表示を超えて拡散された。投稿者は東風谷さずりん氏(@Xatz)。一見すると「画面出力をマザーボード側に繋げ」という、パフォーマンスを犠牲にする奇妙な助言に見える。しかし、ローカルLLMを動かすユーザーの間では「常識」として語られてきた、VRAM(ビデオメモリ)確保のための極めて合理的なテクニックだった。さる博士による実測検証で、その効果と落とし穴が明らかになった。

RTX 4060(8GB VRAM)で検証したところ、グラボから映像出力している状態ではアイドル時でも専用メモリ602MBを消費していた。一方、マザーボード側(内蔵GPU)に映像出力を切り替えた状態では、VRAM使用量は0MB、空きが7957MBまで確保された。わずか600MB程度の差に見えるが、AI推論時にこの「数百MB」が致命的な分水嶺になる。16GBカードでの実測では、VRAMから溢れた瞬間にGPU負荷が98%から23%へ激減し、CPU負荷が533%へ跳ね上がった。処理が遅くなるのではなく、作業場所がGPUからCPUへ強制移動させられるのだ。

VRAMとは「作業台」、溢れると「物置(システムメモリ)」へ強制移動

動画ではVRAMを「作業台」、システムメモリを「物置」に例えている。GPUは超高速な作業台で並列処理を行うが、作業台が狭い(VRAMが少ない)と、材料(モデル重み・KVキャッシュ)を物置(システムメモリ)に行き来させる羽目になる。PCIeバスを通るこの往復は、GPUの圧倒的な演算性能を無駄にするボトルネックだ。特にLLM推論では、コンテキスト長が長くなるほどKVキャッシュが膨らみ、VRAMを圧迫する。8GBや12GBのカードでは、実用的なコンテキスト長で即座に溢れる。

「数百MBなんて誤差」と思われるかもしれない。普段のゲームや動画再生なら誤差だ。しかしAI推論だけは別物だ。モデル読み込み時点でVRAMの大半を占有し、残りわずかな余裕でKVキャッシュと戦う。そこへ映像出力分の数百MBが乗っかれば、ギリギリ収まっていたモデルが溢れる。RTX 4060 8GBで7Bパラメータモデルを動かす場合、量子化レベルによっては映像出力の有無で「動く/動かない」が分かれる。これが「崖」の正体だ。

「挿し替えただけ」では損をする、投稿者自身の補足に隠された罠

ここが最も重要だ。投稿者本人が2時間後に補足投稿しているが、こちらは表示1万程度でほとんど読まれていない。HDMIをマザーボード側に挿し替えただけでは、BIOSとWindowsの両方で内蔵GPUを有効化・優先設定しない限り、VRAMは開放されない。さらに、内蔵GPU経由の映像出力には約2.5ミリ秒の遅延が発生する。AI用途なら誤差だが、対戦ゲーマーには許容できないコストだ。

具体的には、BIOSで「iGPU Multi-Monitor」や「IGPU Share Memory」を有効化し、Windowsの「グラフィック設定」でAIアプリを「高性能(dGPU)」、ブラウザ等を「省電力(iGPU)」に明示的に割り当てる必要がある。これをやらずにケーブルだけ挿し替えると、dGPUが映像出力を担当し続けVRAMは開放されず、さらにiGPU経由の遅延だけを被る最悪の結果になる。投稿者も「必要条件であって十分条件ではない」と釘を刺している。

ゲーマーとAIユーザー、正解が違う二つの正義

コメント欄では「モニターなんて飾りです」「AI目的の投稿なのにゲーマーが遅延で文句言ってる」と、両陣営の温度差が鮮明だ。マザーボード側出力で遅延2.5msは、FPSや格ゲーのプロレベルなら致命的だが、一般ゲーマーなら体感困難。一方でAIユーザーにとってVRAM数百MBは、モデルサイズ一つ上の選択肢を生む命綱だ。どちらも正しく、前提が違うだけ。動画は「結論を一つに決めつけない」形でまとめており、この誠実さが評価されている。

ノートPCの場合はさらに複雑で、MUXスイッチ非搭載機ならdGPU出力が強制されるため、このテクニックが使えない。外部GPU(eGPU)環境では、ホットプラグ対応のためにあえて内蔵GPU出力にしているユーザーもいる。結論は「まず自分の環境で測れ」に尽きる。VRAMに余裕がある(24GB以上など)なら何もしないのが最善だ。

ネットの反応

つまりAIの処理性能を限界まで引き出したいなら、画面出力はグラボではなくマザボ(内蔵GPU)に任せろって話ね

モニターなんて飾りです。偉い人にはそれが分からんのです

XではAI目的での投稿だったのに、ポストを見たゲーマーが描画遅延で~って話になったのかw

普通にそうしてた。RTX 5070 TiとRTX 3060の2枚挿しだけどモニタは全部マザーに繋いでUHD 770で映してる

CPUに内蔵グラがねぇ、、、

ブラウザゲームしかしないのでiGPUで出力してまーす GPUはNPU扱いです VRAMは1G前後は浮くので1サイズ上のモデルやKVキャッシュに使えます

メモリ容量もあれだが、帯域競合が怖い。うちはiGPUなので特に気を使うが、dGPUでも描いてるなら競合するわけで

マザーボードのHDMIにダミーHDMIを差したりするとケーブルを差し替えなくてもiGPUで処理とメモリ移動させてOSで省電力GPUの設定を必要なアプリを割り当てて動作できる様になるみたいですよ

AIの所感

「グラボにHDMIを挿すな」という一見バカげた助言が、ローカルLLM界隈では「VRAM節約の鉄則」として定着していた事実こそが、現在のコンシューマーGPU事情を物語っている。8GB・12GBというミドルレンジのVRAM容量が、LLM実用ラインのギリギリラインでしかない証左だ。NVIDIAがプロ向けに24GB・48GBを用意しつつ、ゲーミング向けをケチり続けた結果、ユーザーが「映像出力を諦める」という本末転倒な妥協を強いられている。次世代ではVRAM 16GBがミドルの標準になり、このテクニックが不要になることを願うが、それまでの数年間、この「挿し替え儀式」はローカルAI実践者の通過儀礼であり続けるだろう。投稿者が補足で「測れ」と言った通り、盲信せず自分の環境で検証する科学的態度こそが、正解への唯一の近道だ。

モバイルバージョンを終了