サイトアイコン 酒呑ガジェット

【凄い】Gemini 3.8 FlashがOpus級に進化!動画理解87.8%で一番強いAIが革命

Gemini 3.8 FlashがClaude Opus級に進化。動画で一番強いAIが60%トークン削減で変える編集の未来

Googleの軽量モデルGemini 3.8 Flashが、実務で使える領域に到達した。Claude Opus 5に匹敵するアウトプットを出しつつ、価格は大幅に安く、生成速度はGPT-5の3倍、Claude Opusの4倍という圧倒的な速さを誇る。さらに注目なのが、Gemini 3.7 Agentic Videoと呼ばれる動画理解に特化した新機能だ。長尺動画の理解性能で87.8%を記録し、従来の1フレームごとの画像解析ではなく一連の流れとして動画を理解することで、トークン数を60%から80%削減しながら高精度な解析を実現している。

Web版のGeminiでも3.8 Flashはすでに利用可能だが、真価が発揮されるのはエージェントツール「AntiGravity」上での活用だ。思考時間をロー、ミディアム、ハイと調整でき、ハイ設定ではClaude Codeでしかできなかったプログラミングやデザインシステムを反映した資料作成を完遂できるようになった。従来のFlashモデルが考えているようで考え切れていないという中途半端さが改善され、長時間タスクをやり切る力が大幅に向上した点が最大の進化と評価されている。

2分で5ページの資料が完成。AntiGravityが示す圧倒的な速さ

実際のデモでは、Gemini 3.7 Agentic Videoについての5ページ分のスライド資料作成を指示したところ、わずか2分で完成した。Claude Codeでは5分から10分かかるとされる同種の作業が、デザインシステムを反映させた再現性の高い状態で短時間で出力される。事前にスキルとして登録したPowerPointの作り方の手順書を読み込み、抜け漏れなくコンテキストを反映できるようになったことが背景にある。

価格面でも優位性は明確だ。Claude Opus 5と比較して大幅に安く、同等のアウトプットを出せるため、複雑なタスクはOpusやGPT-5.6に任せつつ、簡単なタスクはGemini 3.8でこなすというトークン配分の使い分けが理想的だとされる。生成速度はベンチマークでGPT-5.6の72に対してGemini 3.8は305と、体感でも圧倒的な速さを実感できるレベルに達している。

長尺動画理解で87.8%。動画で一番強いAIの証明

各種ベンチマークの中でも最も差が開いたのが長尺動画理解のLVBenchだ。Gemini 3.8 Flashは87.8%を記録し、Claude Opus 5の75.4%、Claude Sonnetの68%、GPT-5.6の82%を上回った。他のタスクでは他モデルが優位な場合もあるが、動画だけはGeminiが一番強いという構図が数値でも裏付けられた。

この強みを検証するため、AntiGravityの画面操作を解説する動画を撮影し、そこから自動でマニュアルを作成するデモが行われた。動画から必要なキャプチャ画像を取得し、クリックしたタイミングに赤枠や矢印を追加して、テキストと画像ベースのマニュアルをNotion上に生成するスキルが使われた。半年前に同様の試みをした際よりも、どの位置でどう拡大表示すればいいかまで理解する解像度が大幅に向上している。

無音も言い直しも一括検出。動画編集がトークン60%削減で変わる

Gemini 3.7 Agentic Videoを組み込んだ動画編集ツールのデモでは、その効率性が際立った。従来の読み込みが1フレームごとに画像として切り分けて解析する方式だったのに対し、Agentic解析は一連の流れとして動画を理解するため、トークン数を大幅に削減できる。画面がどういう状況なのかを理解しつつ文字起こし、無音検出、ブラッシュアップまでを一気に行う。

例えば4分49秒の素材から、フィラーワードや言い直し、ノイズ、無音部分を一括で検出し、全カットして1分46秒に圧縮する処理が短時間で完了した。テロップ挿入や拡大表示のポイントも、AIがピンポイントで見つけて自動で適用する。手を叩いた瞬間を検出してタイムスタンプを特定するなど、従来は手作業で行っていた編集の前処理をAIが肩代わりする。

さらにYouTube上にもこの機能が入ることで、動画の中身で検索できる未来が示唆された。タイトルや概要文だけでなく、動画内で何が語られ、どんな映像が映っているかから検索結果に表示されるようになれば、発信者側は検索キーワードとなる言葉を発しているか、理解しやすい映像を撮れているかが問われることになる。言い間違いの検出では「自然言語で伝えていく」というフレーズを複数回繰り返した箇所をピンポイントで抽出し、編集ポイントを提示するなど、実務的な使い勝手の高さが確認された。

ショート動画もライブ配信も。見どころ抽出とリアルタイム理解の衝撃

ショート動画の自動生成でも、見どころを探して縦長や横長の候補を複数提示し、テロップや図解、拡大表示を選べる形で出力するデモが披露された。完成度はまだブラッシュアップの余地があるものの、動画解析の能力が上がったことで、こうした発想が現実的になっている。

最もインパクトが大きかったのがライブ配信での活用だ。リアルタイムで文字起こししつつ、話している内容を分析して要点テロップや目次を自動生成する。さらに「後ろにある銀の盾に矢印をさして」「緑の葉っぱに赤枠を置いて」といった自然言語の指示で、映像内の物体の位置を正確に把握して矢印や赤枠を重ねることが実演された。あらかじめ用意した素材の中から、状況を理解して適切な場所に配置する処理をAgentic Videoが担っている。配信中にタイトルを差し込むといった演出も、動画の流れを見て自動で判断される。

これらの機能は、動画編集や配信という従来は人手と時間がかかっていた領域を、AIがリアルタイムに支援する未来を示している。動画系はやはりGeminiが強いという評価は、単なるベンチマークの数字だけでなく、こうした具体的なワークフローでの体験に裏付けられている。

ネットの反応

この人が一番AIの情報が有能。いつもありがとうございます

めちゃくちゃ早い情報解説、ありがとうございます!

GeminiはYouTubeの要約に役立ててるけど、その精度が上がる認識で良さそう

2分で資料完成は早すぎる。Claude Codeで10分かかるのが2分は革命的だな

長尺動画理解87.8%でOpus超えは凄い。やっぱり動画はGeminiが一番なのか

AIの所感

Gemini 3.8 Flashの進化は、AIの競争が「総合力」から「特定領域での圧倒的な強み」へとシフトしていることを象徴している。総合的な評価ではClaude OpusやGPT-5.6に及ばない部分があっても、動画理解という一点で突き抜けることで、実務での使いどころが明確になる。60%から80%のトークン削減は、単なるコスト削減ではなく、長尺動画を気軽に扱えるという体験の変化をもたらす。2分での資料作成や、言い直しの自動検出、ライブ配信でのリアルタイム物体認識といったデモは、AIが「文章を書く道具」から「動画を理解し編集するパートナー」へと進化したことを示している。今後は、どのモデルが一番賢いかではなく、どのモデルが自分のワークフローに最もフィットするかを選ぶ時代になる。その中で、動画を扱うならGeminiという選択肢は、もはや外せないものになりつつある。

モバイルバージョンを終了