酒呑ガジェット

〜静かな環境であなたに...こちらは音のでないコンテンツです。〜

【驚愕】AIの声が人間すぎて怖い…Gemini音声合成が日本語1位に、ChatGPTはメールも資料も声だけで片付ける時代へ

【驚愕】AIの声が人間すぎて怖い…Gemini音声合成が日本語1位に、ChatGPTはメールも資料も声だけで片付ける時代へ

AI音声の進化が実用の段階に入ってきた。注目されているのは、文章を感情豊かに読み上げるGoogleのGemini 3.8 Flash TTSと、声のやり取りだけで作業を進めるChatGPT Voiceだ。前者は喜怒哀楽の演技を付けた読み上げが可能なテキスト読み上げモデルで、後者はGmailの整理や資料作成まで音声指示でこなす方向へ進んでいる。紙芝居や絵本、解説アニメのナレーションをAIで賄う活用が現実味を帯びている。

Gemini 3.8 Flash TTSはテキストを音声化するモデルで、130か国語に対応するFlash版と軽量なFlash-Lite版の2系統がある。料金は1MトークンあたりFlashが約9ドル、Flash-Liteが約6ドルとされ、実際の音声生成単価ではFlashが約0.81ドル、Flash-Liteが約0.54ドルという案内がある。2027年1月から約2倍に値上げされる見通しも示されており、今だけ安いという位置付けだ。音声AIの投票ランキングでは総合2位の1260票、上位のマニアックなモデルを除けば一般利用の生成AIとしては最上位級で、発音の正確さが強みとされる。言語別の日本語評価ではFlash-Liteが1位で、現状日本語を作るのが最もうまいのはGeminiという評価になっている。利用場所はGoogle AI StudioとGemini APIの2か所で、将来はNotebookLMの音声解説や動画解説などへの組み込みが見込まれている。

感情豊かに話すAI音声アシスタントと日本語の音声波形が広がる制作スタジオのイラスト

カスタムボイスと自作ツールで紙芝居も大阪のおかんも

AI Studioではモデル選択後に文章を入力して再生するだけで試せる。フラットな読み上げから、スタイル指定や感情タグの埋め込みで雰囲気が大きく変わり、激しい感情表現や男性声への切り替えも可能だ。明るい日本人女性といった指示で新しい声を生成するカスタムボイス機能もあり、声優のような声が作れる。自分の声を録音してAIボイス化する方式も用意されているが、検証時点ではエラーでうまくいかない場面もあったという。

実務的な使い方はAPIキーを取得し、Claude Opus 5.5やCodex、GPT系モデルに指示して日本語向けのWebツールを作る流れだ。紹介された活用例では、アニメーションや紙芝居の台本をClaudeで作り、読み上げをGemini TTSで担わせている。インフレとは何かというテーマでは、100円だったメロンパンが120円になる寸劇で物価上昇とお金の価値低下を説明するデモが作られた。大阪のおかん風の声で冷蔵庫のおかずを知らせる例や、癒やし系ボイスの例も示され、日本語に最適化されたUIを自作して運用する方が使いやすいという結論になっている。オーディオブックやポッドキャストの企画、ゲーム配信の音声、吹き替え、音声エージェント、アプリ組み込み音声などが主な用途として挙げられている。

ChatGPT VoiceはGmail整理もスライド作成も声だけ

ChatGPT Voiceはデスクトップアプリやスマートフォンアプリの音声アイコンから青い玉の相手と話す形式で、従来は会話中心だったものが作業代行へ踏み込んでいる。実演ではGmailから直近のサブスクリプション支払いを探して金額を調べる指示が出され、ChatGPT Proの月3万円やビジネス版55ドル、Claude Maxの36449円、Slackの4993円、Google Workspaceの8360円などが画面に整理された。Web版やスマホ版でも可能になり、デスクトップ版限定ではなくなった点も大きい。

iPhoneでの実演では、ChatGPT Voiceで資料を作る機能をまとめた3ページのスライド作成が指示され、構成検討と公式情報確認を経てPowerPointデータが生成された。画像生成まで音声で進められる方向だ。ただ検証した感想としては、音声で会話のキャッチボールをしながら頼む場面は仕事では少なく、音声入力で雑に一気に指示してCodexなどに連続作業させる方が効率的だという。リモート接続で目の前のパソコンを動かす運用が中心で、寂しさを和らげる価値を除けば会話体験の新しさは限定的という見方だ。結論として、クリエイティブ系ではっきり使えるGemini TTS側の衝撃が強いと総括されている。

ネットの反応

Gemini TTS、AIってわからないレベルですね。アニメの紙芝居との連携面白いですね。どうやってるんですか。TTSで作成した音声とどうやってつなげているのかなど、解説動画作って欲しいです

この音声だけローカルで使えないかな

半年くらい前ですが、Gemini TTSは生成するたびに全く同じ人物にすることが難しく、使う事を止め、Fish Audioで希望の音声を作って、ブレない音声を生成しています。3.8 Flash TTSなら、カスタムボイスで生成し、生成するたびに同一人物の声として出来るんでしょうか。生成するたびに声が変わるのは使えません

イマイチだったとき、特に発音がだめなときどう調整するかわかりますか

Gemini TTSリアルですね。1年ほど前にもAI StudioでTTSできましたが、その頃に比べるとちゃんと日本人してますね

GPTのボイスは前よりチャット上の出力が遅くなった印象があります。「出したよ」って言ってから時間かかるイメージ

11labsを使ってましたがgeminiのほうが良さそうですね

関西弁など方言が自然なのがGemini TTSだけだったので、いつも読み上げ用に使っていましたが使いづらくなってしまいました。以前だと場面やシチュエーションなどの前提条件を入れるところがあったので、漫才形式、関西弁、1.2倍速などを入れると会話全体がそれになってくれてたのですが、それが無くなってしまったので、標準語のイントネーションで方言をしゃべるようになってしまいました

AIの所感

音声AIの競争軸は自然さから再現性と運用性へ移っている。毎回同じ人物の声が出せるか、方言や前提条件を維持できるか、料金が見えるかという地味な条件が現場の採用を決める。Geminiの日本語1位という評価は大きいが、UIの英語表記やAPI課金の不透明さが残れば、結局は自作ツールで包む職人芸が必要になる。ChatGPT Voiceの作業代行は便利だが、会話を楽しむ用途と雑に投げて待つ用途は別物だ。声で頼む快適さより、投げっぱなしで崩れない手順書の方が生産性を決める。音声のリアルさに驚く段階は終わり、声をどう雇うかという運用の段階に入った。

-パソコン