Googleの新しい音声生成モデルは、文章で注文するだけで、まだ誰のものでもない声を作れます。一方で、実在の人の声を写すには、本人が同意文を読み上げた録音が欠かせません。声を作る自由を広げながら、入口には本人の確認を置く。その設計と、期限付きの値札、首位という数字の読み方を順に見ていきます。
Googleは2026年9月23日、音声生成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。Flash TTSは文章による指示で声をゼロから設計でき、セリフ単位の演技指定、2人の話者による会話、長時間の音声生成に対応する。Flash-Lite TTSは大量処理とコスト効率を重視したモデルである。
実在の声の複製には、声の持ち主本人による同意の録音が必要となる。生成音声にはすべてSynthIDの電子透かしが入る。Flash TTSはHume AIのVoice Design Benchmarkで71.4を記録し、総合首位になったとしている。両モデルはGemini APIとGoogle AI Studioで提供を始めた。
From:
Gemini 3.8 text-to-speech says hello
【編集部解説】
9月15日に発表されたGemini 3.8 Liveは、考えながら話すAIでした。その8日後にGoogleが出したGemini 3.8 Flash TTSとFlash-Lite TTSは、同じ世代の「台本を読む」側のモデルです。会話の相手ではなく、ナレーションやオーディオブック、ゲームのキャラクターの声を担います。
今回の世代で大きく変わったのは、声の手に入れ方です。用意された声から選ぶ時代から、声を言葉で作る時代へ。Googleは発表で、30種類の既製の声から、限りのない声のライブラリへ広げると表現しました。
声を「注文書」で作る
声を作る方法は2つあります。1つは、年齢や声質、なまり、話し方を文章で伝えて、まったく新しい声を設計する方法です。もう1つは、実在の人の声を短い録音から写し取る方法です。
作った声はIDとして保存でき、1つのプロジェクトで200件まで、1年間使えます。一度キャラクターを作れば、別の原稿でも同じ声で読ませられます。シリーズもののポッドキャストや、長編のオーディオブックで効いてくる仕組みです。
演技の付け方も整理されました。3.8では、読み上げる本文を一字一句そのまま読む台本として扱い、「ささやくように」「息を切らして」といった指示は別の欄に分けて書きます。笑い声やため息、短い間は、本文の中に山括弧のタグで差し込みます。台本とト書きを分ける、舞台の作法に近い設計です。
日本語の原稿でも、タグは英語で書くのが推奨されています。日本語で書き手が戸惑いやすい点なので、覚えておくと役に立ちます。
複製の入口に「本人の同意」
声の複製には、写し取りたい成人本人の10〜30秒の録音に加えて、同じ人が決められた同意文を読み上げた録音が必要です。Googleは声を作る前に、2つの録音の話者が一致するかを確かめます。同意文は、日本語を含む30の言語・地域の組み合わせで用意されています。
生成された音声には、すべてSynthIDの電子透かしが入ります。人の耳には聞こえない形で、AIが作った音声だと後から判別できる印です。Googleは声の複製機能に、来歴を示すC2PAの認証情報も組み込んだと説明しています。
AI Studioでの声の複製は、米国のイリノイ州とテキサス州、EEA、英国、スイス、インドでは使えません。除外地域には、声紋を含む生体情報の扱いを規律する地域が含まれます。ただし、Googleは今回の地域制限の理由を説明しておらず、個々の制度との因果関係は分かりません。日本は、この除外の一覧に入っていません。
9月には、上海の裁判所が『原神』のキャラクターの声を無断で使ったAI変声ソフトに賠償を命じたと報じられました。日本でも8月に法務省が生成AIの解釈指針を公表し、声と不正競争防止法の関係に触れています。声をどう守るかが各国で形になりつつあるところに、同意の録音を入口に置いた仕組みが並んだことになります。
値札の中身
音声出力分の料金は、生成した音声の長さで決まります。音声は1秒あたり25トークンと数えられ、Flash TTSの音声出力は100万トークンあたり9ドルです。1分に直すと約0.0135ドル、1時間のオーディオブックで約0.81ドルです。いずれもテキスト入力分を含まない、音声出力分の試算です。
前世代のGemini 3.1 Flash TTS Previewは20ドル(1分あたり約0.03ドル)でした。年内は半額以下です。ただし、9ドルは2026年12月31日までの価格で、2027年1月からは18ドルになります。前世代の価格が今のままなら、来年以降の差は1割ほどです。
大量処理向けのFlash-Lite TTSは、年内6ドル(1分あたり約0.009ドル)です。Googleは、3.1 Flash TTS Previewの後継として、まずFlash-Lite TTSを勧めています。移行は「新しい版に上げる」ではなく、「2つの層から選ぶ」形になります。
首位を示した物差し
Googleは、Flash TTSがHume AIのVoice Design Benchmarkで71.4を記録し、総合首位になったと発表しました。読むときに知っておきたい補助線があります。Google DeepMindは1月、Hume AIとライセンス契約を結び、当時のCEOだったアラン・コーエン氏と数人の技術者を迎え入れました。当時の報道では、Hume AIの新CEOが、Googleは一部の技術を非独占で使える権利を持つと説明していました。今回の発表の連名者の1人が、そのコーエン氏です。
Hume AIは新しいCEOのもとで、独立した会社として続いています。9月24日に公開した同社の記事によると、評価はどのモデルかを知らされない評価者が行い、評価用の問題は開発元に渡さないといいます。評価に問題があるという話ではありません。数字を、作り手同士の距離と一緒に受け取るための情報です。
同じ記事は、Flash TTSとFlash-Lite TTSが総合評価で34モデル中1位と2位になったと伝えています。長い音声での安定性の伸びが最も大きかったといいます。一方で、Flash-Lite TTSの声の複製は13モデル中7位で平均並み、Flash TTSも若い声の再現と音量の制御は上位の競合に比べて弱いと、得意と不得意を分けて示しています。Googleは、一般の人が聞き比べるVoice Arenaでも、日本語を含む主要言語で上位に入ったとしています。
声を作る道具が、手の届く場所に
Flash TTSは開発者向けのGemini APIとAI Studioに加え、一般向けのGemini Notebookへの展開も始まりました。Flash-Lite TTSはGoogle Vidsに入ります。声を作る作業が、スタジオの外に出てきています。
地方のメディアが自社のキャラクターに声を与える。小さな出版社が、朗読の声を1冊ごとに設計する。これまで予算の壁で止まっていた企画が、動き出す余地が生まれました。声を作る自由と、声の持ち主を守る手順が、同じ画面に並んだ。その組み合わせが日本の制作現場でどう育つのか、見ていきたいと思います。
【関連記事】
Gemini 3.8 Live、GPT-Live-1と分かれた音声AIの設計
同じGemini 3.8世代の音声対話モデルを扱った記事。台本を読むTTSと対になる、考えながら話すAIの設計を読み解いた。
『原神』AI音声判決|声を守る道は人格権と不正競争の2本
上海の裁判所がAI変声ソフトに賠償を命じた判決と、中国最高人民法院のAI指針から、キャラクターの声は誰のものかを考えた記事。
【編集部後記】
私が動画で使っている解説役のAIキャラクターに、いつか聞き手の相方をつけたいと考えています。ところが今回のFlash TTSでは、文章で作った声どうしを1回の生成で掛け合わせることはできず、1人ずつ作ってつなぐ形になります。
相づちの重なりや、笑いが返ってくるまでの一瞬の間は、2人を同時に生成してこそ出るものです。作った声どうしの掛け合いが1回で作れるようになったとき、声の設計は一人芝居から会話劇へ移っていくのでしょうか。
【用語解説】
TTS
Text-to-Speechの略。文章を入力すると、読み上げた音声を生成する技術。会話の相手になる音声対話モデルとは別に、ナレーションやオーディオブックなど台本のある用途に使われる。
SynthID
Google DeepMindが開発した電子透かしの技術。AIが生成した画像や音声などに、人には知覚できない形で印を埋め込み、後から生成物かどうかを判別できるようにする。
C2PA
Coalition for Content Provenance and Authenticityの略。デジタルコンテンツが誰によってどう作られ、編集されたかという来歴を記録するための業界標準を策定する団体、およびその規格。
EEA
European Economic Area(欧州経済領域)の略。EU加盟国に、アイスランド、リヒテンシュタイン、ノルウェーを加えた地域。
トークン
AIモデルが入出力を数える単位。Gemini APIの音声出力では、音声1秒を25トークンとして料金を計算する。
Voice Design Benchmark
Hume AIの評価基盤Real-World VoiceEQに含まれる評価の1つ。文章で指示した声の特徴を、どこまで正確に作れるかを測る。アクセント、性別、声質、韻律などの項目があり、どのモデルかを知らされない評価者が判定する。
【参考リンク】
Google AI Studio(外部)
Googleの開発者向けツール。ブラウザー上でGemini 3.8 Flash TTSを試し、声の設計や複製、話し方の指示を確かめられる。
Gemini API|Speech generation(外部)
GeminiのTTSモデルの使い方をまとめた公式文書。対応言語はFlash TTSが130、Flash-Lite TTSが101とする。
Gemini API|Voice replication(外部)
声の複製機能の公式文書。成人本人の参照音声と同意音声の要件、30の言語・地域の同意文、声を作る前の話者照合の流れを説明する。
Gemini API|Pricing(外部)
Gemini APIの料金表。Flash TTSは2026年末までの期間限定価格で、2027年1月から音声出力の単価が上がる。
Hume AI|Real-World VoiceEQ(外部)
Hume AIが公開する音声AIの評価基盤。表現力や長い音声での安定性、声の再現、指示への追従などを、盲検の人手評価で比べる。
【参考記事】
Newly-released Google’s Gemini 3.8 Flash TTS tops Hume’s Real-World VoiceEQ leaderboard(外部)
Hume AIによる評価。Flash TTSとFlash-Lite TTSが34モデル中1位と2位とする一方、声の複製などの課題も示した。
Google snags team behind AI voice startup Hume AI(外部)
Google DeepMindがHume AIとのライセンス契約で、CEOのアラン・コーエン氏と約7人の技術者を迎え入れたと報じた記事。
上海首例涉AI声音仿冒不正当竞争案:游戏角色声音被AI复刻销售,判赔75万(外部)
上海市浦東新区人民法院が、『原神』のキャラクターの声をAIで再現して販売した変声ソフトの運営会社に75万元の賠償を命じた事件の報道。


















