文章で注文するだけで、声を一から作れる。Gemini 3.8 Flash TTSのVoice Designで、解説動画のAIキャラクターの声を作り直しました。声は30秒ほどでできましたが、その手前には前払い800円の手続きがありました。同じ原稿を3回読ませて測った結果と合わせて、実際に触って分かったことをまとめます。
私が作っている解説動画には、「伊野部トピ子」という解説役のAIキャラクターが出てきます。声はこれまで、パソコンで動く音声合成ソフトのAivisSpeechで作ってきました。
Googleが9月23日に発表したGemini 3.8 Flash TTSには、欲しい声を文章で説明して作る「Voice Design」という機能があります。トピ子の声を、この機能で作り直してみました。声を作るまでの手順と、同じ原稿を読ませた結果をまとめます。
声の入口は2つ

Google AI Studioの音声生成の画面で「Create new voice」を押すと、入口が2つ出てきます。声を言葉で説明して作る「Voice Design」と、短い録音から声を写す「Voice Replication」です。
複製のほうは使いませんでした。複製には、元の声の持ち主が同意文を読み上げた録音が要ります。トピ子の今の声はAivisSpeechの音声モデルの声で、その同意を私は用意できません。トピ子は実在しない人物なので、文章で一から声を作るのが筋だと考えました。
声を作る前に、前払いの800円

私の環境では、Voice Designを開くと有料枠への切り替えを求められました。GoogleのVoice Designの説明文書には、有料枠に限るという記述は見当たりません。触ってみて初めて分かったことです。
手続きは3段階でした。プロジェクトとAPIキーを選ぶ、支払い情報を設定する、APIキーをリンクする。私のアカウントには有料枠用のプロジェクトがなかったので、既定のプロジェクトとAPIキーがこの場で自動で作られました。

意外だったのは、私に提示されたのが前払いのプランだったことです。使った分をあとで払う代わりに、先にクレジットを購入します。私の画面では800円、3,200円、16,000円を選べ、別の金額も指定できました。購入したクレジットはGemini APIの利用にしか充てられず、原則として払い戻されず、購入から1年で失効します。
Googleの案内によると、新しく有料枠に移る利用者は原則として前払いのプランになり、最低購入額は5ドル相当です。アカウントによっては後払いのプランを選べる場合もあります。
私は最小の800円を選び、残高が減ると自動で買い足す「オートチャージ」はオフにしました。画面ではオートチャージに「推奨」の印が付いていますが、試すだけなら要りません。

手続きは10分ほどで終わりました。声を作る作業そのものより、ここまでのほうが長くかかります。
なお、AI Studioの画面の左下には、10ドルの特典4件、計40ドル分のクレジットの案内も出ていました。有料化の手続きの途中では案内されなかったので、私は800円を払ったあとで引き換えています。Googleの案内では、前払いのプランの利用者は、先に前払いのクレジットを購入しないと、こうした特典をGemini APIに使えません。特典だけで前払いを省くことはできない仕組みです。
日本語で注文して、30秒で3つの候補

入力欄は2つだけです。声の名前と、声の説明。説明の欄には、声質、年齢、性別、音の高さ、話す速さ、アクセント、トーン、話し方の癖を書くよう案内があり、具体的なほど良い結果になると添えられています。例文はすべて英語でしたが、名前も説明も日本語で受け付けました。
トピ子の設定から起こした説明文に、私は「少し鼻にかかった柔らかさ」と「上品で控えめな色気」を足しました。入れた文は次のとおりです。
20代後半から30代前半の日本人女性。落ち着いた知的な声で、ニュースを解説する人のように明瞭に話す。中音域で、少し鼻にかかった柔らかさがあり、上品で控えめな色気がある。甘すぎない。標準語のアクセント。早口にならず、語尾をはっきり言い切る。

「Generate voice」を押すと、30秒ほどで3つの候補が出ました。同じ説明文なのに、3つは特徴の違う声です。それぞれが別の短い文を読み上げ、どれもニュースで使うような言葉が多く含まれていました。説明文の「ニュースを解説する人のように」に、試し読みの文まで合わせているように私には聞こえました。
私は1番目を選びました。文章で注文しても、最後は耳で選ぶ仕組みです。

あとで話者の一覧を開くと、自分で作った声の欄に、選ばなかった2番目と3番目も残っていました。Googleのドキュメントでは、保存できる声は1つのプロジェクトで200件までです。ただ、今回の3つの候補がこの枠にどう数えられるかは、確かめられていません。
同じ一覧では、既製の声を探す欄に「2,000以上」と表示され、言語、性別、音の高さ、スタイル、用途で絞り込めました。Googleの発表文も同じ数を挙げていますが、APIのドキュメントには別の数え方が書かれています。
同じ原稿を3回読ませた

台本の画面では、本文の欄とは別に、話し方の指示(Style)と、笑いや息づかいのタグ(Expression)を入れる欄があります。今回はどちらも既定のままにしました。
原稿は、発表の内容を縦動画1本分(311字)にまとめたものです。「Gemini 3.8 Flash TTS」「Google DeepMind」「SynthID」「C2PA」「0.0135ドル」「71.4」など、読み間違えやすい語を意図して入れています。同じ原稿を3回生成し、AivisSpeechでも1回録りました。
| 音声 | 長さ | 話速 | 0.25秒以上の間 |
|---|---|---|---|
| AivisSpeech | 57.64秒 | 324字/分 | 23回 |
| Gemini 1回目 | 55.40秒 | 337字/分 | 23回 |
| Gemini 2回目 | 57.20秒 | 326字/分 | 15回 |
| Gemini 3回目 | 53.64秒 | 348字/分 | 11回 |
聞いた印象は、3回とも同じでした。同じファイルを3回再生したのかと思ったほどです。ところが長さを測ると、いちばん短い回と長い回で約3.6秒違いました。私の無音の判定では、0.25秒以上の間の回数も、23回から11回まで開きがありました。耳では気づかない範囲で、間の取り方が毎回変わっていたことになります。
読み間違いは、3回ともありませんでした。AivisSpeechでは、25語の読み方辞書を入れて正しく読ませている語です。Geminiは何も指定せずに読み切りました。原稿にない言葉が足されたり抜けたりすることもなく、声も3回とも、候補で選んだときのままでした。
動画に組み込むときの注意
実際の制作に使うなら、気をつけたい点が4つあります。
1つ目は、尺の見積もりです。私は縦動画の原稿を、AivisSpeechの話速から逆算して書いています。今回の3回では、尺が数%動きました。60秒の枠で作るなら余裕を取り、生成したあとの実際の長さで字幕を合わせることになります。字数だけで尺を決める作り方には向きません。
2つ目は、音声の形式と音量です。今回の出力ファイルは、Geminiが24kHz、AivisSpeechが44.1kHzでした。私が測った平均の音量は、Geminiのほうが約2.5dB小さく、動画に組み込むときは音量をそろえる必要があります。
3つ目は、作った声を選んだときの挙動です。私は有料のAPIキーをブラウザーに保存しない設定にしていました。それでも私の環境では、画面を開き直して作った声を選ぶと、有料のキーに切り替わりました。Googleの案内では、AI Studioは無料で使えますが、有料のキーをリンクすると、そのキーでの利用には料金がかかります。生成する前に、画面で選ばれているキーと話者を確かめることにしました。
4つ目は、プログラムから呼び出す場合です。私が画面右上の「Get code」で開いたコードでは、声の指定に画面の表示名(「伊野部トピ子 1」)が使われ、声のIDは見つかりませんでした。Googleのドキュメントでは、作った声は「voice_」で始まるIDで呼び出し、AI StudioからそのIDをコピーできると説明しています。声を作ったときの説明文も、コードでは毎回の話し方の指示として丸ごと送られていました。ドキュメントは、声の変わらない特徴は声の設計に書き、毎回の指示は短くするよう勧めています。このコードがAI Studioの外で動くかは、試せていません。
費用
声を作って3回生成したあと、利用額の画面には、その月の費用として24円と表示されました。3回分の音声の長さ(計166秒)から、発表の単価で音声出力分だけを見積もると約6円です。24円の内訳と、どの操作にいくらかかったのかは、画面からは分かりませんでした。
前払いの残高は、声を作った直後に797円、3回生成したあとに800円と表示されました。Googleの案内では、前払いの残高より先に、引き換えた特典が使われます。私は途中で40ドルの特典を引き換えているので、購入した800円から実際にいくら引かれたかは、この表示だけでは分かりません。
トピ子の声は、Geminiへ
私は、トピ子の声をGeminiに移すことにしました。決め手は、3回とも同じファイルかと思うほど声がそろっていたこと、そして25語の読み方辞書で支えてきた固有名詞を、何も指定せずに読み切ったことです。尺が毎回数秒ずつ動く点は、字幕を実際の音声から起こす今の作り方なら吸収できます。
一方で、ほかのキャラクターはAivisSpeechに残します。今回、作った声は有料のAPIキーで使っており、生成のたびに利用料金がかかります。登場の回数が少ないキャラクターまで移す理由は、今のところ見当たりません。キャラクターごとに、使う頻度を見て決めていくつもりです。
声を作る作業は、日本語の数行と30秒で済みました。私の場合、その手前に必要だったのは、有料枠への切り替えと800円の前払いでした。
【用語解説】
Voice Design
Gemini 3.8 Flash TTSの機能の1つ。年齢や声質、話す速さなどを文章で説明すると、その特徴を持つ新しい声を生成する。今回のGoogle AI Studioでの検証では、有料枠への切り替えを求められた。
Voice Replication
Gemini 3.8 Flash TTSの機能の1つ。短い録音から、その人の声を写し取る。声の持ち主本人が所定の同意文を読み上げた録音が必要で、2つの録音の話者が一致するかを確かめてから声を作る。
APIキー
プログラムや外部のサービスからAPIを呼び出すときに、利用者を識別するための文字列。Gemini APIでは、有料枠の利用と請求がこのキーとプロジェクトに結びつく。
kHz(キロヘルツ)
音声を1秒間に何回記録するかを表す値(サンプリング周波数)。24kHzは1秒に2万4,000回、44.1kHzは4万4,100回記録する。値が異なる音声を混ぜるときは、どちらかにそろえる。
【関連記事】
Gemini 3.8 Flash TTS、声の複製に本人の同意録音
Gemini 3.8 Flash TTSの発表を読み解いた記事。声を文章で作る機能と、複製に本人の同意録音を求める仕組みを整理した。
Gemini 3.8 Live、GPT-Live-1と分かれた音声AIの設計
同じGemini 3.8世代の音声対話モデルを扱った記事。台本を読むTTSと対になる、考えながら話すAIの設計を読み解いた。
【編集部後記】
声の説明文を書くとき、私はトピ子の設定を思い浮かべながら、年齢から話し方の癖まで6つの文を並べました。あとでGoogleのドキュメントを読むと、説明は1〜2文で具体的に書くほうが、すっきりとした一貫性のある声になるとありました。
6文でも、3回とも同じ声に聞こえるほど安定していました。それでも、言葉を削ったときに声のどこが変わるのかは、まだ聞いていません。トピ子らしさを残したまま、説明文をどこまで短くできるのか。次はそこを試してみます。
【参考リンク】
Google AI Studio(外部)
Googleの開発者向けツール。ブラウザー上で声の設計や音声の生成を試せる。今回はVoice Designで有料枠への切り替えを求められた。
Gemini API|Speech generation(外部)
GeminiのTTSモデルの使い方をまとめた公式文書。声の設計と保存、本文と話し方の指示の分け方、保存できる声の上限を説明する。
Gemini API|Voice design(外部)
声の設計の公式文書。作った声をvoice_で始まるIDで呼び出す方法と、説明文は1〜2文で具体的に書くといった勧めを載せる。
Gemini API|Billing(外部)
Gemini APIの請求の仕組みを説明した公式文書。前払いと後払いのプラン、最低購入額、特典クレジットの使われる順番を扱う。
Gemini API|Pricing(外部)
Gemini APIの料金表。Flash TTSは2026年末までの期間限定価格で、音声は1秒25トークンとして計算する。
AivisSpeech(外部)
Aivis Projectが開発する日本語の音声合成ソフト。パソコン上で動き、読み方を登録するユーザー辞書を備える。今回の比較の基準。


















