Google が音声合成モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を公開 文章の指示で声を作り、30秒の音声から複製
Google が Gemini の音声合成モデルを2つ公開した。役柄やなまりを文章で指示して100を超える言語・方言の声を作れ、30秒の音声から本人の同意を確かめたうえで声を複製できる。API と Google AI Studio で同日から使える。料金は発表に無い。
- Google が2026年9月23日(米国時間)、音声合成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開した。Flash TTS は声の作り込みと演出向け、Flash-Lite TTS は大量に安く回す用途向けだとしている
- 役柄・なまり・声の特徴を文章で指示して、100を超える言語と方言で新しい声を作れる。あらかじめ用意された声は2,000以上で、メキシコのスペイン語、ケベックのフランス語、スコットランドの英語といった地域差も含むとしている
- 声の複製は30秒の音声からできる。声の持ち主が読み上げた同意の録音が、参照する話者と一致しないと作れない仕組みになっている。出力には電子透かし SynthID と C2PA の来歴情報が入る
- 台本に行ごとの演出を書き込める。間の取り方・感情・なまりの切り替えのほか、笑い・ため息・相づちといった言葉以外の音も指定できる。2人の話者の掛け合いも1つの台本から作れる
- 声の設計を測る Hume AI の Voice Design Benchmark で Flash TTS が71.4点で総合1位、なまりの再現でも60.8点で1位だったとしている。全体の品質の指標では Flash TTS が1位、Flash-Lite TTS が2位だとしている
- 開発者向けは Gemini API と Google AI Studio で同日から。Gemini Notebook と Google Vids でも使える。企業向けの Gemini Enterprise は「近く」。API の単価も、月額プランの料金や利用上限も、この発表には書かれていない
確かめた一次資料
- Gemini 3.8 text-to-speech says hello(Google、英語、2026年9月23日)