← 記事一覧に戻る

Google が音声合成モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を公開 文章の指示で声を作り、30秒の音声から複製

Google が Gemini の音声合成モデルを2つ公開した。役柄やなまりを文章で指示して100を超える言語・方言の声を作れ、30秒の音声から本人の同意を確かめたうえで声を複製できる。API と Google AI Studio で同日から使える。料金は発表に無い。

  • Google が2026年9月23日(米国時間)、音声合成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開した。Flash TTS は声の作り込みと演出向け、Flash-Lite TTS は大量に安く回す用途向けだとしている
  • 役柄・なまり・声の特徴を文章で指示して、100を超える言語と方言で新しい声を作れる。あらかじめ用意された声は2,000以上で、メキシコのスペイン語、ケベックのフランス語、スコットランドの英語といった地域差も含むとしている
  • 声の複製は30秒の音声からできる。声の持ち主が読み上げた同意の録音が、参照する話者と一致しないと作れない仕組みになっている。出力には電子透かし SynthID と C2PA の来歴情報が入る
  • 台本に行ごとの演出を書き込める。間の取り方・感情・なまりの切り替えのほか、笑い・ため息・相づちといった言葉以外の音も指定できる。2人の話者の掛け合いも1つの台本から作れる
  • 声の設計を測る Hume AI の Voice Design Benchmark で Flash TTS が71.4点で総合1位、なまりの再現でも60.8点で1位だったとしている。全体の品質の指標では Flash TTS が1位、Flash-Lite TTS が2位だとしている
  • 開発者向けは Gemini API と Google AI Studio で同日から。Gemini Notebook と Google Vids でも使える。企業向けの Gemini Enterprise は「近く」。API の単価も、月額プランの料金や利用上限も、この発表には書かれていない

確かめた一次資料

この記事は、上の一次資料の原文を読んで書いています。数字は原文のとおりで、計算した値はそう書いています。

ほかの記事を見る