ニュース

音声生成AI「Gemini 3.8 Flash/Flash-Lite TTS」を発表

音声生成AIモデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」(Text-to-Speech)

 Googleは9月23日、新たな音声生成AIモデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」(Text-to-Speech)を発表した。これらのモデルは現在、Google AI StudioおよびGemini APIを通じて提供されている。今後はGemini Enterprise、Gemini Notebook、Google Vidsといった各プラットフォームへ順次導入される。

 Gemini 3.8 Flash TTSは、深いクリエイティブディレクションとキャラクターデザインのために設計。自然言語のプロンプトを用いて音声を一から作成し、ペースや方言の変化、バックチャネリング、非言語表現、演技の指示をセリフごとに制御できる。

 Gemini 3.8 Flash-Lite TTSは、大量の吹き替え処理や音声エージェントでの運用に向けて開発されており、処理・コストの効率を実現するために設計されている。

 機能面では、100以上の言語と方言に対応し、2,000種類以上のすぐに使える音声を収録する。30秒の音声サンプルから話者の特徴を再現する機能も備える。長時間の音声生成でも音質のブレが少なく、2人の対話シーンを1つの台本から再現する処理にも対応する。

 性能面においては、Hume AIの音声デザインおよび総合品質指標にて1位と2位を獲得した。また、日本語を含む複数言語を対象としたVoice Arenaのブラインド評価でも上位の評価を収めている。