GoogleがGemini 3.8で音声生成を前に進めた理由
Googleが、Gemini向けの新しいtext-to-speechモデルを発表した。名前はGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTS。単に文章を読み上げるだけではなく、声のキャラクターや話し方まで自然言語で細かく指示できるのが売りだ。生成AIの次の競争が、テキストから画像へ、そして音声の「演技」へ移ってきたことを感じさせる発表でもある。しかも今回は、開発者向けの機能追加というより、音声を本気で制作ツールに変えようとしている点が目立つ。 Googleの説明によると、今回の2つのモデルはGeminiファミリーに追加された新しいtext-to-speechモデルだ。Gemini 3.8 Flash TTSは、より創作寄りの用途を狙った上位モデルで、自然言語のプロンプトからゼロから新しい声を作れる。たとえば、役柄、アクセント、声の特徴を指定して、ゲームのキャラクターや没入感のあるオーディオブック、ポッドキャストに合う声を作る想定だ。さらに、セリフごとに演技の指示を与えられ、ペース、方言の切り替え、backchannelingまで細かく調整でき
papoo.work