模型发布·Google DeepMind

Google发布Gemini 3.8 TTS模型,支持自定义语音与精细控制

Google推出Gemini 3.8 Flash TTS和Flash-Lite TTS两款新文本转语音模型,支持从零创建自定义声音或复制现有声音,并提供逐行表演控制。模型覆盖100多种语言和2000多个预设声音,内置SynthID水印等安全功能。创作者和开发者可用其生成有声书、播客或实时语音代理。

Google今日发布了两款新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。前者面向深度创意指导和角色设计,允许用户通过自然语言提示创建全新声音,并逐行控制表演细节,包括语气、节奏、方言转换和应答。后者针对高容量、成本敏感的场景优化,适合批量配音、音频内容创建和具表现力的语音代理。

这两款模型支持从30个原始声音扩展到无限自定义声音库,覆盖100多种语言和方言,提供超过2000个生产级声音模板。用户还可通过30秒的音频样本复制声音,系统内置同意验证、SynthID水印和C2PA凭证以保护权益。语音混音功能即将推出,允许调整音色、音高、语速和口音。

新增的逐行导演控制功能允许用户编写舞台指示,实现长式音频生成、双人场景调度和脚本化非语言表达(如笑声、叹息),适用于播客、有声书和交互式语音代理。模型已集成至Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook和Google Vids,并配备水印等安全工具。

原文出处

Gemini 3.8 text-to-speech says hello

deepmind.google

#Google#语音合成#Gemini

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。