Google 发布 Gemini 3.8 双 TTS 模型,支持 2000 种声音与自定义音色
Google 今日推出 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts 两个文本转语音模型。新模型内置超过 2000 种声音,并支持用 30 秒音频样本创建自定义声音。开发者可通过 API 轻松定义多角色对话,生成一段 1 分 18 秒的音频约需 20 秒,成本 2.74 美分。
Google 今天发布了两款新的 Gemini 文本转语音模型:gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。这两个模型自带一个包含超过 2000 种声音的库,同时允许用户用「30 秒的语音音频样本」创建自定义声音,前提是你拥有该声音的使用权。
Simon Willison 用 GPT-6 Astra 搭建了一个 playground 界面,用来测试这个新 API。这个接口利用了 Gemini API 开放的 CORS 策略,允许用户自带 API key 使用。playground 支持组合单角色旁白或多说话人对话,预览生成的音频,并查看请求和响应的详细信息。设置可以通过可书签化的 URL 保存和分享。
API 的一个显著特点是能方便地定义多个角色之间的完整对话,每个角色可以有不同的声音和语音风格指令。Willison 展示了一个演示片段:两只鹈鹕争论是否要搬到 Pacifica 码头。这个脚本由 Claude 4.5 Opus 撰写。
在实测中,使用 gemini-3.8-flash-tts(非更便宜的 Flash-Lite 版本)生成 1 分 18 秒的音频花费了约 20 秒,成本为 2.74 美分。对于开发者来说,这意味着生成对话式音频内容的成本和时间都处于一个相当低的水平。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。