产品动态3 分钟读完The Verge AI

Google 更新 Gemini Audio,新增转录模型可自动删除口头语

速览

Google 更新了 Gemini Audio,推出 Gemini 3.5 Live、Live Experimental 和 Transcribe 三个新模型。其中 Transcribe 是全新转录模型,能识别 85 种以上语言和专业术语,并自动移除「嗯」「啊」等口头语。用户现在可以在 macOS 版 Gemini 应用和 Android 的 Rambler 听写功能中使用这些更新。

Google 更新了 Gemini Audio,新增了几个 Gemini 3.5 系列模型,带来新的转录功能。这些模型能自动识别专业术语,支持超过 85 种语言。新发布的 Gemini 3.5 Live、3.5 Live Experimental 和 3.5 Transcribe 旨在提升 Google 语音控制 AI 功能的精确度,在背景噪音或用户说话被打断时也能正常工作。

Gemini 3.5 Transcribe 是该系列的全新成员,其发布正值用户等待 Gemini 3.5 Pro 模型上线之际。Google 表示,3.5 Transcribe 相比之前的转录模型 Chirp 3 有大幅进步,特别是在多语言表现和词错率方面。该模型允许用户「仅用声音进行自然编辑」,能自动格式化文本并移除「嗯」「啊」等填充词。用户还可以提供自定义词汇表,让模型适应独特的拼写要求和专业术语。此外,它还能在预录音频中区分最多三位说话者,并提供词级时间戳。

与 Transcribe 同时推出的 3.5 Live 和 3.5 Live Experimental 模型,在现有语音识别技术基础上构建,为 Gemini 的语音聊天模式提供支持。3.5 Live 在处理话中打断、语言识别和实时视觉处理方面表现更好,而 3.5 Live Experimental 则在处理更复杂任务时,会实时逐步叙述其推理过程。

这些 Gemini Audio 更新从今天开始推出,首先面向所有 macOS 版 Gemini 应用用户开放英语版本,并在特定国家和语言中支持 Android 上的 Rambler 听写功能。开发者现在也可以通过 AI Studio 和 Antigravity 在 Gemini API 中公开预览使用这些模型,Chrome 支持也将很快推出。

原文Google’s new AI transcription edits out your ‘ums’ and ‘ahs’theverge.com

#Google#Gemini#语音模型

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。

Google 更新 Gemini Audio,新增转录模型可自动删除口头语 - 一定会自由