Google发布Gemini 3.5 Transcribe,语音转文字提速70%
速览
Google推出新AI模型Gemini 3.5 Transcribe,用于语音转文字,可自动删除“嗯”“啊”等口头语。新模型比旧版Chirp 3快70%,实时错误率降至5.5%。该功能已登陆Pixel 11的Gboard,不久将扩展到Chrome浏览器。
Google在等待Gemini 3.5 Pro发布期间,推出了同系列的Gemini 3.5 Transcribe模型。这个新模型专为语音输入设计,能自动去除语音中的“嗯”“啊”等填充词和口误,直接输出干净的文本。它已经在Pixel 11的Gboard“Rambler”功能中运行,现在开始向更多Google产品推广。
据Google介绍,Gemini 3.5 Transcribe比之前的语音转文字引擎Chirp 3更快更准。从语音到最终文本的转换速度提升约70%,实时语音错误率降至5.5%,略优于Chirp 3的7.32%。模型还支持85种语言,可识别最多三人参与的预录音频,并能根据用户自定义词汇处理专业术语。
需要注意的是,AI在转录时会改写原话,清除口语中的不一致和停顿。对短文本来说效果不错,但并非所有场景都适合改写原意。目前该模型已集成到Gboard、Gemini应用(macOS)、Antigravity和AI Studio中,开发者也可通过Gemini API调用。Google计划在“不久的将来”将Gemini 3.5 Transcribe带入Chrome浏览器,届时所有网页输入框都能使用AI语音转文字。
原文Google announces Gemini 3.5 Transcribe for AI-powered speech-to-textarstechnica.com
#Google#Gemini#语音识别
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。