模型发布·Simon Willison

Google 发布 Gemini 3.8 Live 语音对话模型,支持实时打断

Google 今日发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态与 OpenAI 的 GPT-Live 类似。开发者 Simon Willison 用 GPT-6 Astra 构建了一个浏览器端测试界面,支持选择模型、语音预设和系统提示词。该界面无依赖库,直接通过 WebSocket 连接 Google 的生成式语言服务端点,并用 Web Audio API 处理音频捕获和播放。

Google 于 9 月 15 日发布了两款新的语音到语音模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking。这两款模型的整体形态与 OpenAI 的 GPT-Live 系列相似,主打实时语音交互。

开发者 Simon Willison 在其博客中介绍,他用 GPT-6 Astra 阅读了相关文档,并让其生成了一个用于测试新模型的网页界面。该界面允许用户选择模型和语音预设,输入可选的系统提示词,然后直接在浏览器中开始语音对话。一个关键功能是支持在模型说话时进行打断,这对于需要实时控制的对话场景相当实用。

值得注意的是,这个测试界面的实现没有使用任何 JavaScript 库。它通过 WebSocket 连接到 Google 的 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent 端点,并使用 Web Audio API 的 AudioContext 来处理音频的捕获与播放。这种轻量级的实现方式意味着核心交互逻辑并不复杂,为其他开发者探索类似功能提供了一个简洁的参考。

原文出处

Gemini Live audio

simonwillison.net

#Google#Gemini#语音模型

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。