Google 发布 Gemini 3.7 Flash:面向代码和代理的工作马模型
Google 推出 Gemini 3.7 Flash,这是针对编码和代理工作流的新版 Flash 系列模型。官方称其在代码调试、生产就绪代码、网页开发和知识密集领域上比 3.6 Flash 有显著提升,并给出多个基准对比数据。3.7 Flash 在 Gemini Spark(Google AI Pro/Ultra 订阅)中现已启用,并以介绍价对开发者和企业开放。
Google 在其官方博客发布 Gemini 3.7 Flash,定位为“最智能的工作马模型”,专注于编码、知识工作和网页开发等复杂工作流。Google 表示此版本是在 3.6 Flash 的基础上,基于开发者反馈与算法改进推出的,三周内紧跟 3.6 Flash 发布。
官方给出多项对比数据:在 FrontierCode 1.1 Main 上,3.7 Flash 的表现为 43.6% 对比 3.6 Flash 的 34.4%;在 DeepSWE v1.1 上为 65.3% 对比 49.0%。在 Web 开发评测 Arena.ai 的 WebDev Arena 中,3.7 Flash 的 Elo 得分为 1588,比 3.6 Flash 的 1538 更高。对于处理复杂文档的 GDP.pdf 基准,3.7 Flash 的得分为 34.0%,而 3.6 Flash 为 22.0%;在 AutomationBench 上分别为 30.4% vs 17.0%。文中还展示了将 3.7 Flash 与其他技术结合用于生成交互式网页、实时游戏内容和机器人训练等示例。
在开发者体验方面,Google 提到 3.7 Flash 更善于应对路障、在需要时澄清意图、按指令执行得更准,并在多步骤规划和调用工具时表现出更“尽责”的推理,从而减少手动监督和重试。3.7 Flash 在年底前以介绍价提供:输入 1M token 为 $0.75,输出 1M token 为 $3.75。Google 还称该模型已在 Gemini Spark(面向 Google AI Pro 与 Ultra 订阅用户)中上线,并可通过 Gemini API、Gemini Enterprise Agent Platform 和 Gemini Enterprise app 等渠道访问。
Google 同时指出,3.7 Flash 搭载了更新后的 Frontier Safety 保障,改善了在化学、生物、放射性与核以及网络攻击等滥用领域的防护,并提供了模型卡供进一步了解。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。