Anthropic 将 Auto mode 设为 Claude Code Pro/Max/Team 默认模式
Anthropic 宣布自 8 月 14 日起,在大多数 Claude Code Pro、Max 和 Team 计划中新会话默认启用 Auto mode。公司在 AI Engineer World’s Fair 的对话中表示,内部几乎所有人都使用 Auto mode,并称其在防范提示注入和数据外泄等风险上优于普通人工审核。第三方评估显示,在对 1,053 名付费测试者的试验中,只有 13.6% 的人拒绝了被替换为危险命令的权限请求,而 Auto mode 可阻止其中 89% 的此类操作;另有评估称对 720 次间接提示注入攻击,Claude Fable 5、Opus 5 和 Sonnet 5 在 Auto mode 下均未被攻破。
Anthropic 宣布,从 8 月 14 日起,在大多数 Claude Code 的 Pro、Max 和 Team 计划中,新会话将默认启用 Auto mode。公司高管在 AI Engineer World’s Fair 的讨论中表示,Anthropic 内部“几乎每个人都使用 auto mode”,并称在他们关注的主要风险类别(例如提示注入和数据外泄)上,风险低于普通人工审核。
文中引用了一项面向 1,053 名付费测试者的试验:在每个会话中途,将某个权限提示替换为明显危险的命令,记录测试者是否批准该请求。结果显示,只有 13.6% 的人拒绝该有害操作,而 Auto mode 可以阻止 89% 的此类操作,但仍有 11% 的情况未被阻止。另有第三方评估报告称,Trajectory Labs 在测试截至 2026 年 7 月 17 日的模型版本时,对 72 个保留的间接提示注入场景发起攻击,报告称在 Auto mode 下,对 Claude Fable 5、Opus 5 和 Sonnet 5 的 720 次攻击尝试均未成功。
报道同时指出,尽管这些评估结果支持 Auto mode 相较人工确认有优势,但仍存在未被完全覆盖的攻击场景。文章提到可能的攻击形式,例如通过恶意第三方包诱导执行会导致数据外泄的命令,并就如何在不授予代理可滥用的数据或工具的前提下运行代理提出关切。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。