研究进展·Simon Willison
Anthropic红队评估:GLM-5.3与Claude Mythos在漏洞利用基准上的表现
Anthropic前沿红队发布评估,测试多款模型在内部二进制利用基准上的表现。GLM-5.3在4%的试验中实现完全控制流劫持,Claude Mythos Preview为6%。早期模型如Claude Opus 4.6和GLM-5.2则未能在任何任务中成功,标志着一个重要门槛已被跨越。
Anthropic前沿红队近日发布了一项评估,针对多款模型在内部二进制利用基准上的表现进行了测试。该基准包含100项任务,模型需在随机选取的任务中展示其网络攻击能力。结果显示,GLM-5.3在4%的试验中实现了完全控制流劫持,而Claude Mythos Preview的比例为6%。
尽管GLM-5.3在此项测试中的表现略逊于Claude Mythos Preview,但红队指出,一个有意义的技术门槛已被明确跨越。相比之下,更早期的模型如Claude Opus 4.6和GLM-5.2在同类任务中均未取得成功,这表明新一代模型在高级网络能力方面有了显著提升。
这一发现由Simon Willison在其博客上引用并分享,引发了关于AI模型安全性和潜在风险的讨论。随着模型能力的不断增强,评估和监控其潜在滥用风险变得愈发重要。红队的这一评估为理解当前AI模型的边界提供了参考数据,也为未来的安全研究指明了方向。
#Anthropic#安全#红队测试
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。