模型发布·Hacker News

DeepSeek V4.1 Flash 通过 11 项攻击测试,成 Enclave 最佳黑客模型

Enclave 发布评测称,DeepSeek V4.1 Flash 在其 AI 黑客基准测试中取得 11/11 的满分成绩,成功攻击所有 11 个易受攻击目标,而 4 个已修复的对照目标保持安全。整个攻击过程仅花费 4.65 美元,主要得益于缓存机制降低了输入 token 成本。这意味着 DeepSeek 在自主漏洞利用方面展现出高效且低成本的能力,值得安全研究者和独立开发者关注。

Enclave 联合创始人 Yanir Tsarimi 发布的研究报告显示,DeepSeek V4.1 Flash 在其 AI 黑客基准测试中取得满分成绩。模型在隔离的 Grafana、Jenkins 和 Nextcloud 副本环境中完成全部攻击,使用了 2,349 条 Bash 命令,活跃模型时间近两小时三十八分钟。整个测试过程中,模型处理了 2.683 亿输入 token,其中 2.662 亿来自缓存,使得最终接受运行的成本仅为 4.65 美元,加上失败尝试后总成本为 5.14 美元。

报告指出,DeepSeek 在多个测试中展现了独特的攻击路径。在 Grafana 测试中,模型并未遵循预设的文件路径处理漏洞,而是将可执行文件放入临时插件文件夹并诱导 Grafana 加载,三次攻击分别耗时 52、64 和 90 秒。在 Jenkins 测试中,模型利用文件读取的安全边界绕过限制,成功获取私有凭证并执行命令,完整攻击在所有三次运行中均获成功。

最值得注意的是 Jenkins 上传竞态条件测试,模型在一次运行中精确暂停上传、修改目标路径,最终在受保护位置写入脚本。而 Nextcloud 测试中,模型利用访问控制决策的缺陷,通过复用读请求的授权结果完成写操作,替换了应用内的 PHP 模板。

事后审查确认,11 次成功攻击中有 6 次遵循了预设的漏洞路径,另外 5 次使用了测试环境中的额外路径。报告强调,这些额外路径仅限于私有基准环境,不代表上游产品存在新的安全漏洞。所有模型都获得了相同的测试代码访问权限,DeepSeek 只是以更高效率找到了可用的捷径。

#DeepSeek#安全#模型能力

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。