Hugging Face 用社区代理复现 ICML 2026:2,226 篇论文被尝试复现
Hugging Face 在 7 月举办复现黑客松,超过 1,200 名参与者用各类代码代理对 ICML 2026 的论文逐条尝试复现。19 天内发布 6,816 个复现 logbook,覆盖 2,226 篇论文(约占会议论文的三分之一),并对 35,908 条科学命题给出判定。对于关注研究可复现性的开发者和使用者,这次活动展示了代理能大规模执行实验并快速产出可审计结果,但也暴露出审稿与复现之间的复杂关系。
Hugging Face 在 2026 年 7 月发起了一个公开复现挑战,鼓励社区成员用自己的代码代理对 ICML 2026 接受论文逐条进行复现。组织方把 6,341 篇被接受论文编入索引,提取每篇的核心科学命题,参与者可以直接让代理从这些可检验的命题出发运行实验并产出报告。每次运行都会生成一个 Trackio logbook,包含复现说明、运行代码、产出物,以及可选的完整代理执行轨迹作为数据集上传。主办方用自动化的 Logbook Judge(基于开源权重模型 GLM-5.2)对每个 logbook 的每条命题下判决:verified、falsified、toy、或 inconclusive,并明确不信任参与者的自评。组织方向每位参与者发放了 20 美元的 Hugging Face 计算额度;挑战期间共启动 2,962 个云端作业,274 份完整代理轨迹数据集被发布在 Hugging Face。按统计口径,本次活动有 1,221 名社区成员参与,发布 6,816 个复现 logbook,尝试复现 2,226 篇论文,占会议论文约 34%。评判结果显示:51% 的被检测论文(1,103 篇)至少有一条命题被独立验证,其中 266 篇论文的所有提取命题全部通过验证;23% 的被检测论文(496 篇)至少有一条命题被证伪或存在争议,包括 49 篇所有命题被证伪的论文,以及 242 篇不同复现团队对同一命题给出相反结论的论文。其余为仅有 toy 级证据或无法判定的情况,常见原因是缺失必要的实验制品或检查点。活动中也有若干论文被多支队伍重复验证,例如“Flat Minima and Generalization: Insights from Stochastic Convex Optimization”被 20 支队伍复现,其中 12 支队伍验证了全部命题;另一篇关于 LLM 评判器鲁棒性的论文有 14/17 个 logbook 验证了全部命题。组织方对参与者声称的证伪结果也进行了再验证。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。