研究进展·Hacker News

Anthropic 与 Redwood 发布 Conceptual Reasoning Index(CRI)及三个基准

Anthropic 与 Redwood Research 发布了 Conceptual Reasoning Index(CRI),并推出三套概念推理基准:LMCA、ACCoRD 和 DTBench capabilities。LMCA 包含 560 个立场文本和 1,461 条反对论点的评级,用于评估模型判断论点的能力;ACCoRD 测量模型在概念问题上概率与偏好的一致性;DTBench 是由 407 道多项选择题组成的决策理论测试。CRI 将这些基准聚合为单一指标,旨在衡量模型在缺乏经验证据、依赖论证的领域的概念推理能力。

Anthropic 与 Redwood Research 合作推出了 Conceptual Reasoning Index(CRI),并在网站 conceptualreasoning.ai 提供相关细节与方法学说明。研究者表示,许多与降低先进 AI 风险相关的工作缺乏可操作的经验反馈,因而需要模型在哲学、决策理论等领域进行论证式推理;为此他们构建了三套概念推理基准并将其聚合为 CRI。

LMCA(Language Model Conceptual Argumentation)是一个经过策划并由专家评级的概念论证数据集,涵盖决策理论、哲学和先进 AI 风险等主题。数据集中包含 560 个立场文本和 1,461 条针对这些立场的反对论点,几乎所有论点都由概念研究者 Emery Cooper 评级,部分论点由至少另一名研究者独立评级,总评级次数为 2,140 次。评级遵循详细的评分细则;在至少两人评级的论点上,人际评分一致性高于人机一致性。LMCA 也能用于评估模型的论证生成能力——通过让一个模型生成论点,再用另一个模型按评分细则评价该论点。

ACCoRD(Assessment of Consistency in Conceptual Reasoning Domains)旨在测量模型在概念性问题上的一致性,例如模型对事件概率 P(A) 与 P(A&B) 的报值是否满足概率关系。该数据集最初包含近 14,000 条由模型生成的一致性约束,经过自动检查流程后有 567 条得到进一步审查并被收录进用于计算 CRI 的一致性约束集合。DTBench capabilities(Decision Theory Benchmark)则由 407 道手工设计的多项选择题组成,用于测量决策理论相关能力。

目前 CRI 的聚合指标只包含模型对论点判断的表现(LMCA 中的部分测量),研究团队表示会在未来更新网站并随着新模型与基准的发布保持数据更新。研究者还指出,若模型能以专家水平执行减少 AI 风险的工作,AI 辅助的输出可能会远超无人辅助手段的产出,因此早期衡量与提升此类能力具有意义。

#Anthropic#基准测试#推理能力#CRI

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。