模型发布·Hacker News

GPT-6.1 Sol发布仅一周即取代GPT-6 Sol,智能指数逼近Astra

OpenAI发布GPT-6.1 Sol,距GPT-6 Sol发布仅7天,智能指数上涨4点,仅比GPT-6 Astra低1分,成本却不到后者的四分之一。该模型在多项基准测试中显著提升,同时价格维持不变,缓存读取折扣从90%提高到95%。对开发者而言,这是当前性价比最高的模型之一。

GPT-6.1 Sol 在 GPT-6 Sol 发布仅 7 天后即推出,并迅速取代后者成为 OpenAI 的最新模型。据 Artificial Analysis 的评测,GPT-6.1 Sol 在智能指数上比 GPT-6 Sol 高出 4 点,比 GPT-5.6 Sol 高出 5 点,仅比 GPT-6 Astra 低 1 分。

价格方面,GPT-6.1 Sol 的输入/输出 token 定价与 GPT-6 Sol 相同,仍为每百万 token $2/$10,但缓存读取折扣从 90% 提高到 95%,使得整体混合成本略低于 GPT-6 Sol。在最大努力设置下,GPT-6.1 Sol 每项智能指数任务的成本为 $0.72,仅为 GPT-6 Astra($3.26)的四分之一,比 GPT-6 Sol($1.05)低 31%,比 GPT-5.6 Sol($1.99)低 64%。

评测显示,GPT-6.1 Sol 在多项基准上取得进步:AA-Briefcase v1.1 提升 4 点,GDPval-AA v2.1 提升 5 点,Terminal-Bench 4.0 跳升 12 点,Humanity's Last Exam 提升 5 点,GDP.pdf 提升 6 点。AA-Omniscience 准确率提升 8 点,同时幻觉率从 60% 降至 54%。在 Coding Agent Index 上,GPT-6.1 Sol 比 GPT-6 Sol 高出 3 点,比 GPT-6 Astra 低 2 点。

不过,GPT-6.1 Sol 在所有努力级别下比 GPT-6 Sol 多使用约 10-30% 的输出 token。尽管如此,由于智能指数的提升,其低和中等努力级别在 token 效率上仍处于帕累托最优。评测还发现,xhigh 努力设置比 max 设置高出 3 点。

#GPT-6.1#OpenAI#模型迭代#人工智能

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。