研究进展·Simon Willison
Qwen3.8 27B 测试:大数加法准确率仅 23.57%
Simon Willison 用本地模型 Qwen3.8-27B 复现了两年前 GPT-4o 的大数加法实验。关闭推理时,模型在 5070 个用例中数值准确率仅 23.57%,十到十三位数字时跌至 6.44%。开启推理后,169 次尝试中答对 167 次,但耗时显著增加。
Simon Willison 在本地 DGX Spark 设备上运行 Qwen3.8-27B-Q4_K_M.gguf 模型,复现了两年前用 GPT-4o 做过的实验:让模型计算两个正整数的和,但要求只用英文单词输出结果。测试基准包含 5070 个关闭推理的用例,以及 169 个开启中等推理的对比用例。
关闭推理时,模型整体数值准确率只有 23.57%。当操作数为一到三位数时,准确率为 97.04%,但数字增加到十到十三位时,准确率骤降至 6.44%。不过,格式合规率高达 96.17%,说明模型大部分时候能按格式输出结果,只是数值算不对。
开启推理后,每个组合只测了一次,169 次尝试中答对 167 次。推理过程显示模型会逐位相加并处理进位,例如计算 42299366105622 加 6088794067970 时,会从个位开始逐步累加并记录进位。Simon Willison 指出,由于每次只测一次,换一轮测试结果可能不同,但这表明推理能力对算术准确率提升明显。
#Qwen3.8#模型评测#数学能力
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。