Roboflow 实测:GPT-5.6 Sol 成为 OpenAI 最强视觉模型
Roboflow 对 OpenAI 新发布的 GPT-5.6 系列进行视觉基准测试,结果显示 Sol 在检测和计数上大幅领先前代。Sol 的检测得分从 GPT-5.5 的 13.8 跃升至 46.2 mAP@50,但大图处理稳定性存在问题。对于依赖视觉 AI 的开发者,Sol 值得关注,但需注意其较高的 token 消耗和延迟。
Roboflow 在上周 OpenAI 发布 GPT-5.6 系列(Sol、Terra、Luna)后,用其即将推出的 VLM 基准对其视觉能力进行了测试。该基准覆盖检测、计数、OCR 和数据提取等常见任务,结果显示 Sol 是 OpenAI 迄今最强的视觉模型,尤其在物体检测和计数方面进步明显。
在检测任务中,Sol 的得分从 GPT-5.5 的 13.8 mAP@50 跃升至 46.2,Terra 和 Luna 分别为 44.7 和 43.3,将此前明显短板变为实用能力。Sol 在文档布局检测和密集场景(如药丸、鸡蛋)中表现出色。但测试也发现,在约 2000x2000 像素以上的大图中,Sol 稳定性下降,可能输出无意义的边界框;OpenAI 团队确认了这一问题,建议通过缩放或裁剪图像来规避。
计数方面,Sol 得分 73.0%,高于 GPT-5.5 的 64.9%,Terra 和 Luna 分别为 67.6% 和 66.2%。Sol 能处理重叠物体和带规则的计数任务,但对泡罩包装等复杂场景仍会出错。OCR 性能与 GPT-5.5 持平,Sol 均相似度 90.7%,但文本提取得分 82.5%,低于前代的 87.6%,复杂场景下的简单提取仍会失败。
性能提升伴随着更高的 token 消耗和延迟。Sol 平均每图耗时约 10 秒,成本约 2.5 美分;Terra 约 6 秒,Luna 超 5 秒,后者在延迟和质量的平衡上最佳。Roboflow 建议在提示中指定绝对 XYXY 坐标以获得最佳检测效果。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。