从发布 benchmark 看,6.1 Sol 相比 6.0 Sol 的提升主要集中在复杂任务:真实代码库测试 DeepSWE v1.1 从 68.8% 提升到 75.2%,而且新版在 high 推理档就超过了旧版 max 档的最高分。电脑操作测试 OSWorld 2.0 离线集则从 64.4% 提升到 71.4%。
与 Claude Opus 5.5 相比,6.1 Sol 在部分专业任务上已经领先。按 OpenAI 公布的比较,AutomationBench 多步骤工作流测试中,6.1 在 medium 档高出 2.2%,单任务成本约为 Opus 的1/3;复杂 PDF 推理测试 GDP.pdf 中,6.1 在测试过的各推理档位均高于带 fallback 的 Opus 5.5,单任务成本不到一半。