查看: 132| 回复: 0
跳转到指定楼层
上一主题 下一主题
收起左侧

GPT 6.1 Sol vs GPT 6.0 Sol vs Claude Opus 5.5(求加米加米加米!!)

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
从发布 benchmark 看,6.1 Sol 相比 6.0 Sol 的提升主要集中在复杂任务:真实代码库测试 DeepSWE v1.1 从 68.8% 提升到 75.2%,而且新版在 high 推理档就超过了旧版 max 档的最高分。电脑操作测试 OSWorld 2.0 离线集则从 64.4% 提升到 71.4%。

与 Claude Opus 5.5 相比,6.1 Sol 在部分专业任务上已经领先。按 OpenAI 公布的比较,AutomationBench 多步骤工作流测试中,6.1 在 medium 档高出 2.2%,单任务成本约为 Opus 的1/3;复杂 PDF 推理测试 GDP.pdf 中,6.1 在测试过的各推理档位均高于带 fallback 的 Opus 5.5,单任务成本不到一半。

但上述的benchmark都是OpenAI汇总的 期待更多的benchmark

上一篇:Opus 5.5最大问题是,用完他真的不愿意用其他模型了
您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表