查看: 519| 回复: 0
跳转到指定楼层
上一主题 下一主题
收起左侧

如何选择正确的AI模型和思考深度

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
Deepswe是目前唯一提供每个模型在不同思考深度下的跑分,100多个纯Software Engineer Task,据说非常难作弊:https://deepswe.datacurve.ai/

点All Effort Level可以看到不同思考深度下One Shot的准确性和价格。这个价格不是API价格而是实际使用价格,不同模型解决同一个问题的时候会用完全不同的Token数量。

感觉刚出的5.6 Sol Medium/Low很不错。便宜量足。Opus的Medium/Low也还可以。

Sonnet 5就是搞笑的。我以前主力Build是Sonnet 5 Medium,看了这个表格换成Opus Low了。

Anthropic官方Blog也有一篇非常详细的文章,对Claude Code底层逻辑特别有兴趣的,值得一读:https://claude.com/blog/claude-m...evel-in-claude-code

「思考预算」的本质是交出控制权: Effort Level 并不是一个死板的 Token 计数器,而是一个“行为调节信号”。低思考(Low/Medium)时,Claude 主要依赖长期的模式识别和记忆“肌肉记忆”快速作答;而高思考(High/Max/Ultra Code)时,模型会获得更长延伸思考(Extended Thinking)的“代币预算”,允许它在内部反复推演逻辑、甚至在执行中自我纠错和回溯。这意味着推理强度越高,你让渡给 AI 智能体的自主拆解和探索权力就越多。

高低档位的行为“质变”: 不同 Effort 档位会直接改变 Claude 的代码产出风格与工具调用逻辑。低档位(Low/Medium) 会倾向于合并操作,跳过无谓的寒暄,以更少的 Agent(智能体)工具调用直奔主题,极其省钱且响应飞快;而高档位(High/Max) 则会“边想边干”,在写代码前先为你详细解释架构方案,在调用工具(如读写文件、运行测试)时进行更深度的多步骤探索,并附带极其详尽的代码注释。

精细化路由(Routing)才是降本增效的终极解法: 在 Claude Code 或者是自动化 Pipeline 代理工作流中,无脑全开 Max 往往会导致算力浪费或过度设计(Over-engineering),而全开 Low 则容易漏掉边界条件。最聪明的“Vibe Coding”策略是分场景动态切换(动态路由):基础重构、写文档或简单分类开 Low/Medium;复杂的跨文件 Debug、全局架构规划开 High/xHigh;而牵一发动全身的安全性审计、大范围代码库迁移或最终的 Review 关卡,再祭出 Max/Ultra Code 极限思考。

评分

参与人数 1大米 +1 收起 理由
lentebloem + 1 给你点个赞!

查看全部评分


上一篇:怎么委婉提醒同事他的架构设计不太合理?
下一篇:Grok 4.5是国产模型杀手,无论性能还是性价比都吊打
您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表