AI 把代码越写越好,瓶颈去哪了?兼聊聊 infra 人的焦虑
职场感言
这两年在版面上明显感觉到一种情绪:做 OS、编译器、runtime、性能调优的同学有点茫然。AI 把应用层的代码越写越好,连带着很多人怀疑:自己搞了十几年的底层功夫,是不是也快被吃掉了?隔三差五就有帖子问"infra 还值得做吗"。
最近刷到 Dario Amodei(Anthropic CEO)访谈里的一段【x.com/MilkRoadAI/status/20...274045382773?lang=en】,他引用 Amdahl's Law 谈 AI 的影响:当你把系统里快的部分大幅加速之后,原来"无关紧要"的部分会变成新的瓶颈——旧的优势消失,新的优势从想不到的地方长出来。
这不是抽象理论,数据已经出来了。同一个帖子里引了几组 2026 年的统计:
说个自己的体会。我以前做 AI compiler 的时候,感觉一天的大部分时间其实都花在 debug 上——写代码从来不是瓶颈,搞清楚"为什么错"才是。现在有了 AI 帮忙,体感反而更微妙:简单的问题它秒解,但难一点的,经常烧半天 token 也定位不到。原因想想也直白——它在盲猜。模型看不见执行:不知道内存实际怎么用的,不知道为什么 crash,不知道两次运行为什么结果不一样。它只能靠读代码反复假设,我就看着 token 表一路狂转。我个人一个月 $200 的 token 预算现在都守不住了,回头一算,大半烧在"让模型猜为什么错"这件事上。
所以我的判断和主流焦虑正好相反:AI 越能写代码,runtime 的 ground truth 越值钱。 AI coding 本质上是个开环系统,生成的代码量越大,验证和诊断的缺口就越大。谁来给这个开环系统闭环?只能是对执行层有真正理解的系统——和造这些系统的人。做底层的同学,你们手里的功夫不是快被淘汰的东西,是即将被重新定价的东西。
我在 UMass 做了小二十年 systems research,前两年辞掉了 tenure,中间在 ByteDance 和 XPeng 带过训练基础设施,亲眼看着这些问题每天烧掉 GPU-months。现在我全职创业做的就是这个方向——等于把自己的钱和职业生涯都押在了上面这个判断上。
抛几个问题,想听听大家的一线情况:
最近刷到 Dario Amodei(Anthropic CEO)访谈里的一段【x.com/MilkRoadAI/status/20...274045382773?lang=en】,他引用 Amdahl's Law 谈 AI 的影响:当你把系统里快的部分大幅加速之后,原来"无关紧要"的部分会变成新的瓶颈——旧的优势消失,新的优势从想不到的地方长出来。
这不是抽象理论,数据已经出来了。同一个帖子里引了几组 2026 年的统计:
- 重度使用 AI coding 的团队,merge 的 PR 数量涨了 98%——但 PR review 时间也涨了 91%,实际部署速度几乎没变;
- 96% 的开发者表示,不完全信任 AI 生成的代码进 production;
- Veracode《2026 State of Software Security》:82% 的组织背着 security debt(同比 +11%),critical 级一年暴涨 36%——报告直接归因于 AI 生成代码进入 production 的速度,超过了安全团队的处理能力。
说个自己的体会。我以前做 AI compiler 的时候,感觉一天的大部分时间其实都花在 debug 上——写代码从来不是瓶颈,搞清楚"为什么错"才是。现在有了 AI 帮忙,体感反而更微妙:简单的问题它秒解,但难一点的,经常烧半天 token 也定位不到。原因想想也直白——它在盲猜。模型看不见执行:不知道内存实际怎么用的,不知道为什么 crash,不知道两次运行为什么结果不一样。它只能靠读代码反复假设,我就看着 token 表一路狂转。我个人一个月 $200 的 token 预算现在都守不住了,回头一算,大半烧在"让模型猜为什么错"这件事上。
所以我的判断和主流焦虑正好相反:AI 越能写代码,runtime 的 ground truth 越值钱。 AI coding 本质上是个开环系统,生成的代码量越大,验证和诊断的缺口就越大。谁来给这个开环系统闭环?只能是对执行层有真正理解的系统——和造这些系统的人。做底层的同学,你们手里的功夫不是快被淘汰的东西,是即将被重新定价的东西。
我在 UMass 做了小二十年 systems research,前两年辞掉了 tenure,中间在 ByteDance 和 XPeng 带过训练基础设施,亲眼看着这些问题每天烧掉 GPU-months。现在我全职创业做的就是这个方向——等于把自己的钱和职业生涯都押在了上面这个判断上。
抛几个问题,想听听大家的一线情况:
- Debug 占你开发时间的比例有多少? AI 生成代码出了 production 问题,最后是谁、用什么手段兜的底?
- 上面那组数据——PR 翻倍、review 时间也接近翻倍——和你们组的体感一致吗?
- 你让 AI debug 的战绩如何? 是秒解居多,还是像我一样经常看着它烧 token 转圈?你一个月花在"让 AI 猜错误原因"上的 token 钱大概多少?
- 做底层的同学:你觉得自己哪部分功夫是 AI 五年内吃不掉的?反方观点也欢迎——执行层的验证和诊断,会不会最终也被端到端模型解决?
- 开个脑洞:如果有办法让 AI 直接拿到执行层的 ground truth——crash 现场、真实内存行为、可复现的执行轨迹——把 debug 时间和 token 浪费砍掉一大半,你觉得这东西值多少钱?该个人掏、组里的工具预算掏,还是算在平台费里?
已获得 29 大米


+2
33
共81条回复
✨ 您正在体验新版论坛UI

