楼主: 匿名
跳转到指定楼层
上一主题 下一主题
收起左侧

[改行] 做存储infra的想转AI Infra容易么

   
全局:
转角遇见猫 发表于 2023-02-27 09:55:42. .и
ai infra和core infra一样分类挺细的,其中一部分和data engineering重合(所以很多big data可以号称ai first),但是compute的部分和big data的
Inference 组基本都是各厂oncall最重的组了
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-ZZKL5  | 添加认证 | 2023-2-28 11:49:19
转角遇见猫 发表于 2023-2-27 12:55.--
ai infra和core infra一样分类挺细的,其中一部分和data engineering重合(所以很多big data可以号称ai fir ...

AI的compiler其实只是codegen,而且绝大多数情况下生成的是C++和CUDA,还是比较容易入门的。总体来说门槛并不高,但是回报却很大,只要你愿意和NG去卷。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-HBOC4  | 添加认证 | 2023-2-28 12:21:45
不容易。什么infra 不 infra的Tech厂啊啥的都毁灭吧真的,累了。
回复

使用道具 举报

全局:
本帖最后由 转角遇见猫 于 2023-2-27 23:02 编辑
coffee521521 发表于 2023-2-27 17:18
Inference 组基本都是各厂oncall最重的组了
. 1point3acres
remote inference被oncall肯定是底层的core infra出问题了,model的inference计算本身是很straight forward的。on device inference肯定没有oncall。
回复

使用道具 举报

全局:
本帖最后由 转角遇见猫 于 2023-2-27 23:05 编辑 . 1point3acres.com
匿名用户 发表于 2023-2-27 19:49
. AI的compiler其实只是codegen,而且绝大多数情况下生成的是C++和CUDA,还是比较容易入门的。总体来说门槛 ...

其实有两种方式,一种是写算子kernel,对gpu而言需要对cuda非常熟悉;还有就是compiler codegen,生成比cuda更底层的代码,比如openai用的triton直接生成llvm ptx,一个没background的new grad没有一年时间rampup根本就做不了什么事情,想卷都没机会。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-MKCD4  | 添加认证 | 2023-2-28 15:04:05
donnice 发表于 2023-2-26 20:52
不是很同意。了解底层知识对做上层应用确实是加分项,但绝不是必须选项,就算是加分项,有多“巨大”也不 ...

请问,做gpu instance是指做什么呢?谢谢!
回复

使用道具 举报

全局:
匿名用户 发表于 2023-2-27 17:03
不是很同意compiler这部分,我觉得职业角度来说,只有少数大公司的部分团队在做这个,compiler对于AI来说 ...

> compiler对于AI来说跟对于其他infra来说区别不大
..
workload和硬件不同,AI有GPU和accelerator,新的LLM起来了甚至有可能会重塑整个stack
其他infra对compiler往往是优化jvm或者cpu性能,已经没有low hanging fruit了
不过你说得对,旱的旱死。我佩服的几个大神级程序员不是在写game engining就是在做各种compiler,属于比较挑战的领域。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-5SUW4  | 添加认证 | 2023-2-28 16:54:14 来自APP
donnice 发表于 2023-02-26 18:00:39
AI infra由于数据量巨大,需求复杂,往往涉及到真正意义上的商用高并发系统的开发设计和维护,这里面的知识是非常transferrable的。反观大部分core infra,绝大多数时候都在搞ops
能否举个例子为啥AI infra对high concurrency要求高?因为大量I/O么?.google  и
我觉得无论concurrency还是scalable,core infra不也有要求吗
回复

使用道具 举报

全局:
如果搞过storage ,paxos/raft 实现,LSM tree/Btree存储引擎kvstore replica啥的这些硬核技术去做数据库是更好的选择,这个行业选择很多。这些技术对AI infra来说就是底层黑盒 根本用不上,AI infra侧重的是pipeline 和 compute。我也在摸索过程中,感觉想转其实也是很容易的,毕竟AI这一波刚起来大中厂都有需求,就看你有没有下定决心。
回复

使用道具 举报

全局:
转角遇见猫 发表于 2023-02-27 22:55:49
remote inference被oncall肯定是底层的core infra出问题了,model的inference计算本身是很straight forward的。on device inferen
不要想当然,建议去g, meta的model serving 组了解了解. 举个例子,core infra 也需要用Linux kernel, 出了问题能都推给Linux kernel组么? 同样道理,model serving 组用core infra的components, 但core infra的components 被用在大厂的各个地方,其实g, meta core infra的components 很稳定. . Χ

补充内容 (2023-03-01 00:40 +08:00):
几百gb model 大量的traffic 几千上万台机器跑inference, 各种model 版本update, 都是在线inference, 远比一个小model 单机跑个inference复杂多了
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表