📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
楼主: maxims23
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 当说到ml platform的时候,你到底在说什么?

   
🔗
runrain 2021-6-1 03:09:36 | 只看该作者
全局:
我就在谷歌做的ml platform。你说的很对,来来去去就这些,万变不离其宗
回复

使用道具 举报

全局:
我们这ml platform是负责管理infra的,比如cluster management,build一些api,tools,dashboard等待,也做一些底层的优化写一些custom cuda kernel之类的。mle就是写,优化,测试模型,大型模型要研究怎么sharding和pipelining。rs就是想新的idea了。
回复

使用道具 举报

全局:
runrain 发表于 2021-6-1 03:09
我就在谷歌做的ml platform。你说的很对,来来去去就这些,万变不离其宗
. 1point 3 acres
哇 请问你是sde进去然后分到那组的吗
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-DCQP4  | 添加认证 | 2021-6-1 03:55:19
对于大部分公司, 楼主说的这些ML platform功能已经能满足基础的ML需求了. 像AWS的SageMaker, Google的Vertex AI也都已经有比较好的抽象供大家使用了. 如果日常的工作只是写写terraform, 做些MLOps的工作, 其实价值不会很大. 一来cloud会提供越来越完善的服务, 二来跟产品/业务离得太远, 也无法锻炼到产品思维.

但对于有些公司, ML影响着产品的核心体验, 这些公司对ML platform的要求就会高很多. 比如对model serving有着很强的SLA, 需要深入优化latency. 或者要训练超大规模的神经网络, cloud上提供的training infra不能满足需求, 也可能要深入tensorflow/pytorch的底层. 又或者要定制自己的approximate nearest neighbor的infra来支持embedding retrieval. 对于这些公司, ML platform就不仅仅是在k8s部署几个container就足够的.
回复

使用道具 举报

🔗
wosaide 2021-6-1 03:56:04 | 只看该作者
全局:
LittleFishBall 发表于 2021-6-1 02:36
你说的那些事少数喜欢自己搞 一套 infra 的公司会做。 很多公司的所谓 Infra 组,如果不自己做轮子然后给 ...

个人浅见: MLE是做ML pipeline的engineering work. ML platform的SWE是做ML tool/system(根据公司不同, granularity也不同. 有些公司就是套个abstraction. 有的像楼层里分享的, 会自己造各个layer的轮子), 来给MLE和scientist用. MLE因为本身还是engineer, 而且对于ML platform用的多, 且熟悉痛点. 如果个人愿意, 可以转过去做SWE写ML platform. 反过来写ML platform的SWE转MLE也行. 很多公司并没有把这两类职位分的很开, 甚至他们自己也不知道应该招哪一类人. 进来之后看上面要求, 有什么做什么.
回复

使用道具 举报

🔗
xsh6528 2021-6-1 03:59:41 | 只看该作者
全局:
qinshimingyue 发表于 2021-5-31 21:50
请问下你的背景是mle出身,还是sde出身呀

我是SDE出身,本科实习也做过简单的ML,但对ML本身不是很有兴趣,对计算和系统更有兴趣,研究生主要选了学了并行计算和分布式类型的课。
回复

使用道具 举报

🔗
xsh6528 2021-6-1 04:03:12 | 只看该作者
全局:
qinshimingyue 发表于 2021-5-31 22:10. From 1point 3acres bbs
还想问一下你们公司招人的title是什么呀?还是sde进去然后再分组?前段时间跳槽找工作感觉sde-ml infra的 ...

是SDE general hire进去的,然后再自己组。
我是作为new grad 3级加入ML platform的,确实很难,我是对manager使用了三顾茅庐才蹭进去的。
ML infra org都要求很高,都是名校profile,phd背景也占一半了,一般也只招>=5级。
回复

使用道具 举报

🔗
xsh6528 2021-6-1 04:11:18 | 只看该作者
全局:
yikehongxin 发表于 2021-5-31 17:01
请问这里的parallel是类似:parameter server 么?

是的。

ML的parallel execution也算不上是一般意义的distributed system。.

因为一般我们说到distributed system指的是distributed storage and database sytstem。CAP这一类的问题。

说到ML distributed training,
除了纯data parallel的情况能够要求flexible worker number。
大部分情况都会混合model parallel,也就是一个worker拿model shard/model piece。
所以都是强同步(fully-synced)的。少一个worker,job就fail了。
所以distributed training本质上是通过network连接实现的parallel execution。
回复

使用道具 举报

🔗
denmark8th 2021-6-1 04:29:47 | 只看该作者
全局:
匿名者 发表于 2021-6-1 02:54. 1point 3acres
哈哈,AutoTune是我搞的

同事? :)
回复

使用道具 举报

🔗
runrain 2021-6-1 04:36:36 | 只看该作者
全局:
qinshimingyue 发表于 2021-6-1 03:53
哇 请问你是sde进去然后分到那组的吗

换组换过去的
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表