📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
楼主: maxims23
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 当说到ml platform的时候,你到底在说什么?

   
全局:
uber michelangelo就是一个ML platform的例子吧。大部分ML platform都应该包括:feature store, training (包括experiment tracking, auto-ml, generic trainer, 分布式训练之类的), model registry和model serving。
回复

使用道具 举报

全局:
回复

使用道具 举报

🔗
Muser_Hao 2021-6-1 09:37:35 | 只看该作者
全局:
感谢楼主和上面层主的分享!
回复

使用道具 举报

🔗
龙的传人 2021-6-1 21:11:11 | 只看该作者
全局:
这个本质上大部分都是 DevOps 的工作
回复

使用道具 举报

全局:
基本都是devops,没啥意思。
回复

使用道具 举报

全局:
wombatkiki 发表于 2021-05-31 06:26:49
你这个更像dev ops,不是ml infra。真正的ml infra应该干的是更底层一层的事情,比如computation engine,类似与uber的Michelangelo,airbnb的bi
platform包括infra和上层面向用户的application,不管哪块,都得devops
回复

使用道具 举报

全局:
我也是刚刚开始做MLE的。

首先回答下,AWS和Google虽然提供了ML的service,但是在中大型公司或者产品体验依赖ML的往往都是自己搭的轮子。

其次,我们主要分为online/offline training组,online serving组,专门做cuda底层优化的,集群管理的组

我是training组的,组里主要负责数据IO(从公司内部的存储系统读写数据),分布式训练(data parallel/model parallel),还有和serving平台的对接,以及上面整个pipeline的优化。此外,还会有些专项优化,比如BERT, graph, 大规模sparse/Dense场景。

而做model的同学,主要是关注业务,洗数据,看paper,在我们的轮子上定义模型结构即可。这些不需要多少coding,主要是domain knowledge 和 ML knowledge,还有能看得懂(实现)开源模型就可以了。

.1point3acres我学校里是ML方向的,不过后来还是感觉做MLE更有意思些。(之前也水了些ML论文,后来实习的时候看了组里大佬发的OSDI,感觉更有挑战一些,就决定来做MLE了,不过综合感觉这个track需要知识的广度更大)
回复

使用道具 举报

全局:
真别以为在大公司做ML infra就没事 很有可能你的leadership哪天一高兴就要你migrate到sagemaker什么的cloud上面
回复

使用道具 举报

全局:
包括这些吧,有些比较core infra,有些比较product infra,有的就是product:
底层的数据结构和算法lib和framework,比如pytorch,caffe,boosting,还有cv和nlp的特殊算法,等等
training的优化算法,各种gradient decent,adam,adagrad,minibatch,等等
distributed training,online的parameter server,offline的比如基于MapReduce的,还有和client相关的Federated learning
ml workflow的管理
prediction/inference service
feature management,offline,online,serving time,feature logging,event logging,
product feature data platform,feature extraction
feature engineering management
.1point3acresdata (feature,event,training data) joining service or api,online,offline
ranking service,online,offline
Retrieval service, retrieval algorithms,discrete features based,continous feature based.google  и
还有一些针对比较特殊的ml strategy 的infra,比如reinforcement learning,cold start,calibration, active learning,等等 -baidu 1point3acres
主要的差不多就这些, 想起来在加. check 1point3acres for more.
10年前基本上是没有ml infra的,ml的scientist和engineer干所有需要的事情,后来开始分化,目的是把能generalize出来的部分generalize出来,变成infra和platform,所以很多东西慢慢地从product ml在往ml infra移动。好的mle既要懂ml又要动system。这是为啥mle要求高。

评分

参与人数 1大米 +1 收起 理由
lonelyint + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
waterstream 发表于 2021-06-04 06:59:42
包括这些吧,有些比较core infra,有些比较product infra,有的就是product:
底层的数据结构和算法lib和framework,比如pytorch,caffe,boosting
这里只列里和ml直接相关,而且基本上只在ml里用的infra。当然retrieval也会用在search,recommendation,ads里。不过这几个本身就是ml的最大应用,所以很多时候这三个应用也和ml接近等同了
其他啥data infra,data processing infra,monitoring,ml当然也要用,但是不是ml的系统也要用,所以这里就不提了,因为算general core infra
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表