查看: 8207| 回复: 12
跳转到指定楼层
上一主题 下一主题
收起左侧

[改行] ml infra究竟是做些什么的?

 
🔗
匿名用户-SFXA0  | 添加认证 | 2023-7-23 13:25:29 来自APP |倒序浏览

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
请广大ml infra和mle或者mlops指点一下。我现在顶着mle的title,都在train些过时的模型。

评分

参与人数 2大米 +2 收起 理由
riderkick + 1 赞一个
pkudebra + 1 赞一个

查看全部评分


上一篇:谷歌pip比例
下一篇:真诚请教如何与完全没有技术能力的manager相处

本帖被以下淘专辑推荐:

地里匿名用户
推荐
匿名用户-0AFQP  | 添加认证 | 2023-7-23 18:45:28 来自APP
在一家专门做ml ops的小公司实习过,公司的业务就主要分三块,把客户(mle)的model和相关依赖用docker打包,用k8s部署并提供访问,用grafana等工具做一些监控

感觉有以下几个特点
1. 很像devops,几乎不需要会ai/ml的算法
2. 和几家竞品公司做的东西很类似,经常互相抄feature,也没感觉哪家掌握了什么核心技术壁垒,不会发生ai公司训练出一个牛b模型一夜爆红的情况
3. Customer Driven Development,大客户想要什么feature,我们就优先做什么feature

评分

参与人数 2大米 +2 收起 理由
YunDVES + 1 赞一个
oracler + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
gregregre 发表于 2023-7-23 13:25. 1point 3 acres
为什么inference会有很大的challenge呢,整个模型就是一个stateless的binary,给他数据他就吐出一个答案 ...

无限加GPU肯定没问题,不过资源是有限的
.1point3acres
1. 如果你的model大到load不进单个host的memory怎么办.1point3acres

2. 如果要切割model,怎么做model refresh

3. 怎么做smart model loading/unloading

4. 怎么reduce memory footprint by less gpu. 1point 3acres

5. 一个model需要多少个workers,batch size要多少,怎么做smart batching

评分

参与人数 1大米 +1 收起 理由
DerekCheng + 1 赞一个

查看全部评分

回复

使用道具 举报

地里匿名用户
推荐
匿名用户-8CQJP  | 添加认证 | 2023-7-24 01:23:58
日经问题了
顶楼回复讲了ml infra的各个子方向
https://www.1point3acres.com/bbs/thread-853582-1-1.html

评分

参与人数 2大米 +2 收起 理由
DerekCheng + 1 赞一个
donotgetclose + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
donotgetclose 2023-7-24 00:50:50 | 只看该作者
全局:
本帖最后由 donotgetclose 于 2023-7-23 12:52 编辑

每个公司的要求可能不太一样,一般来说ML infra的主要scope就是ML pipelines。包括data-preprocessing, feature extraction/transformation, training, inference.

有专门负责开发这个platform的,比如G的tensorflow X,Amazon的Sagemaker, Meta的Fluent2

也有用这些platform帮自己team deploy models的。也有只负责其中某个component的

数据量很大的情况下,基本上里面每个component都是一个distributed system,特别是inference那一块,有low latency的情况下,deploy 大模型是很有挑战性的
回复

使用道具 举报

🔗
gregregre 2023-7-24 01:22:02 | 只看该作者
全局:
匿名用户 发表于 2023-7-23 11:45
在一家专门做ml ops的小公司实习过,公司的业务就主要分三块,把客户(mle)的model和相关依赖用docker打包 ...

你的职责是手动去做这些mlops?
回复

使用道具 举报

🔗
gregregre 2023-7-24 01:25:18 | 只看该作者
全局:
donotgetclose 发表于 2023-7-23 17:50
每个公司的要求可能不太一样,一般来说ML infra的主要scope就是ML pipelines。包括data-preprocessing, fea ...

为什么inference会有很大的challenge呢,整个模型就是一个stateless的binary,给他数据他就吐出一个答案,感觉scalability只在于横向堆gpu?如果要访问feature store拿数据的话也是多一点business logic
回复

使用道具 举报

🔗
gregregre 2023-7-24 02:19:00 | 只看该作者
全局:
donotgetclose 发表于 2023-7-23 18:51. 1point3acres
无限加GPU肯定没问题,不过资源是有限的

1. 如果你的model大到load不进单个host的memory怎么办

了解,看起来真正要scale up大模型的部署还是有很多东西可以做,也需要有人维护这些系统。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-CKHQM  | 添加认证 | 2023-7-24 08:55:50
gregregre 发表于 2023-7-23 11:19
了解,看起来真正要scale up大模型的部署还是有很多东西可以做,也需要有人维护这些系统。
.1point3acres
话虽这么说,大部分人在做ops,oncall重没有visibility,不是好活
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表