查看: 6624| 回复: 11
跳转到指定楼层
上一主题 下一主题
收起左侧

深度学习(DL), 强化学习(RL), 和传统ML在业界的应用情况

 
全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
泛机器学习的三大应用领域 NLP, CV, 搜索/推荐, 深度学习已经在前两项(所有项?)占据主流, 大型pre-trained model的出现大大简化了模型的调试和使用, 还有最新的LLM大放异彩
强化学习在业界的应用如何? 传统ML模型还有用武之地吗? 好奇...

评分

参与人数 2大米 +3 收起 理由
Wang_162 + 1 给你点个赞!
debuger + 2 很有用的信息!

查看全部评分


上一篇:The end of programming?
下一篇:来感受一下连Siri都不如的最新的google bard
全局:
本帖最后由 driftalone2020 于 2023-3-31 17:31 编辑

最近求职找了一些RL相关的职位,了解到的一些情况
1. 无人车公司,比如Nvidia, Cruise, 这些有用RL/ imitation learning等做无人车算法planning, prediction, simulation env generation等等,可以看一下NeurIPS 2022无人车 workshop了解一些业界动态 https://ml4ad.github.io/
2. 最近微软xbox组放出来applied research 用RL 做游戏测试,可以搜autonomous game testing了解一下。用RL做游戏(包括游戏测试)是一个很有趣的方向。有很多研究问题。
3. Amazon SCOT组用RL做inventory management。去年NeruIPS他们组有个大佬在RL4real life workshop上说他们用RL做的方案已经落地并节省了18%的成本。这是比较成功的用RL做随机组合优化例子
4. Meta的RL组现在在Ads Org下边。有很多bandit / RL做monetization的项目。其他一些公司也有用RL做计算广告的岗位,比如这个https://jobs.lever.co/system1/1a ... -92cb-6ea00f1aa6a4?
5. 大模型。Chatgpt出来以后确实有很多传统做大模型、多模态的组意识到RL的用途,所以也放出来一些岗,可以关注一下。

另外可以看一下这两年Neurips/icml的 rl for real life workshop的相关内容,了解一下有哪些落地应用

补充内容 (2023-04-01 02:16 +8:00):
update: 游戏测试是 automatic game testing,写错别字了。

评分

参与人数 6大米 +7 收起 理由
pengju.jerry + 1 给你点个赞!
收口罩的猴92 + 1 很有用的信息!
zzay + 1 很有用的信息!
AmyFBKX + 1 赞一个
debuger + 2 很有用的信息!

查看全部评分

回复

使用道具 举报

全局:
ccky 发表于 2023-4-6 09:23
为什么dl体验不如传统ml?

场景少,非常锦上添花,一般一个模型做好了,迭代新坑就少了,例如深度学习的推荐模型,可能一整个team都是搞一个大模型,每个人分到的可能就是很小的dirty work,例如chatbot,建好了之后以后提高的空间越来越少,每次你还都要beat kpi,提高的地方对于一整个team来说就很饱和。 而且吧大部分模型都是很成熟的,现在ChatGPT厉害说不定以后就是调用LLM再改最后一层就OK了,体验一般不怎么好, 不如一些传统ML五花八门的场景deploy简单可解释性高快猛糙弄上去了很快就有business impact,搞完了成熟了就再搞一个business domain,不用说做深度学习推荐就连续做好几年深度学习推荐,leadership对迭代这种大模型的需求会越来越少,被砍budget减缓扩张是迟早的事。 最近马斯克就公开了推特的推荐模型,你会发现是相对简单的模型而且很久没大幅度改过了。。

当然别提自动驾驶。。坑可大了。
回复

使用道具 举报

全局:
我个人的观点是:强化学习只能算作深度学习的一个分支,只是一种学习范式,比如对抗生成也是一种深度学习范式。所以机器学习可以分成传统机器学习和深度学习两种,传统机器学习在数据挖掘和低维信息处理上可以起作用,更高维的数据例如图片、文本token就不太行了。业内对传统机器学习的基本认识是:一定要了解,但通常是拿来主义直接使用而不是像深度学习一样投入人力去打磨。

评分

参与人数 1大米 +2 收起 理由
debuger + 2 很有用的信息!

查看全部评分

回复

使用道具 举报

全局:
蹲答案zszszs
回复

使用道具 举报

🔗
 楼主| mensis924 2023-3-21 12:34:36 来自APP | 只看该作者
全局:
没人么😥😥
回复

使用道具 举报

全局:
LLM也是得靠rlhf呀,rl也大部分是drl,这俩就没法单独拎出来说,driving,robotics,lm,recommendation里都有很多rl component。
传统ml可能在这几个方向用的不多,但quant里很常见。
回复

使用道具 举报

全局:
码一个,等大神分析
回复

使用道具 举报

全局:
柯基1 发表于 2023-03-20 21:45:46
LLM也是得靠rlhf呀,rl也大部分是drl,这俩就没法单独拎出来说,driving,robotics,lm,recommendation里都有很多rl component。
传统ml可能在这几个方
现在没人真的做rlhf了吧,都直接拿chatgpt的output finetune
回复

使用道具 举报

全局:
contextual bandit做推荐推送bidding的应用提供多的。

相反很多dl组容易有坑,普遍体验不如传统ml组(如果是结果向导的公司文化)
回复

使用道具 举报

全局:
harrybob 发表于 2023-03-31 20:58:52
现在没人真的做rlhf了吧,都直接拿chatgpt的output finetune
学术界这几个alpaca,vicuna什么的都是这么搞的,但也仅限于学术界想做类chatbot。比如openai肯定要接着自己搞rlhf,别的公司理论上来说拿chatgpt distill也会有violate tos的风险。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表