楼主: deep_coder
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 30+公司 MLE 面试准备经验分享,已有Uber, DiDi, 蚂蚁Offer

   
全局:
请问楼主申请的岗位都是MLE吗?能不能分析一下不同职位名称之间的实质区别呀?申请的时候好多名字搞得有点晕
回复

使用道具 举报

🔗
 楼主| deep_coder 2019-3-28 23:31:07 | 只看该作者
全局:
本帖最后由 deep_coder 于 2019-3-29 13:21 编辑

机器学习系统设计

大多数公司会问机器学习的系统设计,而不是普通系统设计。毕竟普通的系统设计还是不能cover很多机器学习的考查内容。. 1point3acres.com

.. 问的题,目前来看分两种
1.经典题:比如。设计一个推荐系统,
2.非经典题:一般都是面试官工作上的问题。设计一个classification系统。
(不排除,面试官想跟新candidate聊聊,看看自己的问题有什么新解法)


考点在哪?
New grad问知识,Experienced问细节。
.1point3acres
举个例子,设计一个text classification system:

New Grad的比较好的回答:
. .и
Data. .и
先收集data,分析data。考虑label的distribution。考虑feature是不是只有text的,还是有numeric,nominal的。missing data怎么处理。(比如这个帖子处理missing data就不错:https://towardsdatascience.com/h ... g-data-8646b18db0d4)
text的feature怎么生成embedding,好处坏处有哪些。(word embedding, fasttext, BERT). check 1point3acres for more.
numeric的dat处missing data,如何normalize。(同上)
根据label的distribution,如何balance data。(已经解答了)

Model
模型怎么选择。【传统的模型还是神经网络】

Eval
train, test, validation split data。
evaluation matrix是什么。
(https://scikit-learn.org/stable/modules/model_evaluation.html)

Experienced考点

Data
在New grad基础上,
提出GDPR(privacy),数据脱敏,数据加密。
train/test data和product上distribution不一样怎么办。data distrbution 随着时间在改变怎么办。

Feature:
在实际工作中,都是每个ML组都有自己不同的embedding set。互相使用别人的embedding set。这里怎么pre-train, fine-train, 怎么combine feature非常重要。. From 1point 3acres bbs
feature的ABtest怎么做。(不同traffic来做咯。 )

模型怎么选择。. Χ
这里更多的开始考虑系统方面的constraint。比如prediction latency, memory。怎么合理的牺牲模型的性能以换取constraint方面的benefit。

Eval:
自己不能assume evaluation能用,因为很多得自己根据情况造了。
最明显的例子就是recall。
工业界很多应用场景,不是能实时反馈的系统。比如分辨错了,5天,10天,乃至一个月,才知道错了。怎么算recall。
工业界很多应用场景,不是能知道所有错误信息的。比如spam/fraud detection时。没有人能知道spam/fraud的全部数据都有哪些。
(比较简单的方法,就是不做true recall. sample一些data做个partial recall就好啦。 还可以自己设置其他类似recall的matrix,这个看自己业务了。)


Monitor:
模型如何实时监控。(监控latency,QPS,precision,recall之类的参数。).1point3acres
模型如何ABTest。(多个model,不同的traffic比例测试就行了。)

评分

参与人数 12大米 +44 收起 理由
qmonster + 2 赞一个!
yuyusica + 1 很有用的信息!
paul0127 + 1 给你点个赞!
homomaker + 1 很有用的信息!
whus + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
 楼主| deep_coder 2019-3-28 23:31:50 | 只看该作者
全局:
工作经验
. 1point 3acres
工作经验,除了问一下亚麻式的behavior question外。肯定问的,问的也最多的,就是paper了。

Paper分两种自己发的paper,以及自己看的项目相关的paper。

问paper情况1.这个人做ML方向和新组的ML方向不太相同。
这个时候,就只是确认一下,跳槽前,这个人做的东西有没有做好,做细。
对于自己的paper,他们只会看是什么会议,大概简单聊聊,甚至于不聊。
对于看的paper,也只是顺口问问,看看这个人有没有读paper的习惯,有没有复现过paper上算法。

问paper情况2.这个人做ML方向和新组的ML方向比较类似。
这个时候,面试官更多的是希望能交流很多细节。各种情况怎么办,各种model的trade off,model 放到production上的情况,
还有数据集不一样了,model会不会不好用等等。. .и

无论哪种情况,项目上遇到的,相关的paper要读细。复现时候的坑也要记住细节

评分

参与人数 1大米 +2 收起 理由
Xiavi + 2 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
Xiavi 2019-3-29 01:12:54 | 只看该作者
全局:
lucifer_vent 发表于 2019-3-28 23:31.--
机器学习系统设计

大多数公司会问机器学习的系统设计,而不是普通系统设计。毕竟普通的系统设计还是不能 ...

先谢谢楼主分享! 不晓得为啥我最多只能加两个大米,不然我简直想加100个大米了~好帖!
老实说,想跟楼主讨教如何训练“New grad问知识,Experienced问细节”这一块?
.
比如果,楼主提到的"根据label的distribution,如何balance data?"
我只知道如果data imbalanced,那就oversample minority & undersample majority,但具体如何操作依旧很谜...
或者楼主提到的"train/test data和product上distribution不一样怎么办? data distrbution 随着时间在改变怎么办?"
这我只能不断地做normalize,让train/test/product data的distribution越来越接近...

但我实际上不知道该怎么做...我也做了地里很有名的A Collection of Data Science Takehome Challenges
不过感觉学习的方向不太一样,在实务上如果我碰到这些问题,恐怕连个具体的思路都没有
所以想请教楼主平常是怎么训练这一块的? 有哪些教材可以推荐吗?.1point3acres

谢谢!!!
回复

使用道具 举报

🔗
 楼主| deep_coder 2019-3-29 12:12:07 | 只看该作者
全局:
Xiavi 发表于 2019-3-29 01:12. Waral dи,
先谢谢楼主分享! 不晓得为啥我最多只能加两个大米,不然我简直想加100个大米了~好帖!
老实说,想跟楼主 ...

都是很好的问题。
1.根据label的distribution,如何balance data:
A。sampling无外乎你说的2种。这里有详细的:
https://imbalanced-learn.org/en/stable/user_guide.html
B。如果是classification,data是long tail的,只是取头部80%的label就行啦,其他的label不要了,mark as others.
C。如果真的特别imbalance,99,99% 和0.01%,类似spam的情况。 就只能试试别的方法,outlier detection什么的了。
当然,还有一些具体情况具体分析的办法。。
2.train/test data和product上distribution不一样怎么办? data distrbution 随着时间在改变怎么办?
我这里说的distribution不是特别指的feature的。 是label的。
label只能说多收集data。还是balance data的问题。
data distrbution 改变,就是做auto train, auto deploy.如果参数drop太多,只能人工干预重新训练了。. 1point3acres.com



评分

参与人数 1大米 +2 收起 理由
Xiavi + 2 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
LeonLPSI 2019-3-29 12:12:38 | 只看该作者
本楼:
全局:
感谢分享
回复

使用道具 举报

🔗
Xiavi 2019-3-29 12:38:24 | 只看该作者
全局:
deep_coder 发表于 2019-3-29 12:12
都是很好的问题。.
1.根据label的distribution,如何balance data:
A。sampling无外乎你说的2种。这里 ...

太感谢楼主的回覆了!!!
最后想请问楼主都是怎么学习上述问题的知识啊?. check 1point3acres for more.
请问你有特别读哪方面的textbook吗? 谢谢 :)
回复

使用道具 举报

🔗
 楼主| deep_coder 2019-3-29 12:49:21 | 只看该作者
全局:
Xiavi 发表于 2019-3-29 12:38. Waral dи,
太感谢楼主的回覆了!!!
最后想请问楼主都是怎么学习上述问题的知识啊?. From 1point 3acres bbs
请问你有特别读哪方面的textbook ...
. From 1point 3acres bbs
吴恩达的课程~ 基本有了吴恩达课程上内容,工业界面试就差不多了。
公式最好自己推导推导
回复

使用道具 举报

🔗
cqlq 2019-3-29 12:57:25 | 只看该作者
全局:
很有用的信息!!!
回复

使用道具 举报

🔗
 楼主| deep_coder 2019-3-29 15:19:06 | 只看该作者
全局:
LL的申请季 发表于 2019-3-28 16:04
请问楼主申请的岗位都是MLE吗?能不能分析一下不同职位名称之间的实质区别呀?申请的时候好多名字搞得有点 ...
. 1point3acres
MLE 和 RS都申请呀。-baidu 1point3acres
MLE = 读paper + 写模型 + feature pipeline/deploy/甚至于datawarehouse 都要参与
RS = 读paper + 写模型 + 发paper
DS1 = data analyst的别名
DS2 = 读paper + 写模型(大多数做feature)

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表