查看: 67754| 回复: 97
跳转到指定楼层
上一主题 下一主题
收起左侧

四年Machine Learning Engineer心得

   
全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
转眼我在大厂做MLE已经四年了,最近感到和身边Startup小伙伴的差距,总结一下我的感想,算作新年的一个FLAG。
在大厂做MachineLearning非常显而易见的缺点是每个人只要拧自己的螺丝就可以了。按照当前ML的发展,绝大部分问题都可以用大力出奇迹的方法解决,一个基本的LR模型加上海量的数据就可以搞定。那些复杂的算法开销过高但是收效甚微,对于一些产品组实在是得不偿失。我的第一份工作就非常局限在model performance,我深切感受到在大力出奇迹的现状下,ML门槛过低,调参数跑实验谁也会。所以我换了一份工作,终于可以end2end搞一些ML infra,然而由于大厂的流水线已经非常成熟了,我还是在自己的工位上拧螺丝,学习了一堆不易于扩展的技能,盯着自己眼前的perf而没有什么长期规划。
最近跟一些小伙伴聊天发现他们有的人在startup成长非常快速,因为人员流动,产品迭代速度快,获得了很好的机会。而我一直被上面的TL压着,加上自己在一段时间里懒懒散散不思进取,职业进展缓慢。想想能够一个人心无旁骛好好工作的时间已经不多了,希望2020能够静下心来,做一些有益的工作。
我每年都在面试以保持自己对职场的警惕感。每年都会有不同的职位期望,通过和面试官讨论一些问题来了解当前他们需要什么样的人才,想解决什么样的问题。同时问问自己想成为什么样的人。以此来作为平时工作努力的方向。最近我面了一些比较senior的职位,有两点体会。第一对于senior面试要给自己设立一个人设。第二为了巩固这个人设,要从日常的project下手,多读书。
面试junior的时候,只要证明自己能够快速学习,听话能干活,是个solid problem solver就可以了。但是senior的要求会更多,fast learner已经不是什么优点,而要更加多关注行业领先的技术,和个人leadership development,人设不管是TL向的还是manager向的,设立好了就要不断练习story telling,从自己之前的经验出发,不断巩固。这一点尤其在behavior面重要。HR问你说说之前的一个困难吧。你可以说我那个project啊刚开始有各种技术难点我都通过自学解决了最后效果很好。但是你更应该说我自己发现了当前业务有什么坑,我提出了什么方案,带领了多少人,收集了多少数据和feedback最后还把项目变成generic的platform能够处理更多情况。
技术面试的时候人设也很重要。 做Machine Learning如果你是个对模型研究很深的researcher,面试之前要思考对方公司现在有哪些业务难点,可以用什么样的新model新理论来解决。如果你是个e2e一肩抗的工程师,要思考如何复用已有的pipeline让新的model更容易上线,如何handle更大的scale之类的问题。
所有这些都要考平时的积累,人设才能屹立不倒。最重要的是多读书。不断跟上自己领域最新的成果,即使工作中暂时用不到也没事。我知道有的小伙伴通勤时候看的是花花酱,闲暇时候去meetup,再出去开个顶会开阔一下眼界。反观我自己,开会想着出去玩,通勤时候看的是ins和微博,人和人的差距就这样一点一点变大。
所以给自己立个2020Flag吧,希望还不算太晚。
1. 控制玩手机的时间,卸载北美烧钱快报,坚决抵制消费主义陷阱。
2. 每周读一篇paper
3. 早睡早睡早睡
希望与各位共勉。

评分

参与人数 101大米 +147 收起 理由
cuteripperkk + 2 很有用的信息!
maiqiao + 1 给你点个赞!
damnguychan + 1 给你点个赞!
崔小宝 + 2 欢迎来一亩三分地论坛!
VeronicaSFYA + 1 赞一个

查看全部评分


上一篇:请大家推荐一个Deep Learning Project(有dataset的)
下一篇:NLP

本帖被以下淘专辑推荐:

全局:
共勉早睡和每周读paper
回复

使用道具 举报

推荐
 楼主| fordreamzju 2020-1-29 07:01:11 | 只看该作者
全局:
jerrytim 发表于 2020-1-26 11:52
end2end的ML infra, 楼主可以举些例子吗

个人浅见 不一定对。
我目前理解的end2end,包括了training data generating, model training, model serving. 每一块都很复杂。
Training data如何从log中来,以什么样的形式保存在什么样的file system,如何稳定地实现这个data pipeline?
Model training是我们一般意义上的机器学习算法。
Model serving主要是考虑你的模型可以支持多少QPS?需要用多少storage资源?一旦fail了会怎么样?有没有完整的monitoring system等等。
回复

使用道具 举报

推荐
szhhan 2020-1-22 12:16:57 | 只看该作者
全局:
大公司有个潜在的好处是可能组内有大牛 每天可以从中学习 startup的话可能更会要求可以独当一面
回复

使用道具 举报

全局:
多去顶会真的会很有收获的 共勉
回复

使用道具 举报

🔗
denev2004 2020-1-24 02:25:42 | 只看该作者
全局:
北美烧钱快报lmfao
回复

使用道具 举报

无效楼层,该帖已经被删除
无效楼层,该帖已经被删除
无效楼层,该帖已经被删除
🔗
pengzhao0524 2020-1-24 11:34:15 | 只看该作者
全局:
总结的真好!共勉!
回复

使用道具 举报

全局:
欣赏楼主自我反省和进步的态度~ 有句话共勉 技术深度一定程度上最后的高度 包括你说的“人设” 也是需要时间和努力去沉淀出来的~年龄大了可以再去提高写作和表达 但是技术恐怕就没有精力啦~



补充内容 (2020-1-29 07:45):
仔细看了下id 原来是zju学弟/学妹
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表