楼主: sujfjen220
跳转到指定楼层
上一主题 下一主题
收起左侧

[统计--转专业和交叉方向] 数据科学转行大忌,一做Kaggle误 终生

   
🔗
momo_21 2021-2-7 02:53:29 | 只看该作者
全局:
不能同意更多
回复

使用道具 举报

🔗
CH3COOH 2021-2-7 03:44:46 | 只看该作者
全局:
不做kaggle那有木有什么替代品阿,简历上什么都没有哭了。
回复

使用道具 举报

🔗
sillyboy 2021-2-7 03:46:03 | 只看该作者
全局:
楼主说得很有道理,对于数据科学工作,日常时间80~90%是在做ETL,而且工业界也不会用到很复杂的模型。在对数据充分了解,充分清洗提炼,做好特征工程之后,用很简单的模型即可得到预期的结果。

评分

参与人数 2大米 +2 收起 理由
CharliePTHF + 1 赞一个
buzz + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
除非是没有相关实习且学校里做的项目都很简单,不然不需要做kaggle。我觉得可以拿kaggle上面的数据做项目,不需要说明kaggle、排名等等。每次拿名次的比赛都花了非常多时间精力,虽然我也更多的是乐在其中。
回复

使用道具 举报

全局:
CH3COOH 发表于 2021-02-06 11:44:46
不做kaggle那有木有什么替代品阿,简历上什么都没有哭了。
同问qaq。大家都说多做proj但是真的不知道怎么开始。。。
回复

使用道具 举报

🔗
szhhan 2021-2-7 05:11:21 | 只看该作者
全局:
kaggle比赛就是一群人花了无数时间为了把准确率提高0.01甚至0.001,在真实工作中一点意义都没有 . From 1point 3acres bbs

怎么发现数据能解决的问题,怎么target合适的问题,怎么设计pipeline,落地和部署的可能性,这些都远远比模型finetune高1%的accuracy重要的多

评分

参与人数 1大米 +1 收起 理由
FaFaCOOT + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
李浩泉 2021-2-7 07:13:08 | 只看该作者
全局:
本帖最后由 李浩泉 于 2021-2-7 07:19 编辑
. 1point 3 acres
To be honest, storytelling is the #1 must have skills.
. Waral dи,
Can you have a positive story when the number is negative?

Data never lies, but sometimes you need change your position to address business need.

Raining is bad for outing but good for free car wash. Make different stories to different people using the same data



评分

参与人数 1大米 +1 收起 理由
sanmay + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
dunan00001 2021-2-7 11:34:40 | 只看该作者
全局:
本帖最后由 dunan00001 于 2021-2-7 11:57 编辑

从一个参加过kaggle比赛并且目前做MLE的人的经验和观察,我倒是觉得Kaggle恰恰对于转行学DS的人帮助很大
-baidu 1point3acres
我就按照LZ列的四点 也列下我的观点

第一,大部分数据科学岗现在都对机器学习还是有一定要求的(当然也有纯数据分析岗)。从我在学校上课做project的感觉来看 课堂上往往比较重视一些理论的学习,却很少有机会get hand dirty。课程project也往往采用比较标准的dataset 各种标准solution网上到处都是。Kaggle提供了一个真正上手机器学习的机会,当你比较精通机器学习了以后你可以去看看很多kaggle比赛排名后20%-30%的人的solution很多就是有明显错误的,不去上手做一下很难理解有啥坑(当然即使我经常做也经常会出现一些基本错误翻车)

第二,在实际生产中确实做模型只是其中的一小步。但是对于转行的选手,最重要的就是在上课或者准备面试的过程中是没有机会去接手真实的生产环境的,那么退而求其次,接触下部分环境 体验下做模型的部分也总比纯上课简历上要好看的多(特别是取得好成绩)。对于本身就是做机器学习的phd 当然做kaggle要求有点低了,但是不得不举出一个在别人说kaggle不行的时候我特别喜欢的例子。2012年Kaggle搞过一个Merck Molecular Activity的比赛,当时NN的方法在工业界学术界kaggle上都没人愿意用,于是Hinton大神带着学生亲自下场参加了次比赛并砍下第一 https://www.kaggle.com/c/MerckActivity/overview/winners 这里是Hinton的kaggle profile https://www.kaggle.com/jeff20/followers 总的来说即便是ML的phd Kaggle也有一些比赛是很不错的 能拿第一绝对说明实力
.--
第三,kaggle上的高分模型适不适合实际问。这个确实有一些这样的问题,但是伴随着Kaggle逐渐增加深度学习和不断改善比赛环境,总的来说Kaggle还是希望比赛能尽量接近实用。比如之前和NFL的NFL Big Data Bowl比赛 最近说已经投入实用中https://twitter.com/ph_singer/status/1353472366022680576?s=20 。另外近几年来深度学习的比赛,新的模型和结构应用的很快,基本是arxiv有了就会有选手上手试一试,所以说对于平常没机会接触实际生产和学术的转行选手来说还是很宝贵的经验。当然Kaggle比赛也存在很多坑的比赛,如果发现前排一直没有啥高手现身,那可能建议还是绕着走比较好

第四,kaggle比赛需要大量的时间和精力投入。这点是毫无疑问的,刷题,mock interview这些没有不需要精力的。所以我个人也觉得最好转行以后对一些基础python编程和算法有了解再参加比赛。而且建议一上来就参加feature的比赛,现在很多比赛都会有些分享的solution,如果能看懂solution就已经能学到很多东西了,而基于这些baseline去拿更好的成绩也并非不可能,现在很多金牌选手也是拿一个公开的notebook去魔改来提高比赛技巧

另外针对这段话再说一下
kaggle比赛就是一群人花了无数时间为了把准确率提高0.01甚至0.001,在真实工作中一点意义都没有

首先这句话本身就绝对了,很多公司work就是AUC涨0.1% 0.2%的扣 而且听说有些团队都是0.03% 0.04%的提高就很好了。另外比赛中0.01的差距 可能能让你学到好多东西,比如之前某次CV比赛其实我们最后solution排名比较好后来发现就是我们再超参数和训练的schedule上调的比较好,听上去好像大家都能意识到,但是在比赛中你才能体会到schedule和lr这些细节到底有多重要。

最后再总结下:
练kaggle 我觉得主要有俩大目标吧. check 1point3acres for more.
1 通过比赛 熟悉机器学习的知识,增加对机器学习问题的理解
2 取得好成绩刷简历(当然假设coding等也都过关了,要不然简历过了coding不过也没用)
至于是不是适合所有人 那肯定不是 但我觉得对于转行选手来说这两点往往都会有所欠缺 所以是一个不错的选择

评分

参与人数 12大米 +28 收起 理由
杀G不成反被杀 + 1 赞一个
lllbl + 3 给你点个赞!
爱丽丝和鲍勃 + 10
paul0127 + 1 给你点个赞!
Fake/Random + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
三除米甫 2021-2-7 13:32:08 | 只看该作者
全局:
本帖最后由 三除米甫 于 2021-2-6 23:37 编辑 . 1point 3 acres
dunan00001 发表于 2021-2-6 21:34
从一个参加过kaggle比赛并且目前做MLE的人的经验和观察,我倒是觉得Kaggle恰恰对于转行学DS的人帮助很大-baidu 1point3acres
. 1point3acres
...
. 1point3acres
同意层主,作为一个靠kaggle solo gold拿到Google MLE的转专业选手,我在这里补充几点

第一,我同意楼主说的不是所有数据科学岗位都需要机器学习知识。但是kaggle中会有参赛者post出自己的Exploratory Data Analysis,即便是做和ML不相关的data analyst也从中可以学到其他人在分析数据时是怎么处理数据和做数据可视化的。

第二,先同意楼主说的建模本身也只是日常工作的一小部分,但也是很重要的一部分,其中也参杂了很多技巧,例如模型的参数到底怎么调才又快又好。学生上课通常缺少这方面的指引,只有实践才能出真知。另外,我也承认楼主说的定义问题等等才是工作中的重点,但是作为一个学生,这方面的知识更加难以难涉及到,通常只能在工作中积累。也就是说虽然做kaggle不能教你这些内容,但其实在第一份工作之前也没有很多其他渠道去接触这些内容。
. .и
第三,从我做的几个kaggle来看,top ranking team绝对不仅仅是model stacking,一定是有robust features才能获得好的成绩。在我没有kaggle经历之前,我以为建模的数据处理就是fill missing data,remove outliers,variable standardization,完全想不到那些天马行空的feature原来可以给模型结果带来那么大的帮助。我相信在学到这些feature engineering的思路之后,一定对工作中的模型performance有所帮助。至于data leakage,如果你在一个kaggle比赛中遇见过了,你大概也会因此意识到什么样的data processing容易产生leakage,应该在工作建模中想办法避免。

第四,我可以在这里分享一下我的经验。我第一次kaggle比赛时单人参赛,最后用尽全力拿了个10%的铜牌,在看完top team分享出来的solutions后学到了非常多。第二次参赛和小伙伴组队,靠着之前学来的技巧拿了个3%的银牌,并且也让我收获了几个面试和offer。第三次再次单枪匹马作战,靠着之前总结的经验终于获得了一个个人金牌,也是因为这次比赛的内容和google里面一些小组的工作内容相似,让我拿到了google MLE的面试,当然拿到最后的offer也还是需要刷题+其他ML理论知识的积累。这些比赛大概每次都耗费了我2-3个月的课余/业余精力,也为了跑模型花了几千刀攒了几台电脑,所以付出和回报是否匹配可能每个人都有不同的答案。
我把我自己的经验在这里分享给大家,到底做kaggle值得不值得还是得具体情况具体分析。

评分

参与人数 10大米 +12 收起 理由
Jiy048 + 1 赞一个!
lllbl + 3 给你点个赞!
justinleeme + 1 赞一个
dunan00001 + 1 给你点个赞!
diffmani + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
学到了,谢谢提醒!
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表