楼主: modifiedname
跳转到指定楼层
上一主题 下一主题
收起左侧

Data Scientist 炼成记录-更新完毕2018年12月 | 机器学习练成记录 - 已开新帖

   
🔗
fdsawang56 2016-6-16 07:13:43 | 只看该作者
全局:
theocrasy 发表于 2016-4-4 14:18
我只能说 K神我真的是爱你 你相信我

我信了,骚年。
回复

使用道具 举报

🔗
sheen26 2016-6-23 12:55:38 | 只看该作者
全局:
这两天开始复习准备面试,觉得楼主这个和其他帖子都非常有帮助。
作为一个stat major觉得onlinestatbook很系统的把知识组织起来了,并且帮我补上了平常不怎么用的一部分比较基础的知识. 1point3acres
非常感谢
应付完这次的面试后准备看着list自己补完engineer的部分
略遗憾没早点进地里看到这个贴
回复

使用道具 举报

🔗
DL 2016-7-12 01:30:12 | 只看该作者
全局:
先谢谢K姐的攻略。
本人以前工科背景,用过C++, 但不精。找了网上的一些课开始一通乱学,学了4个多月了,总觉得事倍功半,心里一点底都没有,而且感觉没个头。
今天看到这个好贴,有种相见恨晚的感觉。决定以后不定期的来这儿汇报自己的进展,也请大家多多指教,先在这儿谢过了。
先说下这4个月来学习的进展:
1. 编程方面:
java: 上了Coursera 上的algorithm I, II (Princeton),对算法和java有了一些了解
Python: edx.org 上的Introductionto Computer Science and Programming Using Python 和
Introduction to Computational Thinking and Data Science, 熟悉Python编程,但对处理分析数据的package不熟
SQL: introduction to database (standford), 会SQL
Hadoop and MapReduce: intro to Hadoop and Mapreduce (Udacity.com),会简单的设置,和MapReduce的简单应用,如invertedindex, join, etc.
2. 统计,数据分析方面:
Descriptive statistics (Udacity.com)
Machine learning by Ng(coursera.org)
Machine Learning Foundations: A Case Approach by E. Fox, C.Guestrin(coursera.org)
Machine learning: Regression by E. Fox, C. Guestrin(coursera.org)
Machine learning: Classification by E. Fox, C. Guestrin(coursera.org)
Data manipulation at scale: systems and algorithms by Bill Howe(coursera.org)
了解 regression, logisticregression, decision trees, ensemble methods, classification, clustering,neural networks 的基本原理,能用Python 实现
3. 数据分析,表述:
Introduction to data Science (Udacity.com)
下面两个月的计划:
R programming: ggplot2, dplyr
Python:  pandas, scikit-learn, seaborn
Excel: dashboards, pivot table reports
Database: SQL, MongoDB
Experimental design: hypothesis testing, A/B testing
Machine learning: unsupervised learning, SVM
Visualization: seaborn, d3.js
Leetcode: 每日一题






回复

使用道具 举报

🔗
Tyrant89 2016-7-15 21:56:37 | 只看该作者
本楼:
全局:
学啊学~~
回复

使用道具 举报

🔗
minchen57 2016-7-24 09:33:08 | 只看该作者
全局:
如果早看到这个帖子就好了,不过现在还不晚。按照楼主号召,贴出学习计划,每过一阵来更新,努力坚持住:
背景:香港商科本科,美国经济phd,三年后quit,现于一家consulting company 做data analyst,主要做text mining。
估计在现有岗位再干三年,然后去找一个心仪的data scientist工作。 这三年中会在工作之余,读一个data science master program,坐标IU,近,离单位10分钟。现在没法fall就开始是因为要等十月份H1B生效
打算每学期修两门课,多了顾不过来,一边上班一边带孩子。
基础: 统计计量基础还不错,coding会R和matlab,stata(data science似乎没人用这个),不过看了楼主说的,R需要再加强一下。
自认为软技能和口语还算说得过去,硬技能需要补充更多。

鉴于以上背景及timeline,计划如下

now-2016/9, 补充cs知识阶段1


UCB cs61b java,data structure,                                  目前进度 第六课完

Standford Intro to DB,                                                 目前进度 刚刚注册
CMU intro to computer sys,                                          目前进度 看了intro lecture;
(感觉需要推后以下,因为要用c,没学过,不想和现阶段主要学的java混淆,时间待定)

. check 1point3acres for more.

. check 1point3acres for more.
2016/9-2016年底, 补充cs知识阶段2

普林斯顿 Algorithms,part1 and part2, (有了cs61b的java基础,是时候学习算法了);
Elementary AI, Advanced operating systems (这两门课都在IU傍晚,刚好下班赶得上,先旁听吧,前者因为是大牛教的,等我开学后不一定还开,所以旁先听一下;后者是因为号称系里最难的几门课之一却又是distributed system的prerequist,就先去听一下看看接受程度,需要补什么东西,毕竟要大数据的话,distributed system还是该学一下);
有余力可以开始接触一下python,不过less likely,还是留给进入program之后吧,一半的课都会用到。

2017一整年

好好上班,上班之余好好上学;
主要精力放在选择合适的必要的课程,ML,database,NLP,算法,云计算,Distributed system 计划好这些课的前后时间,17年肯定上不完,合理安排到18年。. 1point3acres
. check 1point3acres for more.
. check 1point3acres for more.
2018一整年

继续好好上班,继续好好上学,基本能看出毕业时间了;.
加强python和巩固java,开始刷算法题;
旁听或者选(看情况)一两门统计课,算一个review,那些东西也该忘得差不多了,为找工作做个准备;.

2018年底-2019年
投简历,针对性准备面试,做好辞职离开屯子的准备;
如果之前哪一项做得不够,goto那一项;

总结,楼主所说的这些知识点技能点,基本都包含在这个program里了,及时补充及时更新进度。欢迎大神提意见。猛拍,感激不尽

. 1point3acres


回复

使用道具 举报

🔗
 楼主| modifiedname 2016-8-5 16:49:07 | 只看该作者
全局:
最近关于数科的一些想法

1. 为什么要学cs
除非你公司就是做big data tech的,否则,对business(i.e. your employer)来说,他们并不在意你是用统计还是ML还是hard coded rule做出来结果。他们只care做出来结果,这个结果可以move business forward,或者直白的说,能move KPI。
数据科学里面math-y side只是一半,IT部分是另外那一半。不是说不可以分工,但是现在两边都懂的人已经越来越多了(大概3,4年之前,的的确确是很少),但是现在大家也都明白了,工作中见到越来越多的cs phd会修大量stat课程,或者stat phd也有个cs BS/MS,或者stat phd修了很多OR课,或者econ phd自学编程,或者ee phd直接就代码stat全都会,或者OR phd 也修了大量统计。如此等等。
说是水涨船高也好,说领域正在慢慢成熟也好,总之就是,需要两手抓,用能否“出结果”来衡量业绩,不要纠结某具体方法。

2 BI/DS
最简单的区分,做出报告给人看的,是BI,做出数据产品直接可以给机器用的,是DS.
R 里面产生个shiny dashboard,算是数据产品的lower bound吧
. 1point 3acres
3. DS is more than ML/kaggle
Kaggle 是好东西,没错没错。但是数科不仅仅是kaggle。
xgb + smart feature engineering 或者DL都是好东西,好在这些好东西现在已经被包装到了极其方便好用的地步,跟10年之前学习的curve已经完全不同。 ..
跳过的step包括,把business问题转化为可建模问题,获取合理数据,数据ETL清晰,质量检查,feature engineering(经常需要domain knowledge), 建模完毕投入生产系统.. 1point 3acres
. check 1point3acres for more.
4. 不是说现在的工具已经包装的非常好了吗?那还有什么难的?
很多人不get的一点包括:眼前这个问题是不是machine learning问题。。。比如好多面试人,拿着AB testing的结果,try to predict treatment group那是有什么用啊?

5. DS level的思考
学校教课,总是从“方法”出发,告诉你方法一般有什么用。但是工作里面是反之,从实际问题出发,需要数据科学家理解use case,理解available and potentially available data, 抽象出模型,然后再选择方法,然后再选择工具。
Entry level DS: Fresh grad在这方面很多会遇到困难。个人感觉minimum bar应该是, candidate 起码会在你告诉他这个应该用什么方法解决后,快速上手做出来。如果这都不行,就基本没法找工作。
超过Entry level: 全部以上,+有的地方会要求你能自己找出,用什么方法。
Sr: 全部以上,+需要知道你选择的方法为什么可以,什么时候不可以,为什么. 1point3acres
再以上:需要你能对大范围的技术问题都比较熟悉trade off,不但能解决已经被提出的问题,还能自己找出将来potentially有high impact的问题. 1point 3 acres
. From 1point 3acres bbs

6 data to insight < solution
insight其实也仍然不是最终结果,最终的结果其实是solution,比如feed进产品的recommender system,比如search API,比如定价或者调度系统。这个意义上说,除非you work for optimizely,否则ab test就不是solution.

7 stay hungry, stay foolish
交叉,前沿,这些是buzzwords,不过也比较实在。所以需要一直学习,你要解决的问题需要什么,你就去学什么。你之前做了什么事情,都无所谓,眼下需要你干什么,你就去学来做。哪怕不能一下子学会,做好,这些都无所谓。亲手做过,对比没做过,那绝对不一样。big data tech, quality, security, AI, IoT, etc...

宽度,可能不会嫌多;至于想在什么维度深入,成为专家,这个可以看机遇和个人喜好。选择合适的组合,学会取舍。再牛逼的人,也不可能在每个维度都成为专家。而且也根本没有必要。
宽度可以包含 data infra, data eng, stats, ML, DL, BI, data viz, data storytelling, PM, etc
. 1point3acres.com
加管人,就是DS manager
加eng,可以是eng manager. Χ
专攻business insight, 上接dashboard下接数据平台,就是analytics偏向行为分析,政策分析的,是economist
协调项目,设计产品,做用户调查什么的,就是PM
data eng+data science 可以是数据部门的lead
以上各种都包括的,就是data部门的GPM(group program manager)
或者如果是比较小的公司,会叫chief data scientist

8 学徒制
data science for business这本书里面提到的一点,我个人及其赞同:跟牛人学习,非常有用。见过很多工作好几年的人,水平完全不行。而牛逼地方出来的人,哪怕就1-2年经验,其实也可以很牛逼。一个牛逼的平台可以给你很大的提高。

9 数科还会火多久?. 1point3acres
数科,目前还是上升期。但是从业人非常良莠不齐,拍良心说,不靠谱的人真的多到匪夷所思。 我觉得过几年会发生大洗牌。

以下部分是个人意见,没有什么数据backup:
big data landscape内有些component 已经开始稳定成熟。
底层infra,中层framework,长期看仍然会是刚需
ds中有些部分会越来越自动化。可以被画成decision tree一样的过程,包括EDA,包括一些统计、ML建模的过程,都可以不太困难的自动化。虽然搭建对”任何数据“都自动分析的平台还是比较难,但是针对某公司内部数据特点,做自动分析的工具,就没那么难。. 1point 3acres


大胆揣测,听老板指挥,写query帮别人pull数据这种职位,可以很大程度被自动化 - 语言识别,然后转换成query - 起码拖拽生成query和dashboard是已经有了。

暂时觉得难以自动化的步骤包括:
这个问题到底是个什么问题?supervised or unsupervised learning? AB testing? optimization?-baidu 1point3acres
我现在看见了自动分析10086种,我应该选哪种?tradeoff分别是什么?
我到底要优化什么东西?KPI到底如何选择?
各种solution effort vs. return 的trade off在哪里?
我现在需要解决这么个问题,我应该去买现成的solution,还是公司组建部门,自己内部做?
找出creative data source,尤其是外部的,开源的数据,或者设计将来要采集什么样的数据
数据quality检查机制

回复

使用道具 举报

🔗
Rheaonirii 2016-8-12 23:12:27 | 只看该作者
本楼:
全局:
谢谢分享
回复

使用道具 举报

🔗
asyz13jinage 2016-8-23 22:27:55 | 只看该作者
全局:
十分感谢楼主的分享,继续努力!希望在不久的将来能有更大的收获。
回复

使用道具 举报

🔗
jone4291 2016-8-24 00:10:16 | 只看该作者
全局:
各位大神太棒 求带
回复

使用道具 举报

🔗
 楼主| modifiedname 2016-9-1 12:20:57 | 只看该作者
全局:
6 data to insight < solution
insight其实也仍然不是最终结果,最终的结果其实是solution,比如feed进产品的recommender system,比如search API,比如定价或者调度系统。这个意义上说,除非you work for optimizely,否则ab test就不是solution.

上文关于solution最近做了更多思考
. 1point3acres
什么是可以用的solution? 目前的理解:
logistics的调度、分配系统
定价系统
机器学习的各种应用比如推荐系统,search ranking, NLP,语音图像识别,将预测结果直接应用到生产的系统(比如预测fraud然后抓获/freeze, 比如预测churn然后立刻给出intervention,比如预测未来需求然后改善调度来协调供给。
很多系统对实时性,performance, scalability有需求。这些基本都是工程上的问题为主
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表