12
返回列表 发新帖
楼主: jennymeng2003
跳转到指定楼层
上一主题 下一主题
收起左侧

一道data science技术面试题 求广泛讨论!

🔗
wwwseeking 2016-3-4 16:56:08 | 只看该作者
全局:
本帖最后由 wwwseeking 于 2016-3-4 16:57 编辑
y_form 发表于 2016-3-1 08:16
过了很久…报个进度…我的elastic net提案被老板否决了…
他的建议是先cluster然后一个个attribute建模Q ...

不就是feature selection? 什么叫做一个个attribute建模? 那还不如用过sparse learning,直接看每个attribute weights,又很好解释。. 1point 3acres
数据维数dimensionality多少,不是high dimension做feature selection有意思么,至少维数也得有几百几千几万以上把
回复

使用道具 举报

🔗
dongdongpan 2016-3-5 01:52:03 | 只看该作者
全局:
po主提出的四个算法需要大量training 数据,200+太少了。 两个思路:
1. tree-based models, 一般情况下我发现这种简单粗暴的方法最好用,根据variable importance,再reduce dimensions,总之200+数据少的太可怜了,别想着用这个来train高维度模型
2. unsupervised learning, 还是用tree based models,虽然没有label outcome,仍然可以找出outlier,然后用已知结果的数据来evaluate performance

另外,这是面试的题目,所以不可以太focus on result,而要重点讲自己对于问题的理解。应该做的第一件事是评估data quality 以及variable importance,这就是feature selection。显而易见,碰到这种面试题,一上来就想着套用算法模型,追求accuracy的切入点是有问题的。
回复

使用道具 举报

🔗
y_form 2016-3-9 01:02:16 | 只看该作者
全局:
wwwseeking 发表于 2016-3-4 16:56
不就是feature selection? 什么叫做一个个attribute建模? 那还不如用过sparse learning,直接看每个att ...

我的问题,并不是传统意义上的feature selection…尽管只有40,但这些features必须要筛选,最好能筛到5个左右。选完之后还得建模看能解释多少variance。我的domain不是data mining,太复杂的模型reviewers理解不了,一定要越简单越好。谢谢你的sparse learning建议。我去看看,虽然老板不会同意用的,但是增长知识是好的。
回复

使用道具 举报

🔗
modifiedname 2016-3-9 01:50:34 | 只看该作者
全局:
没看懂,binary outcome为什么大家提各种regression办法
. 1point3acres
目的是prediction准确 vs 解释性,当然会是不同的approach,不过楼主的题目明确说了需要target AUC
predict为主的话,无论多blackbox都可以,比如RF,一般用这个establish 上限。
下限可以是logistic stepwise的结果,可以先用某些方法做feature的筛选,比如一个个选。. ----
collinear对prediction没有影响,对interpretability有影响
可解释性重要的话,就尽量用简单模型去接近刚刚说的上限。

样本少也一样可以cross validate,来防止Overfit
training data才200, 实测数据2w+这么具体不知道有什么用意,但是p >> n是属于high dimensional data,生物信息里面还挺常见的,比如200个病人,10k个基因表达或者蛋白什么的。-baidu 1point3acres

记得之前用过randomforest效果可以
为了Interpret,还做过用hybrid approach,feature selection via RF, but predict via SVM
我当时的数据里面效果是差不多。
.1point3acres
回复

使用道具 举报

🔗
rushiwowen92 2016-3-10 22:46:29 | 只看该作者
全局:
y_form 发表于 2016-3-1 08:16
过了很久…报个进度…我的elastic net提案被老板否决了….google  и
他的建议是先cluster然后一个个attribute建模Q ...

这么干是为了add business value吗?
回复

使用道具 举报

🔗
 楼主| jennymeng2003 2016-3-11 09:12:22 | 只看该作者
全局:
小K 发表于 2016-3-9 01:50
没看懂,binary outcome为什么大家提各种regression办法.google  и

目的是prediction准确 vs 解释性,当然会是不同 ...

啊 小K姐都出现了!我也不知道200测2W是干啥
总结来看大家都觉得tree会比较适合 所以去自学了一下xgboost
但不知为何最后貌似NN cross validation最好 AUC .8左右
这是一家consulting company的题 并不生统
交上去后HR回复说还不错 约了下一轮面试 ..
+求问K姐consulting行业里的data scientist到底是个什么情况...感觉要求比较低啊
回复

使用道具 举报

🔗
modifiedname 2016-3-11 10:16:40 | 只看该作者
全局:
no idea what consulting does...
回复

使用道具 举报

🔗
ziz 2016-3-11 10:20:05 | 只看该作者
全局:
那2W+ observations上可以用neural network做feature extraction (用autoencoder啥的).没准能提高准确率
回复

使用道具 举报

🔗
pineapple1985 2019-5-26 20:30:45 | 只看该作者
本楼:
全局:
进来学习~~~~~~
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表