查看: 5980| 回复: 18
跳转到指定楼层
上一主题 下一主题
收起左侧

一道data science技术面试题 求广泛讨论!

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 anonym 于 2016-2-1 00:01 编辑
. ----
如果发错地方求告知哈 面试里被问过几次类似的问题了 发上来一起讨论!
题目:给一个dataset 200+ observation with binary outcome  300个predictor(都在0-1之间),已知outcome就是用这300个predictor以某种未知的方法generate出来的 给出另外2W+observation(no outcome, only predictors)要我predict p(y=1|x), performance用AUC(ROC)来测
. 1point3acres.com
现有思路:
1. traditional logistic regression肯定不行 考虑lasso或ridge 但问题是如何考虑transformation,interaction?
. check 1point3acres for more.2. forward/backward/stepwise selection: 同理,如何考虑transformation,interaction?
3. neural network 这个我自学的 觉得比前两个靠谱点 没在R里做过 等做完来和大家汇报下 但听说也是不能automatically take interaction into consideration? 另#of unit和layers如何选
4. SVM 不太熟 容我去复习

谢谢观看!另外有一起找工作的小伙伴求指点简历+networking!
撒花!*★,°*:.☆\( ̄▽ ̄)/$:*.°★* 。

上一篇:跟着做visualization的导师做DS靠谱吗。。回复有米米米~~thx
下一篇:CS转IS学习计划+求讨论
推荐
daichi1231 2016-1-31 01:52:00 | 只看该作者
全局:
之前看到过一篇文章 用embedding algorithm对于这类问题处理的效果更好吧
像boosting bagging   random forest 或者是kaggle上经常用的xgboost?
回复

使用道具 举报

推荐
y_form 2016-1-31 00:42:32 | 只看该作者
全局:
本帖最后由 y_form 于 2016-1-31 02:25 编辑

最近正好在处理一个有点像的问题的。我的大概是50 记录 + 40 variables。performance自己定,能解释通就可以。
300 predictors之间有没有 collinearity? binary outcome之间平不平衡?

有collinearity是很头疼的事情,单独lasso和ridge都解决不了,stepwise也不行。我觉得只能有elastic net。但是我自己的data用elastic貌似出现了overfitting。然后是ridge还是lasso的grouped variable。
然后两个outcome不平衡的话,你还需要weight。
interaction的话得自己手动来啊。光说技术的话,R有包可以自动算interaction,不过就是很慢。
然后你可以实现跑一个feature selection算法嘛,降降维。

然后是不需要解释model的话,可以ML算法,或者PCA/MDS先dimension reduction。
neural network/MLP/SVM反正我自己的data跟普通logistic差不多,还特别慢。而且这种ML model比较难interpret啊。
然后我也在想能不能boosting or bagging…

还有就是如果是有背景的,可以利用背景知识解释嘛。. 1point3acres

另外要是有跟近求回复,我也在愁…. Χ
回复

使用道具 举报

全局:
没看懂,binary outcome为什么大家提各种regression办法

目的是prediction准确 vs 解释性,当然会是不同的approach,不过楼主的题目明确说了需要target AUC
predict为主的话,无论多blackbox都可以,比如RF,一般用这个establish 上限。
下限可以是logistic stepwise的结果,可以先用某些方法做feature的筛选,比如一个个选。
collinear对prediction没有影响,对interpretability有影响
可解释性重要的话,就尽量用简单模型去接近刚刚说的上限。

样本少也一样可以cross validate,来防止Overfit
training data才200, 实测数据2w+这么具体不知道有什么用意,但是p >> n是属于high dimensional data,生物信息里面还挺常见的,比如200个病人,10k个基因表达或者蛋白什么的。

记得之前用过randomforest效果可以
为了Interpret,还做过用hybrid approach,feature selection via RF, but predict via SVM
我当时的数据里面效果是差不多。

回复

使用道具 举报

🔗
 楼主| jennymeng2003 2016-1-29 21:26:32 | 只看该作者
全局:
啊对 还有neural network有个parameter叫decay 用于防治overfitting 可惜我没学过 有人懂么
回复

使用道具 举报

🔗
jacksterling 2016-1-31 00:07:55 | 只看该作者
全局:
你这不是binary classification嘛?为啥要用ridge lasso regression 转换·······. 1point 3 acres

直接考虑SVM,KNN, NB,或者 boosting or bagging with  tree 不是更好····
.google  и
话说这种高维度的用SVM可能比较好吧
回复

使用道具 举报

🔗
gyzjay 2016-1-31 02:06:56 | 只看该作者
全局:
我觉得降维没有啥用。3w+的数据作为样本还是比较小的……然后我记得天奇大神的xgboost和sklearn都有predictprobablity功能。直接输出了分类概率。我觉得基本的svm 、RFC、加个ensemble就可以了。
回复

使用道具 举报

🔗
gyzjay 2016-1-31 02:09:35 | 只看该作者
全局:
反正xgboost无脑暴力求解:)nn对于这种问题实际上并没有必要。因为并不知道feature的关系。一管的学习并没有办法好的找到特征空间。 我觉得实际上他给的这个问题贝叶斯方法就能解决……当然我只是一个还在申请的大四狗。可以忽略我的粗浅言论……
回复

使用道具 举报

🔗
gyzjay 2016-1-31 02:18:41 | 只看该作者
全局:
observation是只空间维度么……之前没有看清楚题目。如果确实是高维数据那么pca还是可以的。但是如果作为样本空间还是普通大小……tree classifier的综合ensemble。nn在300的空间中学习是非常有限的。vote for ensemble model。namely use xgboost:)gradient boosting tree
回复

使用道具 举报

🔗
 楼主| jennymeng2003 2016-2-4 08:56:58 | 只看该作者
全局:
y_form 发表于 2016-1-31 00:42
最近正好在处理一个有点像的问题的。我的大概是50 记录 + 40 variables。performance自己定,能解释通就可 ...
. Waral dи,
我喜欢你的头像!
没有collinearity 平衡 不过没有correlation也用不到pca
回复

使用道具 举报

🔗
y_form 2016-3-1 08:16:38 | 只看该作者
全局:
jennymeng2003 发表于 2016-2-4 08:56
我喜欢你的头像!
没有collinearity 平衡 不过没有correlation也用不到pca

过了很久…报个进度…我的elastic net提案被老板否决了…
他的建议是先cluster然后一个个attribute建模QAQ 我的问题是寻找适合的attribute,不完全是求accuracy...
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表