注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
第一次拿到 onsite,总共2小时,面了 data science team 的两个员工和部门主管。
员工1:. Waral dи,
Q: 假定有一堆基因,每个可能有多种表达,要用它们预测是否发生某种癌症,请问如何 represent features?A:one-hot encoding。Q:为什么不直接用 0,1,2,3,4,5 表示?A:因为不同的基因表现型没有 Order,我们不希望在 feature representation 中引入这个 bias.
Q:如何判断哪个基因比较重要? A: feature importance calculation, 可以用 logistic regression 或者 SVM, random forest 等等。Q: 用不同模型给出的 feature importance 可能不同,哪个比较可信,如何选择?A:并没有所谓更好的 feature importance metric, 不同的模型基于不同的假设给出 feature importance,比如如果 data is intrinsically linear, logistic regression 或者 linear SVC 给出的就很不错,如果没有 prior information,我会倾向于 random forest。Q: random forest 总能给出一致的 feat indent, 3. speed. From 1point 3acres bbs
然后聊了一堆我的 project 细节. Χ
最后问了个跟上面 p-value 类似的问题:如果一个人告诉你,我发现某个基因跟癌症相关 p-value 是0.001,然后要去发 twitter,问你的意见,你会直接让他发吗?A: 问几个问题:1. 发什么内容,2. causal 还是 correlation information,3. 怎么发现这个 p-value 的 (如果跟上面一样从2000个里面挑那就太坑了),4. class 是否 imbalance,5. correlation 是否有年龄、性别等差异从而有可能提取更多有价值的信息。
接着聊了20多分钟他们想做的 projects,问了几个问题结束。
第一次发这么长的,求大米!!
|