查看: 980| 回复: 1
跳转到指定楼层
上一主题 下一主题
收起左侧

关于DS take home的问题

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
最近面试的take home和自己的project都遇到了一些需要处理free text format的数据。比如有些用户survey里会有optional的feedback,或者有些healthcare data里,病人可以选择性填写自己的过去病史。这些数据一般都有一半以上的missing value,之前做project的时候一半都直接把这种column扔掉了,但感觉有些不妥。想请问一下大家,一般都是怎么处理这类数据的呢,如果要用含有free text这个column的话,怎么样处理那些含有missing values的row呢?

上一篇:学校老师很水怎么办?
下一篇:【数科/产品面试学习】Emma Ding付费课程反馈 + 数科面试准备经验
推荐
tl545716730 2022-2-21 23:12:56 | 只看该作者
全局:
我来写个我通常针对这种column的做法哈

从简单到复杂的做法有以下几种

(0) 直接扔掉就好了。:)个人认为病人自行填写的病史数据过于难处理,还是focus在别的column上更高效。

(1) 分词,找关键词,先统计整个survey里最常出现的关键词,看看一些关键的noun和verb,是否能够根据关键词重建成show disease的column

(2)  bag 这样的方法词模型、TFIDF 向量和(简单的 n-gram)语言模型,做feature extraction。这类简单的模型通常是做machine learning很好用的training set。具体performance要取决于machine learning question定义。
-baidu 1point3acres
(3) Named entity recognition,相当于能够更加仔细的抓出各种词性的区别。病史数据比较常见的是各种disease name, years of history, intensity, hospital visiting times的类别。给每一种类别定义一个词库,里面列出对应可能出现的词。然后把每条病史数据判断一下,是否出现过每个词库里相应的词语,如果有的话再转换成单独的column feature。

评分

参与人数 2大米 +2 收起 理由
sdq1688 + 1 赞一个
芒果冰冰 + 1 给你点个赞!

查看全部评分

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表