楼主: 3668112q
跳转到指定楼层
上一主题 下一主题
收起左侧

[统计--就业] survival analysis这个方向怎么样?

🔗
wwtpcsuper 2013-10-23 02:16:07 | 只看该作者
全局:
3668112q 发表于 2013-10-22 02:23
啊。。我问了那个老师,他说这个是个很好的处理大数据的途径,还说我要是想做data analyst这个方向特别适 ...
. 1point 3 acres
你问他怎么定义大数据。。
. 1point 3 acres
survival要是数据足够大干吗还用hazard model.. 直接drop missing variable就行了... Waral dи,
. 1point 3 acres
除非是做variable selection/dim reduction(large p small n)

但是如果做那个的话就直接处理生物数据了,跟工业界的数据类型不是很像. 1point3acres

不过我其实也不知道survival有什么好做的。。如果是clinical trail的话没什么research好做了
回复

使用道具 举报

🔗
sgmzhou2 2013-10-23 02:31:59 | 只看该作者
全局:
survival analysis 在精算当中貌似也有应用,特别是保险
回复

使用道具 举报

🔗
funfunfun 2013-10-23 03:51:05 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 02:16
你问他怎么定义大数据。。

survival要是数据足够大干吗还用hazard model.. 直接drop missing variable ...

Apparently you are not familiar with the foundmental concepts of survival analysis. Censoring is not equivalent to missingness. Dropping cneosred data induces selection bias.
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 04:19:48 | 只看该作者
全局:
funfunfun 发表于 2013-10-22 14:51 . Χ
Apparently you are not familiar with the foundmental concepts of survival analysis. Censoring is n ...

我知道。。我是说sample足够大的情况。。到big data至少得10万个点以上吧。。那么大了bias就没那么重要了
回复

使用道具 举报

🔗
modifiedname 2013-10-23 04:41:56 | 只看该作者
全局:
biostat里面叫的high dimensional data跟大数据的big data完全不是一个意思,正好是相反的
大数据里面目前一般n>>>>p
high dim的是p>>>>n, 样本太小
. check 1point3acres for more.
你可以看看KDD, WWW等会议,里面有多少paper是用到time to event/censored data分析的(估计一般是不会叫survival数据的,我这里说survival,别人第一反应一般是 what's that ?never heard of it)
回复

使用道具 举报

🔗
modifiedname 2013-10-23 04:42:47 | 只看该作者
全局:
起码今年的JSM里面,还是不少人把high dim和big data混淆的
个人感觉这两者没有啥可比性。。。。。
回复

使用道具 举报

🔗
funfunfun 2013-10-23 06:23:24 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 04:19
我知道。。我是说sample足够大的情况。。到big data至少得10万个点以上吧。。那么大了bias就没那么重要了

That's totally incorrect.

点评

多谢  发表于 2013-10-23 07:55
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 07:36:33 | 只看该作者
全局:
funfunfun 发表于 2013-10-22 17:23
That's totally incorrect.

为什么数据量足够大missing data足够少也不能drop点呢?
回复

使用道具 举报

🔗
一拳一心 2013-10-23 07:48:39 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 07:36 .
为什么数据量足够大missing data足够少也不能drop点呢?
. 1point 3acres
最近刚好在上这门课
打个比方 没法去医院做检查而被censor的人都是因为快死了身体太差无法去做检查的人
那么直接去掉样本 就会严重低估hazard 就算数据量大 bias是无法消除的

点评

多谢  发表于 2013-10-23 07:56
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 07:50:45 | 只看该作者
全局:
一拳一心 发表于 2013-10-22 18:48
最近刚好在上这门课
打个比方 没法去医院做检查而被censor的人都是因为快死了身体太差无法去做检 ...

就是based on这个病的致死率低的情况

如果1000个里面999个都要死,然后会怎么样呢
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表