楼主: 3668112q
跳转到指定楼层
上一主题 下一主题
收起左侧

[统计--就业] survival analysis这个方向怎么样?

🔗
wwtpcsuper 2013-10-23 02:16:07 | 只看该作者
全局:
3668112q 发表于 2013-10-22 02:23 . Waral dи,
啊。。我问了那个老师,他说这个是个很好的处理大数据的途径,还说我要是想做data analyst这个方向特别适 ...

你问他怎么定义大数据。。. From 1point 3acres bbs

survival要是数据足够大干吗还用hazard model.. 直接drop missing variable就行了... Χ

除非是做variable selection/dim reduction(large p small n)
. 1point3acres.com
但是如果做那个的话就直接处理生物数据了,跟工业界的数据类型不是很像.

不过我其实也不知道survival有什么好做的。。如果是clinical trail的话没什么research好做了
回复

使用道具 举报

🔗
sgmzhou2 2013-10-23 02:31:59 | 只看该作者
全局:
survival analysis 在精算当中貌似也有应用,特别是保险
回复

使用道具 举报

🔗
funfunfun 2013-10-23 03:51:05 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 02:16
你问他怎么定义大数据。。

survival要是数据足够大干吗还用hazard model.. 直接drop missing variable ...
.--
Apparently you are not familiar with the foundmental concepts of survival analysis. Censoring is not equivalent to missingness. Dropping cneosred data induces selection bias.
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 04:19:48 | 只看该作者
全局:
funfunfun 发表于 2013-10-22 14:51
Apparently you are not familiar with the foundmental concepts of survival analysis. Censoring is n ...

我知道。。我是说sample足够大的情况。。到big data至少得10万个点以上吧。。那么大了bias就没那么重要了
回复

使用道具 举报

🔗
modifiedname 2013-10-23 04:41:56 | 只看该作者
全局:
biostat里面叫的high dimensional data跟大数据的big data完全不是一个意思,正好是相反的
大数据里面目前一般n>>>>p. Χ
high dim的是p>>>>n, 样本太小
-baidu 1point3acres
你可以看看KDD, WWW等会议,里面有多少paper是用到time to event/censored data分析的(估计一般是不会叫survival数据的,我这里说survival,别人第一反应一般是 what's that ?never heard of it)
回复

使用道具 举报

🔗
modifiedname 2013-10-23 04:42:47 | 只看该作者
全局:
起码今年的JSM里面,还是不少人把high dim和big data混淆的
个人感觉这两者没有啥可比性。。。。。
回复

使用道具 举报

🔗
funfunfun 2013-10-23 06:23:24 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 04:19
我知道。。我是说sample足够大的情况。。到big data至少得10万个点以上吧。。那么大了bias就没那么重要了

That's totally incorrect.

点评

多谢  发表于 2013-10-23 07:55
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 07:36:33 | 只看该作者
全局:
funfunfun 发表于 2013-10-22 17:23
That's totally incorrect.

为什么数据量足够大missing data足够少也不能drop点呢?
回复

使用道具 举报

🔗
一拳一心 2013-10-23 07:48:39 | 只看该作者
全局:
wwtpcsuper 发表于 2013-10-23 07:36 . 1point3acres.com
为什么数据量足够大missing data足够少也不能drop点呢?

最近刚好在上这门课
打个比方 没法去医院做检查而被censor的人都是因为快死了身体太差无法去做检查的人
那么直接去掉样本 就会严重低估hazard 就算数据量大 bias是无法消除的

点评

多谢  发表于 2013-10-23 07:56
回复

使用道具 举报

🔗
wwtpcsuper 2013-10-23 07:50:45 | 只看该作者
全局:
一拳一心 发表于 2013-10-22 18:48
最近刚好在上这门课. 1point3acres.com
打个比方 没法去医院做检查而被censor的人都是因为快死了身体太差无法去做检 ...

就是based on这个病的致死率低的情况
. Χ
如果1000个里面999个都要死,然后会怎么样呢
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表