楼主: iamhc
跳转到指定楼层
上一主题 下一主题
收起左侧

问个data mining和big data的问题

🔗
sysu_wenhao 2012-12-13 19:38:36 | 只看该作者
全局:
wwtpcsuper 发表于 2012-12-13 19:04
那就是对数据了解还不够,非参跟随机乱搞有啥区别

熊哥这么黑非参......虽然我也觉得。。。呵呵。。
回复

使用道具 举报

🔗
wwtpcsuper 2012-12-14 00:02:40 | 只看该作者
全局:
sysu_wenhao 发表于 2012-12-13 06:38
熊哥这么黑非参......虽然我也觉得。。。呵呵。。

没黑啊,非参有理论上的意义啊
回复

使用道具 举报

🔗
skywalk 2012-12-14 00:06:37 | 只看该作者
全局:
我最近遇到的一个模型是:用两端quantile来估计一个正态分布的参数。。。求问这种算非参的方法吗?
回复

使用道具 举报

🔗
wwtpcsuper 2012-12-14 00:14:09 | 只看该作者
全局:
skywalk 发表于 2012-12-13 11:06
我最近遇到的一个模型是:用两端quantile来估计一个正态分布的参数。。。求问这种算非参的方法吗?

你都假定正态了,太参数了,很强的假定了~~~
回复

使用道具 举报

🔗
skywalk 2012-12-14 00:14:29 | 只看该作者
全局:
昨天听报告去了~ 有关Big Data& Large-scale computation
数据量增加确实是提供了很多信息,但是实际使用中还关心 计算时间vs Error的trade-off(不是数据量越多越好) ,以及特大型数据怎么建立分布式数据库(考虑占用资源)和并行计算和keeping track of system parameter的问题
举个例子,facebook的数据量巨大,每一个模块item出现的顺序都是经过机器学习调整到最优次序的
单一一台机器是永远无法胜任这种计算量,但是参数求解又是对所有用户的数据都要实时完成,所以可想而知需要以上提到的所有技术。。。
结论: 数据多了,难度大了
回复

使用道具 举报

🔗
modifiedname 2012-12-14 00:38:06 | 只看该作者
全局:
wwtpcsuper 发表于 2012-12-13 11:14
你都假定正态了,太参数了,很强的假定了~~~

you beat me to it....--
这个问题是什么?概率解?
回复

使用道具 举报

🔗
modifiedname 2012-12-14 00:38:41 | 只看该作者
全局:
skywalk 发表于 2012-12-13 11:14
昨天听报告去了~ 有关Big Data& Large-scale computation
数据量增加确实是提供了很多信息,但是实际使用中 ...
. .и
他们解决办法是?
回复

使用道具 举报

🔗
wwtpcsuper 2012-12-14 00:46:20 | 只看该作者
全局:
小K 发表于 2012-12-13 11:38
you beat me to it...
这个问题是什么?概率解?

这个是在估计sigma吧
回复

使用道具 举报

🔗
skywalk 2012-12-14 01:19:33 | 只看该作者
全局:
wwtpcsuper 发表于 2012-12-14 00:46 . 1point 3acres
这个是在估计sigma吧

对,是这个意思
回复

使用道具 举报

🔗
skywalk 2012-12-14 01:27:19 | 只看该作者
全局:
小K 发表于 2012-12-14 00:38
他们解决办法是?
.1point3acres
分布式数据库没听懂。。好CS。。
模型求解本质上是每个机器只负责几个参数的求解,这种参数分组的办法可行是因为目标函数形式上参数之间无关…… 最后再保证每台机器算出来的值consist……
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表