楼主: Poalo
跳转到指定楼层
上一主题 下一主题
收起左侧

有用数据挖掘挖出有价值的孩子吗?

🔗
readman 2014-2-18 11:17:13 | 只看该作者
全局:
鲁迅 发表于 2014-2-18 10:45
就现实应用情况而言:

1、如电信、银行类的数据挖掘平台,所谓的 “大数据”在后端来说仅仅是提升了存 ...

然后, 我觉得什么大数据时代, 全是炒作。 数据本身来自于服务产生的附加价值, 然后对此进行挖掘,或者什么算法后, 产生的价值,最多只能对服务进行优化,并不会产生真正意义上的二次价值。

就比如说, 你可以用用户的习惯来检索出用户可能购买的商品(如淘宝的广告)。但是真正从你推荐的地方去购买这种商品实际购买情况如何呢?你需要再次的统计, 这就相当于一个无限的递归(服务->数据->挖掘->服务->数据->挖掘)。虽然优化了服务, 但是实际价值的体现缺很少。 还不如一个广告直接打出去,然后换回的客户,要实在的多。

评分

参与人数 1大米 +60 收起 理由
anonym + 60 讨论越激烈越好~~

查看全部评分

回复

使用道具 举报

🔗
readman 2014-2-18 11:19:53 | 只看该作者
全局:
鲁迅 发表于 2014-2-18 11:12 . 1point3acres
Yarn出来以后现在版本已经作为一个框架产品在维护了。。。

我看到一个人, 从xxx万开房记录中, 挖掘的数据, 很有钱途!!
回复

使用道具 举报

🔗
鲁迅 2014-2-18 11:25:40 | 只看该作者
全局:
readman 发表于 2014-2-18 11:19 .--
我看到一个人, 从xxx万开房记录中, 挖掘的数据, 很有钱途!!

这么说我觉得还是做连锁旅馆比较有前途,
等赚够了钱我开个连锁奶茶店,
再搞个连锁快捷酒店让家里老人经营
回复

使用道具 举报

🔗
readman 2014-2-18 11:28:08 | 只看该作者
全局:
鲁迅 发表于 2014-2-18 11:25 .--
这么说我觉得还是做连锁旅馆比较有前途,
等赚够了钱我开个连锁奶茶店,
再搞个连锁快捷酒店让家里老人 ...

求你奶茶店里的 奶茶MM

点评

到那个年纪。。。可以给你儿女留着,没准可以是个奶茶GG  发表于 2014-2-18 11:29
回复

使用道具 举报

🔗
hetong_007 2014-2-18 11:40:28 | 只看该作者
全局:
各种业界里的应用可以从Kaggle上窥得一斑:http://www.kaggle.com/. Χ
上面有数据较大的比赛,也有数据较小的比赛。

数据量不小的几个例子:http://www.kaggle.com/c/lshtchttp://www.gequest.com/c/flight2-finalhttp://www.kaggle.com/c/belkin-energy-disaggregation-competition,以及很多其他的competition。这些数据大多数人都觉得不是“大数据”,这没问题。但是这些也不是“小数据”,而且这些数据里非常冗繁复杂的结构意味着在目前的数据量上,数据越多结论就应该越丰富和精确。
. 1point3acres
确实,拿1MB数据,1GB数据,1TB数据算一个平均数是没什么意义的,但是像Kaggle上面的许多任务都不是能通过1MB的数据得到任何有意义结论的。可以延展一下,有些结论通过1GB的数据可能还是不够强,人们要的就会更多。

而大家常常在公开的平台看到从“大数据”分析出的平凡结论,我个人猜测有这么几个原因:

1. 那是伪大数据的结论,可能也就几百行放进excel算一算就完了,毕竟拿任何数据都叫大数据的大数据婊不少见。. Waral dи,
2. survivor bias,就是很有意义有价值的结论别人是不会公开告诉大家的,只会拿些很简单的东西出来给大家看看,造成了公众的认知偏差
3. 即使有公司愿意拿结果出来分享,其中非平凡的结论也有可能是大家不易懂的,或是难以描述导致宣传有偏差的,或者是因为不平凡所以结论泛化性差导致大家不感兴趣,各种原因导致最后没有得到足够的注意。

评分

参与人数 1大米 +60 收起 理由
anonym + 60 那天ML的recitation上TA问有谁知道这个网站.

查看全部评分

回复

使用道具 举报

🔗
readman 2014-2-18 12:30:51 | 只看该作者
全局:
hetong_007 发表于 2014-2-18 11:40
各种业界里的应用可以从Kaggle上窥得一斑:http://www.kaggle.com/
上面有数据较大的比赛,也有数据较小的 ...

Kaggle的数据过于规整。 完全是学术的。
. check 1point3acres for more.
实际操作中, 很多数据根本不是那么有分析价值的。 或者, 你工作中更多的部分, 是分析出那些是误差,那些是有分析价值的数据。

就像我现在干的12.5某铁项目, 1个车,1秒就有几十M的数据量, 这些数据来自于西门子,庞巴迪,卡斯柯,等一堆公司的log。其中解码就非常费劲,然后各种不统一,数据的类型,变量,标量,对应编码系统什么的都是不一样的。何况里面有warn, 有error,还有通用的数据。 然后一天几个G就在哪, 你说那东西没价值吧? 那不可能。 你说有价值吧? 有毛线啊。。摘出来都困难。就算同一厂家,同一个设备,上边的模块都是来自于不同商家的。 你说怎么分析? 。。
回复

使用道具 举报

🔗
hetong_007 2014-2-18 12:43:47 | 只看该作者
全局:
readman 发表于 2014-2-18 12:30
Kaggle的数据过于规整。 完全是学术的。

实际操作中, 很多数据根本不是那么有分析价值的。 或者, 你 ...

这是一个体力活……清洗数据嘛,在kaggle上面的比赛也要做这一步,但是相比起来工作量确实会小很多。你说的这个情况非常烦,但是还挺常见的…….--

如果让我自己一个人做复杂数据的整合和清洗时容易晕头转向,做的事情不完整。复杂的活应该需要一个小团队来做,根据分析的明确目的来决定如何整理不同数据来源,然后要有头脑清晰的人时刻提醒不要钻牛角尖……

我听别人说过,数据挖掘的结果有七八成在清洗数据的时候就定下来了,洗的数据好不好,完全决定了后面的可视化能不能找到有用的信息,能不能通过模型跑出有意义的结果。反正可视化方法和模型基本上不同人用的结果不会差太多,而喂给分析工作什么数据,就变得至关重要了。Kaggle有人说他自己会用几套相似但是不同的方法来整理数据,然后放进模型里面跑看看哪个结果高。我觉得这个例子比较极端,但是能说明重要性。

我也听说ebay内部是通过Topic Model来对大量log数据进行分类和自动化处理的,不知道这样的模式对你的工作有没有什么参考价值~
回复

使用道具 举报

🔗
modifiedname 2014-2-18 12:57:35 | 只看该作者
全局:
variety and velocity are the other two features of big data
大数据本身,大还不是最严重的问题

不是有说法么,哪怕是noisy data,只要够大,也总能跑出好用的结果来,超过更好的模型,但是much smaller, but "cleaner" training data
回复

使用道具 举报

🔗
readman 2014-2-18 13:18:58 | 只看该作者
全局:
hetong_007 发表于 2014-2-18 12:43
这是一个体力活……清洗数据嘛,在kaggle上面的比赛也要做这一步,但是相比起来工作量确实会小很多。你说 ...

- = 没有
TM是对有主题的模型分析,处理。.1point3acres
我们log的数据,是想做一个车辆报错后,通过故障树,找到故障类别和严重性什么的。然后分析产品线。。。
回复

使用道具 举报

🔗
鲁迅 2014-2-18 13:26:09 | 只看该作者
全局:
hetong_007 发表于 2014-2-18 12:43
这是一个体力活……清洗数据嘛,在kaggle上面的比赛也要做这一步,但是相比起来工作量确实会小很多。你说 ...
. 1point3acres.com
哈哈,每个项目80%时间都在捣腾ETL
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表