查看: 8709| 回复: 39
跳转到指定楼层
上一主题 下一主题
收起左侧

有用数据挖掘挖出有价值的孩子吗?

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
为什么感觉现在BIG DATA概念很火,但实际挖掘出来的大部分都是常识?

上一篇:求UT-Austin business analytics面经!
下一篇:求各位大神分析一下Harvard CSE program

本帖被以下淘专辑推荐:

推荐
readman 2014-2-18 12:30:51 | 只看该作者
全局:
hetong_007 发表于 2014-2-18 11:40
各种业界里的应用可以从Kaggle上窥得一斑:http://www.kaggle.com/
上面有数据较大的比赛,也有数据较小的 ...

Kaggle的数据过于规整。 完全是学术的。

实际操作中, 很多数据根本不是那么有分析价值的。 或者, 你工作中更多的部分, 是分析出那些是误差,那些是有分析价值的数据。

就像我现在干的12.5某铁项目, 1个车,1秒就有几十M的数据量, 这些数据来自于西门子,庞巴迪,卡斯柯,等一堆公司的log。其中解码就非常费劲,然后各种不统一,数据的类型,变量,标量,对应编码系统什么的都是不一样的。何况里面有warn, 有error,还有通用的数据。 然后一天几个G就在哪, 你说那东西没价值吧? 那不可能。 你说有价值吧? 有毛线啊。。摘出来都困难。就算同一厂家,同一个设备,上边的模块都是来自于不同商家的。 你说怎么分析? 。。
回复

使用道具 举报

推荐
鲁迅 2014-2-18 10:45:00 | 只看该作者
全局:
本帖最后由 鲁迅 于 2014-2-18 11:04 编辑
anonym 发表于 2014-2-18 08:32 . 1point3acres
举个例子详细讲讲?

就现实应用情况而言:

1、如电信、银行类的数据挖掘平台,所谓的 “大数据”在后端来说仅仅是提升了存储,使得数据的存储量提升,分析时候可以获得更宽泛时间数据的信息。
而实际上数据的粒度并没有变小,同时采用的数据挖掘算法还是那些个经典算法,根据这些个算法“很早”之前的历史数据很难对现在的情况作出正确的预测。

2、当今数据挖掘最热的应用也就是推荐系统,A家的推荐系统案例,
以及炒热“大数据”概念经典的沃尔玛啤酒与尿布的案例(这个案例是我司的得意之作,经常拿出来吹牛逼,真假不知),
但相关的推荐算法其实数据量到达一定程度之后,数据量的明显提升就不会带来推荐精确度的明显提升了。(也就是系统的投资回报率随着数据的爆炸性增长却没有显著提升)

3、如今mapreduce、tez、spark等等计算框架平台层出不穷,分布式存储可扩展性越来越好、查询性能节节攀高、数据量也是各种突破天际,
可当今的“大数据”算法和“小数据”的数据挖掘产生的结果有多大差别其实很难说很明显。很多公司上了最新的数据平台还是大幅亏损,很多公司还用的老的数据分析平台也依然坚挺。

个人觉得现今“大数据”的目的更多是对数据的有效存储和分布式查询的效率提升,等待日后学术界真正匹配的大数据有效算法(能把投资转换成利益,可以随着数据量线性提升的算法)投入工业界。
但毕竟“大数据”是趋势所在,未来一定是会挖掘出更大价值,所以现今的投资也是必需的,万里长征也才刚刚开始,不能输在起跑线上。
. 1point3acres
~
P.S. 这说的“大数据”到底多大算是大,“小数据”到底多小算是小其实没有明确界定,只能说明天的数据总量相较今天肯定是“大数据”。.
. 1point3acres.com

评分

参与人数 3大米 +82 收起 理由
adamzjw + 2 很中肯
anonym + 60 感谢回复!
Kimurate + 20 良心回帖

查看全部评分

回复

使用道具 举报

全局:
yi 好老的帖子

insight 不是来自运气,是来自系统的(systematic )hypothesis driven, problem solving
需要深刻的理解具体应用场景
需要理解数据的来源,采集方式的具体含义
然后才是运用一定的方法(technique)去找到有用的东西
各种compute/storage方面的进步,其实是
1 让 mining the data for business insights变得容易(analytics),让评估变得容易(inference)
2 让机器学习直接改变business模式/给用户体验直接带来改变(machine learning,就是ranking, 推荐,image, text, audio video 方面的应用等等)
. check 1point3acres for more.
2 的方面,因为可以直接带来商业价值,所以被研究的比较多,有很多很多成功案例,也是发展很集中的领域。

1 么,的确同意,简单的reporting为主,为分析而分析太多,而洞见太少

前文提到的confirm已知想法的问题是这样的:如果得到了未必常识和已有想法的insight,也一般难以说服decision maker,这个insight就等于没有卵用。. check 1point3acres for more.

亲身经历的例子:
1. 无数分析和实验证明,某新feature,用户就是不喜欢,因为价格太高。但是老板逼格高,死都听不进去,非要从其他地方拉资源完美支持这种项目。. .и
2. 无数分析和无数轮iteration证明某新feature没有良好adoption,用户不喜欢。但是老板坚信这个方向能成。于是不但不转换方向(pivot)寻找更好的解决办法,而是一再在同一个方向reinvest,延误时机。
3. Eng一批人分析了某烧钱的方案无法有良好回报,于是decision maker再发给Product org 第二批人重新分析。第二批人也得到一样的结论,于是decision maker干脆从企业外面花钱找了合同工来分析,直到得到能验证原本想法的结论为止。然后项目如期上马,果然如同前两批人分析的一样,烧钱而且无用,惨败。. From 1point 3acres bbs
LOL
. .и
回复

使用道具 举报

🔗
readman 2014-2-17 07:14:50 | 只看该作者
全局:
是的.
你见过个人拿到过有价值的,"BIG" data 的么?
现在公司都把数据看做生命..能挖早自己挖了, 小伙伴想自己挖着玩困难啊
回复

使用道具 举报

🔗
鲁迅 2014-2-17 10:22:47 | 只看该作者
全局:
现在上层应用研究速度严重跟不上下层技术架构的发展速度。。。有点本末倒置了

各种新的“大”数据技术架构层出不穷,而上层的数据挖掘得出的结论其实还和过去用excel做“小”数据分析得出的结论没大差。。。
回复

使用道具 举报

🔗
anonym 2014-2-18 08:32:58 | 只看该作者
全局:
鲁迅 发表于 2014-2-16 21:22
现在上层应用研究速度严重跟不上下层技术架构的发展速度。。。有点本末倒置了

各种新的“大”数据技术架 ...

举个例子详细讲讲?
回复

使用道具 举报

🔗
modifiedname 2014-2-18 08:48:30 | 只看该作者
全局:
recommender system at netflix, amazon?.
complex algo behind search engine ranking system?
the numerous online experiments that you are unaware of, but drive shipment of the many tweaks behind both UI rendering, appearance/position of stuff, and adding features etc at facebook, google, ...?
e.g. wikipedia donation campaign. (30+ variants tested, clear winner shown)

association rule mining at walmart that tells them what to stock where and when?

the predictive models at target that can identify pregnant women and their due dates so they can send targeted ads and drive up cross sell significantly?

the classification rule used for segmentation that identify platinum/gold etc users and let companies focus their marketing effort?

航空公司根据need计算票价

tweats predict stock price. ----
google queries predict influenza outbreak weeks ahead of CDC ..

facebook timeline update associated with "single/dating" status (see new data blog from facebook), very recent

quora, stackoverflow, wikipedia etc study that shows certain policy of site drives human behavior. .и



not many of these are available to outsiders though.

评分

参与人数 1大米 +60 收起 理由
anonym + 60 K姐出手

查看全部评分

回复

使用道具 举报

🔗
modifiedname 2014-2-18 09:03:51 | 只看该作者
全局:
另外,说这些insight是小数据也能知道的,个人感觉不是。
别人已经发现以后,当然容易用小数据去confirm. From 1point 3acres bbs
但是之前呢?你面对的可以是巨量的ideas from common sense
you can't tell which one is gonna work
analyzing a small subset (in excel or not) can give you some big directions, yes
but nowadays ppl like to drive profits into those niches as well, and believe it or not, those niches add up
回复

使用道具 举报

🔗
wesley 2014-2-18 11:02:15 | 只看该作者
全局:
楼上说的都好  不过 根据有限的经验 数据越多得到的结论越精确吧 可以探索的东西也更多
回复

使用道具 举报

🔗
readman 2014-2-18 11:09:24 | 只看该作者
全局:
鲁迅 发表于 2014-2-18 10:45
就现实应用情况而言:. ----

1、如电信、银行类的数据挖掘平台,所谓的 “大数据”在后端来说仅仅是提升了存 ...

我要吐槽, mapreduce是理论, 不是框架~
回复

使用道具 举报

🔗
鲁迅 2014-2-18 11:12:15 | 只看该作者
全局:
readman 发表于 2014-2-18 11:09
我要吐槽, mapreduce是理论, 不是框架~

Yarn出来以后现在版本已经作为一个框架产品在维护了。。。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表