注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
本帖最后由 rogerdai 于 2013-4-27 19:22 编辑
大数据,看似是近两年才火起来的一个新概念。市面上的书籍也是鱼龙混杂,叫人难以分辨。
这个东西是什么时候火起来的呢?
先看看Google Trends的“Big Data”趋势:
似乎是2011年后才火起来的样子,嗯..似乎是个新奇的东西... 我们把时间往前再倒一点,到1997年... 看看那篇《The Anatomy of a Large-Scale Hypertextual Web Search Engine》,就是描述Google雏形的那篇文章.. 直接看5.1节 Storage Requirements:
Aside from search quality, Google is designed to scale cost effectively to the size of the Web as it grows。
嗯..Google爬虫在web上爬啊爬抓啊抓,把爬到的页面抓下来..那么这个雏形中的Google需要的存储是多少呢..?
. 1point3acres.com
看起来不大嘛,只需要100多G...但是不要忘了,那时可是1998年...1998年是个神马样的情况呢?看看下图(来自wiki) .
Hard drive capacity over time -baidu 1point3acres
可以看到,2000年前,存储的能力都未能达到百Gb,而Google的需求却已经达到了百Gb。那么企业的产品能满足Google的需求吗..?答案似乎是否定的。来看2001年5月22号的一则报道《Computer Disk Storage Space Outpaces Moore's Law Superparamagnetic Limit Exceeded by IBM Researchers》,其中写道:
... they have now reached densities of up to 25.7 billion bits per square inch 3.98 billion bits per square centimetre. At this density, IBM's highest capacity drives can store 48 billion bytes — 48 gigabytes — of data. . .и
48Gb!而且是2001年,Google在1998年就已经需要不止这个数了!Oh...看来即使是超越摩尔定律的存储产品也不能满足Google的搜索引擎...
还有,数据传输速度也不能满足现在的数据量需求:
1990年,一个普通硬盘驱动器可存储1370MB的数据并拥有4.4MB/S的传输速度,所以,只需五分钟的时间就可以读取整个磁盘的数据。20年过去了,1TB级别的磁盘驱动器随处可见,但是数据传输的速度却在100MB/S左右。所以它需要花两个半小时以上的时间读取整个驱动器的数据。
看来,计算向存储转移是势不可挡了。
.1point3acres
原来,大数据在九十年代末早就出现,而且是因互联网而生。
后来呢,发生了什么?Google越来越大,赚的钱越来越多...更重要的是,互联网业是越来越大...之后的Facebook, Twitter, ...互联网越来越流行。. 1point 3acres
同时,存储的价格越来越低,看下图:
正如引用的文中所述,每Gb的存储价格在2009年已经到了$0.09。互联网公司的钱越赚越多,可似乎银弹也不能解决这个存储不足的问题。
Google作为第一个吃螃蟹的公司,也是最先遇到了这个问题,也就有了Google File System,以及Apache Hadoop...Hadoop历史中值得一提的是:Hadoop来自Lucene,也是来自搜索引擎。
这样看来,big data的真实面目揭开了,也就是就是互联网,确切地说应该是:互联网级别的数据。现在也只有真正的互联网公司才能被称为大数据公司,但其他行业的也逐渐显出处理大数据的需求,比如生物计算,地理信息系统等,所以大数据的应用将不仅仅会是在互联网领域,正如Hadoop不仅仅是用在搜索引擎中一样。 参考:. 1point 3 acres
|