查看: 5011| 回复: 32
跳转到指定楼层
上一主题 下一主题
收起左侧

[BigData] 非cs人求问如何统计每个词的频率

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
有一个1g的数据,每一行是一个人的爱好,比如iron man, c++, baseball,各种各样的字符串。但是这5万个人的爱好是有重复的,目的就是build a histogram of every 'likes', I can choose a cut off in order to ignore some low frequency ones.....
the second one is build a histogram for pair wise 'likes', for example, I want the frequency of the pairs (basketball, baseball)...there are too many pairs for me to consider, not even record the frequencies.
I'm from stat and I only know R. it's not possible for me to read the whole data in to R all at once.
Anyone has some suggestions on which direction I should work on?
Thanks....

上一篇:我这样打matlab对吗
下一篇:Matlab
🔗
blueiceni 2014-4-9 01:08:04 | 只看该作者
全局:
去看下 MapReduce 吧,通常的大数据题都是用 MR 来做处理

也有用 R 来写 MapReduce 程序的方法:

http://blog.kuan0.com/2013/09/ba ... example-with-r.html
回复

使用道具 举报

🔗
 楼主| snowdustdj 2014-4-9 01:18:32 | 只看该作者
全局:
blueiceni 发表于 2014-4-9 01:08
去看下 MapReduce 吧,通常的大数据题都是用 MR 来做处理

也有用 R 来写 MapReduce 程序的方法:

谢谢,这就去看看
回复

使用道具 举报

🔗
tobyljj 2014-4-9 01:28:20 | 只看该作者
全局:
才1G的话完全不用map reduce。。如果只有这个需求的话直接随便写个小东西parse一下就行了
回复

使用道具 举报

🔗
 楼主| snowdustdj 2014-4-9 02:25:16 | 只看该作者
全局:
tobyljj 发表于 2014-4-9 01:28
才1G的话完全不用map reduce。。如果只有这个需求的话直接随便写个小东西parse一下就行了

能具体些吗。。或者哪方面知识
回复

使用道具 举报

🔗
 楼主| snowdustdj 2014-4-9 02:33:08 | 只看该作者
全局:
tobyljj 发表于 2014-4-9 01:28
才1G的话完全不用map reduce。。如果只有这个需求的话直接随便写个小东西parse一下就行了

我目前的想法是一个数据一个数据读
if 新数据 in 已有的数据 then 对应数据count +1
else 把新的数据加入原来list构成新的list 对应count为0
但是考虑到有几十万个数据 这个应该行不通。。所以看看有什么新的思路

另外一个想法是能不能把1G的csv文件一行一行读, 每一行对应一个histogram,然后想想看有没有办法把这5w个histogram整个起来
求指导。。
回复

使用道具 举报

🔗
modifiedname 2014-4-9 07:44:16 | 只看该作者
全局:
map reduce would do
can be implemented in any language, both py and R can do this

may need >1 passes
1 to get word count
2 to .... calculate histogram

i suspect the data will be long tailed and too sparse for histogram to look informative?
回复

使用道具 举报

🔗
 楼主| snowdustdj 2014-4-9 09:40:39 | 只看该作者
全局:
本帖最后由 snowdustdj 于 2014-4-9 10:34 编辑
小K 发表于 2014-4-9 07:44
map reduce would do
can be implemented in any language, both py and R can do this



对的,会把一些频率很低的词条剔除掉。今天网上查了一天了,K姐有木有mapreduce简单应用的资料?我知道那个udacity公开课有教怎么写mapreduce,但是可能来不及了。所以有那种看一天能写出点东西的教程吗

更新下:刚找到rmr package的tutorial了,现在研究下,谢谢姐
回复

使用道具 举报

🔗
EroicaCMCS 2014-4-9 18:26:40 | 只看该作者
全局:
snowdustdj 发表于 2014-4-9 09:40
对的,会把一些频率很低的词条剔除掉。今天网上查了一天了,K姐有木有mapreduce简单应用的资料?我知道 ...

udacity的MR课就4个lesson,几个小时可以看完了
回复

使用道具 举报

🔗
readman 2014-4-9 23:20:07 | 只看该作者
全局:
一个G 太小了, 不用mapreduce.
直接分割下可以了.
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表