查看: 1170| 回复: 3
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 求解如何在TB级别数据中找到top 100高频词 加米!

全局:

2019(1-3月)-CS硕士+短暂实习或全职不超过3个月 | 内推| 码农类General全职@

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
已经两次在面试中遇到了,感觉这也是实际工业界常碰到的问题?. .и
感觉自己每次都没答好, 用minHeap,对于稀有单词直接清除啥的,还有MapReduce应该也可?
求地里大牛们指教!真心想知道该怎么做!

. From 1point 3acres bbs


上一篇:offer 求比较 Micron verification vs 某小公司 analog ic design
下一篇:狗家三月mtv onsite 附 timeline
🔗
numerology 2019-3-23 05:27:11 | 只看该作者
全局:
既然强调了TB级肯定要往分布式的角度去想了. .и

MapReduce是个办法,比如你可以把你的数据shard成100份。每份用一个基本的算法找出top 100高频词
再把这100个top 100的结果merge起来。
回复

使用道具 举报

🔗
shawshank1994 2019-3-23 05:30:21 | 只看该作者
全局:
用MapReduce。思路和这个一样:
https://www.dezyre.com/hadoop-tu ... -wordcount-tutorial

评分

参与人数 1大米 +3 收起 理由
caitlin + 3 给你点个赞!

查看全部评分

回复

使用道具 举报

🔗
 楼主| caitlin 2019-3-23 08:26:10 | 只看该作者
全局:
shawshank1994 发表于 2019-3-23 05:30
用MapReduce。思路和这个一样:.--
https://www.dezyre.com/hadoop-tutorial/hadoop-mapreduce-wordcount-tut ...

谢谢! 紫薯紫薯紫薯!
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表