查看: 3883| 回复: 4
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 讨论一个10K机器web crawler的问题

全局:

2020(7-9月)-CS硕士+3-5年 | Other|BayArea湾区 码农类General全职@meta

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 The8023 于 2020-7-10 15:09 编辑

webcrawler这个系统设计到处都有,比如这个就讲的很好https://medium.com/@morefree7/de ... rawler-f67a8ebb8336

不过具体设计到机器分配上,又是个难题。
请问如果具体到给10K 机器, 1b URL, 每个URL 100KB。 (1b * 100Kb = 一共是100TB的data). 要求不能重复爬,和尽量利用所有机器资源。

该如何分配资源呢? 多少做worker node, 多少做DB, 多少做service, 多少做storage.
因为算的时候不知道考虑到底哪里是Bottlenect, 有点迷茫。有没有大神指导一下分配机器应该从什么角度出发。


评分

参与人数 1大米 +1 收起 理由
tm1234 + 1 赞一个

查看全部评分


上一篇:大家知道Rang Technologies这个ICC怎么样吗
下一篇:亚麻 疫情期间痛苦的找工经验
全局:
插个眼zszszzzzd
回复

使用道具 举报

全局:
我也想知,地里提过DHT,但不明白要用这个
回复

使用道具 举报

🔗
zouying594 2020-9-29 17:21:26 | 只看该作者
全局:
waiting for the answer
回复

使用道具 举报

🔗
春山寒 2020-9-30 01:56:26 | 只看该作者
全局:
1000 机器 参考 spark hadodop 用yarn
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表