查看: 4863| 回复: 11
跳转到指定楼层
上一主题 下一主题
收起左侧

[其他] 问一个网络爬虫的网址问题

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
如题,求网络爬虫大牛指教,我现在需要在 https://www.zagat.com/new-york-city 上把所有餐馆的名字以及评分信息爬下来。其他的我都已经写好了,唯一的问题是网页翻页。. ----

我是这样做的:

要爬的信息的第一页是
https://www.zagat.com/search/pla ... ort=desc&page=1

所以第二页是
https://www.zagat.com/search/pla ... ort=desc&page=2

以此类推,就是最后的page=3,4,5,...一直迭代

但是我趴下来发现所有的link都是指向第一页的,无论page等于几。
所以我觉得可能这些个网址也能不是真正的指向第二页,第三页的网址。我试了其他很多方法去查找真正的超链接,都不对。。. Χ

求大神帮我看看,应该如何找到正确的链接,从而把每一页的信息趴下来?. check 1point3acres for more.

谢谢!.--

上一篇:弱问统计专业10门课30学分能在1年修完吗?
下一篇:AW在统计PhD申请中的问题
推荐
DamienPooh 2016-7-9 00:13:16 | 只看该作者
全局:
粗看了一下,实际的东西在这里,是一个json,结构很清楚,后期应该很好分析
https://www.zagat.com/proxy/v1.4?vertical=46&orderby=relevance&sort=desc&page=4&city=1020&query=&key=abbc09b7c840c10937a4db331422c98b&mobile_only_content=false&limit=15&m=filter&a=place
.--
city应该是你要找的城市的ID,你的帖子里写的是NY,那1020应该就代表NY
page是页数. 1point 3acres
key可能跟浏览器session有关系,如果是的话,这个自己不好生成,最好是先访问一下你帖中的地址,从HTML里面把key提取出来,然后按上面的格式构造URL

评分

参与人数 1大米 +20 收起 理由
jacksterling + 20 感谢分享!

查看全部评分

回复

使用道具 举报

推荐
ITFree 2016-7-11 13:16:13 | 只看该作者
全局:
1楼@DamienPooh 已经讲得特别清晰了,每次访问1楼给的这个网址即可(改变此链接中的page=1,抱歉我没权限发链接):
访问该链接返回的是个json字符串,假设是response,d = json.loads(response),  d['data']就是包含15个餐馆信息的数据。. 1point3acres.com
补充:监控下数据包,查看点击链接后的第一个请求包,就能分析到上面这个链接
回复

使用道具 举报

🔗
回到拉萨 2016-7-1 12:35:52 | 只看该作者
全局:
你用wget一下地址 下来的还是都是第一页?
回复

使用道具 举报

🔗
 楼主| 神奇果子 2016-7-1 12:43:00 | 只看该作者
全局:
回到拉萨 发表于 2016-7-1 12:35
你用wget一下地址 下来的还是都是第一页?

怎么wget啊?我只是手动复制粘贴地址到我的code里的,不知道如何获取“真正”的地址,求指教~
回复

使用道具 举报

🔗
a5147760 2016-7-4 10:19:43 | 只看该作者
全局:
关掉javascript再找超链接试试
回复

使用道具 举报

🔗
qqaas 2016-7-4 10:26:29 | 只看该作者
全局:
用selenium模拟点击页面
回复

使用道具 举报

🔗
jacksterling 2016-7-5 04:24:24 | 只看该作者
全局:
你用什么框架啊?scrapy?
回复

使用道具 举报

🔗
 楼主| 神奇果子 2016-7-8 23:01:17 | 只看该作者
全局:
a5147760 发表于 2016-7-4 10:19
关掉javascript再找超链接试试

怎么关掉js呢?
回复

使用道具 举报

🔗
 楼主| 神奇果子 2016-7-8 23:01:22 | 只看该作者
全局:
a5147760 发表于 2016-7-4 10:19
关掉javascript再找超链接试试

怎么关掉js呢?
回复

使用道具 举报

🔗
 楼主| 神奇果子 2016-7-8 23:02:16 | 只看该作者
全局:
qqaas 发表于 2016-7-4 10:26
用selenium模拟点击页面

恩恩 我也查到这个方法了 但是一直搞不定。。 说是 unknown server
回复

使用道具 举报

🔗
 楼主| 神奇果子 2016-7-8 23:02:48 | 只看该作者
全局:
victorsterling 发表于 2016-7-5 04:24
你用什么框架啊?scrapy?
.google  и
我用R做的。。基本上就是rvest这个包
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表