楼主: EroicaCMCS
跳转到指定楼层
上一主题 下一主题
收起左侧

手把手教你用python抓网页数据

   
🔗
wesley 2014-2-18 00:03:21 | 只看该作者
全局:
必须要顶
回复

使用道具 举报

🔗
bonnie1024 2014-2-20 11:58:28 | 只看该作者
全局:
好贴啊,刚好近期要用,楼主V5
回复

使用道具 举报

🔗
xingzhui222 2014-3-1 07:22:43 | 只看该作者
全局:
楼主有定时爬网页的经验么。。. 1point 3 acres
如果要每天定时哪个时间跑下程序然后抓的数据放到一个file里。虽然我知道linux命令行,但是如果要定时每小时都跑一次,然后跑3个月,感觉自己笔记本一直开着不太现实呀。。有没有啥软件可以用啥的就是不用自己笔记本跑。。。付费也可以哇。
回复

使用道具 举报

🔗
 楼主| EroicaCMCS 2014-3-6 16:27:53 | 只看该作者
全局:
本帖最后由 EroicaCMCS 于 2014-3-6 16:33 编辑
xingzhui222 发表于 2014-3-1 07:22
楼主有定时爬网页的经验么。。
如果要每天定时哪个时间跑下程序然后抓的数据放到一个file里。虽然我知道li ...

没有这方面的经验。。。
肯定不能用笔记本啦,可以试一下免费的云平台,比如:sina app engine, google app engine
回复

使用道具 举报

🔗
kaito666k 2014-3-6 19:13:43 | 只看该作者
全局:
FYI urllib is not thread safe.
回复

使用道具 举报

🔗
ysyyork 2014-3-6 19:15:38 | 只看该作者
全局:
本帖最后由 ysyyork 于 2014-3-6 19:18 编辑
. 1point 3 acres
抓网页抓了几个月。发现有的网站老变html代码格式。真是烦。。。
话说有个爬虫框架很好用介绍给大家Scrapy,虽然灵活性还是自己写的强,但是他的模板足以完成基本的爬取任务。有兴趣可以看看这个:http://www.cnblogs.com/txw1958/a ... crapy-tutorial.html. 1point3acres.com
对于自动屏蔽ip的问题,你可以不要连着抓取,每次抓取完了用sleep函数睡眠一个random时间再抓,这样模拟浏览器访问,不容易被屏蔽。我之前爬豆瓣,连着怕60次就gg了,后来用sleep爬到150多次都没问题。再多应该也没问题,我没试过

评分

参与人数 1大米 +20 收起 理由
EroicaCMCS + 20 感谢分享!

查看全部评分

回复

使用道具 举报

🔗
para 2014-3-14 20:44:15 | 只看该作者
全局:
写得很好~刚好用得上~超级感谢~
回复

使用道具 举报

🔗
jhguo 2014-3-16 15:24:53 | 只看该作者
全局:
特别的,好赞!
回复

使用道具 举报

🔗
fontainebleu 2014-4-29 17:46:02 | 只看该作者
全局:
我在网上看了一个VBA的课程,目前才开始觉得很不错。应该学完VBA是可以试试这个程序的吧。打基础的过程开始了,纯文科背景的没有办法啊

点评

?? vba 跟py 的关系是?  发表于 2014-6-12 13:19
回复

使用道具 举报

全局:
写的很好。简明扼要。Mining the Social Web不错
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表