楼主: modifiedname
跳转到指定楼层
上一主题 下一主题
收起左侧

Data Scientist 炼成记录-更新完毕2018年12月 | 机器学习练成记录 - 已开新帖

   
🔗
EroicaCMCS 2013-12-28 14:01:52 | 只看该作者
全局:
本帖最后由 EroicaCMCS 于 2013-12-29 01:34 编辑
nibuxing 发表于 2013-12-28 05:29
我比K姐你还差得远,还在努力中。谢谢指导。

其实抓简单的网页不会很难,只有几行命令:
  1.    
  2. import httplib
  3. httpClient = httplib.HTTPConnection('***.***.*.***',80) # ***.***.*.*** is the IP address
  4. httpClient.request("GET", "/newkc/akcjj0.asp?xqh=" + str(semesterID),headers = header)
  5. response = httpClient.getresponse()
    . ----
  6. content = response.read()
  7. httpClient.close()
复制代码
先import一个module httplib,然后建立一个http的连接,content就是纯文本的内容了(含html标签),然后再用regex或者beautifulsoup分析出想要的内容并去除html标签(beautifulsoup没用过,我想大概是这样用的吧),上面是我抓选课记录的部分代码(有些变量之前定义的,这里没有标出来)

用regex的分析程序代码示例:

  1. import re
  2. def parseCourseList(lines):
  3.   
  4.   semesterID = 0. Waral dи,
  5.   for line in lines:
  6.     if re.search(r'\s\d{5}\s',line) is not None:
  7.       semesterID = re.search(r'\s(\d{5})\s',line).group(1)
  8.       break

  9. ......
  10. ......
复制代码
re是python里面正则表达式的module

上面是抓简单网页(静态网页),动态网页麻烦一点,要看post/get的参数。
还有,其实httplib有点麻烦了,抓静态网页urllib2就很好,一两条指令搞掂了

点评

是不是说复杂了额。。。  发表于 2013-12-28 14:20
回复

使用道具 举报

🔗
nibuxing 2013-12-29 01:31:45 | 只看该作者
全局:
EroicaCMCS 发表于 2013-12-28 14:01
其实抓简单的网页不会很难,只有几行命令:先import一个module httplib,然后建立一个http的连接,content ...

没有,不复杂的,我大致明白了,但是具体要做还是一知半解。我去找点书或者网上资料看看。谢谢你!
回复

使用道具 举报

🔗
Ruscello 2013-12-29 03:07:58 | 只看该作者
全局:
小k姐的这个帖子真心好啊!!我一直想要好好学统计,但是很多时候会觉得东西好多、没有方向无从下手。有了这么好的总结,就可以一步步填坑了。向小k姐学习!
回复

使用道具 举报

🔗
 楼主| modifiedname 2014-1-4 12:09:21 | 只看该作者
全局:
上了一些比较实用的C#培训

(为什么要C#是因为跟工作相关)
因为几乎没人第一门编程语言会学C#就造成也咩有什么书是给我这种完全新人看的。
Udacity java起了极佳的开头作用。
然后才能看懂C# from scratch之类培训 sigh. From 1point 3acres bbs

然后终于能看懂别人写的比较复杂的UDT and reducers,自己仿写也开始觉得doable了
自己看懂然后讲给别人听一遍,别人也很高兴. .и

下面任务是UDT+reducer写个颇复杂的regression model and or RM ANOVA fit.
回复

使用道具 举报

🔗
 楼主| modifiedname 2014-1-4 12:12:47 | 只看该作者
全局:
Ruscello 发表于 2013-12-28 14:07
小k姐的这个帖子真心好啊!!我一直想要好好学统计,但是很多时候会觉得东西好多、没有方向无从下手。有了这 ...

加油~~~

开这个帖子也是为了记录自己学习过程,可以清楚的看见是如何一步步从不会到会的!!

回复

使用道具 举报

🔗
xnature 2014-1-5 10:59:51 | 只看该作者
全局:
小K 发表于 2013-12-28 05:27
咱俩水平看来差不多 :P

scrape data 没书教吧

我爬过TripAdvisor的数据,用python和beautifulsoup来爬。beautifulsoup可以使用html marker中的class type id来确定元素非常方便,也可以用css selector爬超级方便,再加上正则表达式。
. check 1point3acres for more.
当然更加专业的使用scrappy,但是调试不大方便,而且一般用与通用爬虫。当然他可以用xpath来找,比如说你看到一个网页上的元素,点一下chrome中的inspect this element,然后右击xpath,粘贴到python代码中就行了,就是不灵活。。。。

评分

参与人数 1大米 +20 收起 理由
EroicaCMCS + 20 受教了!

查看全部评分

回复

使用道具 举报

🔗
xnature 2014-1-5 11:00:28 | 只看该作者
全局:
顺便问统计要学到测度那一套么
回复

使用道具 举报

🔗
askiih 2014-1-7 11:27:41 | 只看该作者
全局:
EE界小方向搞统计的路过。被group 排挤的小方向。。以为是小方向的小方向,原来是多人在学的热门。。。。命运。。。。
回复

使用道具 举报

🔗
dalejace 2014-1-7 12:14:07 | 只看该作者
全局:
多谢k姐!共享这么多好资料!
回复

使用道具 举报

🔗
adamzjw 2014-1-7 21:17:38 | 只看该作者
全局:
挺完整的列表。不过全部都能覆盖的确需要不少功夫。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表