楼主: modifiedname
跳转到指定楼层
上一主题 下一主题
收起左侧

Data Scientist 炼成记录-更新完毕2018年12月 | 机器学习练成记录 - 已开新帖

   
🔗
 楼主| modifiedname 2013-12-28 05:00:37 | 只看该作者
全局:
nibuxing 发表于 2013-12-27 15:58
我也正在跟CS61B,上这门课的话我觉得Head first暂时不用看啦,一开始教授会重新讲一点java基础,还是挺好 ...

head first是这课的教材,我从前看过,因为当时没动手编程,觉得记不牢
老师讲基础就太好了
回复

使用道具 举报

🔗
nibuxing 2013-12-28 05:22:35 | 只看该作者
全局:
小K 发表于 2013-12-28 05:00
head first是这课的教材,我从前看过,因为当时没动手编程,觉得记不牢
老师讲基础就太好了
. Waral dи,
python方面,我现在会基本语法和一些算法,也就是上完CS101和CS215,但不知道是不是因为我上得不够仔细,用py去网上取数据这方面没有概念,希望K姐能赐教,书或者相关课程。

第二个问题是,刚来美国四个月,打算开始找实习了,也在慢慢扩充自己的技能,专业是IEOR,并不对口,这对找data scientist方面实习和工作影响大吗。
回复

使用道具 举报

🔗
 楼主| modifiedname 2013-12-28 05:27:45 | 只看该作者
全局:
nibuxing 发表于 2013-12-27 16:22
python方面,我现在会基本语法和一些算法,也就是上完CS101和CS215,但不知道是不是因为我上得不够仔细, ...
. Χ
咱俩水平看来差不多 :P

scrape data 没书教吧. 1point3acres.com
check "visualize this", python beautiful soup 用法
i just googled some "how to" posts 现在access个API啊什么的貌似还没问题
回复

使用道具 举报

🔗
 楼主| modifiedname 2013-12-28 05:28:27 | 只看该作者
全局:
IEOR做 data scientist 挺对口的
回复

使用道具 举报

🔗
nibuxing 2013-12-28 05:29:38 | 只看该作者
全局:
小K 发表于 2013-12-28 05:27
咱俩水平看来差不多 :P

scrape data 没书教吧
. ----
我比K姐你还差得远,还在努力中。谢谢指导。
回复

使用道具 举报

🔗
 楼主| modifiedname 2013-12-28 05:45:21 | 只看该作者
全局:
nibuxing 发表于 2013-12-27 16:29
我比K姐你还差得远,还在努力中。谢谢指导。

我的python的确也就是学了这么几门课 :D

scrape数据,给你个小练习做:
http://www.1point3acres.com/bbs/thread-79211-8-1.html

(exercise on py beautifulsoup and regex)
回复

使用道具 举报

🔗
LIIIIIIING 2013-12-28 11:46:22 | 只看该作者
全局:
正在上ba的课程,但是觉得需要自己自学的东西太多,这贴正好给我参考用!感谢!
回复

使用道具 举报

🔗
EroicaCMCS 2013-12-28 12:33:29 | 只看该作者
全局:
本帖最后由 EroicaCMCS 于 2013-12-28 12:39 编辑
小K 发表于 2013-12-28 05:45
. .и我的python的确也就是学了这么几门课 :D. .и

. scrape数据,给你个小练习做:

K姐,请教几个抓数据的问题:

1 我抓网页一般用py httplib/urllib2 + regex,没用过beautifulsoup。想问下beautifulsoup的好处是不是仅仅是可以生成一个有结构的对象?还是有其他很好的feature?. check 1point3acres for more.
感觉自己用regex写抓的很准但是麻烦,用现成的类库又多了太多无用信息了。。

2 遍历一个网站(比如说抓取某个版的所有页面),我只能自己分析底层的post命令的规则(比如说url里面page=1,page=2,etc),还是说有别的更好的方法?.
一层一层的爬虫抓太多无用信息了,而自己写每一个网站都略不同又太麻烦了。。。
-baidu 1point3acres
自己到处看博客学的,走了很多弯路,求指教~~

BTW, thanks for sharing!又发现D3这种好东西!. ----
回复

使用道具 举报

🔗
 楼主| modifiedname 2013-12-28 12:50:33 | 只看该作者
全局:
同走弯路。
我对scrape web data其实没有太多经验
我想取决于你要抓取什么数据?
visualize this里面的例子是上天气网站抓取过去今年每天气温,你可以想象抓完后应该是个一列或者至少一个矩阵形状的数据

coursera例子是get twitter data, get location, time etc and do some analysis. 1point3acres.com

楼上说的相互寄贺卡,是需要取出某个regex pattern的楼层和id值然后randomize.--

不过话说回来这些我自己很少用到,我常做的是去某web app收集的数据里面取出近期数据进行分析或者读写,比如我常用的效率软件rtm, toggl gmail gcal, douban,这些都有现成api 比较容易弄整齐。

以我目前的程度,说不清两者区别叫什么。。。= =

评分

参与人数 1大米 +50 收起 理由
EroicaCMCS + 50 太感谢了~~

查看全部评分

回复

使用道具 举报

🔗
EroicaCMCS 2013-12-28 13:41:02 | 只看该作者
全局:
本帖最后由 EroicaCMCS 于 2013-12-28 13:47 编辑
小K 发表于 2013-12-28 12:50
同走弯路。
我对scrape web data其实没有太多经验. .и
我想取决于你要抓取什么数据?

有api就很方便了
最近抓的是学校的选课数据 还有体育数据(sina,opta). 1point3acres
这些都没有api的T^T。。。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表