查看: 3560| 回复: 4
跳转到指定楼层
上一主题 下一主题
收起左侧

讨论一道面试题

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 datascientist 于 2014-3-24 10:00 编辑

关于R的,给某一年的1000支股票的每日交易量,和收盘价。想找这样一个回归函数
.
今日收盘价=f(昨日开盘价,昨日收盘价,昨日成交量)

有下面一些想法,抛砖引玉,欢迎大家讨论:

. Waral dи,
把大约1000*270条数据放一起做回归感觉不靠谱,有的股票六七百块一股,有的股票才不到一块钱一股。
把每个股票都scale一下,然后还是把1000*270条数据放一起做回归。
每个股票单独做回归
把股票分类,然后每一类都做一个回归,怎么分类?
分红,突发信息等引起的突然估价变动,要不要作为outlier除去?咱们就不要去考虑去网上找这些分红等信息了,就用给的每日交易量,和收盘价做。


上一篇:分享个MIT big data 的slides,对新手很有帮助
下一篇:Earth Science的PhD有转data scientist的可能吗

本帖被以下淘专辑推荐:

推荐
Superlaw 2014-3-25 08:31:57 | 只看该作者
全局:
回归之前肯定是要做一个outlier去除的,以防影响回国的质量。
题目好像是把所有的数据放在一个回归方程中,我觉得应该是将1000*270条数据放一起做回归。

如果是1000支,每一类都做一个回归方程,题目的原意不是这样的,你说题目是找一个回归函数。

如果是分类的话,那要涉及到segmentation,做segmentation是非监督分类,涉及太多人为控制的因素。

回复

使用道具 举报

🔗
modifiedname 2014-3-26 02:48:28 | 只看该作者
全局:
单只股票的价格across days是correlated,起码要考虑这一点吧。哪怕假定股票之间相互独立。
scaling对影响coefficient大小但是对model fit, stat inference毫无影响。. check 1point3acres for more.

不能去除outlier吧。。。

random intercept random slope model?

统计里面好像用其他办法,不过也许可以cross validation看看predictive power?
回复

使用道具 举报

🔗
wesley 2014-3-27 11:46:02 | 只看该作者
全局:
同意楼上K大妈的观点,应该单只分析
outlier 首先要找到outlier, R里有函数可以很容易的找出outliers, most influence observations, 然后去一个一个的分析如何处理outlier,这里最好是有domain knowledge, 而不是直接全部删掉
对于股票不太懂,但是一个简单的办法是将现有数据分成三块,train, test1,test2, 用step-wise lm 在train上求出模型,再用test1检验,检验predictive power,然后如果不好,再用train重新建模,iterally, 最后的模型再放入test2去检验,此时test2从未被用作计算过
如果数据充足,还可以试试 Cross-validation 以上都可以用R里现成的公式搞定
不过还得看具体的数据去分析,有的数据有很强的自身特点,比如季节性,非常不适用于lm,这时候可以用local linear regression
回复

使用道具 举报

🔗
hayesses 2014-7-30 22:37:41 | 只看该作者
全局:
方差相近的股票为一组吧,如果用线性回归的话。
其实最好的还是要用业务逻辑来进行分类,比如板块类别( 石油, 房地产, 煤矿等)。这样才是最有代表性的。
另外,介于股票的价格存在数量级上的差别,可以用对数化进行处理,减少异方差。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表