查看: 3180| 回复: 8
跳转到指定楼层
上一主题 下一主题
收起左侧

linear regression模型专题研究,尽量覆盖该模型的方方面面

 
全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由 xfsgldd 于 2021-7-1 00:16 编辑

转行做的data scientist,会调包做machine learning,想进一步熟悉各种算法的细节。
linear regression看起来简单,其实有很多细节问题可以问。
总得来说我感觉需要有一个“statistical inference”的mindset,才会有意识地去了解linear regression模型的细节。

Linear regression 模型可以先从如下两个角度看:

1. 认为linear regression就是一个函数近似问题。有(Y,X),拟合一个线性函数 a + Xb 来近似Y。方法就是大家熟悉的least squares。
这里面没有任何统计概念,没有随机变量,没有概率分布,没有统计推断。

2. 认为Y是随机变量,X不是随机变量。Y服从正态分布N(a+Xb,sigma),也就是说E(Y)=a+Xb。然后用MLE方法得到a,b,sigma的估计,以及对应的概率分布(a,b,sigma的估计依赖于X,所以他们也是随机变量,所以他们有概率分布)。从这个角度看,有很多统计推断的知识点(无偏估计,区间估计,t-test,F-test,confidence interval,prediction interval,等等,将在贴中详细讨论)。



补充内容 (2022-01-02 07:14 +8:00):
Linear regression模型的假设条件是什么?应该怎么理解?

写了一个latex PDF文件,但是帖子里没法展示。用github可以看到:
https://raw.githubusercontent.co ... %9D%A1%E4%BB%B6.pdf

评分

参与人数 5大米 +5 收起 理由
verne91 + 1 很有用的信息!
森野夜 + 1 赞一个
table42please + 1 赞一个
ToadTheElder + 1 赞一个
lalala1013 + 1 赞一个

查看全部评分


上一篇:请问国内4年经验的推荐算法工程师如何在美国找mle的工作?
下一篇:有没有小伙伴想一起组队kaggle
推荐
dbox2000 2022-2-19 00:27:48 | 只看该作者
全局:
谢谢楼主的回复!恩我的blog里( https://bit.ly/3Bvkyb3 )写了optional的原因,但是没有写其他非ordinary linear regression的情况,不过面试一般不考更复杂的内容了。
回复

使用道具 举报

推荐
 楼主| xfsgldd 2021-7-1 13:06:47 | 只看该作者
全局:
本帖最后由 xfsgldd 于 2021-7-1 13:32 编辑

谢谢各位贴主加米!咱们大家一起讨论,把linear regression模型分析彻底,知识点不留死角。

先从least square方法开始。有一个问题是假如predictor variables里面有某些变量有线性相关性,会有什么现象发生?

简单举个例子,假如我们现在有两个predictor variables,x1, x2, 并且他们之间有线性关系x2=c*x1. 假如我们有两个数据点(x11, c*x11, y1), (x21, c*x21, y2),则我们有model/design matrix  T=[[1, x11, c*x11], [1, x21, c*x21]], 那么 T'T = [[1, x11+x21, c*(x11+x21)], [x11+x21, x11^1+x21^2, c*(x11^1+x21^2)], [c*(x11+x21),  c*(x11^1+x21^2), c^2*(x11^1+x21^2) ], 可以看到T'T矩阵的第三列等于第二列乘以c,就是说他们线性相关了 (大家手动推导一下写成方阵形式看起来更清晰)。后果是什么?后果是T'T这个矩阵不可逆了。

我们知道least square方法是解线性方程组 T'T *coef = T'y (coef表示模型的系数,包括intercept)。 矩阵T'T现在不可逆了,该线性方程组的解就不唯一了。那么模型的系数coef就不唯一了。

需要注意的是对T'T *coef = T'y,我们应该倾向不要把它写成 coef  = 逆(T'T) T'y, 因为实际应用中不会去把矩阵的逆直接算出来,我们需要的只是coef,所以只要用迭代法把coef的近似解得到就行了。线性代数里面有许多解线性方程组的迭代法,这些方法的准确度依赖于 T'T 的性质,T'T 如果是不可逆矩阵或者很接近于不可逆的矩阵,那么这些迭代法的解不会很准确。
有个概念叫做矩阵的“伪逆”,我不知道各种软件(R,python等)是不是在 T'T几乎不可逆的情况下用矩阵的“伪逆“,那我们需要考虑一下用“伪逆“得到的解有什么性质,对我们的具体问题还有没有价值?


回复

使用道具 举报

全局:
给楼主加米点赞!期待分享
linear regression虽然很重要却经常被忽略
回复

使用道具 举报

🔗
 楼主| xfsgldd 2022-1-2 06:46:40 | 只看该作者
全局:
本帖最后由 xfsgldd 于 2022-1-1 17:12 编辑

linear_regression_假设条件.pdf (65.54 KB, 下载次数: 17)

Linear regression模型的假设条件是什么,应该怎么理解?

可以通过github直接打开看到:
https://raw.githubusercontent.co ... %9D%A1%E4%BB%B6.pdf




回复

使用道具 举报

🔗
 楼主| xfsgldd 2022-1-14 10:08:11 | 只看该作者
全局:
Miao_Techie 发表于 2022-1-12 17:53
谢谢楼主的分享,很有帮助中!我之前也写过一个关于linear regression面试问题的思考

谢谢你的这个blog,写得非常详细!我同意你说的这一点:
”(Optional) The error term  ϵ follows a normal distribution with mean zero and constant variance“
这个确实可以是optional的。只是有了这个假设之后,最大化likelihood函数就等价于最小化least squares(这一点层主的blog里写的很清楚)。如果我们假设误差项服从其他的某种分布,那么likelihood函数就是其他的一个模样,最大化这个likelihood函数可能就不是那么容易(没有解析解)。
还有一点就是,基于error term normal distribution假设的MLE能提供针对error term variance的估计,可惜这个估计不是无偏的,所以不怎么被提及。
回复

使用道具 举报

🔗
20220202 2022-2-19 04:23:00 | 只看该作者
全局:
xfsgldd 发表于 2021-6-30 23:06
谢谢各位贴主加米!咱们大家一起讨论,把linear regression模型分析彻底,知识点不留死角。

先从least s ...

T'T就是X 的covariance ,如果不可逆一般用SVD 找到非零eigenvalue 对应的本征向量,来代替原来的x1,x2... 完全相关是理想状态,真实数据肯定有noise 所以covariance 不太可能rank defficient
回复

使用道具 举报

🔗
ruiweru76 2022-3-10 11:33:21 | 只看该作者
全局:
dbox2000 发表于 2022-2-18 08:27
谢谢楼主的回复!恩我的blog里( https://bit.ly/3Bvkyb3 )写了optional的原因,但是没有写其他非ordinary ...

谢谢分享
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表