|
|
注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
本帖最后由 xfsgldd 于 2021-7-2 06:47 编辑
这个帖子专门讨论logistic regression的方方面面。
说logistic regression, 最好先说一个概率分布----Bernoulli分布。Bernoulli分布很好理解,做一次试验(比如在某一个星期追一个喜欢的人,表白成功的概率是p,则不成功的概率是1-p。为了可以做大量独立重复试验,假设我们喜欢的这个人的记忆时间长度为一个星期。这周一表白成功的概率是p,下周一再表白,成功的概率还是p,这个人对追求者的喜恶程度不增也不减。) 为方便量化研究,引入随机变量X,如果表白成功,则X=1, 否则X=0. 那么我们有 Probability(X=1)=p, Probability(X=0)=1-p. 那这个随机变量的期望是 E(X)= 1*p + 0*(1-p) = p。
为什么我们要这么啰嗦地引入这个众人皆知的简单随机变量及其概率分布呢?
因为用这样一个随机变量来描述logistic regression问题里面的y (通常用logistic regression来做binary classification问题(当然也可以推广到多个class的分类问题),所以y为0或者1),可以让我们把自己置身于statistical inference的mindset里面去。statistical inference是个发展成熟的领域,我们得向他们看齐,熟悉他们的行话,熟悉他们的“艺术”(statistcs既是一门科学,也是一门艺术)。这点对转行做data scientist的人来说容易被忽视,因为这个模型乍一看很简单明了,我们会觉得我们不需要用statistical inference的语言来说这个模型。
logistic regression模型是说用 1/(1 + exp(-X*coef + intercept)来近似X=1的概率,然后用MLE方法来得到coef和intercept (方法可以是New-Rapson或者gradient descent)。
这一步我们容易不去想的一个问题是:它和linear regression的第一步(Y = a + X b + epsilon)有什么区别。有一个区别是 p = 1/(1 + exp(-X*coef + intercept) 里面看不到有随机项, 而linear regression里面是有的,为什么?因为logistic regression其实也是和linear regression一样的思路,就是认为 E(Y) = 1/(1 + exp(-X*coef + intercept), 是直接描述E(Y)了, 而linear regression的好多材料都会先说用a + X b + epsilon描述Y,进而对E(Y)的描述自然而然就是E(Y)=a + Xb。这一点看起来很简单,说这点显得多余,但是有的初学者一开始没有注意到这点的话,当后面就不容易意识到这一点了。有的面试官会问这个知识点,转行的data scientist有时候容易被这么个简单的问题问住。
|
上一篇: 有没有小伙伴想一起组队kaggle下一篇: 关于machine learning and object detection, 有什么你认为必须好的公开课或者书么?
|