查看: 9714| 回复: 10
跳转到指定楼层
上一主题 下一主题
收起左侧

[干货总结][面试系列文章3] Logistic regression面试常见考点解析

   关闭
全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
这篇文章延续我上一篇在地里的文章 Linear Regression 面试常见考点解析,给大家细致总结 logistic regression相关知识的面试常考点和推荐解答。本文内容纯手打,分享出来希望能和大家一起交流进步。

逻辑回归 (Logistic regression) 是最经典的分类模型,在数据分析和建模领域都有非常广泛的应用。作为一种广义线性模型,logisitic regression与很多机器学习理论知识都有紧密的关联,其中包括我在上一篇文章中讲到的linear regression,以及Generalized Linear Model (GLM) ,softmax regression,neural network 等等。因此,在绝大多数 Data Scientist 和 Data Analyst 面试中,logistic regression都是最重要的理论知识考点。在本文中,我会结合数据岗位面试要求和经典例题给大家精炼梳理logistic regression模型的重要知识点,同时结合它与数据科学领域其他知识点的联系,给大家总结常见面试考点。

1. Logistic Regression概念介绍
我们以一个二分类问题为例,简单回顾一下 logistic regression 的应用场景。以下数据表示某流媒体服务运营商在过去一个季度内,客户月均拨打客服电话的次数 (customer service calls) 与客户在季度末取消订阅行为 (unsubscribe) 的数据关系: .google  и
. 1point 3 acres





Notes 1: 从上述讨论中可以看到,这个 logistic function 的数学形式并非来自于严格数学推导证明,而是出自研究人员结合具体需求的近似构造。这个 logistic function 的数学形式也是后文中我们会讲的 logistic regression assumption的一部分。
. Χ
Notes 2: 这里介绍的从 linear regression 到 logistic regression 的转换思想,也是数据岗位面试的考点之一。常见的面试题目是:解释 linear regression 与 logistic regression 两者的区别和联系。要回答好这个问题,首先可以结合上面几幅图讨论两个模型对 outlier 数据处理的不同效果。此外,可以结合后文会介绍的 Generalized Linear Model (GLM) 内容做细致比较。

现在我们得到了 logistic regression 问题中自变量  与因变量  的概率  之间的关系。下一步,我们需要构造 logistic regression loss function,从而求解函数关系中的未知参数。.--


2. 从两种不同角度理解 Logistic Regression Loss Function
首先,我们沿用在上一篇Linear Regression文章中提到的最大似然估计方法 ( Maximum Likelihood Estimation) ,结合 logistic regression 的概率假设来推导它的 loss function。

Logistic regression的概率分布假设是 [面试常考点]: . .и


基于上述概率分布假设,我们通过以下证明过程 (简化版) 推导出loss function [面试考点]:
. check 1point3acres for more.



Notes 1: 上述对 logistic regression loss function的两个不同角度的讨论,也解释了 cross entropy loss 适用于 logistic regression 问题的原因:cross entropy loss 与 logistic regression 的概率分布假设 (Bernoulli distribution & logistic function) 相对应。

Notes 2: 以上我们给出的利用交叉熵定义列出 logistic regression loss function的过程,是一个简化版的推导过程。它的整个描述思路清晰简单,适合在面试中使用。但如果更严格解释的话,其实 logistic regression 构造 loss function时使用的概念是相对熵 (relative entropy),不是交叉熵。在很多资料中,相对熵又被称为KL散度 (Kullback–Leibler divergence)。但由于交叉熵的数学形式更加简单,且与相对熵在取值上只相差一个常数项,因此在绝大多数资料中,我们利用交叉熵的概念来构造 logistic regression loss function。
.
3. Loss Function数值求解
. 1point 3 acres
.1point3acres

这并不是巧合,而是因为这两个模型都属于Genearlized Linear Model (GLM), 可以被统一的模型框架进行描述,因此它们之间有很多相似的性质。

4. Generalized Linear Model.1point3acres
GLM 涉及的理论内容比较多,且不是面试考察的重点,因此在本文中,我们仅简单介绍 GLM 的一些基本概念,以此解释 linear regression, logistic regression和其他一些广义线性模型 (e.g. softmax regression) 之间的关系。


.

了解了这部分内容之后,我们就可以更好地回答前面提到的面试题:解释linear regression与logistic regression两者的区别和联系。即我们可以从probability assumptions, GLM link functions等角度进行讨论,这样才是最完整的solution,也最能impress面试官。简单地回答“Logistic regression的label是离散的,linear regression的label是连续的”是远远不够的。

5. 总结
Logistic regression 是数据科学岗位面试中最常见的模型理论知识内容,考点涉及到logistic regression model assumption, loss function推导以及它和其他线性/非线性模型的异同点比较。本文结合面试要求的难度把相关常见考点进行了梳理。除了本文涉及到的内容,logistic regression 也与 neural network 的很多基本概念有密切的关系,比如我们可以把 logistic regression 看做one layer neural network (perception)。其他涉及到的知识点还包括Multi-class classification (softmax regression), 以及logistic regression在不同变种形式下的正则化方法 (Regularization) 等问题。这些内容我会在后续的文章中继续讨论。如果大家对于 logistic regression 有任何其他问题,也欢迎在地里的留言区一起讨论。祝大家都能顺利通过面试, 实现职场进阶。. Waral dи,


. 1point3acres.com
-baidu 1point3acres





更多图片 小图 大图
组图打开中,请稍候......

评分

参与人数 19大米 +25 收起 理由
fenger8 + 1 赞一个
GreenHill + 1 谢谢分享!
befong000 + 1 赞一个
无聊小浣熊 + 1 赞一个
zhang.chi1 + 3 很有用的信息!

查看全部评分


上一篇:中小公司做modeling还是去二线tech公司做analytics
下一篇:interviewquery怎么样
推荐
kittycerry 2021-4-20 04:45:23 | 只看该作者
全局:
楼主的文章都是精品!
回复

使用道具 举报

全局:
楼主对 GLM的讨论非常有用~~
回复

使用道具 举报

全局:
楼主又出新文章啦!受益匪浅,感谢!
回复

使用道具 举报

全局:
logistic link function是additive log ratio transformation 的特殊形式,也是很严格的数学推导的😂理论上来说只要可以map0,1的区间到real space就可以。
回复

使用道具 举报

🔗
baobaofeilong 2021-4-20 21:17:47 | 只看该作者
全局:
wstutenny 发表于 2021-4-19 01:56
logistic link function是additive log ratio transformation 的特殊形式,也是很严格的数学推导的&#128514 ...
.
Re这个...  logistic regression并没有假设概率分布一定是0/1 Bernoulli. logit link function在GLM这个framework下可以model 0-1区间的response。就曾经碰到【非科班出身】的面试官非说logistic regression只能model {0,1}, 当时真想翻个白眼...
回复

使用道具 举报

全局:
baobaofeilong 发表于 2021-04-20 06:17:47
Re这个...  logistic regression并没有假设概率分布一定是0/1 Bernoulli. logit link function在GLM这个framework下可以model 0-
应该写得清楚一点是map到0-1的概率区间😂,不是response是0,1。很多面试官确实啥也不懂😂
回复

使用道具 举报

🔗
 楼主| interviewML20 2021-4-21 00:40:07 | 只看该作者
全局:
本帖最后由 interviewML20 于 2021-4-21 00:42 编辑
baobaofeilong 发表于 2021-4-20 21:17. From 1point 3acres bbs
Re这个...  logistic regression并没有假设概率分布一定是0/1 Bernoulli. logit link function在GLM这个f ...

非常感谢你的回复!关于这个问题,我很想和大家细致讨论一下,把知识梳理得更清晰一点。我的理解是:.1point3acres
1)关于logistic regression的定义本身,它可以是binomial, 也可以是multinomial, ordinal。我这篇文章想focus在binary logistic regression上,在文章中我提到了“以二分类问题为例”,但确实没再强调一下定义的范围,需要更新下。在一些教材甚至research paper中,我见到有时候会把logistic regression默认是对应binary logistic regression, 而把multinomoial logistic regression叫做softmax regression. 这可能是有时候面试官认为“logistic regression只能model {0,1}“的原因, 其实我在这篇文章的语境下,也是这样认为的。不过确实可以把multinomial和binomial的情况放在一起讨论,它们对应的link function都是一样的 (logit),而且softmax regression和binary logistic regression的绝大多数数学形式都是对应的,这件事情我打算在下一篇文章中总结一下。只不过在DS/MLE面试中,谈到"logistic regression"这个概念的时候,绝大多数情况下面试官都想讨论binary的情况,考察一些经典机器学习的理论知识,我猜可能是因为对应CTR预测等use case, 很多都是binary的。而如果涉及到multi-class的问题, 一般都是deep neural network的问题了,讨论一下softmax layer或者cross entropy loss等等。.

2)关于logistic regression的assumption. 我这里提的两条是简化版,其他assumption还包括对independency和multicollinearity的一些内容。但是我认为这两条是最重要的,面试中这两条就够了。至于“并没有假设概率分布一定是0/1 Bernoulli”和 “是map到0-1的概率区间,不是response是0,1”。我个人有一点不同看法,希望和你进一步交流下。我认为binary logistic regression中, 是要求(assume) binary response variable的, 即 {0,1}。我认为binary logistic regression的思想是,从Y到p再到x,从event Y到the probability of event happening p, 再到log odds of the probability。好像你的理解是,logistic regression不包括从Y到p的这一步,不过我认为“是否包括这一步”问题不大,只是理解上的区别。但binary logistic regression的assumption里面是要求binary outcome的,在wiki里也是这样说的,最早的paper我找不到了... 如果你有其他参考资料的话,麻烦你把它们推荐给我,我去研读学习下。

3) 留言中有另一位朋友谈到"logistic link function是additive log ratio transformation 的特殊形式,也是很严格的数学推导的",我对这个问题很感兴趣,也放在这里一起说了。就像我在前面提到的,我理解binary logistic regression中,是把probability转换为odds, 再take logarithm,得到了logit的形式。但是这个过程是没有被证明的,比如,为什么一定要用odds? 为什么一定要做log transformation? 因此我认为logit function本身是构造出来的,不是理论证明得到的表达式。如果是的话,那么这个证明基于的assumption是什么?我没找到,可能是我知识水平还不够,如果针对这个问题有paper或者参考资料的话,能否麻烦推荐一下?我仔细研读下。

很开心能和朋友们在地里一起讨论知识问题 :) 希望能和大家一起讨论进步!
回复

使用道具 举报

🔗
 楼主| interviewML20 2021-4-21 00:41:06 | 只看该作者
全局:
wstutenny 发表于 2021-4-19 01:56
logistic link function是additive log ratio transformation 的特殊形式,也是很严格的数学推导的&#128514 ...
.--
非常感谢你的留言!我对这个问题有一点自己的想法,放在上一条留言回复里了。希望得到你的指点。大家一起讨论。谢谢!
回复

使用道具 举报

全局:
请问楼主,你说的softmax和logistic regression形式上都对应是什么意思?我看书上写的公式区别挺大的。。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表