楼主: seboy
跳转到指定楼层
上一主题 下一主题
收起左侧

Facebook Data Scientist Analytics 电面

 
🔗
dmindemon 2020-7-6 12:02:29 | 只看该作者
全局:
感谢分享。我来答一下自己的思路。
关于two sample proportion test:
. Χ
  • 有一个前提条件就是,n*p >= 10 or 5.  面试给的两个样本,第一个不满足这个条件(np=1),所以可以被认为sample size不够我们做出合理的结论。公式就是算Pool proportion; 然后根据Pool proportion算SE。
  • 在满足上面条件的情况下,假如p1=p2, t value 就是0,我们的confidence level是100%。几乎可以说这俩一样了。

用什么metrics比较两个Algorithm?.
首先这是一个找metrics的题,其次这是可以延伸到AB testing的题。先说找metrics。最重要的是理清楚我们的Goal。
  • 我们的Goal并不是要用户尽量答完,我们的Goal其实是让我们的题尽量让更多的用户答道。因为做survey的目的是了解客户需求,获得我们需要的信息改进产品。当然是我们的问题被多少人答道比较重要。所以这里我们不可以用答题率。另外我们也不能用答题总数,假如一个算法答题总数大于另一个,但是大部分都集中在简单的题,那其实意义不是很大。所以我们需要一个metrics能告诉我们题库里的题有没有大部分都过一个我们需要的threshold。
  • 找Threshold:以统计学采样的角度考虑,我们需要的significant level,可能sample size 100 就足够,有些qualitive research说30个问答足以。这里可以延伸出sample size的问题。取决于我们的effect size,sensitivity,standard error,alpha。像survey这种就是取决于你的population size,和marginal error。具体数学算法我还不太懂。看到网上说,一个marginal error的estimate是1/sqrt(N),所以sample size 100 就会给你10% marginal error. 另外一个网络资源你说可以用这个公式:n = N / (1 + N*e平方) 。N是总population数,e是p-value,我们可以去0.05。第二个比较靠谱,但是如果不记得可以说,有一个公式,不太记得,但是可以用第一种方法初略estimate,但是有很多tool可以算。
  • 另外,进一步考虑,我们希望问题可以被不同的人群答到。我们可以给我们的pariticipant做一个clustering模型,分几类大组(根据我们关心的feature,比如年龄,工作);然后每个组都可以出一个Metrics。对于我们每一个survey题我们应该给不同的weight给不同的组。比如有些题我们更关心年轻人怎么想,就把对应年轻人cluster的metrics 算一个大一点的weight。最后我们可以求一个weighted average 作为最终衡量算法的metrics


接下来就到了AB testing的问题。很典型。
  • AB是比较容易独立分出来的吗?是的,这种survey,我们只要按user level分的话,AB是可以独立的。不太会有人交流说,我昨天填了个survey怎样怎样。另外可以提,即使按照session分ab也是可以的,因为这种ranking 算法的变化,大部分看不出来。比如news feed recommendation算法变了,你是看不住来的。但是也有大前提是,我们可能不会给同一个人发两份survey:因为首先问题会重复;另外即使不重复,这样不太好,会让我data有bias;最后,这样可能影响这个人的engagement,不一定是好事,所以能避免就避免。
  • 选择control variable(Demographic,behavior,membership, location,language...)。用correlation test。尽量让ab相似。选择一个稳定的subset of population做AB,这样我们的goal metrics 本身的variablility就比较好控制。另外考虑seasonality影响。去掉用户中的outlier,
  • Sample size要多少足够。这个就有标准答案,不多说了。
  • 做完test最重要的一步sanity check:所有control variable 没变化,  Population metrics没变化。
  • Novelty affect就不用check了,因为每个人我们只发一次。
  • 如果结果significant,那我们可以扩大我们的test,继续

-baidu 1point3acres
回复

使用道具 举报

🔗
dmindemon 2023-10-23 11:57:00 | 只看该作者
全局:
1. How do you evaluate which question is best answered 里面统计学的two sample proportion,给的sample size 太小了。这会导致Power很低或者MDE很高。很明显,需要更多Sample才能决定有没有不同。Size = 16*Var / MDE **2 记住这个简化公示。如果MDE是0.1, 那么需要的各个group的Sample是288.

3. Given different algorithms of ordering survey questions, how do you evaluate which one is better? What metrics do you use?
这是在考如何设计Metrics。目的是为了衡量Algorithm好坏. Χ
- Driver Metrics: Most correlated to the Facebook Goal. # Total Answered Questions
- Supporting Metrics: Submit rate%; Session Time Average
- Guardrails Metrics: Distribution of Question answered; Survey Rating if available

4. Can you think of a way to optimize your metric?
AB testing, casual inference. Regression analysis of different possible features to # of answered.
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表