楼主: 匿名
跳转到指定楼层
上一主题 下一主题
收起左侧

AB testing面试题请教

 
🔗
wujiayikelly 2021-1-12 02:50:36 | 只看该作者
全局:
不能,如果你需要10天跑完,每一天的alpha是0.05,10天下来总的false positive rate = 1-(1-0.05)^10,远远大于0.05

看书里说一个比较形象的example是篮球比赛,总共需要打四场才能判断胜负,不能说打完一场我们队赢了就结束吧 :)

评分

参与人数 1大米 +1 收起 理由
czhmily + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
包子 2021-1-13 14:59:21 来自APP | 只看该作者
全局:
wujiayikelly 发表于 2021-01-11 10:50:36. ----
不能,如果你需要10天跑完,每一天的alpha是0.05,10天下来总的false positive rate = 1-(1-0.05)^10,远远大于0.05
. From 1point 3acres bbs
看书里说一个比较形象的examp
这个的前提是每天都看一遍吧
回复

使用道具 举报

🔗
包子 2021-1-13 15:06:44 来自APP | 只看该作者
全局:
icesample 发表于 2021-01-11 08:34:15
. 1point3acres.com 你好,我明白你说的点。我的想法是,如果一周时间p value <5%, 这个时候sample size 只是一半,type 2 error 高,但是type I error 低(?),reject n
我其实也想不明白这点,跑了一半时间发现pvalue非常小,但是power还没到80%。 我能想到的一种解释是这个时候null hypothesis 和 alternative hypothesis 的distribution 重叠很多,所以即使pvalue 很小的情况下,这个观察到的差异来自alternative hypothesis 的概率也偏小,所以需要更多的sample 来减少std, 从而两个假设的distribution 分得更开,得到的结果更可靠?
回复

使用道具 举报

全局:
pm让你停经常不是统计的问题吧 是产品和business上的考虑吧 这产品测出去上了新闻被狂喷之类的
回复

使用道具 举报

🔗
包子 2021-1-13 15:15:55 来自APP | 只看该作者
全局:
包子 发表于 2021-01-12 23:06:44
我其实也想不明白这点,跑了一半时间发现pvalue非常小,但是power还没到80%。 我能想到的一种解释是这个时候null hypothesis 和 alternative hypothesis 的
不是alternative hypothesis 的distribution 是desired lift的distribution
回复

使用道具 举报

🔗
Chaos7 2021-1-15 02:32:50 | 只看该作者
全局:
如果单单是针对p-value的调整的话, 一个建议是可以参考下 Bonferroni correction controls 和 Benjamini-Hochberg correction controls
回复

使用道具 举报

🔗
wujiayikelly 2021-1-16 03:53:02 | 只看该作者
全局:
包子 发表于 2021-1-13 14:59
这个的前提是每天都看一遍吧

一样的,那你一周就是1-(1-0.05)^2
回复

使用道具 举报

🔗
icesample 2021-1-16 06:15:15 | 只看该作者
全局:
包子 发表于 2021-1-13 15:06
我其实也想不明白这点,跑了一半时间发现pvalue非常小,但是power还没到80%。 我能想到的一种解释是这个时 ...

谢谢分享。。。
回复

使用道具 举报

🔗
yyviolin 2021-11-28 11:42:30 | 只看该作者
全局:
wujiayikelly 发表于 2021-1-11 13:50
不能,如果你需要10天跑完,每一天的alpha是0.05,10天下来总的false positive rate = 1-(1-0.05)^10,远远 ...
.--
你说的这个情况我存疑,你说的是Multiple Testing Problem。照你这么算,跑20天,type 2 error岂不是更大了。。。
回复

使用道具 举报

🔗
yyviolin 2021-11-28 12:08:24 | 只看该作者
全局:
ZeZheng 发表于 2021-1-10 14:18
一般做ab test都是根据想要达到的statistical power,一般是0.8,来计算一个sample size,然后用sample siz ...

我认为说反了,early stopping will increase false positive rate which is equivalent to setting an overall higher α.
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表