查看: 8684| 回复: 5
跳转到指定楼层
上一主题 下一主题
收起左侧

请教一下AB test sample size的问题

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
先谢谢大家了。周末复习AB test明白了个七七八八,但是有件事情一直没搞懂。就是effective diff, 就是说只有在experiment group 对KPI的lift超过这个阈值的时候才lunch.

首先我的理解是,sample size的确定是为了控制Type 1, type 2 error, 即对control group来说有足够大的significance level, 对 experiment group 来说有足够大的power. 而根据我的理解,N 的作用就是通过缩小sample mean的standard deviation来减小两个group 的sample mean distribution. 而N的算法刚好就是 control mean distribution的alpha = experiment mean distribution的beta. 通过等式miu_0 + z0*population_std/sqrt(n) = miu_1 - z1*population_std/sqrt(n). 来算出N,
.
这里我的问题有两个,1. effective diff是不是就是用来算miu_1的。miu_0 + diff = miu_1
2. 因为要算N,那似乎N就假设是一样的。可是在A, B 百分比不同的时候怎么算。是不是取小的那个N?
..
如果我的理解有错误还请帮忙指出。thanks again!

评分

参与人数 1大米 +1 收起 理由
xiayu64 + 1 很有用的信息!

查看全部评分


上一篇:新人, 求DS的course, website , book
下一篇:Ads Data Scientist 求推荐reading list
推荐
Awe129kkk 2019-12-10 03:14:18 | 只看该作者
全局:


楼主,看看这个帖子 https://zhuanlan.zhihu.com/p/40919260。讲了估计样本的四个参数。这四个参数是和Type One和Type Two Error有关系的。
. Waral dи,
下面是我复制粘贴的,但是强烈建议去看看这篇文章。
. check 1point3acres for more.
这个计算器需要 4 个输入。有了这四个输入,就一定能够算出所需样本量。这四个输入分别是:

Statistical power
Significance level. Χ
Baseline rate
Minimum detectable effect
. Χ

Statistical Power 和 Significance Level
要搞清这两个概念,我们应该先简短回顾一下 A/B 实验的基本知识。 ..

首先,A/B 测试包含两个假设:

原假设(Null hypothesis, 也叫 H0):我们希望通过实验结果推翻的假设。在我们的例子里面,原假设可以表述为 "红色按钮和绿色按钮的点击率一样"。. ----
备择假设(Alternative hypothesis, 也叫 H1):我们希望通过实验结果验证的假设。在我们的例子里面,可以表述为 "红色按钮和绿色按钮的点击率不同"。
.
由于判断错了,我们把这类错误叫做第一类错误(Type I error),我们把第一类错误出现的概率用 α 表示。这个 α,就是 Significance Level。

在商业背景下,第一类错误意味着新的产品对业务其实没有提升,我们却错误的认为有提升。这样的决定,不仅浪费了公司的资源,而且部分人得到了不应得的奖励。

在非商业背景下,第一类错误往往更加可怕。比如好人被判刑进监狱,健康人被误诊送去化疗。
.
所以,在做 A/B 测试的时候,我们希望第一类错误越低越好。实际操作中,我们把 α 人为定一个上限,一般是 5%。也就是说,在做实验的时候,我们都会保证第一类错误出现的概率永远不超过 5%。

我们的判断又错了。这类错误叫做第二类错误(Type II error),用 β 表示。根据条件概率的定义,可以计算出 β = 1 - power。

总结一下,对于我们的实验:

第一类错误 α 不超过 5%。也就是说,Significance Level = 5%。
第二类错误 β 不超过 20%。也就是说,Statistical Power = 1 -β = 80%。 ..


对两类错误上限的选取(α 是 5%,β 是 20%),我们可以了解到 A/B 实验的重要理念:宁肯砍掉 4 个好的产品,也不应该让 1 个不好的产品上线。

Baseline Rate
这个看的是在实验开始之前,对照组本身的表现情况。在我们的实验里,baseline 就是红色按钮的历史点击率。从直观上我们可以这么理解 baseline:

当 baseline 很大(接近 1)或者很小(接近 0)的时候,实验更容易检测出差别(power 变大),如果保持 power 不变,那么所需要的样本数量变小。举个例子,假设红色按钮的点击率是 0%。那么,哪怕绿色按钮只有一个用户点击,相对于对照组来说也是挺大的提升。所以即便是微小的变化,实验也会更容易地检测出来。
同理,当 baseline 居中(在 0.5 附近徘徊)的时候,实验的 power 会变小。

在工作中,这个参数完全是历史数据决定的。在我们的实验中,我们假定,实验开始之前的历史点击率是 15%。所以 Baseline Rate=15%。. ----

Minimum Detectable Effect
顾名思义,这个参数衡量了我们对实验的判断精确度的最低要求。

参数越大(比如 10%),说明我们期望实验能够检测出 10% 的差别即可。检测这么大的差别当然比较容易(power 变大),所以保持 power 不变的情况下,所需要的样本量会变小。 ..
参数越小(比如 1%),说明我们希望实验可以有能力检测出 1% 的细微差别。检测细微的差别当然更加困难(power 变小),所以如果要保持 power 不变的话,需要的样本量会增加。. Χ

在工作中,这个参数的选定往往需要和业务方一起拍板。在我们的实验中,我们选定 Minimum Detectable Effect=5%。这意味着,如果绿色按钮真的提高了点击率 5 个百分点以上,我们希望实验能够有足够把握检测出这个差别。如果低于 5 个百分点,我们会觉得这个差别对产品的改进意义不大(可能是因为点击率不是核心指标),能不能检测出来也就无所谓了。
. Waral dи,

评分

参与人数 2大米 +2 收起 理由
Mitchie117 + 1 给你点个赞!
xiayu64 + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

推荐
Awe129kkk 2019-12-10 03:27:05 | 只看该作者
全局:
对了楼主,这个文章也很有用。

. From 1point 3acres bbshttps://jeffshow.com/caculate-abtest-required-sample-size.html。A/B 测试系列文章之怎么计算实验所需样本量
回复

使用道具 举报

🔗
goodgoodluck888 2019-12-12 04:09:42 | 只看该作者
全局:
请问楼主面了吗,可以加个微信聊一下吗,lxx97225
回复

使用道具 举报

全局:
想问问lz复习ab testing用到了什么材料
回复

使用道具 举报

🔗
wujiayikelly 2021-1-3 14:43:04 | 只看该作者
全局:
Awe129kkk 发表于 2019-12-10 03:27
对了楼主,这个文章也很有用。
. .и
https://jeffshow.com/caculate-abtest-required-sample-size.html。A/B  ...

谢谢,这个帖子总结的很棒,因为那个online calculator都不给出公式。虽然我用了这个帖子的公式还是对不上udacity final project的答案。。。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表