活跃农民
- 积分
- 992
- 大米
- 颗
- 鳄梨
- 个
- 水井
- 尺
- 蓝莓
- 颗
- 萝卜
- 根
- 小米
- 粒
- 学分
- 个
- 注册时间
- 2019-10-23
- 最后登录
- 1970-1-1
|
really exciting to see this post, wanna build something extra on your answer(随便写写,别当真了).google и
这个朋友的问题是:如果abtesting p value稍微大于0.05或者正好等于0.05, 怎么抉择怎么解释。 这种题怎么答?. ----
应该从1)数据模型本身,2)商业business application and decision,两个方面来回答,您刚刚说的是1)数据层面的trade-off,我加一点商业的理解
这个最重要的context就是这个是一个什么样的business model,2b, 2c, social, saas, or e-commerce? ab测试最终的目标是为商业模式做决策和服务
假设p-value是擦边球0.05,这个时候要看数据波动性,standard deviation,把user的各种metrics给plot出来,看distribution的峰值,为什么这么说呢,因为数据波动大的,说明这个版本的customer体验是不均衡的的,波动小的,说明几乎所有人的体验都差不多,换句话说,波动和峰值小,对于一个business来说,你的risk是更小的,这样对于后续的personalization, precise targeting和customer segmentation都会有作用得多,所以说clarify context很重要,因为对于不同的business model,risk tolerance是不一样的
所以说,第一个要明确的是,如果这类情况发生,结合其他用户数据来选波动小的那个版本
我认为比较好的回答顺序和样本应该是,欢迎指正
1 clarify business context,赚钱公式是什么
2 在customer journey,或者是funnel的哪一环做的测试
3 基于什么样的assumption做的假设(用户价值)
4 除了看testing metrics的p-value,还要看其他metrics,例如invariant(neutral的不应该变的),guardrail(反指标)
5 继续看following后续的conversion(一般来说,ab测试测不出中长期最后的purchasing conversion,可以基于历史数据用一些estimation和proxy)
6 有条件看看之前历史上有没有基于此assumption做过类似的ab测试,结果是什么(注意customer base在公司成长过程中的变化)
7 最后decision launch or not launch,并且说明launch的potential benefit和risk,不launch的gains和损失
我认为只有这么做才是榨干一个测试的价值
另外在工作中,很多情况下,p-value<0.05,我们也没有上线过,p-value>0.05的时候也上线过产品
ps:我之前也写过很长的面经,欢迎点评交流一下
https://www.1point3acres.com/bbs/thread-587908-1-1.html
补充内容 (2021-1-24 05:46):
我刚刚发现这个楼主是个求职培训卖课的,我的文字你看到有用我很高兴,想申明一下我在我一亩三分地的热帖里面无意看到这个帖子,我从来不认识这个楼主,没有任何利益联系,我的评论也不是给这个楼主站台或者是写软文
补充内容 (2021-03-21 06:02 +8:00):
我就说谁会跟我一样那么蠢无聊时免费在一亩三分地上面给别人答数科的题,结果果然是个卖课的,笑笑就好 |
|