总有一个

整体没差别。按国家拆开看,有一个国家「显著提升」。

你没有做一次实验,你做了二十次。 按国家拆、按套餐拆、按设备拆、按注册月份拆 —— 每拆一刀, 就多给噪声一次机会去凑出一个赢家。

在常用的门槛下,二十个分组里至少冒出一个「显著」的概率是 64%, 而且平均会冒出一个。所以「我们发现新加坡的用户特别喜欢这个改动」这句话, 在你什么都没改的时候,也会照样出现。

拆几刀,就有多大概率捡到假的

下面这组模拟里两边真实比例完全一样, 所以跑出来的任何「显著」都是假的。唯一的变量是你拆了几组。

它不知道的事

它假设这些分组是事先定好的。要是你先看了结果再决定按什么拆, 那实际的分组数远不止屏幕上这些 —— 你心里试过的每一种拆法都算一次, 而那个数没人记得住。这种情况下任何校正都不够。

它也假设各组之间大致独立。同一批用户按两个高度相关的维度拆两遍, 不等于两次独立的机会,校正会偏保守。这不算错,但要知道。

这里有 p 值,是这一页唯一的例外 —— 所有的多重比较校正都定义在 p 值上, 不算它就没法演示「看二十次」对它做了什么。每个 p 旁边都放着区间, 所以它永远不是屏幕上唯一的东西。想只看区间不看 p,隔壁是 够了没

贴进来的东西只在这一次请求里存在:不写盘、不记日志、不发给任何人。