搜出来两个「音乐投稿率」
字节的数据平台团队讲过一个他们自己遇到的事。1有人在内部的指标平台上搜音乐投稿率
,搜出来两个。同名,定义不一样。一个团队算的是这个,另一个团队算的是那个,都叫音乐投稿率。
这事听起来很小。但你想想看,抖音到第 8 课那个阶段,几十个团队,每个团队都有自己的留存、自己的时长、自己的投稿率。两个团队坐在一起开会,一个说我们留存涨了,另一个说我们留存跌了,吵了半天,发现说的根本不是一个东西。第 3 课那道题你还记得吧,两个团队都说 D7 是 40%,一个算的是第 7 天当天回来的,一个算的是 7 天里回来过的。那时候我说第 9 课会讲怎么治这个病。就是现在。
这一课要讲的其实是两件事,合起来就是一个数字怎么才算数。第一件,口径。这个数到底是怎么算的,大家是不是同一个算法。第二件,实验。这个数涨了,是你改的东西起了作用,还是碰巧。
口径:先让大家算得一样
字节的解法,从公开材料看,是两层。机制上,给每个指标定一个负责人,自上而下对齐。比如主端投稿的投稿数
是一个核心业务指标,那影像投稿、图文投稿这些分支,都要对齐到这个投稿数
的口径上去,不许自己另起炉灶。工具上,他们把指标放进一个统一的平台,底下的物理表对业务方屏蔽掉,你看到的就是指标,不用自己去写 SQL 算,也就没机会算错。
这套东西做完以后,他们说的效果是,指标答疑会少了,数据问题少了。我觉得这事真正的价值不在省了几个会,在于它让留存
这个词在整个公司里只有一个意思。
口径不统一的时候,所有对比都是假的。
实验:再证明是你让它变的
这个字节是有名的。内部有一句话,A/B 实验是一种信仰,万物皆可试验
。2字节副总裁杨震原的说法是,A/B 测试代表的是科学决策的理念,能量化评估的目标,就用结果数据去验证。有多信仰呢,给你几个数。
今日头条这个名字,都是 A/B 测出来的。4为什么要这样。因为前八课所有的指标,最后都要回答一个问题,我改了一个东西,它到底有没有用。你改了推荐策略,留存涨了 1%,可能是你改得好,也可能是这周放假了,也可能是别的团队同时上了一个活动。只有把用户随机切成两半,一半用新的一半用旧的,其他条件全一样,那 1% 才能算在你头上。
火山引擎那篇讲增长方法的文章里有几个实验的例子5,挺具体的。今日头条做卸载挽留,测了不同的文案和颜色组合,最好的一组转化率比原来高 57%。一个短视频产品改首页,播放人数翻倍,改引导流,人均播放次数涨 140%。这些数字能说出来,是因为它们是实验里跑出来的,有对照组,不是事后对着曲线猜的。
实验的坑,恰好长在主指标和护栏上
但实验也有实验的坑。第一个坑,主指标太多。你一次实验看 20 个指标,总有几个会因为随机波动而上涨,你挑一个涨的宣布成功,这不叫实验,这叫抽奖。下面这个你自己按几次。
什么都没改,15 个指标里也总有几个「显著上涨」
这是一个对照组和实验组完全一样的实验,改动是空的。每按一次,15 个指标各自随机抖一下。按常用的显著性标准,平均每次会有一两个「显著」。
事先定好一个主指标,它涨了才算。事后从 15 个里挑,是在给噪音找理由。
第二个坑,护栏太松或者太多。太松,实验把别的东西做坏了你看不见。太多,任何实验都过不了,因为总有一条护栏在随机波动。第三个坑,统计显著不等于业务有意义。第 5 课那道题的 C 选项就是这个。涨 0.1%,显著,然后呢。
一次实验同时看了 15 个指标,其中 2 个显著上涨,13 个没变化,团队宣布实验成功。这个判断最大的问题在哪?
B。15 个指标里随机挑出两个显著上涨,本身就在随机波动的范围内,上面那个你按几次就见过了。如果实验开始前定好了主指标是某一个,然后那一个涨了,才能算。事后从一堆里挑,是在给噪音找理由。C 是反的,看得越多,随机撞上的越多。
口径和实验,是一件事的两面
口径解决的是这个数是什么
,实验解决的是这个数的变化是不是你干的
。前者没统一,后者的对照组和实验组用的可能都不是同一个数。后者没做,前者再统一也只能看个热闹,你不知道什么有用。
一个数字要算数,先得大家算得一样,再得能证明是你让它变的。
回到那个音乐投稿率
。搜出来两个同名指标这件事,在字节这种规模的公司里能被当成一个需要专门解决的问题,说明他们到那个阶段已经被这种事坑过不止一次。指标体系长到几十个上百个的时候,最大的敌人不是没指标,是指标太多、各说各话。
这一课,口径统一让「留存」在全公司只有一个意思,实验让涨跌能算在你头上。字节每天新增 4000 个实验、同时跑 5 万个。实验的坑长在主指标和护栏上,事先定一个主指标,事后从一堆里挑等于抽奖。
口径不是指标,是所有指标下面的一层
主指标 · 护栏指标第 7 课的两个词,这课补一条坑
这一课的数字从哪来
- 「音乐投稿率」两个口径、指标负责人制度、统一平台屏蔽物理表:火山引擎 DataLeap 从短视频 APP 实践看如何统一数据指标口径。
- 「A/B 实验是一种信仰,万物皆可试验」、杨震原说法:火山引擎 DataTester 在字节 A/B 实验是一种信仰。
- 240 万次、日新增 4000+、同时运行 5 万+(截至 2023 年 6 月):火山引擎 DataTester AB 测试技术揭秘。2023 年 1 月的材料给的是 150 万次、日新增 1500+,取较新的。
- 今日头条命名是 A/B 结果:InfoQ 字节数据平台九年演进。
- 卸载挽留 +57%、首页改造 +100%、引导流 +140%:火山引擎 字节增长分析与 A/B 实验方法。
- 动手块是纯随机模拟,不是任何真实实验。
现在口径统一了,实验也会做了,指标体系到这里其实已经齐了。但还有一个问题没人回答。这几十个指标,广告和留存打架的时候护栏划在哪,推荐团队该更看重时长还是多样性,这些谁说了算?