两条视频,你信谁
哪条更好?只看完播率,A 赢。只看播放时长,B 赢,24 秒对 5 秒。只看互动,B 赢。你要是算法,你信谁?
这个问题我第一次认真想的时候,发现它没有答案。不是我没想出来,是它本来就没有一个单一答案。任何一个用户行为,都不能完整代表喜欢
。
每一个行为都带偏差
所以成熟的推荐系统走到某一天,一定会放弃找一个最好的指标
这个念头,转而同时看很多个,让它们互相校正。这就是多目标优化。
抖音和 TikTok 自己怎么说
抖音 2025 年 3 月在安全与信任中心第一次公开了算法原理1,说的就是这件事。原话大意是,推荐系统现在几乎不依赖给内容和用户打标签,而是通过神经网络直接预估每一个用户对每一条内容的各种目标行为的概率,比如点赞、关注、分享、评论,然后计算用户看这条内容获得的价值总和,把排名靠前的推给用户。你注意那几个词。预估每一种行为的概率,算价值总和。不是挑一个指标,是一堆概率各乘一个权重加起来。
纽约时报 2021 年拿到的那份 TikTok Algo 101 内部文档2,给了一个更直白的版本。文档里写了一个打分公式。
文档自己也说这是高度简化的版本,真实的复杂得多。但骨架就是这个,每个行为一个概率一个权重,加总。我觉得这个公式的意义不在于它准不准,在于它暴露了一件事。那个 V,每个行为值多少分,是人定的。算法预估 P,人决定 V。这些权重加起来,就是这个产品认为什么叫喜欢
。
多目标优化不是把判断交给机器,是把判断藏进了权重里。
权重是你定的,谁赢也就是你定的
拖四个权重,看视频 A 和视频 B 的总分怎么反转。A 完播高但零互动,B 看了 24 秒还点赞关注。
每一行 = 这个行为的预估值 × 你给的权重。两条视频各自加总。
指标不是投票选皇帝,而是彼此校正偏差。
完播率偏短,时长偏长,两个放一起,偏差互相抵一部分。点赞是显性的强信号但稀疏,时长是隐性的弱信号但稠密,两个放一起,一个补另一个的漏。负反馈是用户明确说别给我看这个
,它不参与加分,它是减分项,是护栏。
主指标和护栏指标
说到护栏,这里得正式引入两个词,主指标和护栏指标。这两个词后面第 8 课第 9 课会一直用。
成功的条件是主指标改善,而且护栏没被撞穿。第 5 课那道题你其实已经做过一次了,时长涨 5% 但 D30 和负反馈变坏,不算成功,就是主指标过了、护栏没过。
每个目标自己都带偏差,得一个一个纠
快手 2022 年那篇 KDD 论文3,标题直译是消除观看时长预测中的时长偏差
。他们发现一个很阴的问题,推荐系统学到的不是用户喜欢这条视频
,而是长视频的时长天然高
,于是越来越多地推长视频,而不是用户真的更喜欢的视频。解决办法是按视频长度分组,每组内部比时长的相对位置,而不是比绝对秒数。字节 2025 年那篇是同一个方向的进一步。这些论文之所以存在,就是因为多目标系统里每一个目标自己都带偏差,你得一个一个去纠。这是一个永远做不完的活。
视频 A 完播 100%,视频 B 只完播 40%,因此 A 一定更好吗?
B。单一指标都有结构性偏差,必须让多个信号互相校正。C 是个陷阱,播放量是这一课里最弱的信号,第 2 课就讲过它最容易虚胖。
这一课,没有一个行为能代表喜欢,每个都带偏差。抖音公开的算法和 TikTok 那份文档都是一堆概率乘权重加总,权重是人定的,判断藏在权重里。主指标说改什么,护栏说什么不许坏。到这里所有指标还在一个圈里打转,下一课,钱进来了。
完播率从开始看到结尾的比例
互动率点赞、评论、分享、收藏、关注相对于播放或曝光的比例
主指标一次实验最想改善的指标
护栏指标即使主指标上涨也不允许明显恶化的底线
这一课的数字从哪来
- 抖音公开算法原理(预估各行为概率、计算价值总和、几乎不打标签、多目标建模):新浪 2025-03-31、新浪 2025-04-15,官网 95152.douyin.com。
- TikTok Algo 101 打分公式:NYT 2021-12-05,转述见 Gizmodo。
- 时长偏差与分组纠偏:快手 KDD 2022 D2Q、ByteDance 2025 Relative Advantage Debiasing。
- 视频 A / B 的数字和动手块里的概率、权重都是示意。
到这里为止,所有的指标都还在一个圈里打转,消费者、创作者、算法。冲突已经出现了,但还是都为了用户体验
这个大框架下的冲突。下一课,钱进来了。