抖音指标体系是怎么长出来的
第 5 课 · 第四阶段 · 从规模走向使用深度

同样 100 万人,用得深浅天差地别

DAU 只说明多少人来。总时长把「有多少人」和「每个人用了多久」放到一起。

接着上一课的问题,人多了以后,为什么还要看总时长

纽约时报拿到的那份内部文档

2021 年 12 月,纽约时报发了一篇文章,作者 Ben Smith,标题叫 How TikTok Reads Your Mind。1文章的核心是一份 TikTok 内部文档,名字很朴素,TikTok Algo 101,是写给公司里不懂技术的同事看的,解释推荐算法是怎么回事。TikTok 的发言人确认了这份文档是真的。

文档里有一句话我看到的时候停了一下。它说,公司的终极目标是增加日活用户,为了这个目标,算法选择优化两个紧密相关的指标,一个是留存,用户会不会回来,另一个是使用时长,time spent。

终极目标增加 DAU为此优化的两个指标留存(会不会回来)· 时长(time spent)

留存我们第 3 课讲过了。这一课讲时长。为什么一个已经有几亿 DAU 的产品,还要盯着时长?

DAU 只说多少人来,时长把深度放进来

先回到第 3 课那组数。2017 年 9 月抖音人均时长 22 分钟,12 月接近 40 分钟。2同一段时间 DAU 从 500 万到 3000 万。你注意,时长和 DAU 是一起涨的,但它们说的不是一件事。

你想想看,两个产品每天都有 100 万人来。A 产品用户平均看 5 分钟,B 产品平均看 40 分钟。只看 DAU,它们一样强。但你要是把总时长算出来,A 是 500 万分钟,B 是 4000 万分钟,差 8 倍。

总时长 = DAU × 人均时长。这个乘法是这一课的骨架。

动手试示意,虚线框是抖音 2017 年 9 月的真实点

一个矩形,横边是人,竖边是每人用多久

拖两个滑块,看矩形面积怎么变。同样的总时长,可以是很多人浅用,也可以是少数人深用。

10 万250 万500 万
2 分30 分60 分
总时长
相当于多少人看满 1 小时

所以人多了以后,管理层一定会加一组新的数,总使用时长,人均使用时长,启动次数,单次会话深度。它把规模和深度放进了同一个结果。

我自己的感受是,时长在内容产品里有一种特殊的诚实。播放量可以被自动播放灌水,点赞可以懒得点,但时间是每个人一天只有 24 小时的硬通货,你愿意把 40 分钟给一个 App,这件事很难作假。TikTok 那份文档选它不是偶然。

时长一旦当王,立刻开始变坏

但是。时长这个指标一旦被当成王,它会立刻开始变坏。怎么变坏呢。刺激性的内容能拉时长。重复同一个套路的内容能拉时长。让人停不下来但刷完很空虚的内容,也能拉时长。你要是只看时长,推荐系统会很快学会这些,因为它们确实有效,短期内。然后你再看长期留存,可能在往下掉。负反馈在往上走。用户刷完以后觉得自己被浪费了时间,下次打开的意愿反而低了。

时长是油门,长期留存、负反馈、多样性是护栏。

长期留存时长涨了、D30 掉了,说明是在透支。
负反馈率不感兴趣、屏蔽、举报、快速退出。用户在说「别再给我看这个」。
内容多样性刷十条全一个套路,时长可能高,人在被关进茧房。

说到这个,抖音自己 2025 年在安全与信任中心公开算法原理的时候,有一个说法是多目标建模要主动打破信息茧房,给用户更丰富多元的内容。3你可以把这句话理解成,他们自己也知道光追时长会把人关进茧房,所以多样性得被当成一个目标放进去,而不是一个顺带的结果。这个第 7 课再展开。

你来判断

一次推荐改动让人均时长上涨 5%,但 D30 留存下降,负反馈上升。能算成功吗?

B。时长是重要结果,但长期留存和负反馈是它的护栏。这个改动很可能是找到了某种「让人停不下来但刷完不爽」的东西,时长上去了,用户回来的意愿下去了。一个月以后它会在 DAU 上还回来。C 是个陷阱,统计显著只说明这个上涨不是运气,不说明这个上涨是好事,第 9 课会专门讲。

时长本身也有偏差

还有一层,更技术一点,但我觉得值得说。一条 3 分钟的视频和一条 15 秒的视频,哪怕用户对它们的喜欢程度一样,看 3 分钟那条花的时间天然就长。热门视频被推得多,时长总量也天然高。字节 2025 年发了一篇论文专门讲这个4,说原始的观看时长会被视频长度、热度、用户个人习惯这些因素混淆,所以他们不直接用时长,而是把时长跟同类视频、同类用户的参考分布比一下,看这条视频相对于它应该得到的时长,是高了还是低了。快手 2022 年也有一篇类似的,第 2 课我提过,3 秒门槛对长短视频不公平,时长也一样不公平。

所以你看,时长这个指标从 2017 年的 22 分钟到 40 分钟那个朴素阶段,走到今天,已经变成了一个需要被纠偏以后才能用的东西。第 2 课说的那条规律,每修一个坑就在旁边挖一个新坑,在时长这里又应验了一次。

平均数藏事

还有一个小细节,人均时长是个平均数。少数重度用户会把它拉高,一个每天刷 6 小时的人能抵 36 个刷 10 分钟的人。所以看人均的时候最好同时看中位数,看用户分层。平均数骗人的方式,跟 DAU 不拆开骗人的方式是一样的,都是把不一样的人搅在一起。第 10 课讲启动时延的时候,你会再遇到它一次。

这一课,总时长 = DAU × 人均时长,把规模和深度放进一个结果。TikTok 那份文档选的就是留存和时长。但时长一旦当王就会变坏,必须和长期留存、负反馈、多样性一起看。时长本身还带偏差,今天已经要纠偏以后才能用。

这课认识的指标
总使用时长所有用户当天有效使用时间的总和
总时长 = DAU × 人均使用时长
为什么看它把规模和使用深度放进同一个结果。
刺激和同质内容能短期拉时长。
搭配长期留存、负反馈、多样性
人均使用时长平均每个活跃用户待了多久
人均时长 = 总有效使用时长 ÷ DAU
少数重度用户拉高均值,要一起看中位数和分层。
搭配启动次数、单次会话时长
负反馈率不感兴趣、屏蔽、举报、快速退出的比例
负反馈率 = 负反馈次数 ÷ 有效曝光
为什么看它推荐优化必须守住的体验护栏。
用户没点「不感兴趣」不等于满意,显性负反馈很稀疏。
搭配留存、满意度

这一课的数字从哪来

  1. TikTok Algo 101、终极目标 DAU、优化留存与时长、发言人确认真实:NYT 2021-12-05,转述见 Gizmodo
  2. 2017 年 22 分钟 → 近 40 分钟:抖音如何迈过 500 万日活瓶颈期
  3. 「主动打破信息茧房」:新浪 2025-04-15 抖音解读推荐算法原理
  4. 时长的混淆与纠偏:ByteDance 2025 Relative Advantage Debiasing;快手 D2Q
  5. 动手块里的矩形是示意;A / B 两产品 5 分钟对 40 分钟是示意。

这课结束前再想一件事。每天几亿人,每人 40 分钟,这得多少条视频才够刷?这些视频是谁拍的?