Skip to main content

指标、实验与效果评估

本章导读

上一讲结束时,研习团队把错题归集 MVP 灰度发给了约四百名重做题用户,想验证一条最关键假设:用户到底愿不愿意为「归集后自动进入复习计划」改变行为。灰度跑了一段时间,数据分析师老周把第一份报告投到了周会上。

数字看起来相当不错:归集入口点击率从上一版的约百分之二升到约百分之八;用过的灰度用户约三百二十人,占八成;其中约七成确认了归类,次日打开复习计划的比例约四成(教学假设)。运营阿May当场就准备把「上线一周,八成用户使用归集」写进宣传文案。

问题正好出在这里。大家突然意识到,这些数字只能证明「有人用」,却证明不了「有用」。点击、确认、打开,每一步都说得通,可没有一步能回答:用户真的复习得更好吗。

这一讲就停在这个周会上,看团队怎么从「数字涨了」走到「这组变化到底能不能算到我们头上」。你要分辨的,不只是指标准不准,还有指标背后那个因果链条怎么写。落成的东西,是一页《指标、实验与效果评估》。下一讲《迭代、运营与增长》会从「一次实验只得出一个结论」接下去,讲怎样把一轮轮的判断连成持续学习。

说明:本讲的故事、角色和数字都是教学案例或教学假设,只用于演示推理。除来源一节列出的腾讯公开材料外,不指向任何真实产品或腾讯数据。

开篇:数据涨了,周会上却拿不定主意

周会开始,老周把报告投到屏幕上,逐项念下来:归集入口点击率,从上一版的约百分之二升到约百分之八;灰度用户里使用过归集功能的约三百二十人,占八成;其中约七成确认了归类,次日打开复习计划的比例约四成(教学假设)。

阿May第一个接话:「这还不够好吗?上线一周,八成用户都用了。我下午就把这句话写进宣传,标题都想好了——拍照记错题,八成用户都在用。」

大鹏也点头:「既然数据不错,我们下周就把识别优化排进去,顺便把导出补上,趁热打铁。」

小雨没急着附和。她翻着手机里几条刚回的用户消息,轻声说:「我昨天问了几个学生。有人点了归集、也确认了分类,但第二天根本没打开复习计划;还有人问我,这跟他以前手动抄一遍到底有什么区别。他们没说功能好不好,说的是还没感觉到变化。」

小林把目光从数字上移开,问了大家一句:「这些数字,能说明用户复习得更好了吗?」

会议室安静下来。大家发现,不能。

点击率只说明入口被看见、被点开;确认率只说明用户愿意纠正一次归类;次日打开复习计划也只说明用户回来过一次。它们一个接一个,都停在「碰过这个功能」这一层。没人能回答三个更靠后的问题:用户到底有没有把错题复习完;复习完成率有没有真的提高;长期来看,他是不是因为归集这件事才学得更好。

同一份报告,至少能拆出四种解释。

第一种,归集确实有用,用户因为少抄一遍而愿意继续复习,只是结果需要更长时间才显现。

第二种,归集只是一个新鲜入口,用户点开、确认、第二天回来看看,但复习行为并没有变化,使用增长来自好奇。

第三种,归集反而增加了负担。用户确认归类之后,被排进复习计划的错题更多了,最后干脆放弃复习计划。

第四种,灰度人群本身是重做题用户,他们本来就会复习。数据上涨,只是我们选对了样本,并不反映功能带来的任何增量。

四种解释指向完全不同的下一步。继续做宣传,只服务第二种解释;优化复习计划,只服务第一种。团队缺的不是更多点击,而是一套能把「有人用」和「有用」区分开的指标与实验。

先看最省事的做法:把点击当成成功

团队最直觉的做法,就是阿May的做法:把点击和使用数据当成成功证据,数字涨了,就宣布有效。

这种做法在一种条件下有效:产品还在冷启动,任何使用行为都先于价值判断,团队只想先知道「有没有人愿意碰这个功能」。这时候,使用率可以当作一个早期信号,帮你决定是继续往里投,还是先收手。

但它在另一种条件下失效:产品已经有稳定用户,点击和使用会受入口位置、文案、好奇心和样本选择的影响,不再自动等于用户取得了结果。研习正处在这种失效条件里,因为灰度用户本来就是最可能复习的一群人。他们点了,不等于功能让他们点了。

为什么「有人用」不等于「有用」

一个入口被放在首页最显眼的位置,点击率天然会涨;一个功能因为名字起得新鲜,也会有人想点一下看看。这些行为都能被记录、被统计,但它们回答不了产品真正的问题:用户完成了他想做的事吗,结果比原来更好吗。把「有人用」当成「有用」,就像把「进店的人多」当成「买走的人多」。

三类指标:结果、过程、护栏

《腾讯产品18讲》的数据运营部分包含指标定义与拆解、北极星指标、漏斗分析、A/B测试和总结优化;腾讯灯塔增长课强调把业务经验转成可以操作的数据工具。我们不必一次吞下整套体系,先把指标分成三类,就够解决眼前的问题。

结果指标,回答用户最终取得了什么进展。对研习来说,它不是「使用归集功能的人数」,而是「错题复习完成率」:进入复习计划的错题里,在规定时间窗口内被真正复习完成的比例。

过程指标,回答结果出现之前的关键行为。研习的过程指标是一串动作:练习提交错题、生成归类、用户确认、进入复习计划、打开复习计划、完成复习。每一步的转化,都是过程指标。

护栏指标,防止为了局部优化而伤害整体。研习的护栏是:用户关闭归集功能的比例、单次归集平均耗时、识别纠错投诉比例,以及复习计划留存。

只看过程指标,会把「用得多」当成「有效」;只看结果指标,会漏掉中间在哪一步断掉。三类放在一起,才能同时回答三个问题:有没有用、哪里断了、有没有伤到别的。

回周会现场走一遍。阿May盯着的是过程指标,所以她会急着写宣传。老周补的那句「再往后就没数了」,其实是在说:我们缺一个结果指标,也缺一道护栏。把三类指标摆上白板之后,团队才第一次有了共同的标尺。

怎么记住三类的分工

结果指标告诉你「用户赢没赢」,过程指标告诉你「中间哪一步断了」,护栏指标告诉你「赢的同时有没有输掉别的」。少了任何一类,你看到的都不是完整的产品。

北极星:不是最大的那个数字

有了三类指标,还不够。一个产品往往有很多指标,团队需要一条能把大家拉回同一方向的线,这就是北极星指标。

北极星指标要同时靠近用户价值和产品的长期价值。注册用户数通常很大,却不能说明用户是否完成了目标。对研习来说,月活八万是一个大数字,但它不能指导「归集功能该不该继续」。它涨了,可能是因为别的功能,也可能是因为一次投放,和归集没有关系。

选择北极星指标时,检查四件事:它是否对应用户获得的真实结果;团队的产品动作能否影响它;短期提高它,是否可能伤害长期体验;不同用户群的变化,是否会被平均数掩盖。

研习的北极星指标可以先定为「每周至少完成一次错题复习的用户数」,而不是「归集功能使用人数」。前一个靠近用户价值——用户复习了错题,才是我们想帮他取得的进展;后一个只是过程——点了入口,离结果还差得远。

如果一个指标只能靠营销预算抬高,它更像规模结果,不一定适合指导产品迭代。北极星的作用,不是选一个最大的数字来报喜,而是选一个团队能通过产品动作持续改善、又确实代表用户价值的数字。

先写口径,再看曲线

「活跃用户」这个词,可能指打开一次、完成一个核心行为,或在七天内使用三次。没有口径的指标不能比较,更不能拿来画曲线。

研习第一份报告里的「使用过归集功能」就没有写清口径:它到底是一次打开、一次确认,还是完成过一次复习。老周后来补写:主体是灰度用户,事件是完成一次归集确认,时间窗口是灰度后七天,去重按用户,过滤掉测试账号。改版前后口径一旦发生变化,两条曲线就不能直接连在一起。

每项关键指标至少记录七件事:事件、主体、时间窗口、去重方式、过滤条件、数据延迟和负责人。这七件事写齐,数字才不再是「一个好看的数」,而是可以被复查、被追问的对象。

口径变了,曲线不能连

如果你上个月按「打开一次算活跃」统计,这个月改成「完成一次核心行为算活跃」,然后把两条线画在一起,说「活跃涨了」——这个结论没有任何意义。口径不同,数字就不是同一个东西。写死口径,是为了让每个数字在下次被引用时,还知道它到底在说什么。

漏斗负责定位,分群负责解释

研习的漏斗是六步:提交错题练习、生成归类、用户确认、进入复习计划、次日打开、完成复习。假设数据依次是:生成归类九成、确认七成、进入计划七成、次日打开四成、完成复习两成(教学假设)。

这张漏斗把「完成复习只有两成」的问题,定位在「次日打开到完成复习」这一段。前面几步掉得不厉害,真正的缺口在最后。但漏斗只能告诉你「断在这里」,不能告诉你「为什么断在这里」。

分群把用户切开再比较:手动记录五次以上的老用户,和刚满足条件的新用户;白天整理的用户,和晚上整理的用户;确认后修改过归类的用户,和直接确认的用户。假设老用户的完成复习比例约三成,新用户约一成(教学假设)。这个差异说明,问题未必在功能本身,而在不同用户对复习计划的使用习惯。

数据负责定位异常,分群和用户研究负责解释异常,两者不能互相替代。只靠漏斗,你会对着「两成」干着急;只靠分群,你又不知道先看哪一段。把两者接起来,才知道该去访谈谁、该问什么问题。

相关、因果、显著、重要

这四个词经常被混在一起,我们逐一分清。

相关性,只说明两个变量一起变化。归集使用人数与复习完成率同时上涨,可能是功能有效,也可能是灰度用户本来就是高复习人群。相关性回答不了因果。

实验归因,才试图回答因果。A/B测试通过同时保留一个对照组,降低共同变化带来的干扰,让结果更有可能归到产品改动上。随机分组、样本污染和实验外的干预,仍然需要单独检查。

统计显著,回答差异是否大到不太可能由随机产生。样本很大时,微小差异也可能达到统计显著。研习如果把八万用户全部放进去,也许百分之零点五的差异就「显著」了,但这个差异对用户没有意义。

业务重要,回答这个变化是否值得支付开发、维护和体验成本。复习完成率从两成升到两成半,值不值得继续投入识别优化,需要团队结合成本判断,而不是盯着一个 p 值说「通过了」。

一句话收起来:相关不等于因果,因果要靠实验设计支持,统计显著也不等于值得做。

A/B测试:把因果说清

上线后指标上涨,可能来自节假日、渠道投放、用户结构变化,也可能来自产品改动。研习这次灰度没有对照组,所以无法排除「重做题用户本来就会复习」这一解释。

实验前需要写清六件事:唯一主要假设;实验单位是用户、设备、团队还是内容;主指标与护栏指标;预期方向和最小有意义变化;实验时长与提前停止规则;新老用户等关键分群。

研习的下一次实验可以这样写:主要假设是「自动进入复习计划能提高错题复习完成率」;实验单位是用户;主指标是七天错题复习完成率,护栏是关闭归集比例和复习计划留存;最小有意义变化是完成率提高五个百分点;实验时长十四天;分群区分手动记录五次以上和五次以下。

这里的最小有意义变化是教学假设,团队应当按自己的历史波动和成本来定,而不是抄一个通用数字。

最小有意义变化是什么

它回答一个问题:主指标要变化多少,我们才认为这个改动值得做。变化太小,即使「显著」,也可能不够支付开发和维护成本。先把这个数字写下来,是为了在实验结束、数据出来之前,就约定好「什么叫值得」。

压力测试:主指标涨了,产品却变差

我们做一次压力测试:构造一个「主指标上涨但产品变差」的情形,再用护栏指标把它抓出来。

假设团队把归集入口移到首页最显眼的位置,并默认每天推送一条复习提醒。归集使用人数和复习完成率都上涨了。但关闭提醒的比例,也从约百分之二升到了约百分之九;复习计划以外的其他功能打开率下降;客服收到「被提醒打扰」的投诉增加(教学假设)。

主指标上涨了,产品却可能在伤害那些不想要提醒的用户。护栏指标的价值,就是在主指标漂亮的时候,仍然把副作用暴露出来。因此实验报告不能只报主指标,护栏指标同样必须提前写死,并和主指标一起上报。

只报主指标,等于只报好消息

如果一个实验只汇报「主指标涨了」,却藏起「护栏指标同时恶化了」,那它给团队的是一个片面的结论。把护栏和主指标一起写死、一起上报,是为了在情绪上来之前,让副作用也有机会被看见。

逐步执行:指标与实验流程

第一步,从定位和最关键假设里取出结果指标,写清用户取得的最终进展。研习取的是错题复习完成率,而不是归集使用人数。

第二步,把结果前的关键行为拆成过程指标,排成一条漏斗。研习的漏斗从提交错题练习排到完成复习。

第三步,写至少三个护栏指标,覆盖关闭、投诉、成本或留存中的副作用。研习写的是关闭归集比例、识别纠错投诉比例和复习计划留存。

第四步,确认北极星指标是否靠近用户价值,而不是最大的规模数字。研习选了每周至少完成一次错题复习的用户数。

第五步,给每项关键指标写口径,补全事件、主体、时间窗口、去重、过滤、延迟和负责人。研习把「使用过归集功能」补成了完成一次归集确认。

第六步,如果要做因果判断,设计A/B测试,写清假设、单位、主指标、护栏、最小有意义变化、时长和分群。

第七步,实验结束后只允许三种结论:支持当前假设、不支持当前假设、证据不足。

可直接填写的模板

指标、实验与效果评估

结果指标(用户取得的最终进展):
过程指标(按顺序写漏斗每一步):
护栏指标(至少三个,含关闭/投诉/成本/留存):
北极星指标(是否靠近用户价值):

指标口径(每项关键指标):
事件:
主体:
时间窗口:
去重方式:
过滤条件:
数据延迟:
负责人:

分群(至少两个):
分群一及预期差异:
分群二及预期差异:

A/B测试(如需要):
唯一主要假设:
实验单位:
主指标与护栏指标:
预期方向与最小有意义变化:
实验时长与提前停止规则:
关键分群:

主指标上涨但产品变差的一种情形:
由哪个护栏指标识别:

填完这张表,做一次自我检查:如果明天有人问你「这个功能到底有没有用」,你能不能不用「用的人很多」这句话来回答,而是给出一个结果指标和它的变化。说不出来,就说明指标树还没搭起来。

常见误区及其可见后果

第一种误区,把点击和使用数据当成价值证据。可见后果是团队为「有人点」持续优化入口,用户却没有取得更好结果。

第二种误区,只报主指标、不报护栏。可见后果是主指标上涨时没人看到投诉、关闭和成本同时恶化,直到问题大面积出现才回头。

第三种误区,把统计显著当成业务重要。可见后果是大样本下的微小差异被当成胜利,团队为百分之零点几的提升支付了不成比例的成本。

第四种误区,把相关性当成因果。可见后果是灰度没有对照组,团队把样本选择效应解释成功能有效,放量后效果消失。

第五种误区,口径前后不一致还比较曲线。可见后果是改版前后的数字无法连接,团队却得出「上涨」或「下降」的结论。

第六种误区,把漏斗当成原因。可见后果是团队看到某一步流失大,就直接改那一步,却没有分群或访谈去解释用户为什么离开。

课堂练习

给出一份教学材料:某款笔记产品上线了「AI自动生成摘要」,上线后摘要生成按钮点击率从百分之五升到百分之十二,但用户停留时长下降,删除摘要的比例上升。以上数字均为教学假设。

请在十分钟内完成三件事:为这个功能写一个结果指标、一个过程漏斗和三个护栏指标;指出「点击率上涨」属于哪一类指标,它不能证明什么;写一个「点击率上涨但产品变差」的具体情形。

写完后交换,检查对方是否把点击率当成了价值证据,以及他的三个护栏指标里有没有一个能抓到那个「变差」的情形。

最终作业

回到上一课的 MVP,交付一份《指标、实验与效果评估》。

要求:结果指标、过程漏斗、至少三个护栏指标、北极星指标各写一项;每项关键指标都有完整口径;至少做两个分群并写清预期差异;如需因果判断,写清一份A/B测试卡;最后构造一种「主指标上涨但产品其实变差」的情形,并用护栏指标识别它。所有非来源数字必须标明教学假设。

评分标准

字段评分要点
结果指标是否对应用户取得的最终进展,而不是使用人数
过程指标是否按顺序排成漏斗,每步可观察
护栏指标是否至少三个,覆盖关闭、投诉、成本或留存
北极星指标是否靠近用户价值,是否写清为什么不选规模数字
指标口径是否补全事件、主体、窗口、去重、过滤、延迟和负责人
分群是否至少两个,是否写清预期差异和解释
A/B测试是否写清假设、单位、主指标、护栏、最小变化和时长
相关与因果是否区分相关、归因、显著与业务重要
压力测试是否构造出主指标上涨但产品变差的情形并给出识别指标
数字来源是否标明教学假设或来源事实

本课不能证明什么

指标和实验不能证明产品长期成功,也不能证明用户价值一定成立。它们只能证明,在写清口径和对照的前提下,某项改动是否在特定人群中产生了可解释的变化。

一次实验通过也不能推广到全部用户和全部时间。实验的样本、窗口和护栏边界写在哪里,结论就只覆盖到哪里。

把这一点写清楚,是为了在下一次复盘时,不会反过来怪「指标都说涨了,产品怎么还是不行」。指标本来就不负责成功,只负责在你愿意写清口径、留下对照组的时候,告诉你某个判断被支持还是被推翻。

与下一课的连接

当我们能判断一项改动是否有价值之后,还剩下一个问题:怎样把一轮一轮的判断连起来,让产品在连续迭代中持续学习,而不是连续发版。

下一课《迭代、运营与增长》从这里接下去。它会教我们设计一轮迭代的最小结构,区分问题探索、价值与可用性、真实效果与增长三种验证,并处理生命周期运营与失败复盘。

资料来源