增长黑客之“法”——增长如何持续优化

引言
实验结束以后,不该急着给结果贴上“成功”或“失败”的标签。先想清楚的是接下来做什么。核心指标上涨,可能说明原来的策略有效,也可能只是一次随机波动;指标没有达到统计显著,可能意味着假设不成立,也可能只是样本不足、实验噪音太大,或者具体方案根本没有作用到预想中的机制。即使实验得到了明确的正向结果,也仍然要继续判断:这个改善有没有足够的业务价值,是否值得扩大,以及它有没有把新的问题推到了链路的其他位置。
新证据改变旧判断的时候,增长才成为一件能持续的事。原来最值得投入的变量,经过几轮优化以后可能已经没有那么大的空间;一个很有希望的机制,连续得不到数据支持以后也应该降低优先级;新的用户差异和业务约束,则可能把注意力重新引向其他位置。持续优化不是沿着一条已经选定的道路往前走。它要让每一次行动产生的新信息,重新影响下一次决策。
6.1 结果判断
判断实验结果之前,先要确认这次实验本身有没有提供可信结论的条件。样本是否达到预先设定的要求,分流是否稳定;埋点和实验版本有没有异常,两组用户是否受到不同的渠道、库存、促销或系统故障影响。这些检查都发生在“指标涨了多少”之前。如果实验过程已经出现明显污染,再漂亮的数字也很难说明变化来自实验本身。
确认实验条件没有明显问题以后,才需要看结果本身。这里至少有三个层面不能拆开:结果方向、效果大小,以及它带来的业务代价。统计显著性可以帮助判断当前差异是否很可能只是随机波动,但它并不能告诉我们这个变化值不值得做。一个拥有巨大流量的业务,很容易识别出很小的差异;如果投入大量开发和运营成本,只把转化率从 10.00% 提高到 10.05%,即使统计结果足够可信,也未必具有现实意义。反过来,一个小样本实验提升了二三十个百分点,如果数据波动本身就很大,也不能因为数字漂亮就直接接受。
进入业务决策,还必须看这种变化有没有沿着价值链继续成立。加购提高了,支付有没有改善;支付提高了,退款是不是同步上升;注册增长了,新用户后续的激活和留存又怎么样。很多局部指标都可以通过强刺激暂时推高,但如果问题只是从链路前端转移到了后端,增长并没有真正发生。因此,一个实验的核心指标和护栏指标应该放在一起判断:
| 结果状态 | 更值得关注的问题 | 后续处理 |
|---|---|---|
| 核心指标正向,结果可信,护栏指标稳定 | 改善是否具有足够业务价值 | 扩大范围,并继续观察规模化后的效果 |
| 核心指标稳定负向,结果可信 | 原来的哪一层判断出现了问题 | 停止或回滚,重新检查机制和策略 |
| 差异不显著,实验条件充分 | 实际效果是否过小,或者假设本身缺乏支持 | 降低优先级,决定是否转向 |
| 差异不显著,但实验条件不足 | 当前结果是否根本无法回答问题 | 修复实验条件后再判断是否重试 |
| 核心指标正向,护栏指标明显恶化 | 局部收益是否以更大的长期损失换来 | 暂不扩大,重新调整策略 |
| 不同人群持续表现出明显差异 | 原来的作用对象是否定义得过宽 | 收窄人群,形成新的判断 |

分群结果尤其需要克制。实验结束以后,如果不断切渠道、设备、地区、用户等级和行为标签,总能从大量组合中找到几个看着不错的小群体。如果这些人群原本就有明确的业务依据,可以用来理解策略在哪些用户中更有效;如果只是因为整体结果不好,才在结果出来以后不断寻找“上涨人群”,更适合把它当作新的线索,而不是回过头把原实验重新解释成成功。一次实验留下的东西,不只是“实验组比对照组高了多少”,还包括我们因此可以更有把握地保留哪条判断、放弃哪条判断。
6.2 失败与不显著
失败和不显著经常被放在一起,实际代表的是两件不同的事情。如果实验组在核心指标上出现稳定而可信的负向变化,可以相对明确地说,当前改变带来了不利影响;但如果结果没有达到统计显著,只能说明现有证据不足以确认差异。背后的原因可能是方案没有作用,也可能是效果太小、样本不足,甚至实验本身就没有能力回答这个问题。
所以看到不显著结果时,首先应该判断的不是“方案是不是错了”,而是这次实验究竟有没有测试到原来的假设。如果样本不足、埋点异常、版本故障或者流量分配失衡,问题首先出在实验条件,这时继续讨论策略对不对没有太大意义,因为手上的证据本身就不可靠。实验条件没有明显问题以后,可以继续看具体方案有没有改变假设中的中间行为。比如判断用户没有购买,是因为商品信息难以理解,于是增加了一套新的内容表达。如果上线以后,目标用户的信息查看方式、停留位置和后续路径几乎没有发生变化,那么更值得怀疑的是,这个方案根本没有有效改变用户的理解过程,而不是立即得出“商品理解不影响转化”的结论。
如果方案确实改变了用户的中间行为,核心结果却没有随之变化,原来的因果判断才需要重新检查。用户已经明显更容易理解商品,却仍然没有提高加购,那么“理解困难是主要转化阻力”这件事的可信度就应该下降。再往后,如果几种不同的合理方案都围绕同一种机制进行过验证,却始终没有得到支持,继续调整文案、样式和布局的价值就越来越低。此时要降低的不是某一个方案的优先级,而是整个策略方向的信心。
还有一种结果容易被误认为失败:方案确实有作用,只是作用太小。比如多轮实验都显示轻微正向趋势,最后也有足够证据证明这种变化真实存在,但收益不足以覆盖开发、运营和长期维护成本。这种情况更准确的结论不是“无效”,而是有效,但当前不值得投入。
| 观察到的现象 | 更合理的判断方向 |
|---|---|
| 样本、埋点或分流存在明显问题 | 当前证据不足,先修复实验条件 |
| 方案上线后,关键用户行为没有变化 | 具体实现可能没有真正作用于假设中的机制 |
| 中间行为发生变化,核心结果没有变化 | 原来的因果关系需要重新检查 |
| 多种实现持续得不到支持 | 整个策略方向应该降低优先级 |
| 效果存在,但长期收益很小 | 判断是否值得继续投入 |
| 某类用户持续表现不同 | 假设可能只在特定人群或场景成立 |
例如我曾经有一个零售项目尝试强化到手价、价格信息和倒计时等表达,实验结果只有轻微的正向变化,没有形成足够强的统计证据。这个结果不能证明价格信息没有作用,但至少说明,在当时的商品、用户和页面条件下,继续把大量资源投入价格表现缺乏足够依据。与此同时,另一类围绕商品理解和内容承接的实验获得了明显更强的信号,有限资源自然更应该向证据更充分的方向移动。实验没得到预期结果并不可怕。可怕的是结果已经出来了,原来的假设、策略和优先级却一点都没动。
6.3 模型与优先级更新
增长模型描述的不是业务永远不变的结构,而是当前阶段对业务关系的最好理解。只要实验产生了新的可靠证据,这种理解就应该允许被修正。一个变量得到明显改善以后,它剩余的增长空间会变小;一个机制连续得到不同证据支持以后,对它的信心会提高。原来认为影响全量用户的问题,也可能逐渐发现只集中在某一类人群;一个成本看起来很低的方案,实际实施以后还可能暴露出新的运营负担和风险。所有这些变化,都会影响资源下一步放在哪里。

比如某个阶段已经确认详情到加购是影响订单的关键变量,几轮优化以后,这个环节的转化已经得到明显改善。继续在这里做细微调整,可能仍然能够获得一些收益,但它的改善空间已经和最初不同。此时支付、复购、渠道质量或者其他环节,可能已经成为新的限制条件。如果因为这个方向过去连续成功,就继续把资源留在这里,很容易把已经验证过的优势变成路径依赖。
负向和不显著结果同样需要进入模型。一个变量在数学上仍然重要,不代表团队在当前阶段就一定拥有有效的改变手段。如果多个策略持续缺乏支持,那么对“这个变量能够被低成本改善”的判断就应该变得更加谨慎。相反,如果新证据发现某类用户的改善空间远高于平均水平,原来按照全量用户估算的机会也需要重新计算。每轮验证以后,值得更新的是这些判断:
| 需要重新检查的内容 | 新证据可能带来的变化 |
|---|---|
| 当前基线 | 指标已经改善,或者出现新的恶化 |
| 改善空间 | 原来的增长空间正在缩小,或者出现新的机会 |
| 证据强度 | 对某个机制的信心提高或下降 |
| 作用范围 | 问题从全量用户收窄到特定场景 |
| 实际成本 | 实施和验证成本与最初估计不同 |
| 风险与约束 | 新的退款、投诉、运营或合规问题出现 |
| 相对优先级 | 继续投入当前变量,还是转向新的瓶颈 |
这并不意味着每做完一次实验,都要重新分析整个业务,只需要把新证据放回原来的判断,检查哪些条件已经变化。随着一个变量不断被改善,剩余空间通常会逐渐缩小,同样的投入能够换来的收益也越来越有限。到了这个时候,与其继续在成熟环节里挤最后一点空间,不如重新检查新的限制条件。持续优化需要反复回答的是同一个问题:现在最值得做的,还是不是这件事。
6.4 实验记录与实验库
实验如果只留下页面截图、结果数字和一句“成功”或“失败”,过一段时间以后,它能够提供的信息会迅速减少。值得沉淀的不是某个版本当时长什么样,而是团队面对什么问题、为什么认为某种机制值得验证、采用了什么方式、最终结果又怎样改变了原来的判断。同样一句“转化提升 8%”,如果不知道它针对的是价格、内容、信任还是操作阻力,就很难迁移到其他场景。数字本身不是知识,数字和当时的判断连在一起,才可能成为知识。一条能够被后来者使用的实验记录,不需要很复杂,但最好能够保留完整的上下文。
| 记录内容 | 需要留下的信息 |
|---|---|
| 背景 | 当前目标、核心变量以及问题发生在哪类用户或场景 |
| 假设 | 为什么认为当前机制可能影响结果,以及主要依据 |
| 策略与方案 | 准备改变什么,实际采用了什么动作 |
| 实验设计 | 受众、版本、核心指标、护栏指标、样本和周期 |
| 实验结果 | 效果量、统计结果、辅助指标和异常情况 |
| 结果解释 | 哪些判断得到支持,哪些被削弱,哪些仍然无法判断 |
| 后续决策 | 扩大、调整、继续验证、降低优先级还是停止 |

其中最容易被省略、却最有价值的,是结果解释。“实验组上涨了 12%”只能说明发生了什么;“目标用户在获得更清晰的商品场景和购买理由以后,加购明显改善,而单纯强化价格表达没有得到同样支持”,才开始说明这次实验为业务留下了什么。
这种记录也必须保留不显著和负向实验。如果实验库里只保存成功案例,团队很快会形成一种错误印象,好像过去尝试的大多数方向都有效。更现实的问题是,那些已经被数据削弱的想法,会随着人员变化和记忆消失,隔几个月以后重新出现在需求池里,再花一遍成本。实验数量增加以后,可以按照核心变量、用户群、业务场景、策略方向和实验状态做简单分类。目的不是建设一个复杂的知识系统,而是让后来遇到相似问题的人,能够先查到过去已经验证过什么。比如再次出现“新用户详情转化偏低”,团队可以快速找到过去针对内容理解、价格感知、信任和操作摩擦做过哪些尝试,各自得到过什么结果。这样新的分析才能站在过去的判断上继续向前,而不是一次次从空白脑暴开始。
实验库有没有价值,最终可以用一个很朴素的标准判断:一个没有参加过当时项目的人,能不能根据这条记录理解为什么做、结果意味着什么,并因此少走一些重复的弯路。
6.5 增长迭代
持续优化并不意味着一直做实验。有些机制得到充分验证以后,下一步应该是扩大覆盖、完善工程能力,让效果稳定地进入业务;有些策略连续得不到支持,就应该停止投入;有些结果暴露出新的用户差异,需要重新分析;还有一些成功本身已经改变了业务结构,让新的瓶颈出现在其他位置。所以,一轮增长工作的结束很少只是“上线”或者“不上线”。更常见的情况是:一部分判断被保留下来,一部分假设降低了可信度,一些方案退出候选池,另外一些问题开始获得更高优先级。资源随着这些判断重新分配,新的优化周期才开始。
实验数量本身不能说明增长做得好不好。一个季度跑了几十个实验,如果大多只是围绕同一个页面反复调整颜色、位置和文案,却没有带来新的判断,实验再多,价值也有限。反过来,一次结果并不理想的实验,如果能够排除一个原本准备重投入的方向,让团队及时停下来,反而可能节省更多资源。实验节奏也不需要刻意追求快,不确定性高、验证成本低时,可以用较短周期快速验证;问题涉及长期留存、复杂供应链、基础能力建设或者较高风险时,则需要给验证留下足够时间。比实验数量和速度更重要的是,每一轮投入以后,关键的不确定性有没有减少,下一步是否因此变得更清楚。
增长优化最终形成的,不是一套永远不变的动作,而是一套不断被校准的判断。目标确定需要改变的结果,模型把结果拆成变量,数据帮助识别当前约束,策略提出可能的改变方向,实验再用新的证据修正这些判断。一轮轮迭代之后,应该留下的不是越来越长的实验列表,而是越来越清楚的业务认识:什么正在影响结果,哪些机制已经得到支持,哪些方向可以停止,以及下一笔有限的资源更应该投向哪里。增长能持续,靠的不是每次都找对答案。错误暴露得更快,新证据能改变下一次选择,这就够了。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!













