博客
客户认可的A/B测试框架:适用于任何账户的7个步骤
一个可重复的流程,用于在多个客户账户中运行A/B测试,无需每次测试花费数周即可更快获胜。
摘要
代理机构在比单一产品团队更严苛的条件下运行A/B测试:多个客户、紧迫的截止日期和分散的指标。本文为你提供了一个可重复的框架,适用于任何账户,首先定义一个真正的转化目标。你将学习如何发现摩擦点而不是追逐利益相关者的意见,撰写预测性假设,并在单变量、多变量和AI驱动的实验之间做出选择。它涵盖了实用的样本量规划、如何防止客户过早终止测试,以及如何像顾问一样解读模糊的结果。最后一步是将每次胜利和失败打包成一本行动手册,使下一个客户的测试周期更快。利用这个结构来减少浪费的周数,并将测试转化为你代理机构的竞争优势。当你把测试视为一个系统而不是一系列一次性请求时,你就不会在每个账户上重复发明轮子。
周一上午9:47。一位客户发邮件要求对其定价页面进行“快速A/B测试”。你还有其他三个正在进行的账户,每个都有不同的分析设置、不同的审批流程和不同的“胜利”定义。这个快速测试需要三周才能达到统计显著性。你已知晓这一点。所以你延长了时间线,设定了预期,然后运行测试。然后你花了一周的一半时间来捍卫它。
这不是测试问题。这是系统问题。如果你必须为每个客户重新发明测试方式,你就不是优化合作伙伴——你是测试执行者。接下来是一个适用于任何客户、任何工具、任何流量级别的七步框架。用它来获得更快、更聪明的测试周期,并在各个账户之间产生复利效应。
1. 在动手之前先确定成功指标
根据Optimizely术语表,A/B测试会随机拆分受众,并向每组展示页面的不同版本。这种随机拆分产生数据。但只有当你知道自己衡量的是什么,数据才有意义。大多数客户说他们想要“更多转化”——但转化可能是注册、购买、演示请求,甚至是滚动到页脚。如果你不固定一个指标,你带来的每个结果都可能被重新解读。
每次合作都从15分钟的目标审计开始。问客户:“如果有一个单一行为翻倍,会让本季度成功吗?”然后把这个答案转化为主要指标。将其作为测试的成功标准。其他一切——跳出率、页面停留时间、次要点击——都成为你观察但不优化的护栏指标。
要非常具体。如果客户说“线索”,就定义什么是线索。线索可能是表单提交,但也可能是电话、在线聊天或下载。每种定义都会改变你应该测试的页面元素。表单提交目标指向表单长度和摩擦。电话目标使你的优化完全围绕点击呼叫的位置和信任信号。如果你一开始没有对齐,你会优化错误的页面。
实例:一个B2B客户想要“更多线索”。你问什么是线索。他们说“合格潜在客户”。这无法追踪。你将其缩小为“使用企业邮箱地址的表单提交”。现在你有了一个主要指标。当你之后测试新的主标题时,你将仅根据该指标进行判断。你也会发现有人试图基于更好的跳出率来宣告胜利。这种清晰度让你免于数小时的争论。
一旦你有了主要指标,就把它写在测试简报上。简报应该用一句话说明:“本测试将根据[metric]进行评判。”与每位利益相关者分享。当副总裁后来建议“嗯,参与度确实提高了”时,你指出简报。你没有移动球门柱。你们是同意这些目标的。
这也是你区分信号与噪音的地方。知道哪些测试最重要是成功的一半。将预算花在最有可能带来收入的测试上,是让代理机构高效的原因。
2. 寻找摩擦点,而非偏好
客户会给你一份“我们想运行的测试”清单,这些实际上都是观点。“按钮应该是绿色的。”“标题应该提到我们的奖项。”你不会运行这些。你运行的是减少摩擦或增加信任的测试。CRO手册都指向相同的杠杆:行动号召清晰度、表单长度、布局清晰度、社会证明和信任信号。
通过观察客户用户在哪里放弃来找到这些杠杆。如果他们没有会话录制或基本事件跟踪,就设置它们。每个客户至少观看五个真实用户会话。不要依赖客户关于“用户会喜欢什么”的意见。数据胜过意见。
需要审计的常见摩擦源:
- 表单要求过多或过少的信息
- 行动号召没有明确说明下一步(例如,“了解更多”对比“开始免费试用”)
- 在承诺点附近缺少信任线索(推荐语、保证、退款优惠)
- 移动端加载缓慢的页面
- 有意想不到的额外步骤的旅程(例如,“注册”然后“验证邮箱”而没有警告)
实例:一个电商客户的结账有一个6字段表单外加一个可选的“创建账户”复选框。你设置会话录制并观看五个用户。两人试图删除预填的优惠券代码,因为他们认为这会应用折扣。一人在电话号码字段放弃。摩擦不在于表单长度,而在于令人困惑的优惠券字段。你的测试不是让按钮更大,而是将优惠券字段移到最终审核步骤。这是一个源于观察而非观点的测试。
要在多个客户之间做到这一点,建立一个共享的摩擦日志。每当某个客户的网站上有用户遇到困难时,记下模式。三周后,你会在另一个客户的网站上看到同样的摩擦。这就是你代理机构的私人研究库。这也是对新客户的有力宣传:“我们在你的市场细分中看到了这个确切的问题。”
不要局限于网站行为。查看退出路径、热图和表单字段分析。目标是找到一个用户流失的清晰点。那个点就是你的测试变量。如果你找不到明确的流失点,运行一个诊断测试:尝试一个完全不同的行动号召、一个更短的表单,或一个完全不同的价值主张。结果即使是无意义的,也会告诉你受众真正的阻力在哪里。
保持摩擦日志更新。当你发现一个反复出现的模式时,用一个截图和一行解释记在日志中。几个月后,你将拥有一个适用于你所服务的每个客户用户反对目录。该目录是一个卖点:“我们已经在你的行业中测试了这个确切的反对意见。以下是我们学到的。”
3. 撰写预测“为什么”而非“是什么”的假设
一个好的测试回答一个问题:“如果我们做X,那么Y会发生,因为Z。”“因为Z”就是假设,它使结果具有可移植性。没有“为什么”,一个获胜的测试不会告诉你关于下一个客户的任何信息。
用“如果……那么……因为……”的结构来表述每个测试。它迫使你思考机制。“将表单从5个字段缩短到3个”变成“如果我们缩短表单,那么完成率将上升,因为用户感知到更少的努力。”现在你知道为什么了。你可以将这个规则转移到任何有长表单的客户。
现在说注意事项。常见的做法是每次都只测试一个变量。这个规则存在是有充分理由的:隔离变量能提供清晰的因果解释。但代理机构很少有时间或流量来运行二十个独立的单变量测试。对于低流量账户,你需要权衡。你有三个选择。
| 方法 | 最适合 | 权衡 |
|---|---|---|
| 单变量测试 | 高流量页面、单一假设、有时间 | 最清晰的因果故事,慢 |
| 多变量测试 | 中等流量、多个独立变量 | 更快,但存在混淆交互 |
| AI驱动的实验 | 低流量、紧迫截止日期、希望机器适应 | 较新的工具,对变体控制较少 |
第三个选择值得认真对待。Optimizely的AI实验说明描述了动态分配流量并为你生成变体的机器学习系统。系统不是设置固定分割然后等待,而是学习哪个变体正在获胜,并实时将流量转移到该变体。这可以将两周的测试压缩到几天——代价是失去一些方法论的纯净性。对于有截止日期的代理机构来说,这通常是值得付出的代价。
不确定哪条路线适合你的客户?在承诺之前,值得理解经典测试与AI驱动测试之间的权衡。
以下是决定方法:如果客户有大量流量和开放的时间表,使用单变量测试。如果他们有中等流量和几个候选更改,运行包含最有希望组合的多变量测试。如果他们的流量低且截止日期紧迫,选择可以在飞行中适应的AI驱动实验。不要让对“真正的科学”的偏好蒙蔽你对客户业务限制的认知。正确的测试是在预算蒸发之前产生你可以采取行动的决策的测试。一个在客户活动结束后才完成的完美功效测试是毫无价值的。
实例:一个本地服务客户每天的流量不大。单变量测试需要数月才能检测到有意义的差异。你撰写一个假设,然后使用动态分配流量的AI实验。几天后,系统显示一个变体领先,并将更多流量引导到该变体。你在客户的活动窗口内得到了答案。你接受这个结果在统计学上不如六周的经典测试那么纯粹。这是一个理性的权衡,而不是妥协。
还要注意,“一次一个变量”的规则如果测试的是全新的页面部分而不是单个按钮,则可以放宽。一个整页重新设计的测试可能会改变多个元素,但假设仍然是连贯的:“一个围绕利益优先文案构建的布局将优于当前的功能列表布局,因为用户基于结果做选择。”只要假设指明了机制,你就可以测试一组更改。只需对客户诚实,你不会知道是哪个元素导致了提升。
4. 根据客户日历而非统计教科书来确定测试规模
统计显著性不是你第21天解锁的神奇数字。它取决于你的基线转化率、你需要看到的最小提升以及你可以引导到测试的流量量。这个领域的每个测试指南都重复同样的警告:运行测试直到你有足够的样本量和持续时间,否则你的结论就是噪音。
在安排测试之前,用通俗的语言做数学计算。估计客户当前的转化率和你关心的最小改进。然后估计在合理的置信水平下你需要多少访客。如果这个数字在客户的季度审查之前无法达到,你有三个选择:扩大流量分配以将更多人送到测试中,接受你的流量可以支持的更大的最小可检测效应,或者将测试转变为不承诺“赢家”的学习实验。
你不需要博士学位来做这件事。使用样本量计算器。输入基线率、你想要检测的效应以及你期望的置信度。该工具会告诉你每个变体需要多少访问者。然后除以客户预期的每日测试流量,得到所需的运行时间。如果运行时间不符合客户的截止日期,在启动测试之前调整其中一个输入。这种对话远比浪费三周的周期便宜。
实例:一个SaaS客户的试用注册页面有稳定但不算大的访问流量。你想检测一个有意义的改进,而你的样本量估计表明测试需要的访问者远多于客户在可用时间内提供的流量。客户需要在六周内为董事会会议得到答案。所以你将流量分配从50/50扩大到90/10——但这仍然不够。相反,你降低最小可检测效应,只捕捉大的胜利。现在测试在时间范围内可行,并且你已经明确告诉客户测试能捕捉到什么、不能捕捉到什么。这是专业的做法。
你还需要一个停止规则。提前决定测试运行多长时间以及你将使用什么显著性阈值。绝不要只因为日历日期而停止。知道何时提前停止实验或延长实验——应该由你的判断,而不是任意的周五,来决定。
5. 防止客户过早终止测试
这是你经历过的场景:星期二,客户发来消息:“测试今天早上上线了。我们现在就发布胜者吧。”你有一个变体领先,但你只达到了所需样本量。你的客户看到了胜利。你看到的是噪音。这是代理机构测试失败的最常见原因——不是糟糕的数学,而是糟糕的利益相关者管理。
在测试开始前设定基本规则。发送一页测试简报,说明:主要指标、计划样本量、你最早查看结果的日期,以及运行期间允许更改的内容。让客户签字。当他们偷看时,这就成了一个你可以指出的预期违规,而不是个人拒绝。这不是要对立;而是保护实验的完整性。
另外,保护测试环境。告诉客户在测试运行期间不应发布其他网站更改。一个在测试页面上宣布中断的横幅、来自另一个供应商的最后一刻设计调整,甚至社交媒体流量激增,都可能污染你的数据。一旦测试之外有东西改变,读数就值得怀疑。
实例:客户的开发人员在测试中途推送了一个新的favicon。它不应该有影响,但也不应该发生。你记录它,记下时间戳,并检查之后结果是否发生变化。如果发生了变化,你重新开始测试。客户通常不理解这有多脆弱。你的工作是在测试简报中明确说明,以便他们认真对待。
另一个常见的客户举动是“我们需要在周五启动活动,你能提前结束测试吗?”除非活动干扰测试本身,否则要抵制。如果提前结束,你可能会做出错误的决定。相反,看看活动是否可以稍微推迟,或者将测试移到不受活动影响的页面。你的测试简报是你的谈判工具。用它礼貌而坚定地拒绝。
还有一个习惯:除非你在寻找技术故障,否则绝不要在测试期间查看结果。人脑对概率的感知很差。一连串的好日子感觉像证据,但通常只是噪音。如果你想偷看,打开样本量计算器。提醒自己还有多少数据缺失。
6. 把结果当作故事来读,而不是判决
测试结束了。变体再次获胜。但“哪个按钮获胜”是你学到的最没用的东西。有用的问题是:为什么它赢了?这个解释适用于其他页面吗?我们发现了关于这个受众的哪些以前不知道的东西?
这是大多数代理机构停止的地方。他们发布获胜变体,给客户发送PDF,然后继续前进。这是一个错失的机会。一个零结果——变体没有打败对照组——仍然是一个结果。它告诉你受众不在乎那个变量,或者原版已经足够好了。记录这个学习并应用于下一个测试。最佳实践指南一致强调每次实验后记录学习;这使测试从一系列一次性事件转变为复利资产。
实例:你测试了一个带照片的推荐语与一个纯文本引文。纯文本引文获胜。你深入挖掘原因。图片看起来像摆拍;客户的受众持怀疑态度。教训不是“推荐语不起作用”,而是“这个受众想要真实、不具名姓的证明,而不是精心修饰的照片。”下个月,另一个客户询问社会证明。你已经知道不该给他们看什么。这就是把结果当作故事来读的投资回报率。
解读结果不仅仅是检查p值。还要看方向、幅度和细分差异。如果你不确定是否相信你所看到的,重新审视基础知识。一份关于如何正确解读A/B测试结果而不被噪音误导的指南会让你保持诚实。
还要考虑“那又怎样”测试。将指标翻译成客户的语言。在极小基线上的大幅相对提升可能转化为几乎为零的收入,而高流量页面上的小幅提升可能意味着巨大的收益。不要让相对变化蒙蔽你的绝对价值。客户关心的是底部的数字,而不是置信区间。
当你呈现零结果时,不要道歉。把它框定为数据点。“我们了解到标题长度不会改变这个受众的转化。”这使我们免于再次运行这个测试。零结果是对一个问题的清晰回答。它不是失败。
7. 将每个结果转化为可复用的规则
现在是最后一步,也是将“做测试的代理机构”与“押注测试的代理机构”区分开来的一步。每次测试后,写一页行动手册条目。格式保持一致:客户类型、假设、结果、建议。将其存储在每个可搜索的地方。然后,在运行任何新测试之前,搜索行动手册是否有类似情况。你经常会发现你已经学过了即将再次学习的东西。
这就是测试如何成为代理机构的竞争优势。客户A的“优惠券字段令人困惑”的发现使你不必为客户B的结账设计同样的有缺陷的测试。客户C的“推荐语没有带来改变”使你可以测试其他东西。行动手册是你真正出售的资产,而不是报告。
行动手册条目清单:
- 客户行业和网站类型
- 测试页面和测试的变量
- 以“如果……那么……因为……”形式呈现的假设
- 主要指标结果:赢、输或零
- 你确定的“为什么”解释
- 你会在新客户上复制的一个行为
- 你绝不会再尝试的一个行为
实例:一个健身应用客户测试了只有邮箱字段的免费试用表单与名字加邮箱的表单。单字段版本带来了小幅但持续的胜利。你写下行动手册条目:“对于冲动驱动的受众(健身、食品),尽早减少必填字段;稍后收集个人详细信息。”六周后,一个餐包客户询问他们冗长的注册表单。你调出行动手册条目,推荐同样的简化,并满怀信心地运行测试,因为你已经知道可能的结果。这就是复利效应。
最后,每月与你的团队举行一次“学习回顾”。回顾你在所有客户中的学习。将指向同一基本原理的条目合并。将这些原理转化为未来测试的指导方针。例如,如果两个不同客户看到单字段表单的转化率更高,那么“在承诺之前要求最少信息”的原理可能在其细分市场中都是正确的。这个原理现在会影响每个新客户的着陆页建议,甚至在运行测试之前。
这个框架有效。但只有你真正建立系统,它才有效。从一个客户开始。应用所有七个步骤。然后将它们应用于下一个客户,并让行动手册承担越来越多的工作。你将不再问“我们应该测试什么?”,而是开始问“这里适用哪个已知规则?”这就是运行测试的代理机构与交付更好结果的代理机构之间的区别。
