常见的互联网工具

核心提示作 者:夏延山来 源:正和岛大航海时代对于人类来说,不仅仅是地理大发现,还有源源不断的商业冒险,以及包括航海科技在内的各种技术进步,其中有些甚至难以称之为“技术”,但同样推动了时代的飞跃。航海过程中最大的难题之一,其实还不是面临的可怕未知和

作者:夏燕珊

来源:正和岛

对于人类来说,大航海时代不仅仅是地理上的大发现,还有源源不断的商业冒险和包括航海技术在内的各种技术进步,有些几乎不能称之为“技术”,但也推动了时代的飞跃。

航海中最大的问题之一,其实并不是可怕的未知和飓风海浪,而是缺乏包括新鲜蔬菜在内的补给,这会让船员患上坏血病——这是一种数百年来困扰远航水手的疾病。直到18世纪,一位名叫林德的英国医生出现,这个问题才得以解决。

事实上,林德当时并不知道这种疾病的原因是维生素C缺乏,但为了找到解决这种疾病的方法,他将12名患病的船员分成6组,用不同的方法进行治疗,比如第一组吃水果,第二组喝海水,第三组喝稀释的硫酸,等等。结果他很快发现,吃水果的那一组患者病情好转,而其他几组则没有疗效。经过反复实验,他认为他找到了治疗坏血病的良药。

这种不断验证假设,最终找到正确路径的科学方法流传至今,在很多行业都有不同的叫法。比如制药行业就叫“受控试验”。进入互联网时代后,人们更多地称之为A/B测试。

“Tik Tok”这个名字的由来是一个经典的A/B测试。当初说这个热门的短视频应用有好几个名字可以选择。经过A/B测试,结合商家自身对用户心理的思考,最终决定使用“Tik Tok”这个名字,一炮而红。

这个案例之所以引起了很多关注,是因为它改变了人们的决策依据——“Tik Tok”虽然颇具辨识度,但并不是一个自然的名字,也不是一个天才的突发灵感,而是在与其他“对手”经过PK后成为最终的Chosen1。

这是竞争的结果。从决策的角度来看,在互联网时代数据和工具丰富的背景下,A/B测试基于数据的理性表达,可以作为方法论在各种决策场景中发挥重要作用——它不仅可以评估几个方案中的最佳方案,还可以评估它到底好到什么程度。另一方面,它的“试错”特性也可以帮助测试人员避免业务陷阱。

换句话说,在当今的大数据时代,如果你想在决策时保持理性,摒弃经验主义,你就绕不过A/B测试——事实上,无论是医药行业还是互联网大公司,都早已将这种方法论运用到了极致,它已经成为商业模式中不可或缺的一环,并在这个过程中受益匪浅。现在,是时候让这种方法论表现出更多的包容性了。

01.A/B测试并不神秘。

去年,国内疫苗发展到三期临床研究阶段后,往往选择在国外进行相关试验,因为国内疫情已经得到有效控制,所以需要在国外推广相关试验,获得足够的样本来评估疫苗的有效性和安全性。

参加疫苗接种试验的人通常被称为“实验组”,而另一组没有接种疫苗的人被称为“对照组”。将实验组与对照组疫苗接种产生的抗体进行比较后,最终得到一个完整的疫苗评价,然后逐渐扩大实验组,直到开始对普通人群进行大规模疫苗接种。

这种方法的优点是,既能得到普遍的科学效果评价,又能在出现问题时把风险控制在相对较小的“实验组”范围内,把损失降到最低。

美国空陆军选择第五代战斗机也体现了同样的道理。20世纪80年代中期,美国两大军火巨头洛克希德和诺斯罗普都获得了第五代战斗机的研发合同。两家公司根据自己对“21世纪空战争模式”的理解,按照不同的理念设计自己的飞机,做了两架原型机,一架用F119发动机,一架用F120发动机。美国空陆军根据总共四架原型机的试飞结果选出了第五代战斗机的最佳方案,其中包括发动机的选择——洛克希德公司最终赢得了竞标合同。

虽然每个行业都有不同的做法和名称,但这些其实都隐含着A/B测试的思想。

然而,在注重快速迭代的互联网公司中,A/B测试的应用几乎无处不在——大多数都是为某个功能提供两种或两种以上不同的替代方案,UI、文案、广告等。这需要改进,然后选择少量用户并随机分配给不同的方案。最后,结合一定的统计分析方法,对实验数据进行比较,确定最优方案。

比如在Google,每天可以同时运行上百个A/B测试,让产品或功能的优化尽可能满足用户的需求。

另一家互联网巨头字节跳动,除了建立自己的A/B测试文化,也在通过其企业级技术服务平台“火山引擎”将字节跳动的A/B测试工具开放给更多企业,帮助其他企业实现更高效的数字化成长。来自火山引擎的两位RD专家认为,A/B测试非常有用,并不是一个高不可攀的数字工具。即使其他企业没有技术能力,也可以利用这一工具实现准确、可预测的数字化业务增长。

值得一提的是,与大多数对照试验相比,A/B试验有两个重要特点。第一,用户样本需要反映整体的用户特征,在对用户分组时要求具有随机性和统一性。第二,在分析结果时,要充分结合统计学基础,注重数据分析,充分判断结论的可信度。

A/B测试已经成为决策过程中的一个标准环节,但是首先要建立A/B测试的公司文化,才能真正用好这个被证明的方法论。

2.建立A/B测试的公司文化。

大多数企业都有“创始人文化”,也就是创始人是什么风格,那么这家公司就是什么风格——如果是权威的、实证的商业成长模式,那么就不要指望这家公司会对A/B测试感兴趣。相反,如果是开放的用户思维、市场至上和实用主义,并且是基于理性的数据来做决策,那么就需要A/B测试来起到推动公司发展的关键作用。

1.首先要做的是,做决定的时候,不是基于“我认为”,而是因为“数据证明”。

“我认为”非常容易陷入认知误区。

比如二战期间,据说英国空陆军在评估作战飞机的机身加固时,专门研究了执行实战任务的飞机,发现这些飞机的机翼位置被拍了很多,但是驾驶舱位置被拍的比较少——似乎应该重点加强机翼部分?

然而,事实并非如此。因为所有参与评估的飞机都安全返航,而那些机舱被击中的飞机往往在战斗中损失惨重,却没有飞回来——这意味着如果“拍脑门”决定加固机翼部分,将会导致一个巨大的错误。

最可靠的改进方案是获取足够的数据——无论是飞回基地的,还是被击落的。

2.第二个关键点是要能够不断地提出假设并加以验证,直到找到正确的答案。

在Airbnb高速发展的那些年,曾经发现纽约出租和挂牌的房源增加了很多,但订单数量并没有明显增加。经过一番了解,认为原因可能在于房屋的照片——房东用手机拍照,大多没有接受过专业的拍照培训,所以拍出来的照片效果不佳,导致订单量增加不明显。

为了检验这个假设,Airbnb专门拍摄了一些房屋的照片,并通过技术手段调整照片质量。结果发现这些房子的出租订单是平均水平的两三倍。

这个假设已经被证实了。为此Airbnb官方组建了一个几十人的专职摄影师团队,帮助自己平台上的房东拍照。结果,纽约的订单数量在一个月内增加了两倍。

这种方式在纽约获得成功后,Airbnb将这种方式复制到了其他城市,整个平台的订单量得到了大幅提升,甚至超过了酒店巨头希尔顿。

Airbnb的成长曲线就是一个假设验证和数据驱动的绝对例子——找到现象,然后提出假设,再通过数据验证假设,从而为决策提供依据,直到得到一个关于发展模式的解决方案,并推广到更大范围。

这就是A/B测试的本质——测试有价值的功能,获得用户的真实反馈,通过增加价值和解决问题来改善产品体验——虽然这需要大量的重复性工作和时间成本,但考虑到收益,这些成本是值得的。

对于一个公司来说,当前的大数据时代也让人们更容易获取数据,这提供了一种新的工具思维——在一个重大产品或功能上线之前,先通过A/B测试验证假设,从数据角度为科学决策提供重要依据,从而跳出经验主义可能带来的商业陷阱。

因此,从发展的角度来看,一个公司必须建立A/B测试的文化,并巧妙地使用这种方法论,以便能够在需要的时候随时打开A/B测试。

03.运行完整的A/B测试

A/B测试的应用也需要一定的工具基础。

对于一个公司来说,目前有两种A/B测试工具,一种是公司自己的测试工具,一种是第三方的测试工具。自建测试工具的优点是过程可控,缺点是投入大,对于个别测试需求显得性价比不高。此外,即使自建测试工具,他们也可能没有足够的经验来执行测试和分析结果。基于此,以火山引擎为代表的第三方A/B测试工具日渐流行。

火山引擎是从互联网巨头字节跳动孵化出来的一个业务部门。从“引擎”这个名字来看,它是一个面向企业市场的组织。

至于A/B考试,早在2012年字节跳动成立时就开始了。经过不断的改进和升级,它成为了一个大型测试平台,不仅服务于字节跳动的所有业务线,还具备了为外部客户提供服务的能力。字节跳动的A/B测试从2018年开始服务部分种子客户,2020年将由火山引擎实现商业化。

火山发动机的A/B测试工具已经按照垂直领域进行了标准化,用户可以根据自己的行业特点选择相应领域的标准化产品,即使没有技术团队,技术投入很少,也可以进行A/B测试。

A/B测试分为四个步骤:

1.确定目标,或者定义目标。

目标可以理解为业务发展指标。举个具体的例子,某知名网络名人饮料品牌,想通过A/B测试来确定哪种饮料包装更好。那么,如何决定饮料的包装最合适呢?这个品牌采用的是“购买率”这个指标。通过观察不同颜色和设计的饮料包装与用户购买率的关系,可以确定哪种包装最受用户欢迎。

2.构建假设

假设来源于具体的需求,同时假设本身也需要“具体”。以饮料包装为例,我们的假设可能是红色调包装的购买率比绿色调包装高1.4%。充分的假设不仅反映了实验者对用户/业务需求的理解,还与实验的持续时间和要覆盖的实验样本数量有关。

3.创建并运行测试

完成以上两个步骤后,在运行实验之前,需要找出目标用户。以更换饮料包装为例。目标用户是随机访客,通过这些访客可以找到最受欢迎的包装。然后通过流量分配开始运行实验——在特定时期,分别提供两个饮料柜,一个是对照组,原装,一个是实验组。假设每天提供不同颜色包装的相同饮料,持续一周。实验期结束后,分别统计实验组饮料柜中不同颜色饮料的销售额,然后对对照组饮料的销售额进行分析比较。

如果对照组的销量明显低于实验组,说明确实有更换饮料包装的现实需要。如果实验组中一种颜色包装的饮料远高于其他颜色包装的饮料,说明该颜色可能是消费者最喜欢的外包装。

4.优化和完善

当A/B测试的测试结果逐渐清晰时,我们就可以根据数据来判断测试是否已经成功。如果成功的话,我们可以将测试结果推广到更大的范围。如果不成功,我们可以继续构建假设,直到得到想要的结果,确定最优版本。

A/B测试作为一种有效的工具,展现了一种科学审慎的原则,展现了用户时代的用户思维,从而实现了数据驱动增长的逻辑。

04.结论:判断靠数据,但又超越数据。

A/B测试的另一个优点是,几乎所有的测试版本,包括失败的版本,都可以提供一些价值。

比如那些在A/B测试中被淘汰的版本不一定完全没用,在统计中跑赢的实验版本也不一定是最好的,所以需要决策者整体考虑——这个测试只是提供了一个数据驱动的参考,但不是万能的,也不是唯一的答案。

以Tik Tok的命名为例——字节跳动完成产品名称的A/B测试后,从数据上看,“Tik Tok”并不是首选,但最终成功了,说明最终的决定是综合考虑的结果,这取决于决策者的判断,而不是数据本身——依赖于数据,但又超越了数据。

 
友情链接
鄂ICP备19019357号-22