过去一年,阿里云PAI机器学习团队做了很多面向业务的实践,其中一个是基于MaxCompute+PAI的产品解决方案实践,解决客户增长相关的问题。本文主要分享阿里云团队在用户增长领域的一些探索和实践。希望这篇分享能在用户增长方面给你带来一些帮助。
第一,用户增长模式

AARRR
用户的增长更多的是针对互联网类型的公司,互联网客户的业务本质上是解决用户增长的问题。从商业角度来看,用户增长有多种模式。今天主要讲解AARRR用户增长模型。
在整个AARRR用户增长模型中,MaxCompute+PAI可以做哪个模块?能给客户带来什么价值?
MaxCompute+PAI业务支持架构
以MaxCompute+PAI作为支撑用户增长的基础,产品架构如下图所示。
从计算引擎层是MaxCompute,计算引擎之上是AI场景。我们专注于基于PAI机器学习的AI能力赋能用户成长的商业场景。首先我们提供一个开放的框架,可以基于TensorFlowPYTorch,SQLPYSparkSpark开发自己的算法模型。上面的产品层是PAI机器学习的产品体系,整个产品体系也作为我们业务的支撑,包括PAI-DLC(Cloud Native Deep Learning Runtime Environment),可以把自己的代码训练脚本打包成镜像包,在DLC中运行。PAI-Studio会把用户增长领域相关的运营商模块化,简单拖拽即可。可以做整个用户增长的模型训练。技术能力强的派-DSW开发者可以开发自己的脚本,而不是使用我们的打包脚本。PAI-EAS(模型在线服务)可以从studio和DSW生成的模型生成RESTful API,然后通过HTTP请求调用服务。生成的RESTful请求可以支持解决方案,包括广告RTA解决方案、广告DSP解决方案、智能推荐解决方案、用户召回解决方案和LTV计算解决方案。最终的解决方案是解决用户增长的问题,包括带来新产品、推广活动、留存、创收、分享。
二。MaxCompute+PAI用户增长分类目的详细方案
用户增长-新增
目前,广告仍然是互联网客户的核心和重要手段。广告行业的一个流行方案是RTA。MaxCompute+PAI在RTA方案中的作用是什么?首先看RTA的原理。以前一个APP想吸引新用户,会把钱投到DSP广告平台,平台会圈用户竞价。RTA做了一件事,就是当广告主想控制一部分DSP人群的时候,以前是没有办法的。在RTA的技术支持下,开放了一个接口,广告平台每次选择圈内用户,都会要求一个模型。这个模型的作用就是告诉平台这个用户要不要。那么MaxCompute+PAI就可以帮助客户生成这样的模型。
通过MaxCompute做数据清洗,通过PAI做竞价模型训练,通过模型筛选值得投资的用户。
核心优势
1.强大的数据计算能力:MaxCompute提供PB级的数据计算能力。
2.丰富的算法:PAI提供经典的机器学习算法如LR、GBDT,以及深度学习算法如DeepFM和MultiTower。
用户增长促进活动
新用户少了,我们希望现有客户能在我们平台上多花点时间浏览,多点点击。打开一个互联网APP,70%以上的APP都有提要流推荐,也可以叫相关性推荐。这个系统的精准推荐率影响着用户在平台上的活跃度。如果推荐的内容是用户喜欢看和浏览的,自然会增加平台的点击量,停留时间也会增加。比如业内流行的短视频app,其实都有比较好的个性化推荐系统。那么如何建立一个基于MaxCompute+PAI的推荐系统呢?如下图所示,可以基于Max Compute+PAI+data works+Holograms+Flink做一个相关性推荐系统。更多详情可参考文章:PAI平台搭建企业级个性化推荐系统。
一个好的推荐系统需要一个在线服务模块,分为多路召回、过滤、排序、冷启动。召回模块是做一个粗略的筛选。比如一个用户进来,我们平台有1000万个商品。把这个用户和1000万个商品对比,其实计算量是很大的。也就是我先做一个粗略的筛选,比如选择几百种商品。这个时候我就按这个用户来排序这几百个商品,整个计算的复杂度就会变得很低。
那召回和排序这两个模型怎么用MaxCompute+PAI训练呢?从架构图的角度,在底层,我们要把用户的行为日志、用户画像数据、素材属性数据这三个核心表格上传到MaxCompute,用DataWorks对表格做特征处理,处理训练样本、用户特征数据、素材特征数据。接下来进入PAI-Studio,一个内置的建模平台,里面内置了大量推荐领域的算法,比如PAI-EasyRec,GraphLearn,Alink。我们使用PAI-Studio中的召回算法产生一些基本的召回表,如u2i、i2i和c2i,并将这些结果放入全息图中。我们可以将多通道召回服务与全息图相关联,这解决了训练我们的召回模型的问题。
排序服务可以在PAI-Studio中选择排序算法并生成排序模型。排序模型可以部署在PAI-EAS中,成为RESTful API,这样排序模块就可以请求排序模型的RESTful API,并产生实时的排序结果返回。
经过我们的多次召回,我们筛选出一些重复的产品,并进行排序,然后我们可以得到一个TopN推荐列表。它可以显示在应用程序的提要流中。MaxCompute+PAI的价值在于完成整个分拣业务的数据处理和模型训练。这套相关性推荐系统将有效提高我们APP中feed流的CTR和CVR的转化率,帮助APP提高用户的活跃度和停留时间。
用户增长-保持
当一个APP有几百万、几千万或者几亿用户的时候,数据库里存储了大量的历史用户,但是没有一段时间使用过这个APP的用户。所以,在当前互联网困难的情况下,我们需要对“沉睡”的用户和流失的用户进行一次召回。目前互联网行业流行的方案是通过短信召回,因为短信没有打电话的限制,不会像推送一样被拦截。就短信而言,到达用户的效果和概率还是比较高的。
基于MaxCompute+PAI,为小说、社交、游戏等多个行业构建了丢失用户短信的召回解决方案。
一般的做法是将用户的埋藏数据存储在MaxCompute中,通过DataWorks做特征处理,用PAI机器学习平台训练一个流失用户的召回模型。然后,我们可以对现有的股票用户做一个预测,预测哪些股票用户在被短信触达时,返回app的概率较高,这样我们就可以只通过短信召回这些高概率用户,这样可以节省我们的召回成本,提高我们的召回率。
客户案例

客户是一个陌生人社交APP,图书馆有近1000万睡眠用户。通过短信实现对流失用户的召回。
PAI核心价值:
使用PAI后,百万短信召回率从3%提升到8%,效果提升267%,成本变相降低2倍左右。
用户增长-LTV分数计算和份额分数计算
PAI+MaxCompute构建分数预测模型,可以预测LTV分数,共享概率分数。
当一个APP通过广告带来一个用户的时候,它会关心用户是否会付费,或者产生多少APP价值。有些客户需要在新用户进来的时候,计算这个用户在APP上的未来消费。如果这个用户是高价值用户,就需要通过优惠券或者补贴来激活。我们提供一个LTV方案,比如一个APP的新用户。我们如何计算他的LTV分数?
找第三方数据源,因为新用户还没有在APP里生成任何行为日志。MaxCompute+PAI会提供一套联合建模方案,符合可信计算标准。也就是说,用户数据和第三方数据不会有任何联系。双方的数据可以联邦建模,在PAI中可以生成一个模型。该模型可以对每个新用户进行LTV评分,并根据LTV指导后续运营活动。
客户案例
场景:客户是一个新奇的平台。对于纯新用户,需要做一个30天内购买VIP服务的预测。为了在用户行为较少的情况下,预测用户未来的VIP购买行为,新用户可以有针对性的运营,提高运营效率。
对于纯新用户,VIP购买判断的准确率明显提升。选取40%左右的用户作为训练数据,联邦建模生成的模型可以识别出67%会自然购买VIP的会员,从而提高运营效率67.5%。
三、实用介绍——流失用户的召回
将数据上传到MaxCompute
通过MaxCompute的Tunnel命令将数据上传到项目:tunnelupload { file } { table }
文件链接:https://help.aliyun.com/document_detail/196187.html
工作流构建
进入PAI-Studio,完成工作流的构建。
训练样本:7天不登录者视为流失用户。
通过过滤注册日期和上次登录时间,可以确定哪些用户7天不登录。
特色加工
通过处理将数据变成结构化数据。
一键编码
一键编码可以将类别变量转换成易于使用的机器学习算法形式。一热转换后的格式如下图所示。
模型训练和评估

逻辑回归模型训练。PAI平台上有几十个分类模型。判断短信能否召回可以定义为一个二元分类问题,是/否,二元分类算法可以用于模型训练。经过逻辑训练后,我们可以使用一些数据作为测试数据来获得模型效果。我们在二级评价下生成模型评价报告。ROC值的面积越大,模型效果越好。
模型预测法
生成模型后,我们可以将模型部署为RESTful服务,业务方或者运营同学都可以调用。调用格式如下图所示:
原文链接:http://click.aliyun.com/m/1000294271/
本文为阿里云原创内容,未经允许不得转载。


