导游语言
推荐系统的本质是信息过滤,多个信息漏斗逐渐将最感兴趣的内容呈现给用户,如图1所示。召回阶段作为第一个漏斗,从多个维度筛选出用户可能感兴趣的内容,交给后续的排名技术,直接决定了后续推荐结果的效果上限。本文主要介绍爱奇艺推荐团队的多兴趣召回技术的发展。与其他召回技术相比,多兴趣召回技术可以同时挖掘用户的多个潜在兴趣,突破个性化推荐系统中传统的“千人千面”,达到“千人千面”的效果。

1技术背景:如何召回“好苗子”,打破信息茧房。
优秀的视频推荐系统可以将视频精准地分发给兴趣匹配的用户。这个过程可以比喻为优秀运动员经过层层选拔,在世界大赛上成功登顶,而回忆阶段则相当于运动员青年时期面临的第一次市场组队选拔。
优秀的国家队教练虽然专业水平过硬,但没有不同天赋的好苗子,很难培养出世界级冠军。虽然排序技术可以通过大量的特征和精密的网络来提升效果,但是如果所有召回的视频质量都很差,排序技术效果的上限就会被提前锁定。所以国家队教练需要多个省市的体育人才作为选拔来源,排序技术需要多个回忆来源作为内容进行排序。
说到召回技术,熟悉推荐的同学会举出很多策略和算法。例如,策略包括利用考虑内容相关性的频繁项集挖掘Apriori、利用用户相关性和内容相关性召回itemCF、基于协同过滤召回SVD等。该算法包括item2vec和node2vec,将内容变为嵌入然后搜索其邻居,使用内容理解的CDML召回,GNN召回等。
图2 多兴趣召回主要流程[2]如图2所示,多兴趣召回技术和其他召回技术一样,依赖于用户过去的历史行为,但不同的是,多兴趣召回技术可以学习用户的多种兴趣表达,将个性化推荐从“千人千面”升级到“千人千面”。每个兴趣表达都可以根据最近邻搜索得到对应的视频,成为召回源。一方面,多兴趣召回技术符合大多数用户兴趣爱好不同的现实,可以使推荐结果准确丰富,可以防止内容同质化带来的感知疲劳;另一方面,多兴趣召回技术除了挖掘用户已有兴趣外,还不断挖掘用户从未发现的潜在新兴趣,防止传统推荐算法造成的“信息茧房”现象,让爱奇艺在线的海量文化资源呈现在用户面前。
同时,由于爱奇艺丰富的产品矩阵,一个用户往往会同时使用包括爱奇艺基线、时间戳、奇异果等多种产品。在混合训练多端用户行为的情况下,往往可以提取出不同端用户的不同兴趣和不同端用户的共同兴趣。这些兴趣往往可以帮助用户找到自己喜欢的社区和圈子,完成产品之间的渗透和爱奇艺产品矩阵的复合生态构建。爱奇艺的短视频推荐现在使用了多兴趣召回技术,比如聚类多兴趣召回、MOE多兴趣召回、单激活多兴趣召回。本文将依次介绍它们。
02聚类多兴趣回忆
聚类多兴趣召回的主要优点是不需要训练复杂的神经网络,只需要使用其他在线深度学习嵌入就可以形成多个兴趣向量,时间和空之间的代价很小。主要理论基础是KDD2020提出的兴趣聚类方法PinnerSage[3]。。
PinnerSage聚类多兴趣召回是在传统ii召回的基础上结合聚类方法提出的一种新策略。传统的ii召回通常有两种方式:1。选取用户短期历史行为的每一个视频,进行多次ANN搜索选取相邻视频,不仅时间成本高,而且导致推出的视频同质化严重。2.汇集用户短期历史行为的所有视频嵌入,形成代表用户的用户嵌入,然后搜索ANN邻居。这种方式可以在一定程度上融合信息,减少时间成本空,但容易造成信息丢失。如图3所示,来自池化的嵌入可能在108,000英里之外。
图3PinnerSage利用两者的优势,在用户的历史行为中对视频进行聚类和分组,并汇集形成多个兴趣向量。聚类既避免了多个ann带来的压力,又在一定程度上避免了信息丢失。PinnerSage聚类多兴趣回忆分为两步:
A.聚类过程。如图4所示,用户观看的所有视频都是聚类的。Pinnersage聚类采用层次聚类方法。而不是像K-Means一样设置初始类别数,先把每个视频看成一个类别,然后每两个类别合并。如果合并组中的方差至少增加,则两个类别可以合并为一个类别,然后方差将被停止,直到超过阈值。
图4B.取出嵌入过程。PinnerSage仍然不对类中的视频嵌入进行平均,而是选择类中的一个视频嵌入作为类的代表,它需要满足与类中所有视频嵌入的最小距离。然后用这些代表用户兴趣的嵌入进行人工神经网络。
多兴趣聚类召回可以通过简单的策略形成用户的多个兴趣,时间成本较少。但由于其他算法形成的嵌入空,在学习很多兴趣时容易出现偏差,发布的内容往往过于火爆,无法满足个性化的要求。因此,团队不断向深度学习领域的多利益网络发展。
3 MOE对回忆感兴趣
双塔模型是业界主流的召回模型,但在实际场景中效果有限。因此,团队修改了双塔用户侧的塔结构,引入了类似于MOE[4]的结构,提取多个向量来表示用户的潜在兴趣,得到了很大的提升。MOE是多目标学习中广泛使用的经典结构,根据数据分离训练若干专家模型。最后,我们将几个专家模型的输出作为用户兴趣向量,与视频端提取的向量进行内积计算,得到最相似的用户向量参与损失计算。
图5MOE多塔结构如图5所示,左边是用户端的MOE多塔部分,右边是视频端的单塔部分。该模型的实现细节包括:
A.用户端的输入主要是用户的偏好序列,包括用户偏好的视频id序列、上传者id序列和内容标签序列。序列特征经过嵌入和平均池后得到不同的向量,这些向量拼接形成MOE多塔的输入。经过MOE多塔计算,得到多个向量来表示用户的潜在兴趣。
b、视频端为单塔结构,输入为用户交互过的视频id、上传者id和内容标签特征。经过嵌入提取和拼接,利用单塔结构提取信息。
C.在损失的计算上,由于召回是从数千万的视频库中寻找数百个用户可能感兴趣的视频,实际样本中的负样本空非常大。为了增加负样本的筛选能力,提高负抽样的效率,我们在模型中采用了批量负抽样,将其他批量样本作为当前样本的负样本。同时,利用焦损失损失函数来提高对困难样本的识别能力。
修改后的MOE多塔模型上线后,单个召回源的点击率和人均观看时长都有大幅提升。
修改后的MOE多塔模型上线后,单个召回源的点击率和人均观看时长都有大幅提升。而MOE塔共享底层输入,仅使用简单的DNN网络提取不同向量,导致塔间区分度低,很多冗余向量难以优化;此外,用户序列特征中包含的实际位置信息对用户非常重要,目前的模型很难使用,所以我们希望通过其他网络来利用它。
04单激活多兴趣回忆
Activate multi-interest recall从19年前开始被业界使用,其中最不可避免的就是阿里提出的MIND[3],利用胶囊网络动态路由收集用户序列的多兴趣,在测试集上取得了爆炸式的效果,激起了全行业探索多兴趣网络的热情。推荐组也做了一个探索。
4.1单激活多兴趣回忆第一版
受MIND和其他网络的启发,该团队探索了单激活多兴趣网络的初始版本,网络结构如图5所示。在心智网络中,胶囊网络用于捕捉用户的兴趣,胶囊网络可以同时捕捉观看的序列信息和视频之间的相关性。但由于结构复杂,计算成本高,而且观看序列只需要单一维度来表示网络对位置信息不太敏感,所以团队选择transformer结构来代替,以保证训练速度。

流程大致如下:
A.截取用户观看的视频的id序列{V1,…VN}作为样本,将第n+1个视频作为目标输入网络,嵌入序列E={E1,E2,..EN}在穿过视频嵌入层之后形成。
B.e通过transformer构造的兴趣提取层得到多个兴趣向量M,取最大的兴趣向量|Mi|并嵌入目标视频进行采样softmax loss负采样,所以每次训练实际上只激活一个通道的兴趣向量。
C.模型训练完成后,在推理阶段,取出用户的所有兴趣向量,通过人工神经网络搜索逐一获得召回结果。
第一版虽然结构简单,但上线后效果不错,大大提高了消费指数、视频覆盖面和多样性。但第一版存在重复度高、特征少、不同兴趣向量的回忆结果即时性差的问题,也导致了几个版本的演变。
4.2不合规化多兴趣回忆
4.2中兴趣向量之间没有约束,容易造成兴趣向量过于相似的问题。因此,有必要在损失函数中加入一个正则项。由于第一次多兴趣回忆的主要部分是transformer,所以团队在不改变网络结构的情况下使用三个常规函数进行探索[4]。
图7如图7所示,学习到的视频嵌入、注意力和兴趣向量分别被正则化和约束。在实际生产环境中,发现直接正则化兴趣向量可以达到最佳效果。
4.3容量动态多兴趣回忆
不同的用户往往表现出不同的兴趣分歧,所以兴趣向量的数量应该是一个弹性指标而不是一个超级参数。在4.1和4.2的基础上,如图8所示,在网络结构中引入了兴趣激活记录表。
图8在训练过程中,每当任何用户的兴趣向量被激活时,记录表将记录这种激活。在推理阶段,回溯激活表的情况,剔除用户不活跃或不太活跃的兴趣向量,达到动态兴趣数的目的,从而匹配不同用户兴趣分歧不同的现实。
4.4多模态特征和多兴趣回忆
4.1-4.3中,多兴趣回忆仅使用视频id特征,学习效果仍然有限。因此,在后续版本的开发中,将上传者和内容标签整合到训练中成为主要方向。如图9所示,它是网络的主要结构。
transformer部分与4.1-4.3大致相同,只是训练样本加入了上传者和内容标签的特征,然后通过嵌入和池化部分进入Transformer。有两点值得注意:
损失部分仍然只对视频id的嵌入进行负采样,这样视频id的所有嵌入都可以进入负采样,而不会批量折衷负采样,这样可以使最终推理阶段主要使用视频id嵌入更加准确。一个视频往往有多个内容标签,因此在嵌入内容标签时,需要在嵌入所有内容标签后进行池化操作。
图94.5总结
如4.1-4.4所示,单激活多兴趣网络经历了多次进化,改进后的应用带来了显著的效果,全终端CTR显著提升2%,全终端时长提升1.5%,人均播放量提升1.5%。尤其是在推出视频的多样性上,直接提升了4%以上。
同时,爱奇艺作为一个适合各个年龄段的内容平台,一直存在不同年龄段的用户以家庭为单位使用同一个账号的情况。因此,同一账号下的历史行为往往来自各个年龄段,用户历史行为的复杂性给推荐带来困难。而单激活多兴趣网络的兴趣向量在学习过程中是随机的,在数学表示上是正交的,这使得兴趣向量的搜索范围召回了不同年龄段的人喜欢的海量视频。
激活单一的多利益网络是当前的学术热点之一。希望更多的研究者能提出新的想法,让推荐技术继续发光。
05总结与展望
本文大致展示了爱奇艺短视频推荐召回技术中多兴趣召回的发展。多兴趣召回最大的亮点是可以提取一个用户的多个兴趣,让“千人千面”的画像进入“千人千面”的高维空,让推荐结果同时提高准确率和丰富度。同时也是有意测试,不让用户进入信息茧房。同时,在解决爱奇艺产品矩阵生态构建复杂、用户历史行为复杂等问题的路上,也对该技术进行了探索。
本文还认为多兴趣召回仍然可以优化:
在行为序列的选择上,大部分多兴趣策略和网络仍然只考虑用户的观看历史。如果能利用事件知识图谱,将用户在平台上的搜索、订阅等行为纳入训练数据,应该能捕捉到更多用户的兴趣和倾向。在处理负反馈信息时,多兴趣召回无解。视频中的很多行为,比如点击、负面评论、不喜欢、取消关注,都没有被整合到多兴趣召回中。这些信息对引导兴趣网也很重要,这个方向会成为后期的重点工作。在用户静态信息和偏好特征的整合上,也有很大的应用空。这些特征的结合可以很好地对准排序目标,提高召回源的质量和排序效果的上限。参考
[1] 2021-2-26,如何提高链接目标的一致性?爱奇艺短视频推荐粗糙排名模型的优化过程

[2] AdityaPal,et al . pinner sage:Pinterest推荐的多模态用户嵌入框架。KDD 2020
[3]马,等.用多门专家混合法模拟多任务学习中的任务关系.KDD 2018
[4]岑宇阔,等.可控多元利益推荐框架.KDD 2020。
[5]李超等.在天猫上用动态路由进行推荐的多兴趣网络.CIKM 2019。
[6]李健等,《分歧规则化中的多头注意力》。EMNLP 2018


