目前,基于大数据的推荐系统已经成为移动互联网的研究热点。本文介绍了评价推荐系统质量的十个评价指标。
随着移动互联网的快速发展,网络中的信息量呈指数级增长,大量的商品、信息、知识、视频、音乐等内容和资源可供用户选择。信息过载的问题日益突出。

推荐系统是解决信息过载最有效的方法。因此,基于大数据的推荐系统已经成为移动互联网的研究热点。
事实上,推荐制出现于上世纪末。1998年,亚马逊通过基于物品的协同过滤技术,向数百万顾客提供商品购买建议。学术界对推荐系统的研究一直在进行。
随着云计算、大数据、人工智能等新技术的发展,以及计算能力、数据、算法的提高,推荐系统的性能越来越好,但是对于推荐系统的评价体系基本稳定,除了各项指标的准确率在不断提高。
要了解推荐系统,可以从了解推荐系统的评价指标开始,主要包括以下十点:
一.用户满意度
作为推荐系统的重要参与者,用户的满意度是评价推荐系统最重要的指标。
有时,互联网公司可以通过问卷调查或简单的满意或不满意按钮来获得用户的满意度反馈。
但更多时候,用户满意度是通过对用户的一些行为进行量化分析计算出来的。比如在移动电商应用中,用户购买了推荐的产品,就意味着在一定程度上对系统的推荐结果感到满意,可以用购买转化率来衡量用户的满意度。
此外,点击率、分享率、收藏率、停留时间等指标在衡量用户满意度时也可能有一定权重。
二、预测精度
预测的准确性只是一个笼统的称呼,取决于你想预测什么,比如预测用户对系统推荐的电影的观影后评分。
或者在预测系统推荐的歌曲列表中,用户最终选择了多少首歌曲添加到他的歌单中?
但一般来说,预测准确率是衡量一个推荐系统或推荐算法在预测用户行为上的准确性的最重要的指标。
预测精度的提高通常依赖于算法和模型精度的提高,因此更具有学术研究价值。大数据、机器学习等热门技术与预测准确率密切相关,它们相互促进。技术的发展促进了预测精度的提高,而对预测精度提高看似无止境的需求也带动了技术的不断投入。
三。覆盖率
覆盖率用于描述推荐系统探索长尾内容或商品的能力。
关于覆盖率的定义,最简单的理解就是推荐系统可以推荐的项目占平台所有项目的比例。
以图文内容推荐为例。自媒体作者可能会非常在意自己的内容有没有被推荐给读者。对于覆盖率为100%的推荐系统,意味着每一个内容都被推荐给了至少一个用户;但这是针对一个只提供热门文章列表的系统。
比如一些大学论坛的首页可能每天只显示前十篇文章,这样的推荐系统覆盖率很低。因为它只推荐那些被广泛阅读的文章,而且这些文章占所有文章的比例非常小。
四。多样性
用户的兴趣非常广泛。在视频应用中,用户可能既喜欢看烧脑电影,也喜欢看动作片。
那么,为了满足用户广泛的兴趣,推荐列表需要覆盖用户不同的兴趣领域,即推荐结果需要多样。
为了提高推荐系统的多样性,需要在大的时间跨度内识别和理解用户的兴趣。

五、新奇
新鲜感是指向用户推荐他们从未听说过的内容或商品。比如在视频应用中,应该尽可能多的推荐用户没看过的电影。
但考虑到很多用户在某个应用中可能粘性不强,比如一个用户可能同时是多个视频应用的用户,仅仅依靠用户在自己系统中的行为记录来保证推荐的新颖性是不够的。
另外,更简单的方法是根据内容或商品的平均受欢迎程度进行推荐,因为越不受欢迎的东西越容易让用户觉得新奇。
而向用户推荐冷门内容或产品,实际上是牺牲了一定的推荐准确率,所以我们需要权衡这个指标和其他指标的平衡——这不仅是技术上的考虑,也是商业上的考虑。
第六,惊喜程度
所谓惊喜度,简单解释就是:如果推荐结果与用户的历史兴趣不相似,但能让用户感到满意,那么可以说推荐结果的惊喜度很高。
要兼顾推荐系统的惊喜并不容易,因为这意味着推荐结果与用户历史兴趣的相似度需要降低,因此可能会给预测的准确性带来一定的挑战。
但毫无疑问,用户需要惊喜,这将大大提高用户的满意度和体验。所以推荐系统对惊喜的追求只会不断提高,需要在不影响预测精度的情况下实现。
七。信任
所谓信任度,是指用户是否信任推荐系统,是否愿意“倾听”推荐系统的推荐,而不是几乎忽略推荐渠道或推荐列表的存在。
信任对于推荐系统来说意义重大,因为基于用户信任的推荐内容和产品可以让用户更感兴趣;如果失去了用户的信任,你推荐的任何内容和产品都会让用户觉得是广告,很难产生兴趣。
就像两个人给你推荐同一个产品,一个是你的朋友,一个不是。你会听谁的?
相对于其他指标,信任是有些情绪化的,所以有很多方法可以提高。比如考虑增加推荐系统的透明度;尽量让用户了解推荐系统的运行机制,并得到他们的认可;甚至可以通过一些自媒体做一些宣传;另外,比如在你推荐内容的摘要中,提示用户“你的xx个朋友已经看过了”,也是一种间接提高推荐系统信任度的方式。
八。及时
推荐系统的时效性包括两个方面:
一方面,在很多应用中,由于内容具有很强的时效性,需要在内容还是时效性的时候推荐给用户;另一方面,用户的需求也可能具有一定的时效性。举个例子,当一个用户刚刚在移动电商应用下单购买了一部新手机,如果推荐系统能立刻向他推荐相关配件,肯定比第二天向用户推荐相关配件更有价值,转化率也更高。在这两个方面,前者更依赖于推荐内容本身,而后者需要基于用户行为的实时分析。
九。稳健性
任何能带来利益的算法系统都会受到攻击,比如搜索引擎的作弊,反对作弊的斗争异常激烈。
因为如果能让自己的内容或商品在匹配某个搜索词的搜索结果中排名第一,那将带来巨大的用户流量,意味着巨大的商业利益。
推荐系统也会遇到同样的作弊问题,鲁棒性指标可以用来衡量一个推荐系统对抗作弊的能力。
要增强推荐系统的鲁棒性,更重要的途径是提高剔除噪声数据的能力。毕竟大规模的攻击,比如利用水军攻击某影评网站的评分系统,在用户行为上会和正常用户有明显的区别。因此,为了提高系统的鲁棒性,我们应该最大限度地识别这些噪声数据,并将它们的影响降到最低。
X.商业目标

有时候,上述九个指标很难兼顾,甚至有些指标在某种程度上会形成一定程度的互斥。
而如何平衡这些指标,需要从经济效益和经营目标综合考虑。
另外,对于不同阶段的产品,比如有的产品正处于为用户打磨、试错、积累种子的阶段;部分产品处于烧钱打市场阶段;有些产品处于规模化盈利阶段,其推荐系统的策略会有所不同。
本文由@科技无忧原创发布。每个人都是产品经理。未经许可,禁止复制。
来自Unsplash的图像,基于CC0协议。


