这个内容我就不写了,在网上一搜就找到10个有9个相同的小红书算法内容。没有上一部那么好理解,甚至很无聊。看完不知道说什么好。但是相信我,你看完会收获很多。也许是业务上的一些小问题终于得到了印证,也许是小红书运营的视角更加多元化,或者是我们学到了更加具体的思考。
想听刀法、方法论、废话的可以点右上角的X。如果你想从底层稍微了解一下你在做的平台,如果这个内容对你有帮助就太好了。我拿起很多论文,论坛,找了很多小红书公开演讲的PPT总结,结合业务实际。

很多人常说的小红书算法,大部分是从产品角度,少数是从运营角度,几乎没有人从技术角度。
小红书代理广告部+:wsh685
算法是一系列解决问题的明确指令,它代表了一种描述解决问题的策略机制的系统方式。a取向B,可能是男和女,也可能是国王和王后。我们应该先解释A和B,而不是讨论如何从AB开始。
从产品的角度来说,没什么大问题,但是有两种大点,就是产品的背景和用途。产品的背景包括需要解决什么,具体的使用场景是什么,目标用户是什么。产品的使用包括体验、UI、美工、交互。我看大部分人对小红书算法的分析,都是从UI的角度,也就是用户界面。其实挺不准确或者说很浅薄的。从UI的角度来看,Tik Tok和小红书的相似度非常高。Tik Tok首页-推荐、关注、同城和小红书首页-发现、关注和同城基本一致,新闻页面和我的一样。
页面基本一样,所以算法和逻辑都一样?
相差太多,体现在结果上,我们Tik Tok和小红书都做了200万左右的粉,一个基本没变现,一个盈利很高。后来我们重复报价,平台就像我们那些年追的女生。没有人永远年轻,但总有人年轻。即使经营多年,我们也常常对原来的女孩不熟悉。而平台总会诞生新的机会让后来者遐想空。
事不宜迟,我们简单梳理一下小红书算法。很多段落摘自ArchSummit深圳-赵的演讲,小红书实时推荐团队负责人郭毅的演讲,2019阿里云峰会暨上海开发者开源大数据,秦博、马可的post /PPT。如有侵权,联系修改或删除。
小红书社区是一个分享社区+电商APP。分享社区通常由女性主导,由少数话题引导。
如何将平台每天产生的内容转发分发给用户,让用户看到自己想看的内容,是算法需要解决的问题。
对于小红书来说,社区提供用户粘性,引流电商。电商变现这部分流量,在APP内形成闭环,社区和电商互推。
对于算法团队来说,拥有社群的用户数据和电商板块用户的行为数据,以及如何将两边的用户行为连接起来,更好的了解用户,是算法的根本出发点。
现在,下面这个流量分配模型是大家普遍接受的。CES是根据用户的交互效果给用户打分的系统。其实太笼统了,也不知道ces评分是出现在整个推荐过程的第一、二、三步,还是重复计算。接下来我会通过一些具体的案例,从技术的角度来解释。
如果你看过我上一篇讲搜索流量的小伙伴,应该会印象深刻。一个笔记的搜索流量相对稳定,推荐流量是笔记成为爆款的核心。小红书在线推荐的流程主要分为三步。第一步,从小红书用户每天上传的笔记池中挑选候选集,通过各种策略从几千万条笔记中挑选出几千个候选集进行初步排名。第二步,在模型排序阶段对每个笔记进行评分,根据用户对小红书的赞和收藏行为给平台带来的价值,设计权重评价体系。通过估算用户点击率,评估点击后的赞、收藏、评论的概率进行评分。第三步,在将笔记展示给用户之前,选择得分高的笔记,通过各种策略调整多样性。
那么小红书是如何从每日笔记池中挑选候选集进行第一次排名的呢?
小红书内容图文并茂,用户产出很多高质量的图片。使用CNN提取图像特征,使用Doc2Vec提取文本特征,可以通过一个简单的分类器将用户分类到主题中,主题是数百个人工校准的主题。这是第一排。
CNN和Doc2Vec是如何提取笔记并分类的?
关于图片的识别,小红书是一个非常视觉化的社区,有很多图片。小红书从图像中提取特征取得了很好的效果,在准确率85%左右的情况下覆盖率可以达到73%左右。添加文字后效果更好,准确率达到90%,覆盖率达到84%。
这是内容创作首先要注意的地方。你认可形象的夸张到什么程度?
我们曾经发过一个儿童、中小学的教育案例,在角落里翻开的一本书上拍下了两行关于母婴胎教的文字,肉眼看不清楚。违反规定,发布涉及婴儿遗传学等敏感内容的警告,3天不推荐该账号。后来通过反复查找原因,发现了这个问题。这里有另一个常见的例子,在GBTD模型中涉及机器深度学习。现在流行分享小红书里的祛痘方法,脸上的痘痘怎么治有很多注意事项。如何把这些让人不舒服的内容推荐给想看的人,是个问题。小红书在尝试使用CNN模型做这件事的时候,发现无论照片是全脸漏照、半张脸、1/4张脸甚至只有几个面部器官,都可以很好的识别甚至识别出图片中的文字,有助于反作弊。所以,图片上不要携带任何违禁品。图片识别+图片文字识别的准确率基本在90%。
先说文本的向量表示。文本的向量表示有很多种,其中一种叫做Word2Vec,是Google提出来的。它的原理很简单。其实就是一个很浅层的神经网络,根据前后词来预测中间词的概率。当优化预测时,模型得到单词的向量表示。同一个词的向量表示在空空间也是有意义的,相似的词也在相似空空间。这个模型的有趣之处在于,当你取出向量时,你总是可以做向量运算。
女人和男人之间的向量和女王和国王之间的向量是一样的,所以如果我们知道其中的三个,我们就可以计算另一个。如果我们的笔记重点是“自驾”和“露营”,Word2Vec会根据中间词前后的词来预测中间词的概率,可能是装备、路线、西藏、过夜、海边、周边、攻略,推送到相应的用户页面。
什么是用户画像和笔记画像?在算法中起什么作用?
小红书推荐预测模型已经进化到GBDT+稀疏DW模型。主要有九个预测任务,包括点击、隐藏、喜欢、收藏、评论、分享、关注等。点击、按住、喜欢、评论、分享、关注。Click是小红书最大的模型,每天产生约5亿个样本用于模型训练。GBDT模型中的笔记分布有大量的用户行为统计,产生一些静态信息和动态特征来描述用户或笔记。
通过用户画像和人口统计信息来描述用户,比如性别、年龄等静态信息。笔记分为作者和内容两个维度,比如作者评分、笔记质量、标签和话题。虽然动态不多,但是很重要。动态特征包括用户在浏览和搜索时是否点击、是否有深度行为等类似的用户反馈。这些交互数据有一个实时管道,从线下直接放入线上模型。在线上,这些数据会被用来预测点击率等互动质量指标,然后根据用户和笔记的隐形分类进行推荐。
关于动态特征的提取,小红书用的是Doc2Vec模型,也叫相关笔记。相关注意事项有什么要求?推荐的笔记和用户正在阅读的笔记,最好谈的是一件事。比如同样的口红,同样的酒店,同样的旅游城市,同样的衣服,可能不是一家酒店,但却是类似的酒店。
可能不是同一个旅游城市,但可能是类似的旅游城市。很难理解吗?具体一点吧。如果我在亚特兰蒂斯看这种级别的酒店,那么小红书不会给我推荐格林豪泰,而是同等级别的酒店。如果我经常搜索雪山/草原/沙漠,那么我就不会被推荐到上海/北京/广州这种文化和城市景观都很突出的地方。
需要注意的是,虽然TFIDF模型的基本要求是一样的,但是它可以找出一种笔记,即谈论用户心理,描述用户心情的笔记。因为用户用来描述心情的词汇很接近,所以这种方法也会找出引申的内容。绝字是非常明显的语气词或者形容词,小红书有461万+条注释。

核心实时归属地场景业务如何做用户行为标签?
用户画像相对简单,不会有太多状态,而实时归属是整个实时流处理中最关键的场景。归属实时向用户推荐笔记后,会有曝光和点信息。用户的每一次曝光、点击、查看、撤退都会被记录。
看看下面这张图。四次曝光的用户行为会导致四次笔记曝光。如果用户点击第二个笔记,会生成第二个笔记的点击信息,like会生成like dot信息。
如果用户返回,将显示用户在第二个音符停留了20秒。实时归属会生成两条数据。第一个是点击模型的数据标签。下图第一个和第三个音符没有滴答声,第二个和第四个音符有滴答声。这种数据对于训练点击模型很重要。
像模型几乎和上面一模一样。
CES涉及算法的哪个阶段?
在整个在线推荐过程中,每个笔记只在模型排序阶段进行评分。
在笔记展示给用户之前,小红书会选择分数高的笔记,通过各种策略调整其多样性。
Score=pCTR*,CES,如果涉及的话,只是很小的一部分。
我通过爬虫把爆笔记爬下来,做成CES形式的Excel电子表格分析。无论是散点图还是显示数据关系的图形,都没有规律的图表,所以CES多用于冷启动,聊胜于无。
最重要的是,最后我们会用更通俗的话来阐述这个内容想要论证或反映的观点:
1.小红书算法是一系列解决问题的明确指令。该算法代表了一种描述解决问题的策略机制的系统方法。
我们不应该从用户界面或者从成熟的账号去梳理和总结方法论,因为我们只是对一系列机制中的琐碎点进行梳理和总结,不应该形成所谓的通用方法论。
每个人的工作和业务发展也是如此。很多运营文章一下子就把整个运营过程解释清楚了。我甚至建议你从算法开始了解。工作也是从你的实际理论和认知来进行的,而不是跟着葫芦画瓢。这是你要跟随的飞机。好吧,你建吧。
2.不要做公司想推广的/你喜欢的,而是算法认为用户想看的。毕竟算法需要解决的问题是把平台生产的内容转发给用户,让用户看到用户想看的内容。
3.对于小红书来说,算法的出发点是如何将社群的用户数据与电商板块用户的行为数据联系起来。
目前小红书的盈利模式主要集中在找人种草上。其实算法团队还不够好,不能提供足够优秀的中层支持。不管是电商还是广告,其实大家都有抱怨。
前台主要是为客户和终端卖家实现营销推广和交易转化。该平台主要是为运营商完成运营支撑。后台主要面向后台管理人员,实施流程审核、内部管理和后勤保障,如采购、人力、财务、OA等系统。
算法岗也是各大公司招聘线中报价最高的。目前想做视频内容电商的算法人才,倾向于去Tik Tok和Aauto更快。
想做传统电商的,会倾向于去阿里或者拼多多。至于电子商务或者图文形式的广告,其实各家都做了很多年了,也不是特别好。
小红书和图片能做好,得益于70%的用户是女性,社区氛围营造的生活氛围非常精致。
4.选择合适的内容非常重要。如果内容是小众和刚需,那么小红书通过策略选择的候选集相对容易选择我们的笔记。
在整个笔记出现在大量用户的过程中,我倾向于不涉及CES评分,预测模型其实起了很大的作用。
实际操作中,就是一张图一句话的笔记乱七八糟,旧账乱七八糟,因为预测模型。
5.小红书算法对图片的优先级非常高,准确率至少85%。如果加上文字,准确率可以达到90%。
所以不管是正常的图文,水中未报的笔记,还是非法引流的笔记,算法总能查得一清二楚,只不过和运营中心账户处理的松紧程度有关。

比如哪个月封账号,哪个月查资质,哪个月抓引流,算法有数据,人工干预就好。
6.关于文本的动态特征提取,可以重点关注上面提到的估计词和相关注释。这是一个非常有趣但实用的模型算法。从普通用户的角度来看,我认为Tik Tok和小红书做得很好。
7.小红书算法对笔记内容的好坏,取决于用户画像和笔记画像。用户的画像一般都是静态信息,超过一半是在注册账号的时候完成的,比如性别,年龄。
画像包括评分,笔记质量,标签和主题。
8.我们在浏览推荐页面的时候,可以多看一屏的内容,尤其是用其他账号刷到自己的账号的时候。如果在一个屏幕上有和你相同类别的其他笔记,那么就专注于研究。算法认为你各方面都差不多,展示给用户看。


