定向流量能帮助运营解决什么问题从实战出发更好理解与运用向量

核心提示很多淘系运营开始接受向量召回,但是感觉很难理解,今天我们通俗一点的讲讲向量。向量这个词本身就包含空间向量上的几何概念,除此之外还有很多离线、在线算法、实时模型等,很容易让人云里雾里。向量是什么?如何影响搜索,作为运营如何从实战角度更好的利用

很多淘运营都开始接受向量召回,但是很难理解。今天,我们将更通俗地谈论向量。

向量这个词本身就包含了空之间的向量上的几何概念。此外,还有许多离线、在线算法、实时模型等。,容易混淆人。

什么是向量?如何影响搜索,至于如何从实用的角度更好的利用向量,今天就来说说这个问题。

向量问题

什么是向量?矢量是一个既有方向又有大小的量。

方向是交易方向,背后是精准的语义需求,大小是这个交易方向的点击量和点击行为数据。

什么是向量召回?给你举几个例子吧。比如给你几个文档,找出其中最相似的两个文档?

相似性可以用距离来衡量。数学上,余弦可以用来计算两个向量之间的距离。

余弦距离,也称余弦相似度,用vector 空中两个向量夹角的余弦作为两个个体差异的度量。

向量是多维方向的线段空。如果两个向量的方向相同,即夹角接近于零,那么两个向量相似。为了判断两个向量的方向是否一致,余弦定理被用来计算向量的夹角。

所以用一个向量来表示文档,然后用余弦来计算两篇文章的相似度。

余弦定理描述了三角形的任意夹角和三条边之间的关系。给定三角形的三条边,我们可以用余弦定理求出三角形各角的角。假设三角形的三条边是A、B、C,对应的三个角是A、B、C,那么角A的余弦为:

如果将三角形的两条边B和C视为两个向量,则上述公式等价于:

其中分母代表两个向量B和C的长度,分子代表两个向量的内积。

以文本相似度的余弦距离计算为例,详细说明计算过程:

余弦相似性算法:

vector 空中两个向量之间的夹角的余弦值被用作两个个体之间差异的度量。余弦接近1,角度趋于0,说明两个向量越相似,余弦接近0,角度趋于90度,说明两个向量越不相似。

空间向量

基本思想是:

如果这两句话的用词越相似,其内容就应该越相似。

所以可以从词频入手,计算它们的相似度。

第一步是分词。

句子:这个/皮靴/号/大。那个/数字/适合。

b:这双/皮靴/号/没有/小,那双/多/合适。

第二步,列出所有的单词。

这双,皮靴,号码,大,那双,合适,不,小,非常

第三步,计算词频。

句子:这个是1号,皮靴1号,2号,大1号。那只有1,适合1,没有0,小0,甚至0。

b:这个是1,皮靴1,数字1,大于0。那就只有1,适合的1,没有的1,小的1,甚至1。

第四步,写出词频向量。

句子a:

句子b:

此时,问题变成了如何计算两个向量之间的相似度。我们可以把它们想象成空之间的两条线段,都是从原点出发,指向不同的方向。两条线段之间形成一个夹角。如果夹角为0度,说明方向相同,线段重合,说明两个向量代表的文本完全相等;如果夹角是90度,说明形成了直角,方向完全不同;如果角度是180度,说明方向正好相反。因此,我们可以通过角度来判断向量的相似性。角度越小,越相似。

空间向量

以二次元空为例。上图中的a和B是两个向量,我们要计算它们的夹角θ。余弦定理告诉我们,它可以通过下面的公式得到:

空间向量

计算两个句子向量A:和B:的向量余弦值,确定两个句子的相似度。

假设A向量为[x1,y1],B向量为[x2,y2],那么余弦定理可以改写为以下形式:

空间向量空间向量

数学家证明余弦的这种计算方法对N维向量也是有效的。假设A和B是两个N维向量,A是[A1,A2,...,An]而B是[B1,B2,...Bn],那么A和B之间的角度θ的余弦等于:

利用这个公式,我们可以得到A句和b句夹角的余弦值。

计算过程如下:

空间向量

计算中夹角的余弦为0.81,非常接近1。所以上面的A句和B句基本相似。

余弦值越接近1,角度越接近0度,即两个向量越相似,称为“余弦相似度”。

这是一种单一向量召回方法。在召回机制下,粗糙排名不就是这样的算法吗?

上面的向量算法就是这样工作的。

知道了它的工作原理,其实一切都可以是向量。

只是取实值的点不一样。

在不同点取实际值,精度完全不同。

举个例子:2018年,我们谈到了“图片搜索”。图像搜索的基本逻辑是向量召回。大家都认同形象像标题一样镶嵌着商品“信息”。主图像的原始信息是颜色CMKY和RGB。根据颜色面积比例,取真值进行向量召回,寻找相似图片的过程就是最原始的搜索机制。

通过向量回忆,找到相似的图片进行标记,然后搜索到一个标签精准的人群。

知道了这一点,知道了他当时的厉害,不仅能准确标记,还能搜索任何大词找个玩坑。

在哪个玩大话的时代,效果就是杠杠的。

那么向量就这么简单吗?

当然不会。事实上,从分词那一刻起,词向量召回就已经不准确了。

为什么这么说?

因为分词破坏了词与词之间的顺序关系,失去了语义的准确性。

向量召回真正解决了语义准确性的问题。

要解决语义相识度和准确率的问题,核心在于“大数据”。淘宝之所以有价值,不在于他有多少商家,而在于他沉淀的消费者和商家的历史数据。

数据运营的本质是还原消费者真实的需求过程,深挖消费者的“场景”需求。

对于一个消费者来说,不是某一段时间的认识你,而是从整个购物链和行为数据到身份识别再加上一个长期沉淀的平台来真正做到“认识你,了解你”,然后将有效的信息推荐给合适的人。

这不是模仿你的购物意图,指定身份属性匹配的人群就能做到的。

一个比较错误的理解是,把关键词+购物需求+历史行为+特定身份属性结构看成是一个可以达到语义关联、相识、精准的问题,是大错特错的。

向量召回是解决语义准确率问题的多维实值。

召回机制:召回的是什么?

召回基于具有相同精确购物意图的游客。

召回是基于关键词背后的精准搜索意图。

召回是基于用户行为数据分析的“购物兴趣点”。

召回基于词向量文本相关性和上下文。

向量有长度,向量中的每个元素都是一个数值。

向量召回是基于元素对上述值进行矢量化,构造一个效率高的索引。

都是基于精准的语义购物意图。

这是矢量。

元素值:

可以通过实时的用户行为轨迹数据获得。

可以通过历史用户行为数据获得。

可以通过历史点击率数据获得。

可以通过历史转化率获得。

可以通过深度学习算法结合实时个性化标签数据获得。

等等......

选取的元素——数值都有一个共同的特点,就是可以矢量化来表示精准响应背后的精准需求意图(表示矢量表示)。

你现在能理解向量了吗?

Vector是一个N维向量。数学家证明余弦的这种计算方法对N维向量也成立。所以向量可以在多维度生成向量进行余弦相似,解决语义准确性的问题。多向量维度解决语义准确性问题,并不像上面例子中的单向量维度那么简单。背后取的是个人行为数据和行为轨迹数据的价值,本身不是模仿,而是数据长期沉淀的价值。

所以,解决向量的问题,根本的还是“不破坏,尊重制度,顺应潮流”。

从实战出发要注意什么?

要解决向量问题,第一个解决方法就是入池。

只有两种方法可以准确地进入池中:

被动池入口和主动池入口

主动入池就是通过直通车布局关键词和人群基础设施问题,通过产生的行为数据“入池”商品。

主动入池:强行搜索,引蛇出洞,顺势而为,是坑产的力量;交给系统,系统给出的行为数据就会放入池中。

入池解决了布局向量的问题。

说到这个向量,就是布局影响真实交易的元素。从实战的角度来看,解决方案是:

1.关键词布局背后的购物意向的精准性和聚焦性;

2.单词系统布局的指导向量;

3.直通车测试和定制人群测试,对于符合产品基本属性的人群结构和身份属性有好处;

4.三重布局,优化分词组合结构,解决语义准确性;

5、分层流量,单向入池,多向布局,多渠道召回;

向量背后的商品行为数据越干净,价值越大。

模仿关键词+历史行为+特定身份属性结构的行为,解决语义准确性问题。数据本身是“假”的,数据复制出来的数据更是假的。

向量恰恰是一个通过数据再现数据的过程,这是根本原因。通过“刷”影响力向量,解决转化率问题,看产品真实续航能力和个人数据处理能力。

所以优化语义准确率的思路是:如果你能把这句话理解透彻,你就知道为什么跟不上“大话”了。

优化语义的方法有很多,比如语义向量量词等。向量召回解决的是语义相似度的问题,其背后的准确性取决于如何在多个维度取实数形成多维向量。

现在的搜索基本都是围绕语义回忆展开的。

从商品需求到场景需求,算法强大,语义召回精准。

更何况现在已经有了全面的语义网络、知识图谱和语义知识库系统。

推荐的流量会越来越精准,搜索作为种子会发挥更强大的作用。

 
友情链接
鄂ICP备19019357号-22