一种获取矩阵中向量相似度的方法和系统的制作方法

xiaoxiao2020-10-23  11

一种获取矩阵中向量相似度的方法和系统的制作方法
【技术领域】
[0001] 本发明属于算法领域,尤其设及一种获取矩阵中向量相似度的方法和系统。
【背景技术】
[000引现实生活中,人们往往会遇到将物品进行分类的问题,比如;将电脑、手机和MP3 分类为电子产品,而如果要使计算机对物品进行分类,则需要根据物品之间的相似度进行 分类,将相似度高于预设的阔值的两件物品归为一个类别,即将分类问题转化为求相似度 的问题。
[0003] 假设现在有M篇不同的文章,每篇文章由L个互不重复的单词英文文章为例, 如果是中文文章,则为互不重复的字)组成,如果要找出该些文章中任意两个单词Wi和Wj 的相似度,现有技术是将该M篇文章组成一个M行N列的矩阵,N为M篇文章中所有出现的 单词的个数,其中N>L。对于大规模数据的处理一般使用Map-Re化ce映射-归约模型来 处理。在Map阶段,如果一篇文章中同时存在和Wj,则将和W进行映射,记为("1,'\¥^- 〉l)<i〉,i表示Wi和Wj两者映射的个数,其中i的取值为(1,M);如果一篇文章中未同时存 在Wi和Wj,则将和Wj进行映射,记为(W1,Wj-〉0);在Reduce阶段,对映射进行求和,并 除W根号下M篇文章中Wi和Wj.分别出现的次数的乘积,从而得到Wi和Wj.的相似度。现有 技术整个算法的复杂度为0(M*N2),当M的数值特别巨大时(如1(T),耗费的计算量相当大。

【发明内容】

[0004] 鉴于此,本发明实施例提供一种获取矩阵中向量相似度的方法和系统,W解决现 有技术相似度计算过程中计算量巨大的问题。
[0005] 本发明实施例是该样实现的,一种获取矩阵中向量相似度的方法,所述方法包括 W下步骤:
[0006] 对待获取矩阵进行预处理,所述预处理包括;去除所述待获取矩阵中的零值W及 出现率低于预设的出现率阔值的值;
[0007] 将所述预处理后的待获取矩阵中的值按行向量的方式存储到分布式系统;
[0008] 根据Map-Re化ce映射-归约模型通过抽样计算所述分布式系统中任意两个行向 量的相似度。
[0009] 进一步的,
[0010] 所述根据Map-Re化ce映射-归约模型通过抽样计算所述分布式系统中任意两个 行向量的相似度包括:
[0011] 在Map阶段,按行从所述分布式系统中抽取向量对
[0012] 获取所述向量对Wi、Wj的Re化ce概率;
[0013] 映射所述向量对Wi、Wj;((W 1,wp -〉1),并根据所述Re化ce概率将所述映射提交 到Map-Reduce模型的Reduce阶段;
[0014] 在Re化ce阶段,获取所述向量对Wi、Wj的和
获取所述向量对的相似度, 其中r,表示对应的映射个数,R表示文章的篇数
表示对R篇文章中(Wi, Wj)对应的映射个数进行求和。
[0015] 进一步的,所述获取所述向量对Wf、Wj的Re化ce概率具体为;
[0016] 根据公式
获取所述向量对Wi、Wj的Re化ce概率,其中P为 Re化ce概率、e为取值范围为(0,1)的预设的向量相似度阔值、为向量Wi在所述分布式 系统中出现的次数;
[0017] 所述在Re化ce阶段,获取所述向量对Wi、Wj的和
获取所述向量对的相 似度具体为;在Reduce阶段,获取所述向量对的巧
并根据公式f获取所述 向量对的相似度,其中((Wi、Wj),〈r。…,Tk〉)。
[0018] 进一步的,所述去除出现率低于预设的出现率阔值的值包括:
[0019] 对矩阵中的剩余数值按出现的频率进行降序排列,去除排列在后X位的数值,所 述X为大于零的整数
[0020] 进一步的,所述X为[剩余数值*预设比例]或int(剩余数值*预设比例)。
[0021] 本发明实施例的另一目的在于提供一种获取矩阵中向量相似度的系统,所述系统 包括:
[0022] 矩阵预处理单元,用于对待获取矩阵进行预处理,所述预处理包括;去除所述待获 取矩阵中的零值W及出现率低于预设的出现率阔值的值;
[0023] 矩阵存储单元,用于将经过所述矩阵预处理单元预处理的矩阵中的值按行向量的 方式存储到分布式系统;
[0024] 相似度获取单元,用于根据Map-Re化ce模型通过抽样计算所述矩阵存储单元中 存储的任意两个行向量的相似度。
[00巧]进一步的,
[0026] 所述相似度获取单元,包括:
[0027] 向量对抽取子单元,用于在Map阶段,按行从所述分布式系统中抽取向量对
[0028]Re化ce概率获取子单元,用于获取所述向量对抽取子单元抽取的向量对Wi、Wj的 Reduce概率;
[0029] 映射提交子单元,用于映射所述向量对Wf、Wj; ((W1,Wj) -〉1),并根据所述Re化ce 概率获取子单元获取的Re化ce概率将所述映射提交到Map-Re化ce模型的Re化ce阶段;
[0030] 相似度获取子单元,用于在所述映射提交子单元提交到的Re化ce阶段,获取所述 向量对的和
获取所述向量对的相似度,其中ri表示对应的映射个 数,R表示文章的篇数
表示对R篇文章中(Wi,wp对应的映射个数进行求和。
[0031] 进一步的,所述Re化ce概率获取子单元包括;
[0032]Re化ce概率计算子单元,用于根据公式
获取所述向量对w;、Wj 的Re化ce概率,其中p为Re化ce概率、e为取值范围为(0,1)的预设的向量相似度阔值、 为向量Wi在所述分布式系统中出现的次数;
[0033] 所述相似度获取子单元包括:
[0034] 相似度计算子单元,用于在Re化ce阶段,获取所述向量对Wi、Wj的和
并根据公式获取所述向量对的相似度,其中((Wi、Wj),〈r。…,rg〉)。
[00巧]进一步的,所述矩阵预处理单元具体用于,对矩阵中的剩余数值按出现的频率进 行降序排列,去除排列在后N位的数值,所述N为大于零的整数。
[0036] 进一步的,所述N为[剩余数值*预设比例]或int(剩余数值*预设比例)。
[0037] 本发明实施例与现有技术相比存在的有益效果是:通过对待获取矩阵进行预 处理,将所述预处理后的待获取矩阵中的值按行向量的方式存储到分布式系统,并根据 Map-Re化ce映射-归约模型通过抽样计算所述分布式系统中任意两个行向量的相似度。本 发明实施例通过预处理减少了矩阵中数值的数量,通过抽样降低了Map-Re化ce模型计算 的复杂度,从而可W在保证相似度计算精度的同时,极大的减少相似度计算过程中的计算 量。
【附图说明】
[0038] 为了更清楚地说明本发明实施例中的技术方案,下面将对实施例或现有技术描述 中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些 实施例,对于本领域普通技术人员来讲,在不付出创造性劳动性的前提下,还可W根据该些 附图获得其他的附图。
[0039] 图1是本发明实施例提供的获取矩阵中向量相似度方法的流程图;
[0040] 图2a是本发明实施例提供的待获取矩阵的示意图;
[0041] 图化是本发明实施例提供的去除零向量之后的矩阵的示意图;
[0042] 图2c是本发明实施例提供的去除低于预设的出现率阔值之后的矩阵的示意图;
[0043] 图3是本发明实施例提供的获取矩阵中向量相似度系统的结构图。
【具体实施方式】
[0044] 为了使本发明的目的、技术方案及优点更加清楚明白,W下结合附图及实施例,对 本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用W解释本发明,并 不用于限定本发明。
[0045] 为了说明本发明所述的技术方案,下面通过具体实施例来进行说明。
[004引 实施例一
[0047] 如图1所示为本发明实施例提供的获取矩阵中向量相似度方法的流程图,所述方 法包括W下步骤:
[0048] 步骤S101,对待获取矩阵预处理,所述预处理包括;去除所述待获取矩阵中的零 值w及出现率低于预设的出现率阔值的值。
[0049] 在本发明实施例中,待获取矩阵通常为稀疏矩阵,因此可W对所述稀疏矩阵进行 预处理,所述预处理具体可W为;去除待获取矩阵中的零值W及出现率低于预设的出现率 阔值的值。
[0050] 如图2a为待获取矩阵,图化为去除零值之后的矩阵,图2c为去除出现率小于3 次的值之后的矩阵,从图2c可W看出本发明实施例通过所述预处理有效减少了矩阵中数 值的数量。
[0051] 较佳的,在去除所述待获取矩阵中的零值后,本发明实施例所述去除出现率低于 预设的出现率阔值的值可W包括:
[0052] 对矩阵中的剩余数值按出现的频率进行降序排列,去除排列在后X位的数值,所 述X为大于零的整数。
[0053] 优选的,所述X为[剩余数值*预设比例]或int(剩余数值*预设比例)(表示计 算结果取整)。需要说明的是,本申请所述预设比例中的"比例"与"个数"是存在不同的, "个数"是一个静态的值,而"比例"是一个动态的值,例如如果设置的是"个数V'个数"为 5,而矩阵中剩余的数只有5个,则会去除矩阵中所有的数值。而如果设置的是"比例",例如 "比例"为50%,矩阵中剩余的数值只有5个,那么只要去除5 * 50%= 2. 5,取整后为2,则 去除排列在后2位的数值。
[0054] 步骤S102,将所述预处理后的待获取矩阵中的值按行向量的方式存储到分布式系 统。
[00巧]在本发明实施例中,为了使用Map-Re化ce(映射-归约)模型获取待获取矩阵中 的相似向量,需要将预处理后的值按行向量的方式存储到分布式系统中。示例性的,该分布 式系统为皿FS化adoopDistributeFileSystem,简称;化doop分布式系统)。
[0056] 步骤S103,根据Map-Re化ce映射-归约模型通过计算获取所述分布式系统中任意 两个行向量的相似度。
[0057] 在本发明实施例中,所述根据Map-Re化ce映射-归约模型通过计算获取所述分布 式系统中任意两个行向量的相似度,可W包括:
[005引 1、在Map阶段,按行从所述分布式系统中抽取向量对
[0059] 在本发明实施例中,首先按行从分布式系统中任意抽取两个向量Wi、Wj,该即 为抽取的向量对,该抽取向量对的过程即为抽样。
[0060]2、获取所述向量对、Wj的Re化ce概率。
[0061] 在本发明实施例中,向量的归约概率计算公式为
,即该两个向 量经过映射之后,按照P概率提交到归约阶段,在该公式中,P为映射概率、e为取值范围为 (0,1)的预设的向量相似度阔值、#w为向量W在所述分布式系统中出现的次数,如;Wi在第 二矩阵中出现的次数为5次,则的取值为5;wj.在第二矩阵中出现的次数为6次,则#wJ 的取值为6,即所述获取所述向量对Wi、Wj的Re化ce概率,具体为;
[0062] 根据公式
获取所述向量对Wi、Wj的Re化ce概率,其中P为 Re化ce概率、e为取值范围为(0,1)的预设的向量相似度阔值、#Wi为向量Wi在所述分布式 系统中出现的次数。
[0063] 3、映射所述向量对Wi、Wj; ((W1,Wj) -〉1),并根据所述Reduce概率将所述映射提 交到Map-Reduce模型的Reduce阶段。
[0064] 在本发明实施例中,对向量对Wi、Wj进行映射;((W1,Wj) -〉1),并根据上述归约概 率P将该映射((Wi,Wj.)-〉1)提交到Re化ce阶段,即;上述计算的P如果为0. 6,则按照60% 的概率将映射((Wi,Wj) -〉1)提交到Map-Re化ce模型的Re化ce阶段。
[006引 4、在Re化ce阶段,获取所述向量对Wi、Wj的和
并获取所述向量对的相 似度,其中r,表示(Wi,wp对应的映射个数,R表示文章的篇数:
表示对R篇文章 中对应的映射个数进行求和。
[0066] 在本发明实施例中,根据公式^获取所述向量对的相似度,其中((Wi、Wj),分1,… ,Tk〉),((W;、Wj),〈r。…,Tk〉)表示(W;、Wj)出自〈r。…,rK〉R篇文章中。
[0067] 需要说明的是,在所述根据公式
获取所述向量对的Re化ce概 率的步骤之前,所述方法还包括W下步骤:
[0068] 预设所述向量相似度阔值e。
[0069] 本发明实施例首先通过预处理减少了矩阵中数值的数量,再通过抽样降低了 Map-Re化ce模型计算的复杂度,其中Map阶段的计算复杂度降低为0 (DNlog值)/e),Re化ce 阶段的计算复杂度降低为〇a〇g〇))/e),在保证相似度计算精度的同时,极大的减少了相似 度计算过程中的计算量。
[0070] 实施例二
[0071] 如图3所示为本发明实施例提供的获取矩阵中向量相似度系统的结构图,为了便 于说明,仅示出与本发明实施例相关的部分。
[0072] 所述获取矩阵中向量相似度系统可W是内置于智能终端(例如手机、平板电板、 智能电视机)中的软件单元、硬件单元或者是软硬件结合的单元,所述获取矩阵中向量相 似度系统包括:
[0073] 矩阵预处理单元301,用于对待获取矩阵进行预处理,所述预处理包括;去除所述 待获取矩阵中的零值W及出现率低于预设的出现率阔值的值。
[0074] 在本发明实施例中,所述阔值可W根据实际使用的需要而进行设置,在此不做限 定。示例性的的,该阔值为int(剩余数值巧0% )。
[00巧]矩阵存储单元302,用于将经过所述矩阵预处理单元301预处理的矩阵中的值按 行向量的方法存储到分布式系统。
[0076] 不例性的,该分布式系统为HDFS化adoopDistributeFileSystem,简称;化doop 分布式文件系统)。
[0077] 相似度获取单元303,用于根据Map-Re化ce模型通过抽样计算所述矩阵存储单元 302中存储的任意两个行向量的相似度。
[0078] 进一步的,所述相似度获取单元303包括:
[0079] 向量对抽取子单元3031,用于在Map阶段,按行从所述分布式系统中抽取向量对 Wi、Wj;
[0080]Re化ce概率获取子单元3032,用于获取所述向量对抽取子单元3031抽取的向量 对Wi、Wj的Reduce概率。
[0081] 在本发明实施例中,向量的归约概率计算公式为
,即该两个向 量经过映射之后,按照P概率提交到归约阶段,在该公式中,P为映射概率、e为取值范围为 (0,1)的预设的向量相似度阔值、#w为向量W在分布式系统中出现的次数,如;Wi在第二矩 阵中出现的次数为5次,则的取值为5;wj.在第二矩阵中出现的次数为6次,则#wj.的取 值为6。所述Re化ce概率获取子单元3032,包括:
[0082]Re化ce概率计算子单元30321,用于根据公式
获取所述向量对 Wi、Wj的Re化ce概率,其中P为Re化ce概率、e为取值范围为(0,1)的预设的向量相似度 阔值、为向量Wi在所述分布式系统中出现的次数。
[0083] 映射提交子单元3033,用于映射所述向量对Wj.)-〉1),并根据所述 Re化ce概率获取子单元3032获取的Re化ce概率将所述映射提交到Map-Re化ce模型的 Reduce阶段。
[0084] 在本发明实施例中,对向量对Wi、w进行映射;(("1,"^-〉1),并根据上述归约概 率P将该映射((Wi,Wj.)-〉1)提交到Re化ce阶段,即;上述计算的P如果为0. 6,则按照60% 的概率将映射((Wi,Wj) -〉1)提交到Map-Re化ce模型的Re化ce阶段。
[0085] 相似度获取子单元3034,用于在所述映射提交子单元3033提交到的Re化ce阶段, 获取所述向量对的和
获取所述向量对的相似度,其中ri表示(Wi,Wj)对应 的映射个数,R表示文章的篇数,
良示对R篇文章中对应的映射个数进行 求和。
[0086] 在本发明实施例中,所述相似度获取子单元3034,包括:
[0087] 相似度计算子单元30341,用于在Re化ce阶段,获取所述向量对Wi、Wj的和
,并根据公式f获取所述向量对的相似度,其中((Wi、Wj.),<r。…,r^〉),((Wi、wj), <ri,...,rK〉)表示(Wi、Wj)出自 <1'1,...,1'1(〉1?篇文章中。
[0088] 进一步的,所述矩阵预处理单元301具体可W用于,对矩阵中的剩余数值按出现 的频率进行降序排列,去除排列在后N位的数值,所述N为大于零的整数。
[0089] 优选的,所述N为[剩余数值*预设比例]或int(剩余数值*预设比例)。
[0090] 综上所述,本发明实施例通过对待获取矩阵进行预处理,将所述预处理后的待获 取矩阵中的值按行向量的方式存储到分布式系统,并根据Map-Re化ce映射-归约模型通过 抽样计算所述分布式系统中任意两个行向量的相似度。与现有技术相比,本发明实施例通 过预处理减少了矩阵中向量的数量,通过抽样降低了Map-Re化ce模型计算的复杂度,从而 在保证相似度计算精度的同时,可W极大的降低相似度计算 过程中的计算量,具有较强的 易用性和实用性。
[0091] 所属领域的技术人员可W清楚地了解到,为了描述的方便和简洁,仅W上述各功 能单元、子单元的划分进行举例说明,实际应用中,可W根据需要而将上述功能分配由不同 的功能单元、模块完成,即将所述系统的内部结构划分成不同的功能单元或模块,W完成W 上描述的全部或者部分功能。实施例中的各功能单元、子单元可W集成在一个处理单元中, 也可W是各个单元单独物理存在,也可W两个或两个W上单元集成在一个单元中,上述集 成的单元既可W采用硬件的形式实现,也可W采用软件功能单元的形式实现。另外,各功能 单元、子单元的具体名称也只是为了便于相互区分,并不用于限制本申请的保护范围。上述 系统中单元、子单元的具体工作过程,可W参考前述方法实施例中的对应过程,在此不再寶 述。
[0092] 本领域普通技术人员可W意识到,结合本文中所公开的实施例描述的各示例的单 元及算法步骤,能够W电子硬件、或者计算机软件和电子硬件的结合来实现。该些功能究竟 W硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员 可W对每个特定的应用来使用不同方法来实现所描述的功能,但是该种实现不应认为超出 本发明的范围。
[0093] 在本发明所提供的实施例中,应该理解到,所揭露的系统和方法,可W通过其它的 方式实现。例如,W上所描述的系统实施例仅仅是示意性的,例如,所述模块或单元的划分, 仅仅为一种逻辑功能划分,实际实现时可W有另外的划分方式,例如多个单元或组件可W 结合或者可W集成到另一个系统,或一些特征可W忽略,或不执行。另一点,所显示或讨论 的相互之间的禪合或直接禪合或通讯连接可W是通过一些接口,装置或单元的间接禪合或 通讯连接,可W是电性,机械或其它的形式。
[0094] 所述作为分离部件说明的单元可W是或者也可W不是物理上分开的,作为单元显 示的部件可W是或者也可W不是物理单元,即可W位于一个地方,或者也可W分布到多个 网络单元上。可W根据实际的需要选择其中的部分或者全部单元来实现本实施例方案的目 的。
[0095] 另外,在本发明各个实施例中的各功能单元可W集成在一个处理单元中,也可W 是各个单元单独物理存在,也可W两个或两个W上单元集成在一个单元中。上述集成的单 元既可W采用硬件的形式实现,也可W采用软件功能单元的形式实现。
[0096] 所述集成的单元如果W软件功能单元的形式实现并作为独立的产品销售或使用 时,可W存储在一个计算机可读取存储介质中。基于该样的理解,本发明实施例的技术方案 本质上或者说对现有技术做出贡献的部分或者该技术方案的全部或部分可软件产品 的形式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用W使得一台 计算机设备(可W是个人计算机,服务器,或者网络设备等)或处理器(processor)执行本 发明实施例各个实施例所述方法的全部或部分步骤。而前述的存储介质包括;U盘、移动硬 盘、只读存储器(ROM,Read-OnlyMemoir)、随机存取存储器(RAM,RandomAccessMemoir)、 磁碟或者光盘等各种可W存储程序代码的介质。
[0097]W上所述实施例仅用W说明本发明的技术方案,而非对其限制;尽管参照前述实 施例对本发明进行了详细的说明,本领域的普通技术人员应当理解:其依然可W对前述各 实施例所记载的技术方案进行修改,或者对其中部分技术特征进行等同替换;而该些修改 或者替换,并不使相应技术方案的本质脱离本发明实施例各实施例技术方案的精神和范 围。
【主权项】
1. 一种获取矩阵中向量相似度的方法,其特征在于,所述方法包括: 对待获取矩阵进行预处理,所述预处理包括:去除所述待获取矩阵中的零值以及出现 率低于预设的出现率阈值的值; 将所述预处理后的待获取矩阵中的值按行向量的方式存储到分布式系统; 根据Map-Reduce映射-归约模型通过抽样计算所述分布式系统中任意两个行向量的 相似度。2. 如权利要求1所述的方法,其特征在于,所述根据Map-Reduce映射-归约模型通过 抽样计算所述分布式系统中任意两个行向量的相似度包括: 在Map阶段,按行从所述分布式系统中抽取向量对&、Wj; 获取所述向量对%、Wj的Reduce概率; 映射所述向量对Wp Wj: ((w i,Wj) - >1),并根据所述Reduce概率将所述映射提交到 Map-Reduce 模型的 Reduce 阶段; 在Reduce阶段,获取所述向量对Wi、Wj的和《 = 获取所述向量对的相似度,其中 A表示(Wi, Wj)对应的映射个数,R表示文章的篇数,= 表示对R篇文章中(Wi, Wj) 对应的映射个数进行求和。3. 如权利要求2所述的方法,其特征在于,所述获取所述向量对w i、Wj的Reduce概率 具体为: 根据公式P = emin(#w.細.)获取所述向量对%、Wj的Reduce概率,其中p为Reduce 概率、e为取值范围为(0,1)的预设的向量相似度阈值、Wwi为向量Wi在所述分布式系统中 出现的次数; 所述在Reduce阶段,获取所述向量对Wi、Wj的和《 = >获取所述向量对的相似度 具体为:在Reduce阶段,获取所述向量对WpWj的和α = ,并根据公式7获取所述向量 对的相似度,其中((WpWj),〈1^,…,rK>)。4. 如权利要求1所述的方法,其特征在于,所述去除出现率低于预设的出现率阈值的 值包括: 对矩阵中的剩余数值按出现的频率进行降序排列,去除排列在后X位的数值,所述X为 大于零的整数。5. 如权利要求4所述的方法,其特征在于,所述X为[剩余数值*预设比例]或int (剩 余数值*预设比例)。6. -种获取矩阵中向量相似度的系统,其特征在于,所述系统包括: 矩阵预处理单元,用于对待获取矩阵进行预处理,所述预处理包括:去除所述待获取矩 阵中的零值以及出现率低于预设的出现率阈值的值; 矩阵存储单元,用于将经过所述矩阵预处理单元预处理的矩阵中的值按行向量的方式 存储到分布式系统; 相似度获取单元,用于根据Map-Reduce模型通过抽样计算所述矩阵存储单元中存储 的任意两个行向量的相似度。7. 如权利要求6所述的系统,其特征在于,所述相似度获取单元,包括: 向量对抽取子单元,用于在Map阶段,按行从所述分布式系统中抽取向量对&、Wj; Reduce概率获取子单元,用于获取所述向量对抽取子单元抽取的向量对Wp Wj的 Reduce 概率; 映射提交子单元,用于映射所述向量对Wi、wj: ((w i,Wj) - >1),并根据所述Reduce概率 获取子单元获取的Reduce概率将所述映射提交到Map-Reduce模型的Reduce阶段; 相似度获取子单元,用于在所述映射提交子单元提交到的Reduce阶段,获取所述向量 对%、Wj的和《 = 获取所述向量对的相似度,其中A表示(w i,Wj)对应的映射个数, f R表示文章的篇数,= 表示对R篇文章中(Wi, wp对应的映射个数进行求和。8. 如权利要求7所述的系统,其特征在于,所述Reduce概率获取子单元包括: Reduce概率计算子单元,用于根据公式"=emin<#u, #u, >获取所述向量对&、Wj的 Reduce概率,其中p为Reduce概率、e为取值范围为(0,1)的预设的向量相似度阈值、#Wi 为向量Wi在所述分布式系统中出现的次数; 所述相似度获取子单元包括: 相似度计算子单元,用于在Reduce阶段,获取所述向量对WpWj的和= 7;.,并根据 公式2获取所述向量对的相似度,其中((Wpwj), <Γι,…,rK>)。 e9. 如权利要求6所述的系统,其特征在于,所述矩阵预处理单元具体用于,对矩阵中的 剩余数值按出现的频率进行降序排列,去除排列在后N位的数值,所述N为大于零的整数。10. 如权利要求9所述的系统,其特征在于,所述N为[剩余数值*预设比例]或int(剩 余数值*预设比例)。
【专利摘要】本发明适用于信息处理技术领域,提供了基于一种获取矩阵中向量相似度的方法和系统,所述方法包括:对待获取矩阵进行预处理,所述预处理包括:去除所述待获取矩阵中的零值以及出现率低于预设的出现率阈值的值;将所述预处理后的待获取矩阵中的值按行向量的方式存储到分布式系统;根据Map-Reduce映射-归约模型通过抽样计算所述分布式系统中任意两个行向量的相似度。通过本发明,可以在保证相似度计算精度的同时,极大的减少相似度计算过程中的计算量。
【IPC分类】G06F17/16
【公开号】CN104881395
【申请号】CN201510359140
【发明人】王巍, 许子立
【申请人】Tcl集团股份有限公司
【公开日】2015年9月2日
【申请日】2015年6月25日
转载请注明原文地址:https://www.famiwei.com/read-8138680.html

最新回复(0)