[00298896]一种基于随机算法的分布式实体匹配方法
交易价格:
面议
所属行业:
分析仪器
类型:
发明专利
技术成熟度:
正在研发
专利所属地:中国
专利号:CN201510330555.7
交易方式:
技术转让
技术转让
技术入股
联系人:
华东师范大学
进入空间
所在地:上海上海市
- 服务承诺
- 产权明晰
-
资料保密
对所交付的所有资料进行保密
- 如实描述
技术详细介绍
摘要:本发明公开了一种基于随机算法的分布式实体匹配方法,包括如下步骤:数据预处理步骤:对原始数据进行特征抽取,生成实体及其向量;签名生成步骤:根据实体及其向量生成多个随机向量,生成每一个随机向量相应的签名,对签名进行多次随机变换,再将实体编号、变换后签名和变换序号传输到分布式节点内;匹配对生成步骤:在分布式节点内对签名重排并分组,从组中提取匹配对;相似度计算步骤:通过计算海明距离得到匹配对的相似度。本发明提出了用于减少冗余相似度计算的解决方案,可以有效提升分布式环境下对半结构化和非结构化数据的实体匹配效率,在准确率得到保证的同时,处理速度明显高过目前较先进的实体匹配方法。
摘要:本发明公开了一种基于随机算法的分布式实体匹配方法,包括如下步骤:数据预处理步骤:对原始数据进行特征抽取,生成实体及其向量;签名生成步骤:根据实体及其向量生成多个随机向量,生成每一个随机向量相应的签名,对签名进行多次随机变换,再将实体编号、变换后签名和变换序号传输到分布式节点内;匹配对生成步骤:在分布式节点内对签名重排并分组,从组中提取匹配对;相似度计算步骤:通过计算海明距离得到匹配对的相似度。本发明提出了用于减少冗余相似度计算的解决方案,可以有效提升分布式环境下对半结构化和非结构化数据的实体匹配效率,在准确率得到保证的同时,处理速度明显高过目前较先进的实体匹配方法。