一种基于MapReduce的局部相似自连接算法

作者:王晓霞; 孙德才

摘要:局部相似自连接能在给定的单个数据集中快速找到所有满足相似要求的记录对,它在数据清洗、基因序列比对和剽窃检测等领域都有广泛的应用。为研究基于单个字符串集的并行自连接算法,提出了一种基于MapReduce框架的自连接算法,解决了局部相似自连接的定位问题。该算法采用了过滤验证二阶段模式;在过滤阶段,采用无关对过滤和冗余对过滤抛弃了大量的无效字符串对;在验证阶段,通过生成小编号串内容保留项解决了字符串编号和内容的快速配对问题。实验结果显示,该算法在大数据集上的自连接速度一直快于当前的优秀算法LS-Join,同时非常适合动态编辑距离参数环境下的局部相似自连接操作。实验结果也证明,该算法中提出的相关技术有效地提高了局部相似自连接的速度。

分类:
  • 期刊
  • >
  • 自然科学与工程技术
  • >
  • 信息科技
  • >
  • 电子信息科学综合
收录:
  • 知网收录(中)
  • 维普收录(中)
  • 上海图书馆馆藏
  • 万方收录(中)
  • 国家图书馆馆藏
  • 统计源期刊(中国科技论文优秀期刊)
关键词:
  • 相似连接
  • 自连接
  • mapreduce
  • 数据清洗
  • 大数据

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

期刊名称:计算机技术与发展

期刊级别:统计源期刊

期刊人气:2971

杂志介绍:
主管单位:陕西省工业和信息化厅
主办单位:中国计算机学会微机专委会;陕西省计算机学会
出版地方:陕西
快捷分类:计算机
国际刊号:1673-629X
国内刊号:61-1450/TP
邮发代号:52-127
创刊时间:1991
发行周期:月刊
期刊开本:A4
下单时间:1个月内
复合影响因子:0.62
综合影响因子:0.413