文本相似度计算方法研究综述

作者:陈二静; 姜恩波

摘要:【目的】分析文本相似度计算方法,了解该领域的发展态势。【文献范围】在CNKI和Web of Science中分别以检索式“篇名:文本相似度OR篇名:词汇相似度OR篇名:语义相似度”和“TI:‘text similarity’or‘semantic similarity’or‘lexical similarity’”并限定文献类型进行检索,最终得到69篇重点文献。【方法】对文本相似度计算方法进行系统梳理,分析重点方法的基本思想、特点并总结未来发展方向。【结果】形成了较为全面的分类描述体系,文本相似度计算方法可分为4类:基于字符串的方法、基于语料库的方法、基于世界知识的方法和其他方法。其中,基于神经网络和基于世界知识的方法以及针对跨领域文本的相似度计算将成为该领域的发展趋势。【局限】仅将不同方法本身作为探讨的核心,未进一步分析方法的应用情况。【结论】有助于全面把握和深入了解文本相似度计算方法的研究现状和未来趋势。

分类:
  • 期刊
  • >
  • 自然科学与工程技术
  • >
  • 信息科技
  • >
  • 计算机软件及计算机应用
收录:
  • 维普收录(中)
  • 上海图书馆馆藏
  • 万方收录(中)
  • CSSCI 南大期刊(含扩展版)
  • 知网收录(中)
  • 国家图书馆馆藏
  • 北大期刊(中国人文社会科学期刊)
  • 统计源期刊(中国科技论文优秀期刊)
  • CSCD 中国科学引文数据库来源期刊(含扩展版)
关键词:
  • 文本相似度
  • 语义相似度
  • 本体
  • 词袋模型
  • 神经网络

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

期刊名称:现代图书情报技术

期刊级别:CSSCI南大期刊

期刊人气:1263

杂志介绍:
主管单位:中国科学院
主办单位:中国科学院文献情报中心
出版地方:北京
快捷分类:新闻
国际刊号:1003-3513
国内刊号:11-2856/G2
邮发代号:82-421
创刊时间:1980
发行周期:月刊
期刊开本:A4
下单时间:1-3个月
复合影响因子:1.45
综合影响因子:0.672599971294403