LCS算法实现简单中文文本相似度分析

简介:

LCS(Longest Common Subsequence)算法实现的文本相似度分析:

算法原理:

(1) 将两个字符串分别以行和列组成矩阵。
(2) 计算每个节点行列字符是否相同,如相同则为 1。
(3) 通过找出值为 1 的最长对角线即可得到最长公共子串。

人 民 共 和 时 代
中 0, 0, 0, 0, 0, 0
华 0, 0, 0, 0, 0, 0
人 1, 0, 0, 0, 0, 0
民 0, 1, 0, 0, 0, 0
共 0, 0, 1, 0, 0, 0
和 0, 0, 0, 1, 0, 0
国 0, 0, 0, 0, 0, 0

为进一步提升该算法,我们可以将字符相同节点(1)的值加上左上角(d[i-1, j-1])的值,这样即可获得最大公用子串的长度。如此一来只需以行号和最大值为条件即可截取最大子串。

人 民 共 和 时 代
中 0, 0, 0, 0, 0, 0
华 0, 0, 0, 0, 0, 0
人 1, 0, 0, 0, 0, 0
民 0, 2, 0, 0, 0, 0
共 0, 0, 3, 0, 0, 0
和 0, 0, 0, 4, 0, 0
国 0, 0, 0, 0, 0, 0
 

代码:

private final String content_regex = "(?i)[^a-zA-Z0-9\u4E00-\u9FA5]";
 
 /**
  * 判断两段正文相似度
  * @param content1
  * @param content2
  * @return
  */
 private float calculateContentSimilarity(String content1, String content2){
  
  String s1 = content1.replaceAll("content_regex", "").trim(); 
  String s2 = content2.replaceAll("content_regex", "").trim();
  
  if(s1.equals(s2)){
   return 1.00f;
  }else {
   if (s1.length() > s2.length() ? (s1.indexOf(s2) > -1)
     : (s2.indexOf(s1) > 0)) {
    return s1.length() > s2.length() ? ((float) s2
      .length() / (float) s1.length()) : ((float) s1
      .length() / (float) s2.length());
   }
  }
  
//  return calculateSimilarityLCS(s1, s2);
  
  return calculateContentSimilarityD(content1, content2);
 }
 
 /**
  * 判断两段正文相似度
  * @param content1
  * @param content2
  * @return
  */
 private float calculateContentSimilarityD(String content1, String content2){
  
  String[] s1 = content1.trim().split("。"); 
  String[] s2 = content2.trim().split("。"); 
  
  if(s1.length < s2.length){
   String[] temp = s1;   
   s1 = s2;
   s2 = temp;
  }
  
  float totalWeight = 0;

  for (int i = 0; i < s2.length; i++) {

   float unitWeight = 0;

   for (int j = 0; j < s1.length; j++) {

    if(content2.indexOf(s2[i]) > -1){
     unitWeight = 1.00f;
     break;
    }
    float weight = calculateSimilarityLCS(s2[i], s1[j]);

    if (unitWeight < weight) {
     unitWeight = weight;
    }
   }

   totalWeight += unitWeight;

  }
  
  return (totalWeight/s2.length) * (s2.length/s1.length);
  
 }
 
 
 /**
  * 判断两段文本相似度
  * @param value1
  * @param value2
  * @return
  */
 private float calculateSimilarityLCS(String s1, String s2) {
  int[][] d = new int[s1.length()][s2.length()];

  int index = 0;
  int length = 0;

  for (int i = 0; i < s1.length(); i++) {
   for (int j = 0; j < s2.length(); j++) {
    int n = i - 1 >= 0 && j - 1 >= 0 ? d[i - 1][j - 1] : 0;

    d[i][j] = s1.charAt(i) == s2.charAt(j) ? 1 + n : 0;

    if (d[i][j] > length) {
     length = d[i][j];
     index = i;
    }
   }
  }
  
  int begin = index - length + 1;   
  String simword = s1.substring(begin, begin + length) ;

  return s1.length() > s2.length() ? ((float) simword
    .length() / (float) s1.length()) : ((float) simword
    .length() / (float) s2.length());
 }

 本文转自william_xu 51CTO博客,原文链接:http://blog.51cto.com/williamx/747485,如需转载请自行联系原作者

相关文章
|
2月前
|
运维 监控 JavaScript
基于 Node.js 图结构的局域网设备拓扑分析算法在局域网内监控软件中的应用研究
本文探讨图结构在局域网监控系统中的应用,通过Node.js实现设备拓扑建模、路径分析与故障定位,提升网络可视化、可追溯性与运维效率,结合模拟实验验证其高效性与准确性。
206 3
|
5月前
|
机器学习/深度学习 边缘计算 算法
NOMA和OFDMA优化算法分析
NOMA和OFDMA优化算法分析
290 127
|
7月前
|
数据采集 机器学习/深度学习 算法
别急着上算法,咱先把数据整明白:大数据分析的5个基本步骤,你都搞对了吗?
别急着上算法,咱先把数据整明白:大数据分析的5个基本步骤,你都搞对了吗?
432 4
|
2月前
|
存储 边缘计算 算法
【太阳能学报EI复现】基于粒子群优化算法的风-水电联合优化运行分析(Matlab代码实现)
【太阳能学报EI复现】基于粒子群优化算法的风-水电联合优化运行分析(Matlab代码实现)
|
3月前
|
机器学习/深度学习 算法 5G
【MUSIC、最大似然与克拉美-罗下界】MUSIC与ESPRIT 算法来估计到达角(AoA),并尝试推导克拉美-罗下界(CRLB)以分析其性能研究(Matlab代码实现)
【MUSIC、最大似然与克拉美-罗下界】MUSIC与ESPRIT 算法来估计到达角(AoA),并尝试推导克拉美-罗下界(CRLB)以分析其性能研究(Matlab代码实现)
142 0
|
4月前
|
编解码 算法 5G
MIMO雷达空间谱估计中Capon算法与MUSIC算法的对比分析及实现
MIMO雷达空间谱估计中Capon算法与MUSIC算法的对比分析及实现
315 2
|
4月前
|
人工智能 自然语言处理 算法
2025 年 7 月境内深度合成服务算法备案情况分析报告
2025年7月,中央网信办发布第十二批深度合成算法备案信息,全国389款产品通过备案,服务提供者占比超七成。截至7月14日,全国累计备案达3834款,覆盖文本、图像、音视频等多模态场景,广泛应用于生活服务、医疗、金融等领域。广东以135款居首,数字人、AI客服等C端应用主导,民营企业成主力,国企聚焦公共服务。随着AI政策推动,备案已成为AI产品合规上线关键环节。
|
7月前
|
存储 监控 算法
员工行为监控软件中的 Go 语言哈希表算法:理论、实现与分析
当代企业管理体系中,员工行为监控软件已逐步成为维护企业信息安全、提升工作效能的关键工具。这类软件能够实时记录员工操作行为,为企业管理者提供数据驱动的决策依据。其核心支撑技术在于数据结构与算法的精妙运用。本文聚焦于 Go 语言中的哈希表算法,深入探究其在员工行为监控软件中的应用逻辑与实现机制。
176 14
|
8月前
|
自然语言处理 算法 安全
境内深度合成服务算法备案通过名单分析报告
本报告基于《境内深度合成服务算法备案通过名单》,分析了2023年6月至2025年3月公布的10批备案数据,涵盖属地分布、行业应用及产品形式等多个维度。报告显示,深度合成算法主要集中于经济发达地区,如北京、广东、上海等地,涉及教育、医疗、金融、娱乐等多行业。未来趋势显示技术将向多模态融合、行业定制化和安全合规方向发展。建议企业加强技术研发、拓展应用场景、关注政策动态,以在深度合成领域抢占先机。此分析旨在为企业提供参考,助力把握技术发展机遇。
境内深度合成服务算法备案通过名单分析报告
|
8月前
|
供应链 算法 搜索推荐
从公布的前十一批其他算法备案通过名单分析
2025年3月12日,国家网信办发布算法备案信息,深度合成算法通过395款,其他算法45款。前10次备案中,深度合成算法累计3234款,其他类别647款。个性化推送类占比49%,涵盖电商、资讯、视频推荐;检索过滤类占31.53%,用于搜索优化和内容安全;调度决策类占9.12%,集中在物流配送等;排序精选类占8.81%,生成合成类占1.55%。应用领域包括电商、社交媒体、物流、金融、医疗等,互联网科技企业主导,技术向垂直行业渗透,内容安全和多模态技术成新增长点。未来大模型检索和多模态生成或成重点。
从公布的前十一批其他算法备案通过名单分析

热门文章

最新文章