solr4.2增量索引之同步(修改,删除,新增)

本文涉及的产品
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
云数据库 RDS MySQL,高可用系列 2核4GB
简介:

solr增量索引配置 
1.在进行增量索引前,首先要弄懂几个必要的属性,以及数据库建表事项,和dataimporter.properties 
                   data-config.xml里面的数据 
  <!--  transformer 格式转化:HTMLStripTransformer 索引中忽略HTML标签   ---> 
  <!--  query:查询数据库表符合记录数据   ---> 
  <!--  deltaQuery:增量索引查询主键ID    --->    注意这个只能返回ID字段 
  <!--  deltaImportQuery:增量索引查询导入数据  ---> 
  <!--  deletedPkQuery:增量索引删除主键ID查询  ---> 注意这个只能返回ID字段 
                   数据库配置注意事项 
1.如果只涉及添加,与修改业务,那么数据库里只需额外有一个timpstamp字段 
就可以了,默认值为当前系统时间,CURRENT_TIMESTAMP(笔者的数据为mysql的) 
2.如果还涉及删除业务,那么数据里就需额外再多添加一个字段isdelete,int类型的 
用0,1来标识,此条记录是否被删除,当然也可以用其他字段标识,ture或false都可以 

                             dataimporter.properties 
这个配置文件很重要,它是用来记录当前时间与上一次修改时间的,通过它能够找出,那些,新添加的,修改的,或删除的记录 

       下面为笔者当时测试时的一个演示,其中添加,修改,删除,都涉及了 

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
<dataConfig>   
          <!---   此段话配置的是一个MySQL的数据源,(数据源也可以配置在solrconfig.xml中)  --->
         <dataSource name= "mydb"  type= "JdbcDataSource"  driver= "com.mysql.jdbc.Driver"  url= "jdbc:mysql://localhost/test"  user= "root"  password= "ninemax" />
         
         
         <document>
              <!--  下面分别来介绍属性(如有错误,欢迎指出) -->
              <!--  pk= "ID"  这个很有必要,因为其中的增量索引查询主键ID时需要  -->
               <!--  dataSource= "mydb"    这个引用名字是引用上面数据源的名字 -->
               <!--  name= "myinfo"    这个名字必须唯一,存在多个实体时 -->
                <!--  query="select  *  from myinfo WHERE isdelete= 0    query查询是指
                查询出表里所有的符合条件的数据,因为笔者测试的有删除业务,所以
                where  后面有一个限定条件isdelete= 0 ,意思为查询未被删除的数据
                
                (注意这个query查询只对第一次全量导入有作用,对增量导入不起作用)               -->
                <!--
                deltaQuery= "select ID  from myinfo where my_date > '${dataimporter.last_index_time}'" 
                deltaQuery的意思是,查询出所有经过修改的记录的ID
                可能是修改操作,添加操作,删除操作产生的
                (此查询只对增量导入起作用,而且只能返回ID值)               -->
                <!--
                deletedPkQuery= "select ID from myinfo where isdelete=1"    
                此操作值查询那些数据库里伪删除的数据的ID(即isdelete标识为 1 的数据)
                solr通过它来删除索引里面对应的数据
                (此查询只对增量导入起作用,而且只能返回ID值)               -->
                <!--
                 deltaImportQuery= "select * from myinfo where ID='${dataimporter.delta.ID}'"
                 次查询是获取以上两步的ID,然后把其全部数据获取,根据获取的数据
                 对索引库进行更新操作,可能是删除,添加,修改
                 (此查询只对增量导入起作用,可以返回多个字段的值,一般情况下,都是返回所有字段的列)               -->
                
                
              
              <entity pk= "ID"   dataSource= "mydb"  name= "myinfo"  query= "select  *  from myinfo WHERE isdelete=0 " 
               deltaQuery= "select ID  from myinfo where my_date > '${dataimporter.last_index_time}'" 
               deletedPkQuery= "select ID from myinfo where isdelete=1"              
               deltaImportQuery= "select * from myinfo where ID='${dataimporter.delta.ID}'"
               
              >
              <!--  此条记录有必要说一下,ID指定大写的,与上面语句中的对应起来---->
              
               <field column= "ID"  name= "id" />
                <field column= "name"  name= "name" />
                <field column= "address"  name= "address" />
                <field column= "age"  name= "age" />
                 <field column= "my_date"  name= "my_date" />
                  <field column= "isdelete"  name= "isdelete" />
               </entity>
              
 
         </document>
         
     </dataConfig>

转自: 

http://www.jiancool.com/article/12743229775/;jsessionid=14E9B3F1BB33399799884B5C8F15DDE1 


本文转自 兴趣e族 51CTO博客,原文链接:http://blog.51cto.com/simplelife/1883024


相关实践学习
如何在云端创建MySQL数据库
开始实验后,系统会自动创建一台自建MySQL的 源数据库 ECS 实例和一台 目标数据库 RDS。
全面了解阿里云能为你做什么
阿里云在全球各地部署高效节能的绿色数据中心,利用清洁计算为万物互联的新世界提供源源不断的能源动力,目前开服的区域包括中国(华北、华东、华南、香港)、新加坡、美国(美东、美西)、欧洲、中东、澳大利亚、日本。目前阿里云的产品涵盖弹性计算、数据库、存储与CDN、分析与搜索、云通信、网络、管理与监控、应用服务、互联网中间件、移动服务、视频服务等。通过本课程,来了解阿里云能够为你的业务带来哪些帮助 &nbsp; &nbsp; 相关的阿里云产品:云服务器ECS 云服务器 ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,助您降低 IT 成本,提升运维效率,使您更专注于核心业务创新。产品详情: https://www.aliyun.com/product/ecs
相关文章
|
4月前
|
SQL 数据库 开发工具
实时计算 Flink版产品使用合集之数据库中有新增索引,同步任务没有报错,索引的变动是否有影响
实时计算Flink版作为一种强大的流处理和批处理统一的计算框架,广泛应用于各种需要实时数据处理和分析的场景。实时计算Flink版通常结合SQL接口、DataStreamAPI、以及与上下游数据源和存储系统的丰富连接器,提供了一套全面的解决方案,以应对各种实时计算需求。其低延迟、高吞吐、容错性强的特点,使其成为众多企业和组织实时数据处理首选的技术平台。以下是实时计算Flink版的一些典型使用合集。
|
4月前
|
API 数据库 流计算
有大佬知道在使用flink cdc实现数据同步,如何实现如果服务停止了对数据源表的某个数据进行删除操作,重启服务之后目标表能进行对源表删除的数据进行删除吗?
【2月更文挑战第27天】有大佬知道在使用flink cdc实现数据同步,如何实现如果服务停止了对数据源表的某个数据进行删除操作,重启服务之后目标表能进行对源表删除的数据进行删除吗?
109 3
|
11月前
|
SQL 流计算
对于Flink CDC,当源表的数据被删除后,可以通过以下方法在结果表中同步删除
对于Flink CDC,当源表的数据被删除后,可以通过以下方法在结果表中同步删除
760 1
|
SQL 分布式计算 NoSQL
Spark 操作 kudu -- 增加,删除,修改,查询操作 | 学习笔记
快速学习 Spark 操作 kudu -- 增加,删除,修改,查询操作
1551 0
Spark 操作 kudu -- 增加,删除,修改,查询操作 | 学习笔记
|
4月前
|
SQL Oracle 关系型数据库
实时计算 Flink版产品使用合集之delete主键删除源表一条记录,目标表未删除数据问题如何解决
实时计算Flink版作为一种强大的流处理和批处理统一的计算框架,广泛应用于各种需要实时数据处理和分析的场景。实时计算Flink版通常结合SQL接口、DataStream API、以及与上下游数据源和存储系统的丰富连接器,提供了一套全面的解决方案,以应对各种实时计算需求。其低延迟、高吞吐、容错性强的特点,使其成为众多企业和组织实时数据处理首选的技术平台。以下是实时计算Flink版的一些典型使用合集。
156 1
|
4月前
|
关系型数据库 MySQL
elasticsearch删除脏数据(根据指定字段删除数据)
elasticsearch删除脏数据(根据指定字段删除数据)
|
9月前
|
流计算
Flink CDC-sql怎样导数据使starrocks支持主键模型delete的配置吗?目前只能更新和插入,但是删除不行
Flink CDC-sql怎样导数据使starrocks支持主键模型delete的配置吗?目前只能更新和插入,但是删除不行
172 1
|
4月前
|
存储 Oracle 关系型数据库
删除了表中 2023之前的数据 flink cdc 里面会删除吗?
删除了表中 2023之前的数据 flink cdc 里面会删除吗?
97 0
|
10月前
|
数据库
解决logstash同步数据库内容到ES时,同步时间点用到了别的表的最新时间点
解决logstash同步数据库内容到ES时,同步时间点用到了别的表的最新时间点
67 0
|
存储 SQL NoSQL
PostgreSQL列存增加更新和删除功能
PostgreSQL列存增加更新和删除功能
274 0