【深入浅出】阿里自研开源搜索引擎Havenask集群扩分片

简介: 本次分享内容为Havenask的集群扩分片,共2个部分组成( 集群扩分片简介、 集群扩分片实践),希望可以帮助大家更好了解和使用Havenask。

一、集群扩分片简介

流程与修改schema基本一致,用户通过hape修改分片数,进而修改了catalog中的信息触发全量build,新版本全量切换后,新的分片数生效。

image.png


二、集群扩分片实践

1、过程概述

集群扩分片操作的命令与变更表结构一致,相关命令可查看havenask官网。在havenask官网中找到hape命令https://havenask.net/#/doc/v0-2-2/sql/petool/command),然后找到update命令,更新全量表。命令中的参数可更新全量表的partition数量(分片数)。首先创建一个分布式的havenask集群,再创建一张全量表,查询这张全量表,然后对该全量表进行扩分片操作,使用的命令与变更schema的命令相同,等待扩分片操作完成之后,再查询集群。


2、扩分片实践

接下来我们在havenask分布式集群上进行一次扩分片操作。

hape命令变更表结构(https://havenask.net/0/doc/sql/petool/command


准备集群:

  • hape start havenask -c /ha3_install/hape_conf/remote
  • hape create table -t in1 -p 1 -s /ha3_install/example/cases/normal/in0_schema.json  -f hdfs://xxx/test.data -c /ha3_install/hape_conf/remote
  • hape gs bs -c /ha3_install/hape_conf/remote
  • hape gs havenask -c /ha3_install/hape_conf/remote


查询:

  • /ha3_install/sql_query.py --address  http://<qrs-ip>:45800 --query "select * from in1"


扩分片:

  • hape update table-schema -t in1 -p 2 -s /ha3_install/example/cases/normal/in0_schema.json -f hdfs://xxx/test.data -c /ha3_install/hape_conf/remote
  • hape gs bs -c /ha3_install/hape_conf/remote
  • hape gs havenask -c /ha3_install/hape_conf/remote


查询:

  • /ha3_install/sql_query.py --address http://:45800 --query "select * from in1"

3、具体步骤

  • 首先,启动havenask分布式集群;然后,创建一张分片数为1的全量表,触发全量表创建已经完成,在全量表构建期间,可以用gs命令查看,build info表示全量表正在构建中,当有了currentbuild info信息,表明全量表已经构建完成,集群也处于了ready状态;


  • 接下来,查询正常后,进行扩分片操作,把分片数改为2,执行命令后会触发全量buildbuild完成且索引切换上线后,查看全量build的状态,当创建完成后,build info当中会有两个分片的信息;


  • 最后,再次查询集群的状态,显示集群状态为ready,两个分片状态也为ready,扩分片后的集群也已完成。

 

三、结尾

具体Havenask集群扩分片的演示视频可以通过链接查看,欢迎各位开发者使用。

视频链接:https://developer.aliyun.com/live/253698?spm=a2c6h.13262185.profile.7.563bee42LdD7By


关注我们:

Havenask 开源官网:https://havenask.net/

Havenask-Github 开源项目地址:https://github.com/alibaba/havenask

阿里云 OpenSearch 官网:https://www.aliyun.com/product/opensearch

钉钉扫码加入 Havenask 开源官方技术交流群:

1715594790746.png

 

目录
相关文章
|
SQL 运维 搜索推荐
《揭秘,阿里开源自研搜索引擎Havenask的在线检索服务》
Havenask是阿里巴巴智能引擎事业部自研的开源高性能搜索引擎,深度支持了包括淘宝、天猫、菜鸟、高德、饿了么在内几乎整个阿里的搜索业务。本文针对性介绍了Havenask的在线检索服务,它具备高可用、高时效、低成本的优势,帮助企业和开发者量身定做适合业务发展的智能搜索服务。
85767 138
|
人工智能 搜索推荐 异构计算
|
资源调度 分布式计算 Kubernetes
给 K8s 装上大数据调度引擎:伏羲架构升级 K8s 统一调度
飞天伏羲作为有着十多年历史的调度团队,在服务好 MaxCompute 大数据平台的过程中,一直在不断通过自我革新赶超业界先进水平,我们经历了 Fuxi 2.0 的这样的大规模升级,今天通过 K8s 统一调度项目又再次实现了系统架构的蜕变,将大数据平台强大的调度能力赋予 K8s 系统,同时去拥抱 K8s 周边丰富的生态。除了集团弹内集群,将来我们在公共云、专有云等多个场景,也会以 K8s 统一调度的方式进行输出,以更好地服务云上的用户,敬请期待!
3181 116
给 K8s 装上大数据调度引擎:伏羲架构升级 K8s 统一调度
|
关系型数据库 MySQL 索引
MySQL InnoDB中的锁-插入意向锁(Insert Intention Lock)
MySQL InnoDB 插入意向锁 Insert Intention Lock
4848 0
MySQL InnoDB中的锁-插入意向锁(Insert Intention Lock)
|
运维 搜索推荐 调度
Ha3搜索引擎简介
Ha3是阿里巴巴搜索团队开发的搜索引擎平台,它为阿里集团包括淘宝、天猫在内的核心业务提供搜索服务支持。
27365 1
|
消息中间件 Docker 索引
【一文解读】阿里自研开源核心搜索引擎 Havenask简介及发展历史
本次分享内容为Havenask的简介及发展历史,由下面五个部分组成(Havenask整体介绍、名词解释、架构、代码结构、编译与部署),希望可以帮助大家更好了解和使用Havenask。
73888 0
【一文解读】阿里自研开源核心搜索引擎 Havenask简介及发展历史
|
SQL C++ 开发者
【技术解析 | 实践】Havenask-UDF定制
本节分享 Havenask UDF定制相关的内容,共包含3个部分,分关于 Havenask 的 UDF 相关的介绍、自定义 UDF 的开发及配置方法的介绍,最后将进行 UDF 定制的实际操作演示。
57033 1
|
机器学习/深度学习 数据可视化 PyTorch
贝叶斯优化实战(二)(1)
贝叶斯优化实战(二)
467 0
|
Java 数据库连接 BI
Github标星35K+超火的Spring Boot实战项目,附超全教程文档
今天给大家推荐一个Github上面超火的SpringBoot实战电商项目mall,目前在Github上面已经有35k+Star。该项目拥有全套教程,对学习者特别友好。全套教程的获取方式已经放在文末!