性能提升20倍:阿里云 Milvus 深度优化磁盘索引,重新定义亿级向量检索

在线体验各类最新模型,更有模型 免费Token 额度领取!
立即体验
简介: 向量检索正步入"既要低成本,又要高性能"的新时代。阿里云向量数据库 Milvus 版通过将 DiskANN 图索引与最前沿的 RaBitQ 量化算法深度融合,并在工程层面完成从量化内核到 I/O 调度链路的全栈优化,在 1 亿 768 维标准评测数据集上,将磁盘向量索引 QPS 提升至开源 Milvus 的 20倍 以上,P99 延迟降低至 1/10 以下,QueryNode 内存占用减少 29%,同时保持 98%+ 的召回率,为 RAG、多模态检索、智能推荐等 AI 场景提供了极致性价比的基础设施。

摘要

向量检索正步入"既要低成本,又要高性能"的新时代。阿里云向量数据库 Milvus 版通过将 DiskANN 图索引与最前沿的 RaBitQ 量化算法深度融合,并在工程层面完成从量化内核到 I/O 调度链路的全栈优化,在 1 亿 768 维标准评测数据集上,将磁盘向量索引 QPS 提升至开源 Milvus 的 20倍 以上,P99 延迟降低至 1/10 以下,QueryNode 内存占用减少 29%,同时保持 98%+ 的召回率,为 RAG、多模态检索、智能推荐等 AI 场景提供了极致性价比的基础设施。

一、为什么需要磁盘向量索引?

1.1 百亿级数据下的成本困境

在大规模 AI 应用中,数据集通常包含数十亿甚至数百亿向量。传统内存索引(HNSW、IVF_FLAT)在数据量突破亿级时,内存成本呈线性增长,单节点难以承载。DiskANN 将图索引与向量数据存放在 SSD 上,内存仅需保留轻量压缩向量与热点缓存,从而将内存成本降低一个数量级。

1.2 开源 DiskANN 的性能瓶颈

开源Milvus中原生 DiskANN 使用 Product Quantization(PQ)作为内存中的距离估算方案,在系统架构和搜索性能方面存在三重瓶颈:

瓶颈维度

问题

计算效率

PQ 依赖查表累加,CPU计算效率不高

I/O 调度

系统调用开销大,并发吞吐受限

搜索策略

大量候选节点被无效计算,CPU压力大

阿里云 Milvus 团队基于此,对 DiskANN 进行了从算法到工程的全栈优化。

二、核心技术:DiskANN + RaBitQ 深度融合

2.1 Vamana 图:图索引内存重排布

DiskANN 的核心是 Vamana 图索引。与 HNSW 的多层结构不同,Vamana 采用单层稀疏图,通过两轮剪枝构图策略,在保持图连通性的同时引入更多"长边",显著减少搜索收敛所需的跳数。开源 DiskANN 将每个节点的邻居列表与其全精度向量数据存放在同一磁盘扇区。搜索时通过一次磁盘读取同时获得邻居关系和原始向量,实现"隐式重排",虽然可以在计算下一轮邻居的同时完成精确距离计算,但是在搜索过程中涉及到大量的串行磁盘 IO。 阿里云 Milvus 通过将 Vamana 图索引在内存中重新组织,实现搜索过程 Zero IO, 只在最后 Rerank 阶段从磁盘上获取原始向量,获得极致性能提升。

2.2 RaBitQ:极致量化,1 bit 到 4 bit 的精准压缩

RaBitQ(Random Bit Quantization)是当前最前沿的向量量化算法。其核心思想是:在高维空间中,将向量归一化后映射到超立方体的顶点上,每一维仅需 1 bit 表示。

为什么高维下 RaBitQ 精度反而更高? 这源于高维概率的"集中效应":当维度 d 足够大时,随机向量之间的角度高度集中,量化到超立方体顶点的误差以 O(1/√d) 的速率收敛。这意味着在 768 维空间中,1 bit 量化的误差已经非常小。阿里云 Milvus 在标准 1-bit RaBitQ 基础上,采用了 4-bit 扩展模式,在每一维使用 4 bit 来编码残差信息,在压缩比和精度之间取得最优平衡:

量化方案

压缩倍率

单条 768 维向量内存

精度

计算速度

Float32

1x

3072 Byte

精确

基准

PQ (M=384)

8x

384 Byte

中等

查表累加,较慢

RaBitQ 1-bit

32x

96 Byte

较高

popcount,极快

RaBitQ 4-bit

8x

384 Byte

AVX-512 VNNI,极快

三、性能测评

3.1 测试环境

项目

配置

Benchmark

Zilliz VectorDBBench

数据集

Performance768D100M(1 亿 768 维向量)

QueryNode

16 CU × 2 节点

对比组

阿里云 DiskANN + RaBitQ

开源 DiskANN + PQ

3.2 测试结果

四、结论

在不同的测试场景在阿里云 Milvus 方案均实现 20 倍以上 QPS 提升,在 P99/P95延迟也大幅降低,召回率略降低不到 1%。索引构建时间从 20h 缩短到 6h 小时左右,阿里云 Milvus 相比于开源 DiskANN 实现完成端到端性能极致提升。

参考文献

  1. Subramanya, S.J., et al. "DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node." NeurIPS 2019.
  2. Gao, J., Long, C. "RaBitQ: Quantizing High-Dimensional Vectors with a Theoretical Error Bound for Approximate Nearest Neighbor Search." SIGMOD 2024.
  3. Aguerrebere, C., et al. "Locally-adaptive Quantization for Streaming Vector Search." arXiv 2024.
  4. Gao, J. "Quantization in The Counterintuitive High-Dimensional Space." dev.to, 2024.
目录
相关文章
|
4月前
|
人工智能 运维 算法
轻量化起步,更低门槛上手向量检索 —— 阿里云 Milvus 单机版正式上线!
AI时代向量检索成刚需,但部署成本高、运维难。阿里云Milvus单机版正式上线:一键开通、4CU起配、支持900万级向量,月付仅628元起,适合初创、开发者及中小项目快速验证RAG、语义搜索等场景,未来可平滑升级至集群版。(239字)
|
人工智能 安全 Apache
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
QwenPaw 是一款开源、本地优先的AI个人智能体(Apache 2.0),数据归属用户、记忆自主进化、支持钉钉/飞书/微信等多端触达。3行命令即可部署,内置Coding IDE、Persona人格、定时任务、MCP工具生态与多Agent协作,真正属于你的私有AI助理。
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
|
1月前
|
人工智能 算法 数据挖掘
DeepSeek 公式怎么导出 Word?完整保留 LaTeX 数学公式的 3 种方法
DeepSeek生成的数学公式导出到Word常遇显示异常、不可编辑等问题。本文详解三种解决方案:手动LaTeX复制(适合少量公式)、Markdown/Pandoc转换(适合技术用户批量处理)、DS随心转插件(一键在AI页面导出可编辑Word),助你高效保留公式结构与准确性。(239字)
509 1
|
DataWorks 数据挖掘 Serverless
阿里云EMR Serverless StarRocks 内容合集
阿里云 EMR StarRocks 提供存算分离架构,支持实时湖仓分析,适用于多种 OLAP 场景。结合 Paimon 与 Flink,助力企业高效处理海量数据,广泛应用于游戏、教育、生活服务等领域,显著提升数据分析效率与业务响应速度。
610 0
|
9月前
|
人工智能 运维 监控
Flink 智能调优:从人工运维到自动化的实践之路
本文由阿里云Flink产品专家黄睿撰写,基于平台实践经验,深入解析流计算作业资源调优难题。针对人工调优效率低、业务波动影响大等挑战,介绍Flink自动调优架构设计,涵盖监控、定时、智能三种模式,并融合混合计费实现成本优化。展望未来AI化方向,推动运维智能化升级。
990 8
Flink 智能调优:从人工运维到自动化的实践之路
|
9月前
|
存储 人工智能 大数据
云栖2025|阿里云开源大数据发布新一代“湖流一体”数智平台及全栈技术升级
阿里云在云栖大会发布“湖流一体”数智平台,推出DLF-3.0全模态湖仓、实时计算Flink版升级及EMR系列新品,融合实时化、多模态、智能化技术,打造AI时代高效开放的数据底座,赋能企业数字化转型。
1589 0
|
SQL Serverless 测试技术
体验 Serverless StarRocks × Paimon (DLF) 查询 TPC-DS 标准库性能
本文介绍如何通过共享TPC-DS样例数据集,创建并绑定DLF Catalog到StarRocks实例,实现高效数据查询与分析。内容涵盖RAM用户授权、外部Catalog连接、性能测试(如TPC-DS Query 3)、数据写入内外表、物化视图构建数仓DWD-ADS层,以及通过Quick BI进行可视化报表展示的完整流程,助力快速搭建湖仓一体架构。
323 0
|
9月前
|
存储 人工智能 算法
从 VLDB‘25 看向量数据库发展方向:行业观察与技术前瞻
第 51 届国际大型数据库会议(The 51st International Conference on Very Large Data Bases,简称VLDB 2025)是数据管理、数据库系统与大规模数据处理领域最具影响力的国际顶级学术会议之一。本届 VLDB 在于2025 年 9 月 1 日至 9 月 5 日在英国伦敦Queen Elizabeth II Centre (QEII Centre) 举办。
|
存储 SQL 人工智能
Hologres 4.0全新发布:AI时代的一站式多模态分析平台
2025年云栖大会,Hologres发布全新4.0版本升级,以“AI时代的一站式多模态分析平台”为核心理念,全面展示了Hologres在结构化、半结构化与非结构化数据分析能力上的重大突破,特别是在OLAP分析、点查、向量检索、全文检索、湖仓协同及AI Function集成等方面的领先优势,刷新ClickBench、JSONBench、VectorDBBench等多项榜单,登顶第一。