OSS&Tablestore 向量检索能力全新升级,重塑AI时代数据管理

本文涉及的产品
数据管理 DMS,安全协同 3个实例 3个月
推荐场景:
学生管理系统数据库
对象存储 OSS,20GB 3个月
对象存储 OSS,恶意文件检测 1000次 1年
简介: 近日,阿里云成功举办了“AI驱动:数据管理的进化与创新 ”线上新品发布会。发布会上,阿里云存储产品向量检索能力全新升级,重塑AI时代数据管理。

【阅读原文】戳:OSS&Tablestore 向量检索能力全新升级,重塑AI时代数据管理

众所周知,优质数据是AI大模型持续迭代的核心。根据IDC预测2025年全球数据量将达到175 ZB,在如此繁杂的数据资源中,如何精准地捕捉数据间的语义关系,提升信息检索的效率,成为了大模型的核心竞争力之一。因此,在AI生产链路中,向量检索技术通过推理应用实现数据价值,将不同模态的数据在同一空间中进行表达和检索,在自然语言处理、计算机视觉等应用领域起到了重要作用。

 

近日,阿里云成功举办了“AI驱动:数据管理的进化与创新 ”线上新品发布会。存储的本质是数据服务,其价值不止于把数据存下来本身,更在于其便捷的采集、精细的管理、高效的流动与使用。

 

1.在数据采集阶段,阿里云运用OSS跨区域复制、OSS传输加速,保障海量非结构化数据高效、安全的传输和统一存储;

 

2.在数据预处理阶段,OSS图片处理、OSS数据索引、EBS弹性临时盘能够提升预处理效率,为训练提供高质量的数据集;

 

3.模型训练和推理阶段,CPFS高性能并行文件存储,以及此次全新推出的OSS Connector for AI/ML能够在大规模、容器化部署的生产环境中,提升模型训练的效率,降低数据集加载时间;新版本OSSFS、OSS加速器可以在推理阶段,加速中小模型的快速拉取;

 

4.在AI应用阶段,阿里云通过OSS数据索引、OSS内容安全、Tablestore向量检索、IMM智能处理等能力的组合,致力于为客户提供基于现有数据和环境,在云上快速搭建AI应用,高效验证业务创新思路的能力。

 

 

当前,AI企业希望面向多模态数据具备开箱即用的数据处理能力,并且一份数据能够对接多种计算引擎和AI框架,提升AI推理实施的便利性 、将传统的单模态数据处理平滑升级为AI多模态数据处理。这要求存储系统的检索能力需要新增向量检索的功能,并且具备开放生态、高性能、低成本等特性。然而,当前多样的向量数据库还存在一些挑战,尤其是在向量检索最核心的成本、规模、召回率三个方面

 

阿里云OSS Indexing发布了向量索引和检索能力。该功能除了可以对OSS Meta进行检索之外,还可以对多媒体数据元信息、用户自定义元数据以及向量语义进行检索。OSS Indexing功能,是依托阿里云表格存储TableStore提供的索引存储和检索能力而构建的。阿里云表格存储是一款Serverless分布式结构化数据存储服务,依赖于新能力的升级,Tablestore支持了RAG应用及传统的多模态搜索场景,同时也支持了OSS indexing的元数据服务。本次发布会上,表格存储针对上述在向量检索领域遇到的成本、规模、召回率等挑战,发布了低成本、大规模、高性能、高召回率的向量检索服务,能以较低成本支持千亿规模数据的存储和检索。

 

通过gist数据集做对照测试得出:相同资源消耗情况下,Tablestore索引构建写入完成时间,比某社区开源向量引擎降低65%,查询时延约仅为开源引攀的九分之一。同时,更低检索时延(Tablestore 71 ms/某开源向量引擎613 ms),内存资源消耗仅为开源向量引擎的十分之一。

 

 

除此之外,本次发布会还重磅更新了OSS数据湖的生态接入方式,包括高性能的 OSS Connector for AI/ML、新版本OSSFS等。同时,OSS在数据安全、性能和数据管理上针对AI负载进行了进一步优化,当前数据处理和检索能力演进主要聚焦在简单易用、更强的兼容性、低成本、AI serverless等方面,即提供开箱即用的AI能力。

 

此次阿里云表格存储向量检索能力的全新升级,推动了智能推荐、内容检索、RAG和知识库等应用的广泛普及,重塑了AI时代海量数据管理的方式。“面对诸多挑战与机遇,阿里云存储将持续进化创新,在AI数据pipeline全流程中,为客户提供更丰富多样的数据管理能力。”阿里云智能资深产品专家彭亚雄(崆闻)阐述到。


我们是阿里巴巴云计算和大数据技术幕后的核心技术输出者。

欢迎关注 “阿里云基础设施”同名微信微博知乎

获取关于我们的更多信息~

相关实践学习
MySQL基础-学生管理系统数据库设计
本场景介绍如何使用DMS工具连接RDS,并使用DMS图形化工具创建数据库表。
相关文章
|
21天前
|
存储 人工智能 数据管理
OSS&Tablestore 向量检索能力全新升级,重塑AI时代数据管理
阿里云 OSS Indexing 发布了向量索引和检索能力。该功能除了可以对 OSS Meta 进行检索之外,还可以对多媒体数据元信息、用户自定义元数据以及向量语义进行检索。OSS Indexing 功能,是依托阿里云表格存储 TableStore 提供的索引存储和检索能力而构建的。表格存储针对成本、规模、召回率等挑战,发布了低成本、大规模、高性能、高召回率的向量检索服务,能以较低成本支持千亿规模数据的存储和检索。
145 8
|
2月前
|
机器学习/深度学习 人工智能 专有云
人工智能平台PAI使用问题之怎么将DLC的数据写入到另一个阿里云主账号的OSS中
阿里云人工智能平台PAI是一个功能强大、易于使用的AI开发平台,旨在降低AI开发门槛,加速创新,助力企业和开发者高效构建、部署和管理人工智能应用。其中包含了一系列相互协同的产品与服务,共同构成一个完整的人工智能开发与应用生态系统。以下是对PAI产品使用合集的概述,涵盖数据处理、模型开发、训练加速、模型部署及管理等多个环节。
|
28天前
|
存储 机器学习/深度学习 弹性计算
阿里云EMR数据湖文件系统问题之OSS-HDFS全托管服务的问题如何解决
阿里云EMR数据湖文件系统问题之OSS-HDFS全托管服务的问题如何解决
|
2月前
|
消息中间件 分布式计算 DataWorks
DataWorks产品使用合集之如何使用Python和阿里云SDK读取OSS中的文件
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
|
2月前
|
存储 运维 安全
阿里云OSS的优势
【7月更文挑战第19天】阿里云OSS的优势
99 2
|
2月前
|
存储 API 开发工具
阿里云OSS
【7月更文挑战第19天】阿里云OSS
84 1
|
2月前
|
人工智能 对象存储
【阿里云AI助理】自家产品提供错误答案。阿里云OSS 资源包类型: 下行流量 地域: 中国内地通用 下行流量包规格: 300 GB 套餐: 下行流量包(中国内地) ,包1年。那么这个是每月300GB,1年是3600GB的流量;还是1年只有300GB的流量?
自家产品提供错误答案。阿里云OSS 资源包类型: 下行流量 地域: 中国内地通用 下行流量包规格: 300 GB 套餐: 下行流量包(中国内地) ,包1年。那么这个是每月300GB,1年是3600GB的流量;还是1年只有300GB的流量?
106 1
|
2月前
|
存储 弹性计算 对象存储
预留空间是什么?阿里云OSS对象存储预留空间说明
阿里云OSS预留空间是预付费存储产品,提供折扣价以锁定特定容量,适用于抵扣有地域属性的Bucket标准存储费用及ECS快照费。通过购买预留空间,如500GB通用预留+100GB标准-本地冗余存储包,用户可优化成本。
|
3月前
|
SQL 分布式计算 DataWorks
DataWorks产品使用合集之如何将CSV文件从阿里云OSS同步到ODPS表,并且使用列作为表分区
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
DataWorks产品使用合集之如何将CSV文件从阿里云OSS同步到ODPS表,并且使用列作为表分区
|
3月前
|
监控 Serverless 持续交付
阿里云云效产品使用问题之如何让流水线支持构建 flutter web 应用到 OSS
云效作为一款全面覆盖研发全生命周期管理的云端效能平台,致力于帮助企业实现高效协同、敏捷研发和持续交付。本合集收集整理了用户在使用云效过程中遇到的常见问题,问题涉及项目创建与管理、需求规划与迭代、代码托管与版本控制、自动化测试、持续集成与发布等方面。