阿里云 EMR Serverless StarRocks(Stella 2.2.0)发布:多模态处理与分析闭环,内表与湖表统一检索

简介: Stella 2.2 面向 AI 时代的数据基础设施,打通“多模态数据处理—向量化与理解—多路检索—分析消费”的完整闭环。无论数据沉淀在 Paimon 湖表,还是 StarRocks 存算分离内表,都可以在统一 SQL 入口下组合结构化分析、全文检索、向量检索与 AI Function,服务智能驾驶、具身智能、内容与商品理解、企业知识库和 RAG 等场景。

Stella 2.2 面向 AI 时代的数据基础设施,打通“多模态数据处理—向量化与理解—多路检索—分析消费”的完整闭环。无论数据沉淀在 Paimon 湖表,还是 StarRocks 存算分离内表,都可以在统一 SQL 入口下组合结构化分析、全文检索、向量检索与 AI Function,服务智能驾驶、具身智能、内容与商品理解、企业知识库和 RAG 等场景。


一、AI 时代,企业需要的不是更多引擎,而是处理与分析闭环

大模型应用正在把企业数据从“结构化宽表”扩展为结构化、半结构化与非结构化数据共存。以智能驾驶为例,一条数据既包含车辆、天气、时间、传感器等结构化字段,也关联图片、语音、视频和文本描述;具身智能则需要同时管理机器人状态、任务指令、视觉轨迹、动作序列和训练标注。

传统方案往往需要计算引擎、搜索引擎、向量数据库和模型服务协同:数据被复制到多套系统,Schema 与索引重复维护,结果还要在应用层拼装。随着数据规模和模态增加,链路成本、数据一致性与在线稳定性都会成为瓶颈。

Stella 2.2 的目标,是用一份数据和一套 SQL 入口完成两类核心工作:

  • 多模态处理:通过 AI Function 对文本、图片、音频、视频进行理解、抽取、分类、摘要和向量化;
  • 多模态检索:在存算分离内表与 Paimon 湖表上组合结构化条件、全文与向量检索,直接服务分析、样本圈选、RAG 与 Agent。


二、Stella 演进:从正式发布、性能领先到多模态闭环

版本

产品里程碑

Stella 1.0

Stella 正式发布,面向云上湖仓分析提供更好的性能与稳定性,并以全托管 Serverless 形态降低运维和弹性扩缩成本。

Stella 2.0

TPC-H 打榜第一,OLAP 性能达到 SOTA;同时补齐 ETL 核心能力,进入 ETL Production Ready 阶段。

Stella 2.2

形成多模态处理与分析闭环:AI Function 负责数据理解与向量化,存算分离内表和 Paimon 湖表共同承载多模态检索与分析。

Stella 2.2 不是单独增加一项搜索能力,而是把 AI 数据加工与数据检索放回同一个分析系统中:处理结果可进入内表,也可通过 Native Writer 写入 Paimon;随后直接使用结构化、全文和向量能力完成检索与分析。


三、关键特性一:多模态处理——AI Function

Stella 2.2 将模型能力封装为 SQL Function,用户可以在查询、筛选、聚合和写入 SQL 中直接调用模型,不需要额外编排 Python 服务。

3.1 覆盖文本理解、生成、向量化与多模态输入

  • 理解与治理ai_sentimentai_classifyai_extractai_filterai_redact
  • 生成与转换ai_completeai_translateai_summarizeai_fix_grammar
  • 语义计算ai_similarityai_embed
  • 多模态处理ai_complete 支持文本、图片、视频、音频输入,ai_embed_multimodal 支持把多模态内容映射到统一向量空间;
  • 跨行汇总ai_aggai_agg_summary 支持按业务分组完成自然语言归纳。

AI Function 可以作用于存算分离内表,也可以直接处理 Paimon 表中的 VARCHAR、VARBINARY/BLOB descriptor 或对象 URL。执行侧提供模型能力路由、批处理、并发与 QPS 控制、Token 用量统计和错误处理,为生产环境中的模型调用提供统一治理入口。

3.2 数据流示例:智驾场景自动理解与标注

Paimon/内表中的路采数据
  ├─ 结构化字段:车型、天气、时间、传感器值
  └─ 多模态对象:图片、视频、音频、文本描述
AI Function
  ├─ ai_complete / ai_extract:场景理解与结构化抽取
  ├─ ai_classify / ai_filter:危险场景分类与语义筛选
  └─ ai_embed_multimodal:生成统一向量
结构化标签 + 文本描述 + Embedding
写入存算分离内表,或通过 Native Writer 写入 Paimon
进入样本圈选、训练数据治理、RAG/Agent 与 BI 分析

一条 SQL 即可把“理解—抽取—向量化—落表”串联起来,数据处理结果与原始业务字段保持在同一套表语义中。


四、关键特性二:多模态检索——内表与 Paimon 两条数据链路

Stella 2.2 同时覆盖存算分离内表和 Paimon 湖表。两者面向不同的数据组织方式,但共享统一 SQL 入口,混合检索能力被直接编排进业务数据流,不需要把结果拉到应用层再次拼接。

4.1 存算分离内表:在线分析与多模态检索一体化

存算分离内表支持向量索引在共享存储上的构建、持久化、读取和回收,支持 HNSW/IVF 系列索引与余弦相似度、内积、L2 距离;同时可结合内表全文/倒排索引和普通 SQL 谓词,完成结构化、关键词和语义相似度的联合检索。

向量索引文件随 Lake Tablet 元数据统一管理,支持异步构建、精确 Vacuum 跟踪,并在索引文件缺失时回退到暴力距离计算,从而兼顾性能与可用性。查询侧支持参数化向量输入与 Profile 指标,便于接入在线应用并持续调优。

数据流示例:具身智能轨迹检索

机器人轨迹、任务指令、视觉特征与动作标签
        ↓  写入存算分离内表
结构化列 + 文本列/倒排索引 + 向量列/HNSW(IVF)
        ↓  单条 SQL 统一编排
任务/时间/设备过滤 + 关键词召回 + ANN 相似轨迹召回
Top-K 候选轨迹与原始业务字段
训练样本选择、失败轨迹复盘、相似任务推荐与在线分析

4.2 Paimon 湖表:面向多模态数据湖的原生检索与读写闭环

Paimon Global Index 将湖表上的多路索引统一到分布式执行框架中:

  • 向量检索:支持 ANN Top-N,覆盖余弦相似度、内积和 L2 距离;
  • 全文检索:支持 Tantivy 全文索引与 score() Top-N;
  • 结构化过滤:BTree、Bitmap 索引可作为前置过滤条件;
  • 缓存与可观测:Global Index 接入 DataCache,提供元数据缓存、行标量缓存与 Profile 指标;
  • 多模态数据承载:可读取 Paimon BLOB/BLOB descriptor,把图片、音频、视频、文档及其结构化元数据、文本描述和向量组织在同一湖表中;
  • Native 读写:Paimon-cpp Native Reader 作为读取兜底路径,Native Writer 支持数据写入、固定 Bucket 路由与提交错误传播,形成处理结果写回湖表的闭环。

数据流示例:智驾多模态样本圈选

OSS + Paimon
  ├─ BLOB/descriptor:图片、视频、音频、文档
  ├─ 结构化字段:车辆、天气、时间、标注
  ├─ 文本字段:场景描述、工单与模型生成摘要
  └─ 向量字段:图片/视频/文本 Embedding
Global Index + Native Reader
  ├─ BTree/Bitmap:结构化候选过滤
  ├─ Tantivy/BM25:关键词与全文召回
  └─ ANN:跨模态语义相似召回
        ↓  SQL 中组合多路条件与 Top-N
训练样本集 / 数据质量分析 / RAG / Agent
AI Function 继续加工 → Native Writer 写回 Paimon

这条链路强调“多模态数据在湖、处理与检索在 Stella”:既保留 Paimon 的开放湖格式与低成本存储,又避免把多模态检索拆成多套独立系统。


五、典型场景

智能驾驶:多模态训练数据圈选

按车型、天气、时段等结构化条件筛选,再组合场景描述全文召回和图片/视频向量相似度,快速定位长尾场景;AI Function 可继续完成场景分类、标签抽取与描述生成。

具身智能:轨迹理解与相似任务检索

将任务指令、环境视觉、动作序列和运行指标统一组织,检索相似轨迹并结合结构化指标定位失败原因,为训练集构建、评测和在线决策提供数据基础。

内容、电商与广告:跨模态素材打标和检索

支持文搜图、图搜图、图搜文、视频搜文等跨模态检索,并组合类目、时间、品牌、审核状态等条件,服务商品理解、素材推荐、版权审核与内容运营。

企业知识库与 RAG

对文档、图片、音视频和结构化业务数据进行抽取、摘要与向量化,通过全文、向量和权限/业务条件联合检索,为 RAG 与 Agent 提供更完整的上下文。


六、产品功能发布清单

6.1 湖表多模态检索

  • Paimon Global Index 支持 ANN 向量 Top-N、Tantivy FTS score() Top-N,以及 BTree/Bitmap 前置过滤;
  • 支持带得分的 Global Index 查询,ANN 候选数量与搜索参数可配置,并修正不同距离度量的排序方向;
  • Global Index 接入 DataCache,新增 Catalog 元数据缓存、行标量缓存、索引 Profile 指标;
  • 支持读取 Paimon BLOB 与 BLOB descriptor,Paimon-cpp Native Reader 作为 Split 读取兜底路径;
  • Paimon Native Writer 支持写入与固定 Bucket Shuffle,新增 paimon_bucket(),完善 TIMESTAMP/TIMESTAMP_LTZ 精度写入和提交失败传播;
  • 支持 Paimon TRUNCATE TABLE,并优化非 Metastore 分区表的分区枚举开销。

6.2 存算分离内表多模态检索

  • 支持在存算分离模式下构建、写入和读取向量索引;
  • 向量索引文件纳入 Lake Tablet 元数据并支持精确 Vacuum 跟踪;
  • 支持异步向量索引构建,并在索引文件缺失时回退到暴力距离计算;
  • 支持余弦相似度、内积、L2 距离及参数化向量查询;
  • 可将向量检索与内表全文/倒排索引、结构化 SQL 谓词组合,形成统一的多路检索流程;
  • 新增向量检索 Profile 指标,便于定位召回与执行性能。

6.3 AI Function

  • 文本理解与治理:ai_sentimentai_classifyai_extractai_filterai_redact
  • 文本生成与转换:ai_completeai_translateai_summarizeai_fix_grammar
  • 语义与向量:ai_similarityai_embedai_embed_multimodal
  • 分组汇总:ai_aggai_agg_summary
  • ai_complete 支持文本、图片、视频、音频与多内容组合,ai_embed_multimodal 支持 URL、图片二进制及多内容输入;
  • 支持 OpenAI-compatible 与 DashScope Native 能力路由,并提供微批、限流、Token 统计与错误治理。

6.4 功能、性能与稳定性优化

  • Paimon Global Index:修复 OR 结果聚合、索引分片范围、ANN 参数顺序和度量排序方向问题;
  • Paimon I/O:异步读取线程安全优化,元数据与数据缓存优化,减少重复远端访问;
  • Paimon 类型兼容:完善 INT96、TIMESTAMP、TIMESTAMP_LTZ 与无时区时间戳处理;
  • Paimon 写入稳定性:固定 Bucket 路由、提交失败透传与 Native Writer 上下文统一;
  • Fluss:优化谓词下推、分区裁剪和分区信息复用,并支持无 Lake Snapshot 的 Fluss-only 表读取;
  • 查询稳定性:修复 Join 重排列裁剪、聚合下推后空 Analytic、Lambda 参数 ID 冲突与 INSERT OVERWRITE 重规划问题;
  • 系统稳定性:增加 MySQL 结果发送写超时、AutoVacuum 事务清理防抖和按 Warehouse 的慢查询指标。

七、总结

Stella 1.0 让 Serverless StarRocks 正式进入生产,Stella 2.0 用 TPC-H 第一和 ETL Production Ready 建立性能与工程能力,Stella 2.2 则进一步把数据处理、模型调用、多模态检索和分析消费连接成闭环。

对用户而言,核心价值不是增加一套专用检索系统,而是在现有湖仓数据上直接获得 AI Function 与多模态检索能力:Paimon 湖表适合开放、低成本的多模态数据湖,存算分离内表适合在线分析与检索,两条路径都由 Stella 的统一 SQL、Serverless 计算和可观测体系承载。

相关文章
|
28天前
|
SQL 人工智能 Serverless
从数据湖到多模态湖仓-基于阿里云 EMR Serverless StarRocks 与 DLF Paimon 构建AI时代的统一分析检索架构
阿里云 EMR Serverless StarRocks 在统一数据、一致语义和系统级优化之上,构建了面向 AI Data、AI Agent 和多模态应用的下一代湖仓架构。
从数据湖到多模态湖仓-基于阿里云 EMR Serverless StarRocks 与 DLF Paimon 构建AI时代的统一分析检索架构
|
27天前
|
人工智能 分布式计算 Serverless
阿里云 EMR Serverless Spark 全托管 Ray 再进化:加速构建全模态数据处理新基建
阿里云 EMR Serverless Spark + Ray 双引擎构建全模态数据处理的新基建,通过极致内核优化和统一数据、算力底座,彻底打通了大数据工程与 AI 模型训练的割裂。结合 RayData、Daft、Data-Juicer 等多模态引擎,以及 CPFS、OSS 等高性能存储生态,阿里云正在为全球的 AI 开发者提供一套最具竞争力的数据新基建。
303 0
阿里云 EMR Serverless Spark 全托管 Ray 再进化:加速构建全模态数据处理新基建
|
6月前
|
存储 分布式计算 数据建模
淘宝闪购基于阿里云 EMR Serverless Spark&Paimon的湖仓实践:超大规模下的特征生产&多维分析双提效
本文介绍阿里云 Serverless Spark + Paimon 在淘宝闪购大数据湖仓场景的应用。
|
9月前
|
存储 缓存 Cloud Native
EMR StarRocks Stella 内核正式发布,登顶 TPC 榜单全球第一
EMR Serverless StarRocks 重磅发布全新企业级版本内核 Stella (StarRocks Efficient and Lightening-fast Lakehouse),完全兼容开源 StarRocks,为用户提供企业级的产品功能、卓越的性能及稳定性保障。
|
SQL 关系型数据库 MySQL
猿辅导基于 EMR StarRocks 的 OLAP 演进之路
猿辅导大数据平台团队负责人申阳分享了猿辅导基于EMR StarRocks 的 OLAP 演进之路。
13505 5
猿辅导基于 EMR  StarRocks 的 OLAP 演进之路
|
27天前
|
人工智能 分布式计算 Serverless
EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践
阿里云 EMR Serverless Spark 引入 Ray 分布式计算框架与 Daft 高性能数据引擎,为用户提供了一套开箱即用、免运维且极致高效的多模态数据处理基础设施。
|
存储 JSON 分布式计算
StarRocks + Paimon 在阿里集团 Lakehouse 的探索与实践
阿里集团在推进湖仓一体化建设过程中,依托 StarRocks 强大的 OLAP 查询能力与 Paimon 的高效数据入湖特性,实现了流批一体、存储成本大幅下降、查询性能数倍提升的显著成效: A+ 业务借助 Paimon 的准实时入湖,显著降低了存储成本,并引入 StarRocks 提升查询性能。升级后,数据时效提前60分钟,开发效率提升50%;JSON列化存储减少50%,查询性能提升最高达10倍;OLAP分析中,非JOIN查询快1倍,JOIN查询快5倍。 饿了么升级为准实时Lakehouse架构后,在时效性仅损失1-5分钟的前提下,实现Flink资源缩减、StarRocks查询性能提升(仅5%
1500 60
StarRocks + Paimon 在阿里集团 Lakehouse 的探索与实践
|
关系型数据库 MySQL BI
用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓实战分享
本文从用友畅捷通公司介绍及业务背景;数据仓库技术选型、实际案例及未来规划等方面,分享了用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓的实战经验。
2087 0
用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓实战分享
|
存储 SQL 人工智能
Hologres 4.0全新发布:AI时代的一站式多模态分析平台
2025年云栖大会,Hologres发布全新4.0版本升级,以“AI时代的一站式多模态分析平台”为核心理念,全面展示了Hologres在结构化、半结构化与非结构化数据分析能力上的重大突破,特别是在OLAP分析、点查、向量检索、全文检索、湖仓协同及AI Function集成等方面的领先优势,刷新ClickBench、JSONBench、VectorDBBench等多项榜单,登顶第一。
|
9月前
|
存储 人工智能 分布式计算
阿里云DLF 3.0:面向AI时代的智能全模态湖仓管理平台
在2025年云栖大会,阿里云发布DLF 3.0,升级为面向AI时代的智能全模态湖仓管理平台。支持结构化与非结构化数据统一管理,实现秒级实时处理、智能存储优化与细粒度安全控制,助力企业高效构建Data+AI基础设施。
2546 3

热门文章

最新文章