【直播】StarRocks Stella 2.0 发布|具身行业训练数据圈选实战

简介: EMR StarRocks Stella 2.2.0 多模态数据处理与检索能力重磅发布!揭秘文本、图片、视频的统一向量化与多模态理解,实战演示具身行业训练数据圈选全流程,从向量化标注到模型训练准备,助力智能驾驶、RAG等场景落地,理论+实操一站式掌握!

EMR StarRocks Stella 2.2.0 多模态数据处理与检索能力重磅发布!揭秘文本、图片、视频的统一向量化与多模态理解,实战演示具身行业训练数据圈选全流程,从向量化标注到模型训练准备,助力智能驾驶、RAG等场景落地,理论+实操一站式掌握!

💡 核心亮点抢先看

Stella 能力讲解

  • 多模态处理,AI Function 赋能:告别繁琐的外部调度,AI Function 原生融入 SQL 链路!支持文本、图片、视频统一向量化,轻松实现多模态数据理解、生成与智能分析。
  • 全场景检索,内表湖表全兼容:向量检索、全文检索、混合检索能力全面发布!无论数据沉淀在 StarRocks 存算分离内表,还是 Paimon 湖表,均可在统一 SQL 下实现高效检索。
  • Paimon 湖表多模态检索优势:深度解析 Paimon Global Index 架构,看其如何统一向量、全文与结构化索引,实现“多模态数据在湖、处理与检索在 Stella”的极简运维。
  • 企业级 AI Function 能力:开箱即用的默认模型、函数级模型分层调用,兼顾高吞吐与成本优化,构建生产级 AI 数据计算体系。

具身场景实战

  • 行业场景:具身智能训练数据圈选
  • 湖表数据向量化与标注:一键调用 AI Function,完成多模态样本的向量化与标签抽取。
  • 高质量对话样本筛选:利用语义过滤谓词,用自然语言精准筛出符合业务逻辑的高质量数据。
  • 训练数据质量评估:结合 AI 聚合与结构化分析,快速定位长尾场景与数据瑕疵。
  • 数据集导出与模型训练准备:打通从数据检索到模型训练的最后一步,实现端到端闭环。

👉 扫描海报下方二维码进群观看直播:

相关文章
|
2月前
|
人工智能 分布式计算 大数据
活动报名 | Agentic Lakehouse Meetup · 北京站,从开源技术创新到多模态数据智能化
8月14日,阿里云在北京举办“Agentic Lakehouse”技术活动,聚焦开源大数据生态如何支撑AI Agent全生命周期。
409 2
活动报名 | Agentic Lakehouse Meetup · 北京站,从开源技术创新到多模态数据智能化
|
2月前
|
SQL 人工智能 缓存
阿里云 EMR Serverless StarRocks(Stella 2.2.0)发布:多模态处理与分析闭环,内表与湖表统一检索
Stella 2.2 面向 AI 时代的数据基础设施,打通“多模态数据处理—向量化与理解—多路检索—分析消费”的完整闭环。无论数据沉淀在 Paimon 湖表,还是 StarRocks 存算分离内表,都可以在统一 SQL 入口下组合结构化分析、全文检索、向量检索与 AI Function,服务智能驾驶、具身智能、内容与商品理解、企业知识库和 RAG 等场景。
520 2
|
关系型数据库 MySQL BI
用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓实战分享
本文从用友畅捷通公司介绍及业务背景;数据仓库技术选型、实际案例及未来规划等方面,分享了用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓的实战经验。
2152 0
用友畅捷通基于阿里云 EMR StarRocks 搭建实时湖仓实战分享
|
2月前
|
人工智能 分布式计算 Serverless
阿里云 EMR Serverless Spark 全托管 Ray 再进化:加速构建全模态数据处理新基建
阿里云 EMR Serverless Spark + Ray 双引擎构建全模态数据处理的新基建,通过极致内核优化和统一数据、算力底座,彻底打通了大数据工程与 AI 模型训练的割裂。结合 RayData、Daft、Data-Juicer 等多模态引擎,以及 CPFS、OSS 等高性能存储生态,阿里云正在为全球的 AI 开发者提供一套最具竞争力的数据新基建。
521 0
阿里云 EMR Serverless Spark 全托管 Ray 再进化:加速构建全模态数据处理新基建
|
21天前
|
人工智能 分布式计算 Serverless
EMR Serverless Daft 算子市场免费公测|10分钟极速实战(附视频教程)
Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。 以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量“噪音”。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈。 本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。
180 0
|
8月前
|
分布式计算 Serverless 测试技术
有奖实践:EMR Serverless StarRocks × Serverless Spark x DLF 共探 TPC 极致性能
免费试用 EMR Serverless StarRocks 与 EMR Serverless Spark,体验“实时分析冠军”与“批处理之神”的极致性能表现!
有奖实践:EMR Serverless StarRocks × Serverless Spark x DLF 共探 TPC 极致性能
|
2月前
|
人工智能 分布式计算 Serverless
EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践
阿里云 EMR Serverless Spark 引入 Ray 分布式计算框架与 Daft 高性能数据引擎,为用户提供了一套开箱即用、免运维且极致高效的多模态数据处理基础设施。
|
2月前
|
SQL 人工智能 分布式计算
EMR Serverless Spark AI Function 的双维降本实践
EMR Serverless Spark AI Function 已在智驾、具身智能等行业广泛落地。随着数据规模增长,如何控制由模型推理与Spark计算资源构成的双重成本愈发关键。本文深入解析并发控制等执行机制,并重点介绍两大降本手段:一是通过感知AI Function的查询优化减少模型调用量;二是利用Batch File异步批量推理降低单价并释放等待期资源。两者适用场景各异且可叠加使用,助力企业实现高效降本。
204 0
EMR Serverless Spark AI Function 的双维降本实践
|
2月前
|
分布式计算 运维 自然语言处理
EMR Serverless Spark PB级文本语义去重4倍加速的技术方案解读
针对大模型语料清洗中文本去重面临的性能瓶颈,某企业迁移至阿里云emr serverless spark后实现突破。新方案通过minhash-lsh内置函数将算法下沉引擎层,减少40%代码量;结合fusion engine向量化加速与shuffle优化,消除python udf跨进程开销并解决数据倾斜问题。实测去重性能提升4倍,任务耗时从天级降至小时级,且实现零shuffle失败与免运维。该实践验证了serverless架构在pb级数据预处理中的高效性与稳定性,显著加速模型迭代并降低计算成本。
324 0
|
7月前
|
存储 分布式计算 数据建模
淘宝闪购基于阿里云 EMR Serverless Spark&Paimon的湖仓实践:超大规模下的特征生产&多维分析双提效
本文介绍阿里云 Serverless Spark + Paimon 在淘宝闪购大数据湖仓场景的应用。