EMR Serverless Daft 算子市场免费公测|10分钟极速实战(附视频教程)

简介: Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量“噪音”。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈。本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。

多模态数据处理,从写第一行代码开始。

Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。

以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量“噪音”。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈

本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。


🚀 10 分钟完成 demo,超简单

场景介绍:

该 Demo 面向多模态数据处理场景,将对第一视角视频进行分布式抽帧与去黑边处理,并调用 Qwen3.7-plus 多模态大模型精准识别每帧的手部交互动作,并在 Notebook 中直观呈现图文对应的动作分析结果。

视频讲解:

点击查看视频

前提条件:

  1. 阿里云账号,开通创建 EMR Serverless Spark Workspace 和 OSS Bucket
  2. 已开通 EMR Serverless Spark AI 中心。
    请进入 Serverless Spark 的工作空间 - AI中心,点击 "开通 AI 中心"

  3. Spark 工作空间按量配额上限>20 CU


  4. Spark 工作空间队列弹性并发上限>20 CU

操作步骤:

👉 参考原文下载本 demo 中涉及的文件:https://help.aliyun.com/zh/emr/emr-serverless-spark/getting-started/multimodal-data-processing-quick-start?spm=a2c4g.11186623.help-menu-28066.d_1_11.5be758cbIV9DRR

Step 1 · 下载 daft_demo.ipynb 文件,并导入您的 Spark workspace 中

Step 2 · 下载要处理的视频到本地,并上传到您的 OSS Bucket

注意:请确保您的 spark workspace 与 OSS Bucket 属于同一个 region

Step 3 · 替换 daft_demo.ipynb 代码中的路径变量

# 抽帧之后的图片会放到该目录,<请替换为您的 oss 输入视频,以及输出目录>
INPUT_VIDEO = "oss://apsara-demo/dataset/P01_101_part012_299.40s_310.00s.mp4"
OUTPUT_DIR = "oss://apsara-demo/dataset/daft-output/"

Step 4 · 在 Spark Workspace 中,创建 Notebook Session,并运行 daft_demo notebook

注:选择 esr 版本为为 esr-4.9.0 (Spark 3.5.2, Scala 2.12, Ray 2.55.1, Daft 0.7.17)

运行效果图:

算子市场免费公测窗口

2026 年 8 月 31 日 — 9 月 30 日

公测期间算子调用 Qwen3.7 模型 免费,无其他额外 token 费用!免费模型如下:

  1. qwen3.8-max
  2. qwen3.7-max
  3. deepseek-v4-pro
  4. glm-5.2
  5. qwen3.7-plus (本次活动默认使用模型)
  6. tongyi-embedding-vision-plus-2026-03-06
  7. qwen3.7-text-embedding
  8. qwen-audio-3.0-tts-plus
  9. qwen-audio-3.0-tts-flash
  10. qwen3.7-flash
  11. qwen-audio-3.0-asr-flash

⚠️ 公测须知

公测期间 SparkSQL AI Function、Daft Local、Daft on Ray 运行环境中的算子及 Qwen3.7 模型调用均免费。公测结束后按实际使用量计费,具体标准会在结束前公布,不用担心突然扣费。

公测期间不保障 SLA,但服务不降级,放心用就好。请遵守阿里云数据安全规范,不要上传敏感数据哦。


🔥 立即参与

👉 登录 EMR Serverless Spark 控制台,进入 Spark Workspace,开始你的第一个算子任务吧!

如体验过程中有任何问题,欢迎加入 EMR Serverless Spark 钉群进行交流!


相关文章
|
5天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1452 0
|
5天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1127 0
|
14天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3759 4
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
5天前
|
人工智能 安全 前端开发
刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!
OpenAI 正式推出 GPT-6 Astra 模型,带大家看看这次 GPT 有哪些提升,跟 Claude Fable 5.1 有什么差距?AI 编程能力如何?AGI 真的来了么?
628 0
|
2天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
551 0
|
6天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)

热门文章

最新文章