Spark

首页 标签 Spark
# Spark #
关注
9171内容
|
18小时前
| |
Databricks 实测 Spark 比 Flink 快 92%,流计算要变天了。
Databricks 3月2日发布测评:Spark Real-Time Mode(RTM)在实时特征计算(编码、enrichment、聚合)中,较Flink最高快92%(p99延迟9ms vs 95ms)。RTM打破微批限制,实现毫秒级低延迟、全状态支持与流式Shuffle,挑战“必须双引擎”行业共识。
Apache Doris 高性能 Open Lake Variant 读写技术解析(含对比数据)
相比 Spark,Doris 冷跑综合加速 15.10×、热跑 19.14×;拆列场景热跑综合加速达 58.64×,部分 Paimon 测试超过 106×
EMR Serverless Daft 算子市场免费公测|10分钟极速实战(附视频教程)
Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。 以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量“噪音”。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈。 本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。
|
19天前
| |
来自: 弹性计算
大数据成本为什么越跑越高?别急着加机器,Spot + 队列调度可能省下一半
大数据成本为什么越跑越高?别急着加机器,Spot + 队列调度可能省下一半
|
25天前
| |
来自: 云存储
Catalog 多了无法统一管理?Gravitino 一个入口统管 OSS Tables【详解 OSS Tables 系列】
本文介绍如何通过 Apache Gravitino 统一管理多源异构元数据(如 OSS Tables、Hive、JDBC 等),解决 Catalog 多、配置重复、元数据碎片化问题。Gravitino 作为元数据联邦层,提供统一命名空间与权限治理,并支持 Spark/Flink/Trino 等引擎通过单一 REST 接口跨源查询,显著降低运维与接入成本。
|
26天前
|
柬埔寨本地化钓鱼与多阶段恶意软件攻击研究
本文分析2026年针对柬埔寨的未归因定向攻击:利用本地化钓鱼邮件(政府通知、医疗记录等)为入口,通过Inno Setup双扩展名伪装、DLL侧加载、PNG隐写、BYOVD技术滥用ar drv.sys驱动(CVE-2026-36425)内核级禁用安全软件,最终部署Spark RAT。提出终端防护、驱动治理、钓鱼防御与区域情报协同四维闭环防御建议。(239字)
|
1月前
| |
来自: 云存储
分析师想查数据湖?Trino 不用搬数据,直接查 OSS Tables【详解 OSS Tables 系列】
本文介绍如何让Trino支持阿里云OSS Tables——需对Trino源码做两处轻量修改(注册oss://协议),使其通过Iceberg REST Catalog对接OSS Tables,实现秒级交互式SQL查询。涵盖Table Bucket创建、Catalog配置及权限设置,助力BI分析师高效即席分析湖数据。(239字)
|
1月前
| |
来自: Qoder CN
AI + ♾️ 开发者创作大赛 · 第二期正式开启
本期聚焦“AI+影视流”,邀创作者用Qoder打造可运行的电影Agent:写脚本、调模型、自动剪辑,一人即剧组。魔搭提供AIGC工具链,NVIDIA DGX Spark保障本地持续生成。发布方案至小红书,带话题#魔搭社区 #Qoder #AI无限开发者创作大赛。
|
1月前
| |
来自: 云存储
还在自建 Hive Metastore?Spark 直连 OSS Tables 就能跑 Iceberg 【详解 OSS Tables 系列】
本文详解Spark对接OSS Tables数据湖的极简方案:无需自建Hive Metastore,原生兼容Iceberg REST Catalog协议,仅需配置JAR包、凭证及Catalog参数,即可通过标准SQL完成建表、读写、分区、Time Travel等全功能操作。
|
1月前
|
一个 SQL 字段到底是怎么算出来的?我做了一个能给出“证据”的血缘工具
Scope Lineage 是一款面向 Spark/Hive 的开源 SQL 字段血缘分析工具,专注回答“字段怎么算出来”:不仅追踪物理来源,更识别常量生成、保留完整表达式与加工步骤,并明确标注证据边界(Verifiable Lineage),支持复杂 CTE/UNION/聚合场景。
免费试用