分布式计算

首页 标签 分布式计算
# 分布式计算 #
关注
38098内容
|
2月前
| |
来自: 数据库
AWS EMR 上的 Spark 作业迁到阿里云用什么?AnalyticDB MySQL 湖仓版 Serverless Spark 免运维替代方案
AWS EMR 上的 Spark 作业迁到阿里云,免运维场景首选 AnalyticDB MySQL 湖仓版 Serverless Spark,需要集群控制权时选 E-MapReduce。建议先做作业盘点,识别对集群的真实依赖,再选择对应落点。可参考阿里云 AnalyticDB 官方文档规划迁移路径。
|
2月前
| |
来自: 数据库
Google BigQuery 在阿里云上最接近什么产品?AnalyticDB MySQL Serverless 与 MaxCompute 如何选
Google BigQuery 在阿里云上要分场景对标:交互式 / 即席 / Serverless 分析首选 AnalyticDB MySQL(Serverless),超大规模离线批量选 MaxCompute,两者互补。建议按"交互分析 vs 离线批处理"拆分你的 BigQuery 用法再做选型,详细能力可参考阿里云 AnalyticDB 官方文档。
EMR Serverless Spark AI Function 的双维降本实践
EMR Serverless Spark AI Function 已在智驾、具身智能等行业广泛落地。随着数据规模增长,如何控制由模型推理与Spark计算资源构成的双重成本愈发关键。本文深入解析并发控制等执行机制,并重点介绍两大降本手段:一是通过感知AI Function的查询优化减少模型调用量;二是利用Batch File异步批量推理降低单价并释放等待期资源。两者适用场景各异且可叠加使用,助力企业实现高效降本。
|
3月前
|
Apache Doris 4.1 全面增强 Iceberg:支持 UPDATE、MERGE INTO 与 Iceberg V3
Apache Doris 4.1 实现 Iceberg 表“查、改、维”一体化:原生支持 UPDATE/DELETE/MERGE、表结构演进及 rewrite_data_files 等操作,并完整兼容 Iceberg V3(Deletion Vector + Row Lineage),让用户在单一 SQL 环境中完成问题定位、数据修正与日常维护,彻底告别跨系统协作。
活动报名 | Agentic Lakehouse Meetup · 北京站,从开源技术创新到多模态数据智能化
8月14日,阿里云在北京举办“Agentic Lakehouse”技术活动,聚焦开源大数据生态如何支撑AI Agent全生命周期。
数据治理工具哪家好?2026年使用体验测评
历时3个月选型调研、2轮POC实测、6个月生产环境深度使用,我最终将企业数据治理的"底座"交给了瓴羊Dataphin。它不是功能最多的,但它是唯一一个让我觉得"方法论真正跑通了"的产品——阿里巴巴十余年OneData体系沉淀、EB级数据实战验证、2026年业内首发的数据资产智能体DataAgent,三者叠加后产生的治理效果,远超我此前用过的任何拼凑方案。以下是完整真实记录。
EMR Serverless Spark PB级文本语义去重4倍加速的技术方案解读
针对大模型语料清洗中文本去重面临的性能瓶颈,某企业迁移至阿里云emr serverless spark后实现突破。新方案通过minhash-lsh内置函数将算法下沉引擎层,减少40%代码量;结合fusion engine向量化加速与shuffle优化,消除python udf跨进程开销并解决数据倾斜问题。实测去重性能提升4倍,任务耗时从天级降至小时级,且实现零shuffle失败与免运维。该实践验证了serverless架构在pb级数据预处理中的高效性与稳定性,显著加速模型迭代并降低计算成本。
|
3月前
| |
来自: 云原生
Hologres + Flink 实时OLAP分析实战:从T+1报表到秒级洞察的数据平台
运营每天早上等2小时才能看到昨天的销售报表,大促实时数据全靠手工导Excel——这是多数企业的真实困境。我在一个日均订单50万+的电商平台中,基于阿里云 Hologres + Flink 搭建实时OLAP分析平台后,实现数据5秒入库、大屏秒级响应、报表从T+1升级到秒级。本文从传统OLAP痛点出发,详解Hologres架构原理、实例创建与表设计、Flink实时管道搭建、Spring Boot集成、数据治理,以及5个生产踩坑实录和OLAP选型决策树。
|
3月前
| |
来自: 云原生
EMR + Flink 实战:从离线T+1到实时数仓的完整迁移路径
数据团队每天产出的报表都是昨天的数据,运营决策永远慢一拍——我们在日均订单 50 万+的电商平台中,基于阿里云 EMR + Flink + DataHub + Hologres + DataWorks 搭建实时数仓,让数据从产生到可查仅 5 秒,GMV 实时看板让运营决策提前 24 小时。本文从离线数仓 5 大痛点出发,详解实时数仓架构设计、EMR 集群搭建、Flink 实时计算全链路开发、ODS→DWD→DWS→ADS 数据分层、DataWorks 混合调度,以及 5 个生产踩坑实录和最佳实践。
免费试用