|
SQL 存储 大数据
|

Flink 基础详解:大数据处理的强大引擎

Apache Flink 是一个分布式流批一体化的开源平台,专为大规模数据处理设计。它支持实时流处理和批处理,具有高吞吐量、低延迟特性。Flink 提供统一的编程抽象,简化大数据应用开发,并在流处理方面表现卓越,广泛应用于实时监控、金融交易分析等场景。其架构包括 JobManager、TaskManager 和 Client,支持并行度、水位线、时间语义等基础属性。Flink 还提供了丰富的算子、状态管理和容错机制,如检查点和 Savepoint,确保作业的可靠性和一致性。此外,Flink 支持 SQL 查询和 CDC 功能,实现实时数据捕获与同步,广泛应用于数据仓库和实时数据分析领域。

11464 42
来自: 实时计算 Flink  版块
|
缓存 人工智能 算法
|

深度揭秘复杂异构硬件推理优化

本文介绍了大语言模型在部署推理层面的性能优化工作,涵盖高性能算子、量化压缩、高效运行时及分布式调度四个方面。面对参数和上下文规模增长带来的显存、缓存与计算开销挑战,文中详细探讨了如何通过优化算子性能、低精度量化压缩、异步运行时框架设计以及多层次分布式架构来提升大模型推理效率。此外,还展示了BladeLLM引擎框架的实际应用效果,证明了这些技术在高并发场景下的显著性能提升。

1195 7
|
存储 分布式计算 大数据
|

【赵渝强老师】阿里云大数据生态圈体系

阿里云大数据计算服务MaxCompute(原ODPS)提供大规模数据存储与计算,支持离线批处理。针对实时计算需求,阿里云推出Flink版。此外,阿里云还提供数据存储服务如OSS、Table Store、RDS和DRDS,以及数据分析平台DataWorks、Quick BI和机器学习平台PAI,构建全面的大数据生态系统。

765 18
|
存储 数据可视化 Python
|

使用Python实现个人财务管理工具

本文介绍如何使用Python实现一个简单的个人财务管理工具,包括记录支出和收入、生成财务报告和数据可视化等功能。通过命令行界面输入数据,计算总支出、总收入和净收入,并使用Matplotlib库进行数据可视化。

1294 2
来自: 数据可视化DataV  版块
|
数据采集 存储 数据处理
|

数据治理:如何制定数据标准与规范

在当今这个数据驱动的时代,数据已成为企业最宝贵的资产之一。然而,随着数据量的爆炸性增长和数据来源的多样化,如何有效地管理和利用这些数据成为了企业面临的重大挑战。数据治理作为确保数据质量、安全性、合规性和可访问性的关键过程,其核心在于制定并执行一套科学、合理的数据标准与规范。本文将探讨如何制定数据标准与规范,以推动企业的数据治理实践。

2638 3
|
机器学习/深度学习 边缘计算 PyTorch
|

PyTorch 与边缘计算:将深度学习模型部署到嵌入式设备

【8月更文第29天】随着物联网技术的发展,越来越多的数据处理任务开始在边缘设备上执行,以减少网络延迟、降低带宽成本并提高隐私保护水平。PyTorch 是一个广泛使用的深度学习框架,它不仅支持高效的模型训练,还提供了多种工具帮助开发者将模型部署到边缘设备。本文将探讨如何将PyTorch模型高效地部署到嵌入式设备上,并通过一个具体的示例来展示整个流程。

4285 1
|
数据采集 人工智能 监控
|

赌你一定想要!OpenDataLab首款大模型多模态标注平台Label-LLM正式开源

Label-LLM 是一款专为大模型训练设计的多模态文本对话标注工具,支持团队协作,让标注工作变得简单高效。它不仅涵盖丰富的任务类型,如回答采集、偏好收集和内容评估等,还支持多模态数据标注,包括图像、视频和音频。Label-LLM具备预标注载入功能,能大幅提升工作效率,并提供全方位的任务管理与可视化分析,确保标注质量。快来体验这款强大的标注平台吧![部署文档](https://github.com/opendatalab/LabelLLM)

4039 0
|
SQL 存储 Java
|

Hive 特殊的数据类型 Array、Map、Struct

在Hive中,`Array`、`Map`和`Struct`是三种特殊的数据类型。`Array`用于存储相同类型的列表,如`select array(1, "1", 2, 3, 4, 5)`会产生一个整数数组。`Map`是键值对集合,键值类型需一致,如`select map(1, 2, 3, "4")`会产生一个整数到整数的映射。`Struct`表示结构体,有固定数量和类型的字段,如`select struct(1, 2, 3, 4)`创建一个无名结构体。这些类型支持嵌套使用,允许更复杂的结构数据存储。例如,可以创建一个包含用户结构体的数组来存储多用户信息

4108 0
|
机器学习/深度学习 自然语言处理 索引
|

Moirai:Salesforce的时间序列预测基础模型

过去几个月,时间序列基础模型发展迅速,包括TimeGPT、Lag-Llama、Google的TimesFM、Amazon的Chronos和Salesforce的Moirai。本文聚焦于Moirai,这是一个用于时间序列预测的通用模型,尤其强调零样本推理能力。Moirai处理各种数据频率、适应未知协变量并生成概率预测。文章介绍了Moirai的三个关键特性:多尺寸补丁投影层、任意变量注意力和混合分布。此外,还对比了Moirai与Chronos和TimeGPT,发现Moirai在性能上未超越Chronos,后者在数据效率上更优,但不支持多变量预测。

1668 2
|
XML SQL 关系型数据库
|

Flink CDC产品常见问题之binlog 过期如何解决

Flink CDC(Change Data Capture)是一个基于Apache Flink的实时数据变更捕获库,用于实现数据库的实时同步和变更流的处理;在本汇总中,我们组织了关于Flink CDC产品在实践中用户经常提出的问题及其解答,目的是辅助用户更好地理解和应用这一技术,优化实时数据处理流程。

591 0
来自: 实时计算 Flink  版块
|
SQL DataWorks NoSQL
|

DataWorks常见问题之如何自定义日期参数

DataWorks是阿里云提供的一站式大数据开发与管理平台,支持数据集成、数据开发、数据治理等功能;在本汇总中,我们梳理了DataWorks产品在使用过程中经常遇到的问题及解答,以助用户在数据处理和分析工作中提高效率,降低难度。

664 0
|
传感器 机器学习/深度学习 编解码
|

智能驾驶--语义分割 公开数据集 汇总

本文整理了10个质量较好,数据集较大,比较新的,图像语义分割的公开数据集;主要服务于智能驾驶方向(辅助驾驶、自动驾驶等)。

3714 0
|
机器学习/深度学习 存储 算法
|

机器学习面试笔试知识点-决策树、随机森林、梯度提升决策树(GBDT)、XGBoost、LightGBM、CatBoost

机器学习面试笔试知识点-决策树、随机森林、梯度提升决策树(GBDT)、XGBoost、LightGBM、CatBoost

2432 0
|
人工智能 弹性计算 物联网
|

部署Stable Diffusion玩转AI绘画(GPU云服务器)

本实验通过在ECS上从零开始部署Stable Diffusion来进行AI绘画创作,开启AIGC盲盒。

1675 0
来自: 人工智能平台PAI  版块
|
存储 SQL 运维
|

开源大数据OLAP引擎最佳实践

本篇内容分享了开源大数据OLAP引擎最佳实践。 分享人:范振 阿里云高级技术专家

16759 0
来自: 大数据计算 MaxCompute  版块
|
12天前
|
存储 消息中间件 运维
|

淘天集团基于 Fluss、Paimon 与 StarRocks 构建湖流一体数据链路

针对淘天集团秒级分析需求,构建基于Fluss、Paimon与StarRocks的湖流一体架构。Flusss承载秒级实时数据,Paimon沉淀分钟及历史数据,StarRocks通过Union Read统一查询,实现数据自动同步与口径一致。相比传统Kafka+Flink链路,新方案消除实时孤岛,降低80以上消费成本,提升50%开发效率。阿里云EMR Serverless StarRocks通过Native读取等增强,进一步简化运维,实现低成本、高性能的秒级实时OLAP分析。

95 0
|
16天前
|
人工智能 算法 大数据
|

为什么物流公司都在卷“算法”?大数据如何让配送路线越跑越聪明

为什么物流公司都在卷“算法”?大数据如何让配送路线越跑越聪明

116 3
|
19天前
|
数据采集 监控 NoSQL
|

如何设计一套高可用的爬虫任务队列,保证断点续爬与故障转移?

这篇文章提出了一种基于Redis的任务队列解决方案,增强了爬虫任务的稳定性和可靠性。文章分析了Celery的不足,并设计了一个包含任务状态机、断点续爬、故障转移和代理层的架构。通过checkpoint、心跳和租约机制,以及隧道代理模式,有效解决了爬虫任务执行中的稳定性问题。

101 0
|
19天前
|
存储 人工智能 大数据
|

电网也开始“会思考”了?大数据如何预测用电、调度能源,还能算清碳排放

电网也开始“会思考”了?大数据如何预测用电、调度能源,还能算清碳排放

109 2
|
22天前
|
数据采集 网络协议 API
|

单机万级并发:利用Python asyncio与aiohttp打造极致性能的异步爬虫

文章介绍了使用asyncio和aiohttp实现高并发新闻数据采集的方法。它指出了传统多线程的局限性,并强调了异步编程的优势。文章还讨论了环境配置和关键参数设置,并提供了一个实现示例。

132 0
|
22天前
|
人工智能 缓存 搜索推荐
|

面向AI原生搜索时代的GEO架构设计:从内容索引到语义检索系统的全链路优化

GEO(生成式引擎优化)是AI搜索时代的新范式,核心目标从“网页排名”转向“被AI理解、验证与引用”。它以知识片段、实体关系、语义结构和RAG适配为优化单位,助力企业成为大模型可信信源。

156 0
|
22天前
|
存储 人工智能 Apache
|

从向量存储到 Agentic 数据基础设施:Paimon × Milvus 如何构建 AI 原生多模态数据湖

本文整理自李钰在 Apache Flink Forward Asia 2026 的演讲,讨论 AI 与 Agent 进入生产环境后,数据湖与向量数据库“双系统”架构暴露出的结构性问题,以及 Apache Paimon 与 Milvus 围绕同一份湖数据协同的技术路径。

202 1
|
26天前
|
人工智能 搜索推荐 API
|

从 SEO 到 GEO:Schema.org 如何提升企业网站在 LLM 中的可发现性

2026年,用户从搜索转向直接向AI提问,企业竞争已从SEO升级为GEO(生成式引擎优化)。Schema.org结构化数据成为AI理解网页的关键基础设施,助力LLM精准抽取事实、提升RAG召回准确率,并支撑AI Agent自动化交互。它是AI时代的知识图谱基石。

164 0
|
28天前
|
SQL 人工智能 小程序
|

行为数据链路设计:从问题定位到策略回流

本文从行为分析、身份归一、动态人群、策略执行和效果回流出发,讨论数据分析与运营链路如何保持统一口径。

136 3
|
2月前
|
运维 安全 网络协议
|

精选 5 款基于 .NET 开源免费、功能强大的 Windows 系统优化工具

本文精选5款基于.NET开源免费的Windows优化工具:Optimizer(全能系统调优)、SophiApp(Win10/11深度微调)、WinMemoryCleaner(智能内存清理)、ZyperWin++(轻量美观全系适配)和Winhance(一站式环境定制),助你提升性能、保障隐私、简化运维。

337 0
|
2月前
|
数据采集 机器学习/深度学习 运维
|

从“秒封”到“日爬十万”:谈谈5个风控机制

这篇文档讨论了Python爬虫常见问题和反爬策略。作者提出五个关键点:1. 控制请求频率;2. 轮换IP;3. 伪装请求头;4. 模拟真实访问路径;5. 使用高匿名代理。这些策略需综合运用,提高爬虫生存率。

420 5
|
2月前
|
人工智能 运维 安全
|

Skill即服务:用Agent安全玩转云上Flink

Flink Skill是阿里云为AI Agent时代打造的安全运维能力,通过Confirm门控、目标锁定、Read-back验证三层防护,实现自然语言驱动的Flink全生命周期管理。实测可将作业反压从99%修复至0%,全域巡检缩至30秒,并支持多Skill协同搭建实时数仓等复杂场景。

573 2
来自: 实时计算 Flink  版块
|
3月前
|
SQL 人工智能 自然语言处理
|

一条 SQL 生成广告:Hologres 如何实现素材生成到投放分析一体化

广告投放面临“量、准、快”不可兼得的不可能三角:素材产能不足、数据与创意割裂、测试周期远超素材生命周期。阿里云Hologres以“Data + AI = All in One”理念,通过Object Table、AI Function、Dynamic Table等能力,实现素材采集、智能打标、AI生成、投放分析全链路闭环,用SQL驱动一体化智能创意工厂。

441 0
来自: 实时数仓 Hologres  版块
|
4月前
|
算法 安全 测试技术
|

多智能体协同中的任务拆解与动作映射:关键指标对比与算法设计思路

本文聚焦2026年企业级多智能体落地核心瓶颈——任务拆解不准与语义到动作映射断层,提出“分层级树状拆解+分布式角色调度”算法及五维特征驱动的动作映射技术,构建可评估、可复用、强合规的工程化方案,并通过实测数据验证其在跨系统长链路任务中96.2%执行成功率与92.3%异常自修复率。

538 6
|
4月前
|
存储 人工智能 算法
|

工程师高培解读XilinxVivadoFPGA设计进阶与AI自动编程

本文系统梳理Vivado FPGA开发八大核心模块:底层结构、时序收敛、综合策略、IP复用、非项目模式、HLS高级综合、DFX动态重构及AI辅助编程,融合中际赛威实战经验,助力工程师突破技术瓶颈,提升设计效率与可靠性。(239字)

507 0
来自: 人工智能平台PAI  版块
|
5月前
|
数据采集 传感器 人工智能
|

AI质检+MES如何重构智能制造质量闭环

AI质检与MES深-度融合,构建“感知-分析-决策-执行”质量闭环:实现100%全检、自动拦截、一物一档、工艺自优化及缺-陷预-测;通过OPC UA/MQTT/边缘网关打通设备数据,支撑全流程精-准质量追溯。

700 4
|
5月前
|
机器学习/深度学习 人工智能 JSON
|

AI 术语满天飞?90% 的人只懂名词,不懂为什么!

本文不堆砌概念,只讲前因后果:从大模型底层逻辑,到 Context、RAG、Function Calling、MCP、Skills 的核心关联,拆解所有面试高频考点,让你告别 “名词解释”,吃透原理,面试直接碾压面试官!

1676 7
|
6月前
|
安全 Java 网络安全
|

哪些政策要求企业开展漏洞扫描?

在网络安全法等法规要求下,企业须定期开展漏洞扫描。具备CNAS/CMA/CCRC资质的第三方机构,依据GB/T 30279、34943等标准,通过专业工具对网络、系统、应用及容器镜像等进行全面扫描,出具权威《漏洞扫描报告》,助力企业合规整改、筑牢安全防线。(239字)

678 2
|
6月前
|
消息中间件 人工智能 NoSQL
|

函数计算异步任务在高并发Agent场景下的幂等性与去重实践(附真实踩坑案例)

本文分享大厂AI应用在函数计算(FC)高并发场景下,应对异步任务重复执行的**四层幂等去重实战方案**:从全链路requestId透传、Redis+Lua轻量锁(拦截85%+重复)、Handler内指纹校验,到DB唯一索引兜底。附可落地代码与真实数据——重复率由11.7%降至0.08%,LLM调用与FC账单显著下降。

461 0
|
7月前
|
存储 人工智能 关系型数据库
|

传统数据库与向量数据库:一个管“是什么”,一个管“像什么”

向量数据库是AI时代的语义检索引擎,将文本、图片等非结构化数据转化为“语义向量”,支持基于相似性的毫秒级搜索。它不替代MySQL等传统数据库,而是作为大模型的“海马体”,赋能RAG、智能问答与多模态应用,实现从“关键词匹配”到“理解含义”的跃迁。(239字)

1112 7
|
7月前
|
数据采集 人工智能 机器人
|

2026年 智能体来了!什么是 AI 智能体工程化?为什么金加德强调 Workflow + Code 才能真正落地?

AI智能体工程化是将AI从聊天工具升级为“数字员工”,通过流程编排(Workflow)、代码逻辑(Code)与知识增强(RAG),让其稳定执行重复性业务流程,实现可复用、可落地的自动化生产。

809 7
来自: 人工智能平台PAI  版块
|
7月前
|
安全 网络安全 数据安全/隐私保护
|

用好代理 IP:加密付费拒绝免费陷阱

代理IP兼具隐私保护与安全风险,合规使用可防追踪、保障跨境业务,但非正规服务易致信息泄露、账号风控,甚至被用于违法活动。用户应选择加密付费代理,避开免费陷阱,遵守法规,强化安全防护,让技术真正服务于合法需求。

537 4
|
7月前
|
存储 人工智能 并行计算
|

别再搞混了!一文看懂“显存”与“内存”:从办公桌到实验室的硬核分工

本文以生动比喻与硬核解析,深入浅出地讲清内存(RAM)与显存(VRAM)的本质区别:内存是CPU的通用工作台,显存是GPU的专用高速实验室。二者分工明确,数据需通过PCIe传输,无法互相替代。尤其在AI训练中,显存容量与带宽直接决定模型能否运行。文章结合代码实例、性能对比表及排错指南,帮助开发者理解“CUDA out of memory”等常见问题,并提供优化策略与云平台建议,是迈向高效AI开发的必读指南。

4278 0
|
7月前
|
消息中间件 监控 算法
|

数据不守规矩怎么办?——聊聊乱序事件的处理策略与实战要点

数据不守规矩怎么办?——聊聊乱序事件的处理策略与实战要点

444 11
|
8月前
|
数据库
|

什么是 Code 39?

Code 39是1974年由Intermec开发的字母数字条形码,支持43个字符,广泛用于汽车、医疗、国防等领域。分Regular和Full ASCII两种,后者可编码全部128个ASCII字符。结构简单,自校验强,但密度较低。可通过HCreateLabelView轻松生成,适用于非零售场景。

1025 2
|
8月前
|
数据采集 领域建模 数据库
|

领域模型图(数据架构/ER图)

通过四色原型法进行领域建模,提取数据架构核心要素:红色时标原型(MI)表征业务流程节点,绿色参与方-物品原型(PPT)作为实体,黄色角色原型(Role)体现参与关系,蓝色描述原型(DESC)定义属性。基于风控系统实例,从业务流程提炼出MI骨架,逐步补充PPT实体与Role角色,最后添加DESC描述信息,进而映射为ER图。其中PPT对应实体,MI对应关系,结合一对一、一对多、多对多约束,构建清晰的数据模型,支撑系统设计与数据库实现。(239字)

444 0
|
8月前
|
XML JSON Java
|

JSONUtil

本文介绍了Java中常用的数据结构与JSON之间的相互转换方法,涵盖一维、二维数组、List、Map、XML等转JSON或Object的操作,使用Hutool、FastJSON和net.sf.json等工具类实现,适用于常见数据处理场景。

384 0
|
8月前
|
存储 安全 小程序
|

认识OAuth2.0

OAuth2.0是一种开放授权标准,允许第三方应用在用户授权下安全访问资源,无需获取用户账号密码。它通过令牌(token)机制实现权限控制,支持授权码、简化、密码和客户端四种模式,广泛用于第三方登录与服务间资源共享。

364 0
|
9月前
|
数据采集 运维 DataWorks
|

【赵渝强老师】阿里云大数据集成开发平台DataWorks

DataWorks是阿里云一站式大数据开发治理平台,支持数据集成、开发、建模、分析、质量监控、服务化及迁移等全链路功能,兼容多种计算引擎,助力企业高效构建数据中台,实现数据资产化与价值挖掘。

783 6
|
9月前
|
缓存 关系型数据库 MySQL
|

网站源码二次开发基础:环境搭建与简单修改步骤

本文围绕 PageAdmin(PA)开源 CMS 展开,聚焦新手二次开发核心:先明确 PHP、MySQL 等环境需求,以 PHPStudy 为例详解安装配置、源码部署、数据库创建及系统安装步骤;再阐述后台登录、基础信息修改、栏目与内容管理、简单模板调整及缓存清理等实操流程,为新手提供清晰易懂的入门指南。

1306 11
来自: 人工智能平台PAI  版块
|
9月前
|
弹性计算 关系型数据库 网络安全
|

新手零代码建站指南:3步搭建适配阿里云的企业官网

本文介绍新手用 PageAdmin CMS 搭建企业官网的核心流程:先准备阿里云资源(域名注册备案、2 核 4G 入门级 ECS、LNMP/LAMP 环境)及下载该 CMS;再分 3 步搭建(部署程序到 ECS、配置数据库完成安装、选模板填内容 + 域名解析与 SSL 配置);上线后需做数据备份、安全优化与性能监控。

929 0
来自: 人工智能平台PAI  版块
|
9月前
|
JSON 数据挖掘 API
|

闲鱼商品列表API秘籍!轻松获取列表数据

闲鱼商品列表API(Goodfish.item_list)基于RESTful架构,支持GET请求,返回JSON格式数据,可获取商品标题、价格、图片、卖家信息等,适用于电商比价与数据分析,助力开发者高效集成闲鱼商品数据。

569 1
|
9月前
|
存储 NoSQL Go
|

英伟达谷歌都在用的(开源特征存储平台Feast)-架构学习指南

欢迎来到Feast的世界!这是一个开源的生产级机器学习特征存储系统,专为解决特征数据高效管理与服务而设计。本指南将带你从零掌握其架构、核心概念与实战技巧,助你像架构师一样思考,像工匠一样编码,轻松应对训练与推理的一致性挑战。

1622 2
|
9月前
|
人工智能 测试技术 Python
|

AI也有“智商”吗?我们到底该用什么标准来评估它?

AI也有“智商”吗?我们到底该用什么标准来评估它?

1322 8
|
10月前
|
机器学习/深度学习 数据采集 人工智能
|

别怪推荐系统不懂你,可能是你的数据“太模糊”了

别怪推荐系统不懂你,可能是你的数据“太模糊”了

475 9

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70024
内容
128
活动
440138
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务