|
6月前
|
数据采集 Kubernetes Docker
|

采集架构的三次升级:脚本、Docker 与 Kubernetes

本文通过一个网站商品列表页采集任务,展示了爬虫架构从Python脚本到Docker化,再到Kubernetes Job化的三次演进。Kubernetes在处理大规模、高成本、高稳定性需求的爬虫任务时变得必要,帮助自动管理任务生命周期和资源,避免系统失控。

181 1
|
6月前
|
XML JSON 算法
|

淘宝商品详情API接口指南

淘宝商品详情API(taobao.item.get)可获取商品标题、价格、图片、库存、销量等核心信息。支持POST/GET请求,返回JSON格式数据。需提供app_key、timestamp、sign等参数,常见响应码包括200(成功)、401(权限不足)、403(签名错误)等,适用于电商数据对接与分析。

768 0
|
7月前
|
SQL 关系型数据库 MySQL
|

MySQL 学习资源精选:从入门到优化的高效清单

本文精选MySQL学习资源,按“入门→进阶→实战”三阶段系统梳理视频、书籍、项目等优质资料,结合科学计划与实操建议,帮助学习者高效掌握核心语法、底层原理与性能优化,快速实现从零基础到能独立设计与优化数据库的跃迁。

1239 0
|
7月前
|
SQL 分布式计算 算法
|

别再一把梭哈了:聊聊文件格式里的压缩取舍——Snappy 和 Zstd 到底怎么选?

别再一把梭哈了:聊聊文件格式里的压缩取舍——Snappy 和 Zstd 到底怎么选?

746 4
|
7月前
|
运维 安全 API
|

当安全事件不再“靠人吼”:一文带你搞懂 SOAR 自动化响应实战

当安全事件不再“靠人吼”:一文带你搞懂 SOAR 自动化响应实战

770 10
|
8月前
|
缓存 JSON 搜索推荐
|

拼多多商品详情API接口指南

拼多多商品详情API是开放平台提供的商品数据查询接口,支持获取商品信息、价格、库存、销量、评价及促销等关键数据,返回结构化JSON格式。适用于电商数据分析、价格监测、竞品分析与个性化推荐场景,配合缓存、批量请求与签名优化策略,提升调用效率与系统稳定性。(238字)

1051 1
|
8月前
|
人工智能 JSON 文字识别
|

发票验真API:基于权威数据源与阿里云平台的发票验真代码解析

发票验真迈向智能化新阶段,融合OCR识别与权威查验平台,实现全票种自动化验真。一站式接口高效、安全、可溯,支持批量处理与高并发调用,显著提升效率、降低合规风险,助力企业构建智能财税风控体系。(238字)

1017 0
|
8月前
|
人工智能 自然语言处理 搜索推荐
|

阿里云 AI 搜索 DeepSearch 技术实践

阿里云OpenSearch LLM版推出DeepSearch技术,实现从RAG 1.0到RAG 2.0的升级。基于多智能体协同架构,支持复杂推理、多源检索与深度搜索,显著提升问答准确率,助力企业智能化升级。

1838 23
|
8月前
|
自然语言处理 JavaScript Java
|

TKM帮您管理编程开发过程中多语言、多版本的切换烦恼

TakMll(特客猫)是一款多语言环境管理工具,支持PHP、Java、Python等多版本快速切换。通过“tkm”命令实现环境添加、查询、切换与删除,简化开发环境配置流程,提升效率。官网:[https://tkm.youqiong.net/](https://tkm.youqiong.net/)

1074 15
|
8月前
|
存储 缓存 Cloud Native
|

EMR StarRocks Stella 内核正式发布,登顶 TPC 榜单全球第一

EMR Serverless StarRocks 重磅发布全新企业级版本内核 Stella (StarRocks Efficient and Lightening-fast Lakehouse),完全兼容开源 StarRocks,为用户提供企业级的产品功能、卓越的性能及稳定性保障。

723 1
|
8月前
|
人工智能 自然语言处理 机器人
|

中小企业也能玩转大模型:把AI搬到自己机房里不是梦

中小企业也能玩转大模型:把AI搬到自己机房里不是梦

1833 3
|
9月前
|
机器学习/深度学习 数据采集 人工智能
|

【机器学习算法篇】K-近邻算法

K近邻(KNN)是一种基于“物以类聚”思想的监督学习算法,通过计算样本间距离,选取最近K个邻居投票决定类别。支持多种距离度量,如欧式、曼哈顿、余弦相似度等,适用于分类与回归任务。结合Scikit-learn可高效实现,需合理选择K值并进行数据预处理,常用于鸢尾花分类等经典案例。(238字)

2313 7
|
9月前
|
人工智能 算法 大数据
|

别让“热搜”骗了你:大数据如何让新闻更真实?

别让“热搜”骗了你:大数据如何让新闻更真实?

660 17
|
9月前
|
数据采集 存储 供应链
|

第三方电商数据 API 数据来源深度解析:合规与稳定背后的核心逻辑

本文揭秘第三方电商数据API的底层逻辑:通过官方授权、生态共享与合规采集三重来源,结合严格清洗校验,确保数据稳定、合规、高质。企业选型应关注来源合法性与场景匹配度,避开数据陷阱,实现真正数据驱动增长

813 4
|
10月前
|
存储 人工智能 数据可视化
|

从零构建能自我优化的AI Agent:Reflection和Reflexion机制对比详解与实现

AI能否从错误中学习?Reflection与Reflexion Agent通过生成-反思-改进循环,实现自我优化。前者侧重内容精炼,后者结合外部研究提升准确性,二者分别适用于创意优化与知识密集型任务。

2048 9
|
10月前
|
机器学习/深度学习 负载均衡 网络架构
|

Mixture of Experts架构的简要解析

Mixture of Experts(MoE)架构起源于1991年,其核心思想是通过多个专门化的“专家”网络处理输入的不同部分,并由门控网络动态组合输出。这种架构实现了稀疏激活,仅激活部分专家,从而在模型规模与计算成本之间取得平衡。MoE的关键在于门控机制的设计,如线性门控、噪声Top-K门控等,确保模型能根据输入特征自适应选择专家。

1657 8
|
11月前
|
人工智能 分布式计算 自然语言处理
|

多智能体系统设计:5种编排模式解决复杂AI任务

本文探讨了多AI智能体协作中的关键问题——编排。文章指出,随着系统从单体模型向多智能体架构演进,如何设计智能体之间的通信协议、工作流程和决策机制,成为实现高效协作的核心。文章详细分析了五种主流的智能体编排模式:顺序编排、MapReduce、共识模式、分层编排和制作者-检查者模式,并分别介绍了它们的应用场景、优势与挑战。最后指出,尽管大模型如GPT-5提升了单体能力,但在复杂任务中,合理的智能体编排仍不可或缺。选择适合的编排方式,有助于在系统复杂度与实际效果之间取得平衡。

2242 10
|
12月前
|
存储 SQL 测试技术
|

抖音集团基于Paimon的流式数据湖应用实践

本文整理自抖音集团数据工程师在Flink Forward Asia 2024的分享,围绕流式湖仓架构的背景、实践与未来展望展开。内容涵盖实时数仓架构演进、Paimon的应用与优化,以及在长周期指标计算和大流量场景下的落地实践经验。

1028 0
来自: 实时计算 Flink  版块
|
12天前
|
人工智能 搜索推荐 API
|

从 SEO 到 GEO:Schema.org 如何提升企业网站在 LLM 中的可发现性

2026年,用户从搜索转向直接向AI提问,企业竞争已从SEO升级为GEO(生成式引擎优化)。Schema.org结构化数据成为AI理解网页的关键基础设施,助力LLM精准抽取事实、提升RAG召回准确率,并支撑AI Agent自动化交互。它是AI时代的知识图谱基石。

115 0
|
26天前
|
人工智能 UED
|

2026年企业做GEO,为什么真实性比发稿数量更重要

2026年GEO已非简单“多发文”,而是以真实、可溯、一致、适配、可纠错为根基的品牌认知资产建设。央视3·15曝光“AI数据投毒”警示:虚假内容终致信任崩塌。合规GEO,始于信息准确,成于长期治理。

161 1
|
1月前
|
BI 双11
|

全棉时代 x Quick BI:助力全棉时代高价值会员精益运营,实现双十一到店转化率提效150%+

全棉时代借助阿里云瓴羊数据智能,实现会员精细化运营:双十一到店转化率提升150%+,母婴与家清品类交叉渗透率增50%+。Quick BI支持对话式分析,助品牌从“流量”转向“留量”经营。

152 3
|
1月前
|
数据采集 运维 分布式计算
|

数据治理做了3年,老板却说“没效果”?聊聊数据治理KPI到底该怎么定

数据治理做了3年,老板却说“没效果”?聊聊数据治理KPI到底该怎么定

140 3
|
1月前
|
机器学习/深度学习 PyTorch 算法框架/工具
|

PyTorch深度学习实战 |常见层 layer结构的实现和代码实战

本文介绍了PyTorch中常见的7种神经网络层结构及其输入输出逻辑。通过代码示例演示了全连接层(nn.Linear)、卷积层(nn.Conv2d)、LSTM层、GCN图卷积层和Transformer层的使用方法,重点讲解了各层的输入输出维度变换规则。文章以一张海绵宝宝图片为例,详细展示了图像数据的预处理流程,包括使用PIL和OpenCV两种方法读取图片并转换为PyTorch张量的过程。通过"代码+实战"的方式帮助读者理解神经网络层如何对特征进行维度变换,最终实现从原始输入到目标输出的映射

211 0
|
1月前
|
机器学习/深度学习 人工智能 算法
|

人工智能|大白话DETR 模型

DETR(检测变换器)是首个端到端目标检测模型,摒弃锚框与NMS后处理。它以CNN提取特征,经Transformer编码器-解码器处理,配合100个可学习目标查询(OQ),通过二分图匹配实现预测框与真实框的一对一最优分配,直接输出类别与坐标。(239字)

296 3
|
2月前
|
JSON Java fastjson
|

java工具:《jsonObject转map》

java工具:《jsonObject转map》

256 0
|
3月前
|
机器学习/深度学习 数据采集 人工智能
|

跨越鸿沟:传统产品经理如何迈向AI产品经理的黄金赛道

跨越鸿沟:传统产品经理如何迈向AI产品经理的黄金赛道

578 9
|
3月前
|
人工智能 运维 监控
|

OpenClaw爆火背后,企业级智能体为何更需要“私有化部署替代方案”?

OpenClaw(“小龙虾”)引爆AI智能体热潮,但企业落地面临安全、规模化与成本三大困局。OpenOcta应运而生——专为企业打造的私有化智能体平台,具备默认安全、集中管控、成本可控及深度集成能力,已覆盖金融、政务、制造等十余行业,助力企业安全高效迈入智能体时代。(239字)

494 4
|
3月前
|
编解码 人工智能 测试技术
|

Anthropic最强王炸!Claude Opus 4.7来了:编程能力暴涨13%(附如何使用到Opus 4.7)

Anthropic发布Claude Opus 4.7:视觉能力跃升——图像分辨率提升3倍,支持2576像素长边,高精度解析截图、PDF、手写笔记;编码能力稳步增强(SWE-bench达87.6%);新增/ultrareview代码审查命令、xhigh推理档位及安全防护机制;价格不变,仍为$5/$25每百万token。

1692 1
|
3月前
|
人工智能 分布式计算 DataWorks
|

阿里云大数据 AI 产品月刊-2026年3月

阿里云大数据& AI 产品技术月刊【2026 年 3 月】,涵盖 3 月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据& AI 方面最新动态。

466 1
|
3月前
|
存储 人工智能 JSON
|

AI 成为主流负载后,数据基础设施将如何演进?|Apache Doris 2026 Roadmap

Scale Intelligence, Accelerate Insight,不仅是年度主题,也定义了 Doris 在 AI 时代的演进方向。

373 0
|
3月前
|
算法 调度 数据库
|

演化计算与抽样方法构造新算法流程:从 AlphaEvolve 看 LLM × EA 融合范式

本文系统解析AlphaEvolve——Google DeepMind提出的LLM×EA融合新范式:以语义引导的抽样机制、双模型协同进化(Gemini Flash+Pro)、自动评估闭环,实现算法的自主发现与优化,已突破矩阵乘法纪录并提升训练效率。(239字)

458 15
|
4月前
|
机器学习/深度学习 人工智能 自然语言处理
|

Transformer 时代的语言模型:大规模语言模型的发展脉络与技术演化

本文系统梳理大语言模型技术演进脉络:从Transformer与Attention机制奠基,到BERT/GPT的范式分野;从提示工程、RLHF对齐优化,到LLaMA开源引爆生态;再到LoRA微调、FlashAttention加速、RAG增强、MCP协议互联、Skills技能封装,直至Openclaw桌面级GUI智能体。覆盖模型架构、训练优化、推理加速、应用落地全链条。

1012 2
|
4月前
|
数据采集 JSON 供应链
|

1688商品详情数据一键获取,item_get API接口讲解

本文分享1688商品详情API(offerDetail.get)实战经验:摒弃爬虫,依托官方接口实现合规、稳定、高效的数据采集。涵盖接入流程、关键参数、返回字段解析及避坑要点,助力企业快速落地电商供应链数据建设。(239字)

825 2
|
4月前
|
Java
|

java工具:Long转String(时间毫秒数转日期格式字符串)

java工具:Long转String(时间毫秒数转日期格式字符串)

344 2
|
5月前
|
机器学习/深度学习 缓存 监控
|

基于API的印度股市数据对接指南

本文为开发者提供印度股市(NSE/BSE)API对接完整指南,涵盖环境配置、实时行情、历史K线、基本面数据获取,支持HTTP/WS双协议,内置重试、缓存、时区处理与技术分析功能,助力快速构建量化工具与行情应用。(239字)

468 3
|
5月前
|
机器学习/深度学习 人工智能 物联网
|

烧显卡不烧钱:学生党个人开发者GPU选购指南,看完不再被割韭菜

本文为学生与个人开发者量身打造大模型微调硬件选购指南:解析LoRA/QLoRA等高效微调技术如何大幅降低显存需求,对比RTX 3060/3090/4090等显卡的显存、带宽、算力与性价比,提供2000–8000元梯度配置方案,并分享混合精度、梯度累积等显存优化技巧及云资源省钱策略。

827 5
|
5月前
|
SQL 人工智能 自然语言处理
|

步向“数字一局”,中交一公局“语义 + AI”双引擎驱动经营管理智能化转型

不仅在技术上实现了“Data + AI”的深度融合,更构建起以数据驱动、以智能辅助决策的新型经营管理模式

325 3
|
5月前
|
人工智能 编解码 监控
|

告别“爆显存”:LoRA技术如何用1%的参数,解锁大模型微调自由?

本文深入浅出解析LoRA(低秩自适应)技术:它通过冻结大模型主干、仅训练两个小矩阵(B·A),实现显存节省99%+、性能保留95%+,让RTX 4090等消费卡也能高效微调大模型。含原理、QLoRA量化、六步实操与效果评估,助你零基础打造法律/医疗等垂直领域专属AI。(239字)

919 5
|
5月前
|
人工智能 定位技术 SEO
|

GEO ROI衡量的完整逻辑链:从心智到商业价值的系统化方法

本文提出GEO(生成式引擎优化)ROI衡量新范式:摒弃传统SEO的排名点击逻辑,转向“被AI引用与信任”的心智份额评估。构建“定义有效→设定基准→全链路指标→ROI计算→决策迭代”五步逻辑链,强调答案引用率、权威信源占比、高质量转化率等核心指标,实现影响力到商业价值的科学转化。

445 2
|
5月前
|
监控 安全 网络安全
|

8080 和 3128 端口的核心区别及使用场景

HTTP代理常用端口8080与3128各有侧重:8080多用于管理监控(如Web配置界面),易记但可能被防火墙拦截;3128为标准端口,稳定性高,主供客户端正常请求转发。端口可自定义,需据安全与性能需求合理选用。

554 9
|
6月前
|
人工智能 JSON 物联网
|

大模型微调完全指南:原理、实践与平台选择,让AI真正为你所用

微调是让通用大模型成为垂直领域“专家”的关键路径:通过小规模、高质量数据定向优化模型参数,实现专业适配。相比提示词工程的临时性,微调能内化知识、提升准确性与风格一致性。LoRA等高效微调技术大幅降低门槛,百条数据+单卡即可完成,兼顾效果与成本。(239字)

743 6
|
6月前
|
存储 人工智能 分布式计算
|

阿里云 OpenLake:AI 时代的全模态、多引擎、一体化解决方案深度解析

阿里云徐晟详解OpenLake:构建全模态、多引擎、一体化智能数据体系,融合大数据与AI,支持湖仓一体、Agentic Data及AI搜索,助力企业降本增效、加速AI落地。(239字)

941 2
|
6月前
|
存储 数据采集 人工智能
|

大模型微调显存计算:从原理到实践的精准把控

本文深入解析大模型微调中的显存占用问题,揭示8GB显存为何能跑7B模型的真相。从显存四大组成部分入手,结合量化、LoRA、AdamW8bit等优化策略,手把手教你精准计算与压缩显存,让低配显卡也能高效微调大模型,助力AI实践入门。

1015 3
|
6月前
|
存储 机器学习/深度学习 人工智能
|

构建AI智能体:八十一、SVD模型压缩的艺术:如何科学选择K值实现最佳性能

本文探讨了SVD(奇异值分解)在深度学习模型压缩中的应用。随着模型规模不断扩大,面临的存储、计算和能耗问题日益突出。SVD通过将大型矩阵分解为三个特殊矩阵(U、Σ、Vᵀ),并根据奇异值大小进行截断,实现模型的高效压缩。文章详细分析了SVD的数学原理、压缩机制和参数选择策略,重点讨论了如何通过能量保留、目标压缩率和拐点检测等方法确定最佳截断秩k。以一个500×300的用户-物品矩阵为例,实证显示k=32时能实现82.93%的压缩率,99.97%的能量保留和5.86倍计算加速,达到了精度损失与压缩收益的最佳平衡

507 5
|
7月前
|
消息中间件 SQL API
|

今日练习

本课程作业旨在掌握Docker部署RabbitMQ、消息队列在医嘱系统中的应用,以及对接第三方短信API。通过实战完成消息发送与消费,并接入真实短信服务,提升中间件与外部接口集成能力。(238字)

761 1
|
7月前
|
SQL 大数据 数据挖掘
|

十、HQL:排序、联合与 CTE 高级查询

Hive 查询不仅能查,还能查得漂亮、高效。我们这次聚焦 HQL 中的高级技巧——从 ORDER BY 到 SORT BY、DISTRIBUTE BY 与 CLUSTER BY,带你理解排序在分布式环境中的执行逻辑;再深入讲解 UNION 与 CTE 等查询组织方式,帮你将复杂 SQL 拆解得更清晰。我还特意写了丰富示例与实战练习,适合正在提升 Hive 查询能力的你阅读、收藏和练习。

484 6
|
8月前
|
人工智能 自然语言处理 人机交互
|

《智能语》:十进制驱动的多模态人工语言系统构建与协同机制研究

《智能语》是全球首个融合十进制逻辑、多模态表达与东方哲学的人工语言系统,实现文字、语音、词汇、语法全链条协同。通过笔画-音素-数字三重绑定,构建“形音义理”统一的创新架构,具备语义精准、无限扩展、跨文化普适等优势,为语言学习、人机交互与文化传播提供全新范式。(238字)

452 4
|
8月前
|
数据采集 机器学习/深度学习 人工智能
|

AI 十大论文精讲(二):GPT-3 论文全景解析——大模型 + 提示词如何解锁 “举一反三” 能力?

摘要 2020年发表的《Language Models are Few-Shot Learners》(GPT-3论文)开创了AI新时代。该论文突破性地证明:当Transformer模型参数规模扩大到1750亿时,仅通过文本交互即可实现任务无关的少样本学习。GPT-3采用"预训练+提示词"的新范式,无需微调就能在翻译、问答等40+任务上展现强大性能。论文系统验证了模型在语言建模、闭卷问答等9类任务中的表现,其中在LAMBADA长文本任务上准确率达86.4%,较此前最优提升18.4%。这一研

1301 152

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
69911
内容
128
活动
440102
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务