|
3月前
|
数据采集 JavaScript 前端开发
|

技术拆解:单页面应用(SPA)路由跳转后的数据抓取策略

这篇文档讨论了单页应用(SPA)数据抓取的挑战和策略。SPA与传统服务端渲染不同,数据由JS生成,导致传统爬虫失效。难点包括路由切换时机、动态接口定位、鉴权、反爬等。解决方案包括直接复现接口和浏览器自动化渲染。核心是保持会话和IP一致性。文档提供了技术解决方案和代码示例。

306 1
|
3月前
|
存储 人工智能 NoSQL
|

基于GB/T 42131的艾索四标融合GEO方法论知识图谱技术实现

本文面向阿里云开发者,深度解读GB/T 42131国家标准与RAG架构融合的GEO(生成式引擎优化)工程化实践,详解知识图谱建模、四级信源分级、图+向量双引擎存储等关键技术,提供可复用、可验收的标准化落地方案。(239字)

364 1
来自: 智能搜索推荐  版块
|
3月前
|
人工智能 数据可视化 数据挖掘
|

连续7年!阿里云凭借Quick BI成为中国唯一上榜Gartner® ABI魔力象限的BI厂商

阿里云Quick BI第七次入选Gartner分析与BI魔力象限挑战者象限,是中国唯一连续七年上榜的BI厂商。作为AI-native智能分析平台,它集多源接入、归因分析、生态协同、按需计费于一体,已服务万家客户,覆盖全球8大区域。(239字)

373 1
|
3月前
|
人工智能 运维 BI
|

如何通过API获取全国招标公告和中标公告数据

对很多软件公司、企业信息化团队和数据应用开发者来说,招投标数据一直是一个高价值但比较难处理的数据源。招标公告、中标公告、政府采购公告、工程项目公示分布在不同网站和平台上,页面结构不统一,发布时间不一致,字段也不标准。如果只靠人工检索和复制,很难支撑系统化应用;如果自行采集和清洗,又会持续消耗技术和运维成本。

548 0
|
4月前
|
人工智能 自然语言处理 监控
|

ZOLOZ x Quick BI:全球化AI × BI方案,强化跨境交易风险实时管控

ZOLOZ携手瓴羊Quick BI,构建全球化AI×BI风控分析体系:支持25国合规部署、多语言及时区适配;数据分析成本降低超80%,日活用户超500+,服务全球1000+企业客户,实现跨境身份验证与风险管理的实时洞察与高效协同。

201 0
|
4月前
|
存储 缓存 NoSQL
|

前台多币种汇率定时同步架构:跨境独立站外币定价底层实现方案

本文详解Taocarts多币种汇率架构:基于Laravel实现分级定时同步(主流币种每小时/小众币种每4小时)、Redis分布式锁与缓存、Fixer.io接口集成、bcmath高精度计算、多层兜底(缓存→DB→静态保底)及前台无感切换。覆盖代购系统核心痛点,助力跨境独立站稳健定价。

423 1
|
4月前
|
机器学习/深度学习 存储 人工智能
|

图解人工智能的数学基础(线性代数)

本文系统讲解线性代数核心概念,涵盖向量(定义、几何/坐标表示、内积)、矩阵(含义、运算、秩、逆、相似、分解)、行列式(几何意义与变换关系)、线性方程组、特征值与特征向量、二次型、向量空间及范数等,强调其在AI与神经网络中的实际应用。

522 7
|
4月前
|
存储 搜索推荐 大数据
|

优路教育借助阿里云Flink+StarRocks+Paimon湖仓一体化构建职业教育业务全链路实时数据服务平台

优路教育大数据团队携手阿里云,基于实时计算 Flink + EMR Serverless StarRocks + DLF(Paimon) 构建了全链路实时数据服务平台,从学员画像、营销筛选到题库关联查询,实现了从“分钟级延迟”到“秒级响应”的质变,为成人教育行业的数据化转型提供了标杆实践。

801 5
|
4月前
|
机器学习/深度学习 自然语言处理 PyTorch
|

PyTorch深度学习实战 |手动计算 Transformer和完整的代码实现

本文介绍了基于PyTorch实现Transformer模型的完整过程。主要内容包括:1)Transformer架构的核心组件实现,如多头注意力机制、位置前馈网络、位置编码等;2)模型构建步骤,包括词嵌入层、编码器/解码器块和输出层的实现;3)完整的训练流程,包含数据处理、损失计算和参数优化;4)评估方法验证模型性能。文章通过代码示例详细展示了如何从零开始构建Transformer,并应用于机器翻译任务,同时对模型各层的输入输出维度进行了说明。该实现可作为深度学习实践者学习Transformer架构的实用指南

325 0
|
4月前
|
人工智能 自然语言处理 安全
|

企业级AI推理服务选型:为什么SOC2正在成为新门槛

开源大模型推理成本骤降,企业加速落地智能客服、代码辅助等场景。但规模化后,数据安全、结果可追溯、合规审计、跨境隐私、服务SLA等“信任问题”成为新瓶颈。SOC2正成AI基础设施选型硬指标——它验证服务商在安全、可用、完整、保密、隐私五大维度的可靠能力。高性能与高安全可兼得。

304 1
|
5月前
|
消息中间件 编解码 JSON
|

如何同时使用多个Logstash进行不同的日志传输

项目需新增Logstash处理Spring Boot日志,但与现有实例共用默认data目录导致启动失败。错误提示“another instance using the configured data directory”。解决方法:为新实例指定独立data路径,支持命令行`--path.data`、配置文件或环境变量三种方式,确保目录存在且有写权限。

441 0
|
5月前
|
SQL 人工智能 安全
|

从 BI Copilot 到业务 Agent:指标服务如何成为统一数据接口?

一个能够提供标准化、语义化、服务化数据接口的指标层,正成为数据智能新阶段的战略基础设施。

391 3
|
5月前
|
Web App开发 人工智能 自然语言处理
|

2026 爆火 OpenClaw 小龙虾 AI 部署教程|Win10/11 一键搭建本地 AI 数字员工,零代码零基础即用

OpenClaw(“小龙虾”)是2026年爆火的开源本地AI智能体,GitHub星标超28万。本教程专为小白设计,Win10/11一键部署,零代码、全图形化操作,10分钟即可启用AI数字员工,自动完成文件整理、Excel生成、浏览器操作等办公任务,数据全程本地运行,隐私安全无忧。(239字)

1134 1
|
6月前
|
数据采集 JavaScript 前端开发
|

告别空壳HTML!Node.js + Playwright + 代理IP 优雅抓取动态网页实战

本文详解Node.js+Playwright抓取动态网页的实战方案:针对React/Vue等框架渲染的SPA页面,结合代理IP(支持动态/固定转发模式)突破采集限制,并提供BrowserContext级代理配置、IP有效性验证、健壮重试机制及常见报错(407/429/403)应对策略,助你构建高可用工业级爬虫。

759 0
|
6月前
|
SQL 机器学习/深度学习 人工智能
|

数据智能行业投融资趋势出现了哪些新变化,为什么语义层技术更受关注?

截至2026年4月初,数据智能行业投融资出现了一个很明确的新变化:资本关注点正从“通用大模型能力展示”转向“能否进入企业真实数据生产链路”,其中语义层、本体语义层、指标治理与跨系统问数能力因此明显升温。更具体地看,当前市场大致可分为预置SQL/问答对路线、Text2SQL+宽表路线、指标平台路线,以及语义层/本体语义层路线

360 0
|
6月前
|
机器学习/深度学习 分布式计算 搜索推荐
|

PAI-Rec 召回引擎:构建高性能推荐系统的核心引擎

PAI-Rec是阿里云智能推荐平台的核心召回引擎,经阿里大规模场景验证。支持多路召回融合(U2I/I2I/向量/随机)、召回即过滤、毫秒级实时更新与分布式弹性架构,开箱即用,助力企业构建毫秒级、高精度、强实时的推荐系统。

605 9
来自: 智能搜索推荐  版块
|
7月前
|
机器学习/深度学习 编解码 JSON
|

从踩坑到高效落地:淘宝拍立淘图片搜索API的实操心得

淘宝拍立淘API提供高精度以图搜品服务,支持Base64/URL传图,基于MobileNet/ResNet提取200+图像特征,毫秒级匹配相似商品。关键需控主体占比≥70%、签名严格ASCII排序、阈值设0.8,单次返回50条结构化结果。(239字)

936 3
|
8月前
|
安全 C++
|

关系记忆不是越完整越好:chunk size 的隐性代价

本文揭示关系型RAG(如祝福/道歉生成)中一个反直觉真相:关系信息并非越完整越好。大chunk会将“可引用的触发点”异化为“需总结的材料”,诱使模型转向安全、抽象、概括性表达,丧失走心感。核心原则是——切分重在“可被直接引用”,而非“逻辑完整”。

1009 11
|
8月前
|
数据库 C++
|

相似度搜索 ≠ 语义理解:向量数据库的能力边界

本文直击RAG系统常见误区:向量数据库只解决“相似性检索”,不等于“语义理解”。它能高效召回“看起来相关”的内容,但无法判断概念等价、逻辑冲突、条件限制或信息可用性。混淆二者是多数故障根源。正确认知其边界,方能工程化落地。

502 3
|
8月前
|
人工智能 自然语言处理 运维
|

GEO推广服务深度解读:AI搜索时代的企业流量新范式

生成式AI重塑搜索生态,“关键词搜索”正被“自然语言提问+AI生成答案”取代。GEO(生成式引擎优化)应运而生——它不追求页面排名,而致力于让企业内容成为AI回答中的权威引用源。本文系统解析GEO的技术原理、核心价值、落地路径与未来趋势,助力企业抢占AI搜索时代增长先机。(239字)

1678 1
|
8月前
|
搜索推荐 数据挖掘 UED
|

必应SEO优化方法:提升网站在必应搜索引擎排名的实用策略

必应(Bing)为全球第二大搜索引擎,做好其SEO优化可显著提升网站曝光、获取精准流量。本文系统梳理五大核心策略:关键词研究(善用Bing工具、聚焦长尾词)、网站结构、内容质量、技术优化(速度/移动端/HTTPS)及高质量外链建设,并提供进阶建议。(239字)

836 1
|
8月前
|
存储 SQL 运维
|

存量数仓宽表治理:基于 NoETL 语义编织实现指标统一管理

在企业已有的 DWD 明细数据层之上,构建一个统一的语义层,将业务逻辑的定义与物理存储和计算执行彻底解耦。

350 2
|
9月前
|
数据采集 人工智能 安全
|

2026AI元年:AI 落地范式转移:已被反复验证的产业级实践共识

本文探讨AI从技术竞赛迈向产业落地的关键转型:2026年成规模化应用分水岭。强调落地核心不在模型参数,而在数据治理、工作流重构、RAG工程化、推理可控性、人类协同机制及四大落地准则——场景对齐、知识解耦、架构弹性、迭代闭环。

683 0
|
9月前
|
人工智能 安全 物联网
|

告别数据泄露:三步构建企业级AI的隐私保护盾

企业微调大模型面临数据不出域与合规强监管的双重挑战。本文详解差分隐私(加噪声)、联邦学习(数据不动模型动)和LoRA(仅调0.1%参数)三重防护技术,覆盖脱敏、训练、部署全链路,并提供可运行代码与ε值选型指南,助你安全打造专属AI。(239字)

883 1
|
9月前
|
数据采集 人工智能 监控
|

AI也能“专业进修”?不用写代码,教你用微调打造行业专属模型

本文深入浅出解析AI微调(Fine-tuning)技术,聚焦如何让通用大模型成长为行业专才。详解LoRA等高效微调原理,对比RAG优劣,提供数据准备、模型选择、在线训练到效果评估的四步实战指南,助力零基础用户低成本打造专属专业AI。(239字)

618 10
|
9月前
|
存储 人工智能 分布式计算
|

阿里云 OpenLake:AI 时代的全模态、多引擎、一体化解决方案深度解析

阿里云徐晟详解OpenLake:构建全模态、多引擎、一体化智能数据体系,融合大数据与AI,支持湖仓一体、Agentic Data及AI搜索,助力企业降本增效、加速AI落地。(239字)

1135 2
|
9月前
|
存储 人工智能 数据库
|

2026 AI Agent 搭建师职业全景指南:从技术基石到商业闭环

2026年,AI职业迎来范式变革,“AI Agent搭建师”取代提示词工程师,成为集架构设计、系统集成与智能协同于一体的“数字流程总设计师”。他们构建具备感知-思考-行动闭环的智能体,推动企业从“聊天机器人”迈向“行动中心”与“数字员工团队”。通过异构模型路由、多智能体编排、MCP工具协议与GraphRAG记忆系统等核心技术,实现业务流程自动化与决策智能化。该职业融合技术、业务与战略,人才缺口巨大,薪酬领先,被誉为AI时代的“黄金职业”,并持续向AI架构师与伦理治理等方向演进。

2182 1
|
9月前
|
机器学习/深度学习 人工智能 自然语言处理
|

让大模型“读懂”你的文档:RAG核心技术——文档切分完全指南

文档切分是智能问答系统成败的关键。本文深入解析RAG技术中分块(Chunking)的核心原理,涵盖五大切分策略:从基础的按句子、固定长度切分,到更智能的递归与语义切分。通过LangChain实战代码,手把手教你处理文本、Markdown、代码等多格式文档,并优化块大小、重叠与分隔符参数。提供人工抽样、模拟检索和端到端测试三大评估方法,助你构建高效精准的知识检索体系。

1686 0
|
9月前
|
人工智能 运维 供应链
|

智能体来了:生产企业如何用AI赚钱

在“智造”转型浪潮下,AI已成为制造企业发展的必选项。本文系统解析AI在研发、生产、供应链、管理等场景的应用路径,提出从数据筑基到智能体落地的四阶段实施框架,揭示避免技术陷阱、组织阻力的关键策略,助力企业以价值驱动、稳步推进智能化升级。

665 0
|
9月前
|
存储 搜索推荐
|

漫画说:为什么你的“增量计算”越跑越慢? ——90%的实时数仓团队都踩过的坑,藏在这几格漫画里

面对海量数据,传统全量计算导致实时更新效率低下。阿里云 Hologres 通过有状态增量计算,仅处理变更数据并持久化中间状态,实现秒级刷新、降本增效,真正让“增量”摆脱重复扫描历史的困局。

413 1
来自: 实时数仓 Hologres  版块
|
9月前
|
人工智能 搜索推荐 数据库
|

从零搭建RAG系统:原理剖析+代码实践,解锁大模型“记忆力”新姿势

RAG(检索增强生成)为大模型配备“外接大脑”,通过连接专属知识库,提升回答准确性。广泛应用于医疗、法律、客服等领域,兼具专业性与可解释性。本文详解其原理、实战步骤与优化技巧,助你快速构建个性化AI助手。

2471 12
|
9月前
|
数据采集 人工智能 自然语言处理
|

开源大模型微调对比:选对模型,让定制化更高效

本文对比Llama 3、Qwen2.5、Mistral三款开源大模型在中文场景下的微调表现,从算力门槛、数据效率、任务适配性等维度分析,结合实战案例与主观评估,为开发者提供选型建议,助力高效构建定制化AI模型。

1288 10
|
9月前
|
存储 缓存 数据建模
|

StarRocks + Paimon: 构建 Lakehouse Native 数据引擎

12月10日,Streaming Lakehouse Meetup Online EP.2重磅回归,聚焦StarRocks与Apache Paimon深度集成,探讨Lakehouse Native数据引擎的构建。活动涵盖架构统一、多源联邦分析、性能优化及可观测性提升,助力企业打造高效实时湖仓一体平台。

961 39
来自: 实时计算 Flink  版块
|
9月前
|
自然语言处理 运维 物联网
|

大模型微调技术入门:从核心概念到实战落地全攻略

大模型微调是通过特定数据优化预训练模型的技术,实现任务专属能力。全量微调精度高但成本大,LoRA/QLoRA等高效方法仅调部分参数,显存低、速度快,适合工业应用。广泛用于对话定制、领域知识注入、复杂推理与Agent升级。主流工具如LLaMA-Factory、Unsloth、Swift等简化流程,配合EvalScope评估,助力开发者低成本打造专属模型。

1252 16
|
9月前
|
XML JSON 算法
|

淘宝商品详情API接口指南

淘宝商品详情API(taobao.item.get)可获取商品标题、价格、图片、库存、销量等核心信息。支持POST/GET请求,返回JSON格式数据。需提供app_key、timestamp、sign等参数,常见响应码包括200(成功)、401(权限不足)、403(签名错误)等,适用于电商数据对接与分析。

1092 0
|
9月前
|
数据采集 监控 调度
|

Worker越简单,系统越稳定:从单机到集群

本文讨论了从单机采集系统迁移到集群的原因和过程。最初,单机系统适用于数据监控,但随着数据完整性问题的出现,单机系统因失败无声、稳定性依赖个人经验等缺点而不再适用。迁移到集群后,通过分离调度和执行、升级代理IP基础设施,提高了系统的可控性和可靠性。核心改变是数据完整性和失败处理能力的提升,而非速度。最终,从单机到集群的转变是为结果负责,确保数据可靠性。

210 0
|
10月前
|
数据采集 领域建模 数据库
|

领域模型图(数据架构/ER图)

通过四色原型法进行领域建模,提取数据架构核心要素:红色时标原型(MI)表征业务流程节点,绿色参与方-物品原型(PPT)作为实体,黄色角色原型(Role)体现参与关系,蓝色描述原型(DESC)定义属性。基于风控系统实例,从业务流程提炼出MI骨架,逐步补充PPT实体与Role角色,最后添加DESC描述信息,进而映射为ER图。其中PPT对应实体,MI对应关系,结合一对一、一对多、多对多约束,构建清晰的数据模型,支撑系统设计与数据库实现。(239字)

552 0
|
10月前
|
JSON 前端开发 Java
|

第六章 SpringMVC框架

Spring MVC核心组件包括DispatcherServlet、HandlerMapping、HandlerAdapter、Handler和ViewResolver,协同完成请求分发、处理与响应。其流程为:请求经DispatcherServlet分发,通过HandlerMapping定位处理器,由HandlerAdapter执行Handler,再经ViewResolver解析视图并渲染返回。此外,可通过拦截器实现登录校验等操作,结合@RestControllerAdvice和@ExceptionHandler统一处理异常,并使用@RequestMapping等注解简化开发。

627 0
|
10月前
|
自然语言处理 fastjson Java
|

FastJson:大面积故障规避案例

本文记录了一次由Kotlin语法混淆引发的FastJson反序列化故障排查过程。因误将 `{}` 赋值给Java对象字段,导致FastJson解析时触发 `kotlin_error` 静态标记位异常,进而引发全局反序列化失败。问题隐蔽且影响广泛,最终通过深入源码定位并反思多语言混编下的开发规范与框架风险,强调了对底层机制理解的重要性。(239字)

460 0
|
10月前
|
Shell 测试技术 Apache
|

Jmeter快速入门

本文介绍了Apache JMeter的下载、解压与运行方法,并指导用户进行中文语言设置及基本使用。通过添加线程组、HTTP取样器和监听器,快速完成性能测试配置,适合初学者入门学习。

515 0
|
10月前
|
安全 Java 数据安全/隐私保护
|

2.OAuth2.0实战案例

本文介绍基于Spring Boot与Spring Cloud的OAuth2安全认证实现,涵盖父工程搭建、资源服务与授权服务配置,并演示授权码、简化、密码及客户端四种模式的全流程测试,实现安全的分布式系统权限控制。

754 0
|
10月前
|
SQL 安全 网络协议
|

常见的网络攻击

恶意软件指具有险恶目的的程序,如病毒、勒索软件、间谍软件等,常通过钓鱼邮件或漏洞入侵系统,窃取数据、破坏功能。网络钓鱼伪装成可信来源骗取敏感信息。中间人攻击窃听通信,DDoS攻击以海量流量瘫痪服务,SQL注入窃取数据库,零日漏洞利用未修复缺陷,DNS隧道则隐蔽传输恶意数据,均为常见网络安全威胁。

758 0
|
10月前
|
存储 缓存 Java
|

自定义注解

本文介绍Java自定义注解的实现原理与应用,结合Spring AOP和过滤器实现日志、权限控制等功能。通过@Target、@Retention等元注解定义注解,并在Controller中使用,配合拦截器完成登录验证等实际场景,提升代码可读性与复用性。

378 0
|
10月前
|
前端开发 安全 Java
|

用户自定义认证

本文介绍如何自定义Spring Security认证前端页面,包含login.html前端代码配置与后端接口及安全策略设置,通过SecurityConfig实现表单登录、路径放行与跳转控制,最终实现认证访问。

301 0
|
10月前
|
安全 Java 关系型数据库
|

OAuth2.0实战案例

本教程介绍如何搭建Spring Boot集成Security与OAuth2的项目,包括创建父工程、配置依赖管理、添加资源模块及数据库连接,实现安全认证服务的基础架构。

1079 0
|
10月前
|
数据采集 安全 API
|

高精度IP定位:准确性提升与数据优化全攻略

使用IP数据云、IPinfo、IPnews这类专业的IP数据服务平台检测,不仅可以查询IP,更是一个网络风险识别仪器。对于跨境电商、安全研究人员,或者想提高上网隐私的人来说,都挺值得收藏学习。

1509 1
|
10月前
|
机器学习/深度学习 数据采集 运维
|

宕机不是突然的,是你没提前看见 —— 聊聊 IT 事件预测,机器学习如何把事故掐死在摇篮里

宕机不是突然的,是你没提前看见 —— 聊聊 IT 事件预测,机器学习如何把事故掐死在摇篮里

294 3
|
10月前
|
数据采集 分布式计算 监控
|

Airflow 做 ETL,真不是“排个 DAG 就完事儿”:那些年我踩过的坑与悟出的道

Airflow 做 ETL,真不是“排个 DAG 就完事儿”:那些年我踩过的坑与悟出的道

637 4
|
10月前
|
人工智能 自然语言处理 安全
|

AI 十大论文精讲(六):拆解 LLM 智能体的 “通用密码”

本文解读复旦NLP团队2023年重磅综述《The Rise and Potential of Large Language Model Based Agents》,系统剖析LLM智能体“大脑-感知-行动”三大核心模块,涵盖单智能体、多智能体、人机协作与智能体社群四大应用场景,提炼工具SKMA体系、安全护栏、结果检查三大落地要点,并提出AGI路径、虚拟到物理迁移等开放问题,为构建通用智能体提供统一范式,被誉为该领域“入门圣经”。

1319 4

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70384
内容
128
活动
440238
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务