|
9月前
|
数据采集 人工智能 文字识别
|

PDF 转 Markdown 神器:MinerU 2.5 (1.2B) 部署全攻略

MinerU是由OpenDataLab推出的开源PDF解析工具,支持精准布局分析、公式识别与表格提取。本文详解其2.5-2509-1.2B版本在Linux下的部署流程,涵盖环境搭建、模型下载、核心配置及实战应用,助你高效处理复杂PDF文档,提升AI数据清洗效率。

3874 3
|
11月前
|
SQL 分布式计算 大数据
|

【跨国数仓迁移最佳实践8】MaxCompute Streaming Insert:大数据数据流写业务迁移的实践与突破

本系列文章将围绕东南亚头部科技集团的真实迁移历程展开,逐步拆解 BigQuery 迁移至 MaxCompute 过程中的关键挑战与技术创新。本篇为第八篇,MaxCompute Streaming Insert:大数据数据流写业务迁移的实践与突破。 注:客户背景为东南亚头部科技集团,文中用 GoTerra 表示。

2401 137
来自: 大数据计算 MaxCompute  版块
|
Java 程序员 开发者
|

源代码是什么,怎么使用它开发体育直播平台

源代码是用编程语言编写的原始代码,定义了软件的设计与功能,具备可定制化和灵活性高的优点,但需要开发者掌握相关技术和框架。若缺乏条件,可选择优秀的软件开发服务商,如熊猫比分,进行定制开发。

1095 7
|
机器学习/深度学习 人工智能 算法框架/工具
|

使用Python实现深度学习模型:智能身份验证与防伪

使用Python实现深度学习模型:智能身份验证与防伪

836 1

【免费资料】IEEE33节点系统参数及拓扑图visio

初学者入门配电网可参考经典的IEEE 33节点系统,此系统在文献中广泛应用。资源包括节点和支路参数的Excel表格及Visio的网络拓扑图,可免费下载。配电网以闭环设计增强灵活性和可靠性,故障恢复涉及网络拓扑约束。提供的MATLAB相关链接探讨了孤岛、重构及故障恢复策略。

8563 0
|
9天前
|
JSON 分布式计算 Apache
|

Apache Doris 高性能 Open Lake Variant 读写技术解析(含对比数据)

相比 Spark,Doris 冷跑综合加速 15.10×、热跑 19.14×;拆列场景热跑综合加速达 58.64×,部分 Paimon 测试超过 106×

71 0
|
10天前
|
数据采集 人工智能 自然语言处理
|

AI搜索引用机制解析:小微团队30天验证内容分发路径

本文面向小微团队,聚焦AI搜索优化核心——如何让内容进入生成式引擎引用集。解析引用机制、平台差异验证法,并提供30天可落地的内容分发与观测路径,涵盖引用版图构建、平台匹配策略及信息块结构优化,助力技术决策者高效启动AIGC时代SEO。

96 0
来自: 智能搜索推荐  版块
|
10月前
|
数据挖掘 C++ 计算机视觉
|

Python:ImportError:DLL loadfailed while importing onnxruntime_pybind11_state: 动态链接库(DLL)初始化例程失败 报错解决

在进行文件夹内人脸识别与对比聚类时,遇到onnxruntime库报错,通常因版本不兼容或环境冲突导致。本文整理了五种解决方案:降级onnxruntime至1.14.1、重装库、区分GPU/CPU版本、安装Visual C++运行库、创建Python虚拟环境。通过版本匹配与环境隔离,有效解决DLL初始化失败等问题,提升项目稳定性。

3865 8
|
10月前
|
存储 自然语言处理 测试技术
|

一行代码,让 Elasticsearch 集群瞬间雪崩——5000W 数据压测下的性能避坑全攻略

本文深入剖析 Elasticsearch 中模糊查询的三大陷阱及性能优化方案。通过5000 万级数据量下做了高压测试,用真实数据复刻事故现场,助力开发者规避“查询雪崩”,为您的业务保驾护航。

2515 89
|
8天前
|
IDE 开发工具 C++
|

UE 物体高亮插件 HighLightActors(完全开源纯免费)

HighLightActors 是一个适用于 Unreal Engine 5.8 的运行时插件(同时适用于UE5.0-5.8之前的所有版本),用 Custom Depth/Stencil 和后处理材质给 Actor 绘制可配置的轮廓。插件支持 C++ 与蓝图调用。

81 1
|
9天前
|
数据采集 人工智能 监控
|

GEO日志观测实操:用User-Agent追踪AI爬虫访问

本文详解如何通过User-Agent从服务器日志精准识别GPTBot、Google-Extended、博查搜索Bot等AI爬虫,统计其访问页面与频次;强调UA仅反映“谁来过”,不可推断“是否被收录或引用”,需结合robots.txt配置与静态HTML保障抓取可达性。(239字)

80 0
|
3月前
|
数据采集 JSON API
|

京东评论接口实战指南:评论数据深度分析

京东评论接口是获取商品真实用户反馈的核心工具,支持口碑监控、产品迭代、竞品分析与舆情预警。本文详解官方API接入流程:账号认证、权限申请(分基础/进阶/高级)、密钥获取,并提供Python实战代码(含MD5签名、全量采集、NLP情感分析与差评关键词挖掘),强调合规使用与避坑指南。(239字)

460 0
|
4月前
|
存储 人工智能 自然语言处理
|

拒绝“大模型幻觉”:一文彻底搞懂 RAG(检索增强生成)技术全流程

本文深入解析RAG(检索增强生成)技术,直击大模型落地私有知识场景的核心痛点——如何让LLM精准、低成本、高时效地基于企业文档作答。从文本分片、向量化索引,到召回重排、增强生成,系统拆解五大关键步骤,揭示RAG作为“AI外挂”的底层逻辑与工程实践精髓。

1452 5
|
JSON 监控 API
|

抖音视频详情API秘籍!轻松获取视频详情数据

抖音视频详情API是抖音开放平台的核心接口,通过视频ID可获取包括标题、播放量、点赞数、评论等50多个字段,适用于内容分析、竞品监控和广告评估等场景。接口支持HTTP GET请求,返回JSON格式数据,便于解析处理。文中还提供了使用Python调用该接口的示例代码,包含请求发送、认证、响应处理等功能,帮助开发者快速获取视频数据。

3406 5
|
数据采集 JavaScript 前端开发
|

三种常见网站结构的解析方式对比—信息结构与处理路径图谱

页面结构对信息提取方式有重要影响,本文分析三种主流结构类型及应对策略,结合代码实例对比静态页面、动态页面与接口型页面的处理方法,帮助开发者快速选择合适方案,提升数据采集效率。

443 0
|
机器学习/深度学习 人工智能 自然语言处理
|

阿里云人工智能平台 PAI 开源 EasyDistill 框架助力大语言模型轻松瘦身

本文介绍了阿里云人工智能平台 PAI 推出的开源工具包 EasyDistill。随着大语言模型的复杂性和规模增长,它们面临计算需求和训练成本的障碍。知识蒸馏旨在不显著降低性能的前提下,将大模型转化为更小、更高效的版本以降低训练和推理成本。EasyDistill 框架简化了知识蒸馏过程,其具备多种功能模块,包括数据合成、基础和进阶蒸馏训练。通过数据合成,丰富训练集的多样性;基础和进阶蒸馏训练则涵盖黑盒和白盒知识转移策略、强化学习及偏好优化,从而提升小模型的性能。

2988 7
来自: 人工智能平台PAI  版块
|
人工智能 Linux 定位技术
|

使用 Godot 开发游戏的通用流程

使用 Godot 开发游戏的通用流程

2604 3
|
数据安全/隐私保护 UED iOS开发
|

Figma桌面客户端下载教程+协作设计入门,小白也能变大神

Figma 是全球领先的云端UI/UX设计工具,支持多人实时协作、矢量图形编辑与原型交互设计。其核心优势包括跨平台同步、团队协作(支持50+成员同时编辑)和丰富的资源生态(集成2000+免费插件)。Figma无需安装,通过浏览器访问官网即可使用。硬件要求最低为4GB内存和5Mbps宽带,推荐配置为8GB+内存和50Mbps+宽带。用户可通过创建团队空间邀请成员,支持邮箱邀请和链接分享。Figma还提供详细的官方学习资源,帮助用户掌握核心功能。

3026 2
|
Cloud Native Apache 流计算
|

资料合集|Flink Forward Asia 2024 上海站

Apache Flink 年度技术盛会聚焦“回顾过去,展望未来”,涵盖流式湖仓、流批一体、Data+AI 等八大核心议题,近百家厂商参与,深入探讨前沿技术发展。小松鼠为大家整理了 FFA 2024 演讲 PPT ,可在线阅读和下载。

10044 18
来自: 实时计算 Flink  版块
|
Kubernetes Go 云计算
|

Golang 入门技术文档

**Golang 技术文档摘要:** Golang,由Google开发,是一种静态强类型、编译型语言,广泛应用于云计算、网络编程和分布式系统。本文档介绍了Golang的基础和特性,包括安装配置、 HelloWorld 示例、基本语法,如变量推导、函数多返回值和并发编程(goroutine、channel)。Golang的并发模型基于轻量级goroutine和channel,支持高效并发处理。此外,文档还提及了接口和多态性,展示了如何使用接口实现类型间的交互。Golang在Docker、Kubernetes等项目中得到应用,适用于后端服务开发。【6月更文挑战第9天】

474 1
|
存储 编解码 iOS开发
|

视频文件格式:MOV与MP4格式的区别是什么?

视频文件有多种格式,很多人在下载时不知道该选择哪种文件格式。不同格式有不同特点,各自有优缺点。本文将详细介绍常见的MOV和MP4的特点与区别,以供读者了解及选择。

11861 3
|
3月前
|
SQL 数据采集 人工智能
|

【直播】StarRocks Stella 2.0 发布|具身行业训练数据圈选实战

EMR StarRocks Stella 2.2.0 多模态数据处理与检索能力重磅发布!揭秘文本、图片、视频的统一向量化与多模态理解,实战演示具身行业训练数据圈选全流程,从向量化标注到模型训练准备,助力智能驾驶、RAG等场景落地,理论+实操一站式掌握!

245 0
|
7月前
|
SQL 机器学习/深度学习 人工智能
|

基于本体论的应用到底能做什么?

本文剖析本体论从亚里士多德哲学到AI核心技术的演进,对比Palantir、UINO、字节、帆软等厂商技术路线,揭示其在跨表查询(准确率≥95%)、语义理解与知识积累上的优势,也明确其需本地部署、依赖大模型等边界,助力企业理性选型。(239字)

1548 1
|
7月前
|
芯片
|

掌握OVP过压保护芯片:电路设计、引脚说明及PCB板应用

过压保护OVP:指当输入达到过压保护阀值时,表现为:切断断开输出;恢复条件:输入电压低于过压保护阀值。主要功能意义:保护后级电路或芯片不被高压损坏;应用:蓝牙耳机,充电宝,等等USB输入充电口和输出高电压隔离保护电路。

822 1
|
8月前
|
人工智能 API 数据安全/隐私保护
|

如何使用 LiteLLM 网关代理统一管理你的大模型

大模型使用混乱?费用失控、切换成本高、权限难管?LiteLLM 是轻量实用的大模型网关,统一 OpenAI 兼容接口,纳管 OpenAI、Qwen、本地 vLLM/Ollama 等多源模型。支持 Docker Compose 一键部署、虚拟 Key 权限控制、预算限额与全链路可观测性,业务代码零改造即可接入。

4393 8
来自: 人工智能平台PAI  版块
|
8月前
|
机器学习/深度学习 TensorFlow API
|

TensorFlow 入门指南

TensorFlow 是 Google 开源的主流机器学习框架,支持从研究到生产的全周期开发。其核心优势在于:灵活的数据流图、Keras 高级API易上手、底层API可深度定制,以及TensorBoard、TFLite、TF Serving等完善生态,广泛应用于图像识别、自然语言处理等领域。(239字)

727 2
|
9月前
|
编解码 JSON 监控
|

淘宝图片搜索API接口指南

淘宝图片搜索API(拍立淘)支持通过图片或URL检索淘宝/天猫同款商品,适用于比价、内容带货、运营监控等场景。需申请接口权限,上传符合要求的图片,返回相似商品信息,包括标题、价格、主图及相似度得分。

1387 0
|
10月前
|
前端开发 安全 JavaScript
|

网站代码 网站源代码 网页源代码 网页代码网站

本文深入解析网站源代码与网页源代码的核心概念及区别,阐述其作为互联网技术基石的关键作用。通过剖析PageAdmin等典型源码案例,揭示源代码在技术学习、网站优化、安全维护等方面的核心价值,并探讨如何高效利用代码网站资源进行创新开发。文章强调在尊重版权的前提下,开发者可借助源码资源提升能力,推动网页技术持续发展。

2441 10
来自: 大数据计算 MaxCompute  版块
|
人工智能 分布式计算 DataWorks
|

大数据AI产品月刊-2025年7月

大数据& AI 产品技术月刊【2025年7月】,涵盖7月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据& AI 方面最新动态。

2861 2
|
存储 算法 数据可视化
|

使用Python代码识别股票价格图表模式

在股票市场交易的动态环境中,技术和金融的融合催生了分析市场趋势和预测未来价格走势的先进方法。本文将使用Python进行股票模式识别。

2035 0
|
自然语言处理 并行计算 算法
|

cp-sat求解器介绍及使用案例

cp-sat求解器介绍及使用案例 更多文章欢迎关注我的微信公众号:Python学习杂记

5498 1
|
1天前
|
存储 人工智能 安全
|

结构化数据互转(下):任意进制与罗马数字的换算实现

本文深入探讨数字的多种表示法(十进制、二进制、十六进制、罗马数字等),强调数值与表示法的本质区别;详解进制转换原理、`parseInt`陷阱、`BigInt`精度保障、前导零语义、二进制补码位宽依赖及罗马数字规范校验,助力开发者安全、准确地处理各类数字转换场景。(239字)

34 0
|
8天前
|
人工智能 安全 SEO
|

为什么 AI 会被伪权威误导——PoisonedRAG 与知识库污染防御

本文剖析AI被伪权威误导的根源:非能力不足,而是默认省略审计级穿透核验以控成本。揭示PoisonedRAG投毒本质是优化攻击,并提出多层防御框架——源头校验、可信分级、多源交叉验证与内容治理,为白帽GEO与知识库安全提供实操路径。(239字)

73 0
|
3月前
|
人工智能 算法 机器人
|

10个行业AI搜索获客实战:从本地餐饮到工业制造的GEO策略

AI搜索正取代传统SEO,用户从“点击链接”转向“直接要答案”。本文基于餐饮、装修、法律等10大行业实战,揭示GEO(生成式引擎优化)本质:不求被搜到,而要成为AI主动推荐的“唯一答案”。通过认知重塑、策略原点、行业剖解与系统飞轮四步,助企业预制结构化“答案单元”,抢占AI时代获客先机。

262 2
来自: 智能搜索推荐  版块
|
3月前
|
分布式计算 运维 自然语言处理
|

EMR Serverless Spark PB级文本语义去重4倍加速的技术方案解读

针对大模型语料清洗中文本去重面临的性能瓶颈,某企业迁移至阿里云emr serverless spark后实现突破。新方案通过minhash-lsh内置函数将算法下沉引擎层,减少40%代码量;结合fusion engine向量化加速与shuffle优化,消除python udf跨进程开销并解决数据倾斜问题。实测去重性能提升4倍,任务耗时从天级降至小时级,且实现零shuffle失败与免运维。该实践验证了serverless架构在pb级数据预处理中的高效性与稳定性,显著加速模型迭代并降低计算成本。

341 0
|
7月前
|
监控 数据可视化 数据处理
|

本地自动化新思路:不用脚本也能让电脑软件自己动起来?1949ai带你探究

本文分享了一线开发者在落地办公自动化时的真实困境与思考:面对CRM、Excel、邮件客户端等多系统混用场景,单纯写代码(如Selenium+PyAutoGUI)易受界面变化、弹窗、环境差异困扰;而可视化流程工具凭借“条件触发+跨应用感知”更稳定易维护。作者主张“代码管数据、工具管交互”的混搭策略,并附实用文件监听代码示例。核心观点:自动化不是炫技,而是把人从机械劳动中解放出来。(239字)

563 5
|
11月前
|
存储 人工智能 分布式计算
|

阿里云DLF 3.0:面向AI时代的智能全模态湖仓管理平台

在2025年云栖大会,阿里云发布DLF 3.0,升级为面向AI时代的智能全模态湖仓管理平台。支持结构化与非结构化数据统一管理,实现秒级实时处理、智能存储优化与细粒度安全控制,助力企业高效构建Data+AI基础设施。

2808 3
|
存储 分布式计算 大数据
|

MaxCompute操作报错合集之自定义udf的函数,引用了import net.sourceforge.pinyin4j.PinyinHelper;但是上传资源后,出现报错,是什么原因

MaxCompute是阿里云提供的大规模离线数据处理服务,用于大数据分析、挖掘和报表生成等场景。在使用MaxCompute进行数据处理时,可能会遇到各种操作报错。以下是一些常见的MaxCompute操作报错及其可能的原因与解决措施的合集。

706 0
来自: 大数据计算 MaxCompute  版块
|
SQL 关系型数据库 MySQL
|

flink cdc 同步问题之如何提高用户速度

Flink CDC(Change Data Capture)是一个基于Apache Flink的实时数据变更捕获库,用于实现数据库的实时同步和变更流的处理;在本汇总中,我们组织了关于Flink CDC产品在实践中用户经常提出的问题及其解答,目的是辅助用户更好地理解和应用这一技术,优化实时数据处理流程。

562 0
来自: 实时计算 Flink  版块
|
关系型数据库 MySQL Java
|

Flink cdc报错问题之使用jdbc connector报错如何解决

Flink CDC报错指的是使用Apache Flink的Change Data Capture(CDC)组件时遇到的错误和异常;本合集将汇总Flink CDC常见的报错情况,并提供相应的诊断和解决方法,帮助用户快速恢复数据处理任务的正常运行。

828 0
来自: 实时计算 Flink  版块
|
人工智能 并行计算 算法
|

【DSW Gallery】基于MOCOV2的自监督学习示例

EasyCV是基于Pytorch,以自监督学习和Transformer技术为核心的 all-in-one 视觉算法建模工具,并包含图像分类,度量学习,目标检测,姿态识别等视觉任务的SOTA算法。本文以自监督学习-MOCO为例,为您介绍如何在PAI-DSW中使用EasyCV。

944 0
来自: 人工智能平台PAI  版块
|
9天前
|
JSON 算法 API
|

淘宝天猫商品评论API接口解析(附 JSON 样例)

本文详解淘宝开放平台taobao.item.reviews.get接口,合规获取商品近180天公开评价数据(含评分、文本、晒图、SKU、追评及商家回复),涵盖鉴权、签名、参数、JSON示例、字段释义与生产避坑指南。(239字)

80 0
|
12天前
|
SQL Apache DataX
|

StarRocks 迁移至 Apache Doris 完整指南:三步完成结构、数据与业务平滑切换

StarRocks 怎么迁移到 Apache Doris?SR 迁移 Doris 是否需要重新建表?几亿、几十亿数据怎么搬?DataX、Flink、Parquet 应该怎么选?全量迁移之后又如何保证增量数据不丢?

101 0
|
18天前
|
数据采集 JSON 监控
|

告别爬虫采集1688商品数据:1688商品详情接口接入实践

1688官方商品详情API提供稳定、合规的结构化数据(标题、价格、规格、主图、供应商等),替代高维护成本的爬虫方案,适用于跨境铺货、价格监控、素材采集及货源数据库建设,支持按需字段返回,JSON格式标准易用。(239字)

148 1
|
28天前
|
数据采集 缓存 算法
|

淘宝 / 1688 / 微店官方API对接:反向海淘系统的核心壁垒

反向海淘需对接淘宝、1688、微店多平台API,但鉴权、字段、价格模型、风控差异巨大,直接调用维护成本高。本文提出统一API适配中间层架构,收敛平台差异,实现鉴权隔离、参数标准化、数据归一、错误码统一及流量管控,提升系统稳定性与可维护性。(239字)

176 1
|
29天前
|
人工智能 自然语言处理 数据可视化
|

使用 WorkBuddy + Sive API,做无限可能的数据分析和可视化

现在 AI 时代,除了 Coding, 办公也开始全名 AI 辅助了,比如现在各种桌面端大战,各类产品都需要考虑如何把自己交给 AI 作为弹药,Sive 就提供了一套 OpenAPI,将数据分析能力完全暴漏给 AI Agent。

250 0
来自: 数据可视化DataV  版块
|
4月前
|
数据采集 JSON 程序员
|

为什么说掌握了HTTP协议状态码,就解决了50%的爬虫报错

文章强调了HTTP状态码在爬虫中的重要性,提供了应对常见问题的解决方案。例如,使用代理IP绕过403和429状态码,以及对200状态码的二次校验。理解状态码对提高爬虫效率至关重要。

489 0
|
8月前
|
安全 Java 网络安全
|

哪些政策要求企业开展漏洞扫描?

在网络安全法等法规要求下,企业须定期开展漏洞扫描。具备CNAS/CMA/CCRC资质的第三方机构,依据GB/T 30279、34943等标准,通过专业工具对网络、系统、应用及容器镜像等进行全面扫描,出具权威《漏洞扫描报告》,助力企业合规整改、筑牢安全防线。(239字)

839 2
|
9月前
|
机器学习/深度学习 供应链 监控
|

淘宝图片搜索API(taobao.item_search_img)

淘宝图片搜索API是阿里基于深度学习的视觉检索服务,支持以图搜同款/相似商品,毫秒级响应、高准确率。提供商品、交易、店铺等结构化数据,适配选品、同款监控、智能上架等场景,合规高效,助力电商数字化升级。(239字)

1052 7
|
9月前
|
机器学习/深度学习 人工智能 监控
|

从原理到实践:零代码也能搞定的PPO微调全攻略

本文深入浅出解析PPO(近端策略优化)算法——大模型对齐人类偏好的核心技术。通过“温和教练”比喻、四步原理拆解与实操指南,零基础也能理解其剪切机制、优势函数与稳定训练逻辑,并亲手微调出更懂你的AI。(239字)

760 0

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70385
内容
128
活动
440239
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务