|
12月前
|
机器学习/深度学习 人工智能 索引
|

RAG 切片利器 LumberChunker 是如何智能地把文档切割成 LLM 爱吃的块

RAG 里的文档应该怎么切割比较好呢?按固定的字符数或词数?按句?按段落?加个重叠窗口?还是 ...

522 1
|
12月前
|
存储 数据库 索引
|

RAG检索质量差?这5种分块策略帮你解决70%的问题

RAG效果关键在于文档分块:固定、递归、语义、结构化与延迟分块各有优劣。合理选择能显著提升检索质量,减少幻觉,增强上下文理解,是构建高效RAG系统的核心环节。

1238 4
|
12月前
|
Java 数据挖掘 数据处理
|

(Pandas)Python做数据处理必选框架之一!(一):介绍Pandas中的两个数据结构;刨析Series:如何访问数据;数据去重、取众数、总和、标准差、方差、平均值等;判断缺失值、获取索引...

Pandas 是一个开源的数据分析和数据处理库,它是基于 Python 编程语言的。 Pandas 提供了易于使用的数据结构和数据分析工具,特别适用于处理结构化数据,如表格型数据(类似于Excel表格)。 Pandas 是数据科学和分析领域中常用的工具之一,它使得用户能够轻松地从各种数据源中导入数据,并对数据进行高效的操作和分析。 Pandas 主要引入了两种新的数据结构:Series 和 DataFrame。

842 0
来自: 人工智能平台PAI  版块
|
1月前
|
数据挖掘 BI API
|

语义层 vs MCP 工具层:Agent 调用数据时,语义应该放在哪一层

更合理的架构是语义层承载统一业务口径,MCP 作为 Agent 调用语义服务及其他工具的标准协议层。

123 1
|
1月前
|
数据采集 监控 前端开发
|

micro常用 API:商品详情|关键字搜索商品|快递费用

微店开放API提供商品搜索、详情获取、运费实时计算三大核心接口,打通选品→采集→铺货→下单全链路,助力ERP厂商、跨境货源中台及代购平台实现自动化运营,提升数据准确率与用户转化。

136 0
|
1月前
|
人工智能 自然语言处理 搜索推荐
|

GEO采样题集设计:从原理到实战的系统化构建指南

本指南系统构建GEO采样题集,提出“客户语言题面+系统意图标注”双层设计,确立50题冻结Benchmark标准,覆盖自然推荐、品牌评估等四类核心意图,确保跨平台、跨轮次数据可比可验,直击采样不可复现痛点。(239字)

110 0
|
1月前
|
JSON 自然语言处理 监控
|

亚马逊商品评论API技术解析与落地应用

本文详解亚马逊SP-API评论接口(reviews-v2021-01-01)实战要点:仅支持自有ASIN数据,涵盖鉴权、分页、多站点、增量同步;解析差评预警、VOC分析、情感识别等落地流程,并梳理跨境开发高频坑点,助力选品与舆情系统建设。(239字)

128 1
|
2月前
|
数据采集 人工智能 监控
|

数据中台实践派:瓴羊 Dataphin 的全链路治理思路拆解

瓴羊Dataphin是阿里旗下AI原生智能数据治理平台,基于OneData方法论,以OneID/OneModel/OneService架构,实现全链路数据集成、智能建模、标准统一、资产治理与安全服务,助力企业将数据中台从“成本中心”升级为“价值引擎”。

159 0
|
2月前
|
存储 缓存 JSON
|

jd.item.get(京东商品详情 API)全业务场景落地手册

京东商品详情API(V2.0):结构化获取SKU全量数据,支持ERP同步、跨境铺货、竞品监控、反向海淘等8大场景。含接口规范、JSON样例、缓存限流策略、避坑指南及Python Demo,助力稳定高效集成。(239字)

196 0
|
2月前
|
数据采集 XML 人工智能
|

4步构建多语言内容中枢:从AI引用混乱到80%准确率

本文提出4步法构建多语言内容中枢:诊断AI眼中的语言孤岛问题;建立语义ID与结构化数据绑定多语言版本;训练语言信号强化引用偏好;通过反向Prompt测试闭环验证。实测将引用准确率从30%提升至80%以上,不依赖特定引擎规则,专注底层语义对齐。

134 0
来自: 智能搜索推荐  版块
|
2月前
|
人工智能 Kubernetes 搜索推荐
|

4个机制解析:AI引擎如何选择引用内容

本文揭示AI引擎(如ChatGPT、Perplexity)引用机制与传统SEO的本质差异:非靠关键词排名,而重内容可解析性、权威信号与实时性。基于实测数据,从四层面提供可落地优化路径——理解引用逻辑、结构化内容(Schema/层级/FAQ)、构建权威背书、建立监测迭代闭环。

207 1
来自: 智能搜索推荐  版块
|
3月前
|
数据采集 人工智能 搜索推荐
|

电商产品页GEO优化:从关键词匹配到任务匹配的四步指南

AI搜索正重塑电商推荐逻辑!本文以家居乳胶枕案例切入,揭示产品页被AI推荐的核心机制:从任务匹配、结构化数据、权威信号到动态监测。提出可落地的四步优化法——让页面从“商品描述”变为“任务说明书”,助你抢占AI时代流量入口。

216 0
来自: 智能搜索推荐  版块
|
3月前
|
人工智能 运维 Serverless
|

开发者生态的AI信任基建:睿擎GEO双五模型在技术社区场景的工程化落地与量化运营路径

本文提出GEO双五模型V1.2,以“先治理、后建设、再验证、长迭代”路径,构建面向大模型的AI信任基建。通过五层架构(L4-L5)与五级成熟度(M1-M5)量化体系,助力技术社区从“内容分发平台”升级为AI时代“可信技术基础设施”,抢占开发者决策入口。(239字)

163 0
来自: 智能搜索推荐  版块
|
3月前
|
人工智能 供应链 搜索推荐
|

GEO 深度进阶:从入门到行业实战的完整路径

本文揭秘GEO(生成式引擎优化)本质:非SEO升级,而是内容价值传递范式转移。指出AI不“找”内容而“读”内容,强调结构化、可提取、可验证的“引用友好型”内容设计。通过餐饮、教育、SaaS三大行业实战案例,拆解从“被收录”到“被首选引用”的进阶路径,助你构建AI时代的内容护城河。

323 1
来自: 智能搜索推荐  版块
|
3月前
|
SQL 人工智能 安全
|

企业级 AI Agent 的安全防护实践:防止提示注入与数据泄露

AI Agent正重塑企业安全边界:其自主调用API、数据库、知识库等能力,在提升自动化效率的同时,也引入提示注入、工具滥用、记忆污染等新型风险。本文系统剖析十大威胁与防护策略,提出“模型管推理、系统管安全”的多层防御架构,涵盖输入检测、Prompt隔离、工具白名单、RAG权限治理及全链路审计,助力企业构建可信AI智能体。

378 0
|
3月前
|
数据采集 人工智能 自然语言处理
|

基于GEO服务商签约合同条款分析的技术能力评估框架研究

本文构建四阶段GEO服务商技术能力评估框架(方法论验证、案例审计、合同审查、付费分析),基于10个签约前问题,实证检验3家服务商。结果表明:该框架在方法论清晰度、案例可验证性与合同保障性三方面具备显著区分力,有效缓解信息不对称。

250 0
来自: 智能搜索推荐  版块
|
3月前
|
SQL JSON 运维
|

一条SQL同时处理结构化条件和非结构化语义匹配。

本文对比智能客服场景下向量检索的两种架构:独立向量库 vs 内置向量的关系型数据库。结合5万知识库、日增数百条、QPS 20+的实际需求,剖析二者在数据一致性、运维成本、查询性能与扩展性上的真实差异,指出多数创业团队无需“为技术而技术”,关系库向量化已足够成熟可靠。(239字)

171 0
|
3月前
|
数据采集 人工智能 安全
|

AI大模型赋能企业跨端远程办公与文件处理:从RAG检索到任务闭环的工程实践

本文探讨AI大模型如何赋能企业跨端远程办公与文件处理,聚焦RAG检索、权限管控与任务闭环的工程实践。强调信息与任务连续性,而非单设备AI功能;覆盖会议纪要自动化、合同提取、文档摘要等高频场景,并提供分层架构、部署选型与安全 checklist,助力企业务实落地。

255 0
|
3月前
|
人工智能 搜索推荐 API
|

从 SEO 到 GEO:Schema.org 如何提升企业网站在 LLM 中的可发现性

2026年,用户从搜索转向直接向AI提问,企业竞争已从SEO升级为GEO(生成式引擎优化)。Schema.org结构化数据成为AI理解网页的关键基础设施,助力LLM精准抽取事实、提升RAG召回准确率,并支撑AI Agent自动化交互。它是AI时代的知识图谱基石。

246 0
|
3月前
|
数据采集 存储 JSON
|

基于录音转写与大模型的家装客户概览生成实践

针对家装行业长录音(常超万字)设计客户概览系统:通过语音转写、角色区分、语义分段、结构化事实提取、历史数据融合及多层校验,精准提炼家庭情况、需求、预算、顾虑等关键信息,确保每项结论可追溯、无混淆,赋能销售与设计高效决策。

331 1
|
3月前
|
数据采集 运维 中间件
|

2026架构前沿:将Declarative Crawler(声明式爬虫)引入你的技术栈

这篇文档强调了2026年数据工程领域声明式爬虫架构的重要性。它通过分离业务意图和执行细节,降低跨部门协作门槛。关键挑战在于底层IP设施。文档介绍了爬虫代理技术,并通过Python代码示例展示了如何实现声明式会话组。最后,提出了渐进式迁移策略,以实现声明式爬虫架构

161 0
|
3月前
|
存储 JSON Apache
|

Apache Doris 在 AgentLogsBench 中领先,支撑 Agent 可观测性生产负载

AgentLogsBench 是面向AI Agent可观测性的新型混合负载基准,聚焦trace回放、大文本搜索、动态JSON过滤与实时看板四大真实场景,2026年5月测试显示Apache Doris综合性能领先。(239字)

194 3
来自: 大数据运维SREWorks  版块
|
3月前
|
数据采集 JSON API
|

Temu店铺上新1688商品详情数据采集项目总结

本项目依托1688平台,通过API批量采集商品数据,经标准化清洗、跨境适配(标题优化、参数补全、图片处理、文案翻译)及人工复核,实现Temu店铺高效、合规、规模化上新,日均SKU提升3–5倍,审核通过率达98%以上。(239字)

297 0
|
3月前
|
弹性计算 人工智能 NoSQL
|

ECS 上给 Coding Agent 准备可复现环境

本文介绍在ECS上为Coding Agent定制的标准化开发环境:通过Docker Compose+健康检查、固定Node/DB/Redis镜像、预置环境变量与统一脚本,解决本地环境差异导致的测试失败、依赖未就绪等问题,确保Agent开箱即用、稳定执行lint、测试与开发任务。(239字)

249 0
|
4月前
|
数据采集 存储 人工智能
|

AI搜索重构制造业采购逻辑:基于阿里云的企业级GEOCMS优化实践

福建制造企业官网内容多为PDF/图片,AI无法识别,导致“隐形”。本文提出基于阿里云的GEO(生成式引擎优化)方案,含结构化建模、向量知识库、AI引用监测、llms.txt引导四大引擎,助力企业从“人类可读”升级为“AI可理解”,抢占AI搜索新流量。

463 0
来自: 智能搜索推荐  版块
|
4月前
|
存储 分布式计算 固态存储
|

数据堆成山才想治理?别等磁盘爆了才后悔:聊聊数据生命周期管理那些事

数据堆成山才想治理?别等磁盘爆了才后悔:聊聊数据生命周期管理那些事

291 0
|
4月前
|
机器学习/深度学习 PyTorch 算法框架/工具
|

PyTorch深度学习实战 |手算GCN (图神经网络)模型

本文介绍了使用PyTorch实现图神经网络(GNN)处理分子结构数据的实战方法。主要内容包括:1) GNN的基本原理,通过节点特征矩阵和邻接矩阵处理图结构数据;2) 分子图的表示方式,将SMILES字符串转换为PyTorch Geometric图对象;3) 图卷积运算过程,包括特征变换和邻接特征聚合;4) 代码实现示例,构建包含GCN层和全局池化的模型,对乙醇分子进行特征提取和分类预测。文章通过具体案例展示了GNN在化学领域的应用,为读者提供了从理论到实践的完整指导。

243 0
|
4月前
|
PyTorch 算法框架/工具 计算机视觉
|

基于YOLO11路口交通信号灯通识别 交通指引信号识别 交通标识别识别

基于YOLO11路口交通信号灯通识别 交通指引信号识别 交通标识别识别

214 0
|
4月前
|
供应链 API 调度
|

淘宝拍立淘 API(爆款挖掘项目技术复盘)

本项目基于淘宝拍立淘接口,以图搜货,批量匹配同款/近似款商品;融合相似度、销量、售价构建爆款筛选模型,优化预处理、队列调度与分层过滤,高效挖掘高潜力爆品,支撑选品对标、货源挖掘与趋势研判。(239字)

231 0
|
4月前
|
机器学习/深度学习 人工智能 算法
|

图解人工智能的数学基础(高数)

本文系统讲解微积分核心概念:数列与递推、极限(含无穷小/大)、导数(含中值定理、泰勒公式)、积分(不定/定/变上限/反常)及微分方程,并延伸至多元函数、偏导数、链式法则与二重积分,结合Sigmoid函数、药物衰减等实例及SymPy代码演示,突出其在AI与工程中的应用基础。

410 5
|
4月前
|
机器学习/深度学习 人工智能 编解码
|

人工智能|大白话YOLOv2

YOLOv2采用轻量高效的Darknet-19骨干网络(仅19层卷积),全用1×1和3×3小卷积核,配BatchNorm与LeakyReLU;引入Anchor Boxes、Passthrough层融合多尺度特征,并支持多尺寸输入,显著提升精度与小目标检测能力。(238字)

277 0
|
4月前
|
机器学习/深度学习 数据可视化 PyTorch
|

PyTorch深度学习实战 |语义分割基础知识

《PyTorch语义分割实战解析》摘要:本文深入探讨语义分割中的标签处理技术,对比P模式与L模式的本质区别。P模式通过调色板实现人机双重视觉效果,底层存储类别索引(0,1,2等),表面呈现彩色可视化效果。针对边缘模糊问题,提出使用255作为忽略标签(IgnoreLabel)的解决方案。文章系统梳理7大评价指标:从基础的像素准确率(PA)到综合性的mIoU和mF1,特别强调mIoU作为核心指标的重要性,其平衡各类别的特性使其成为模型性能评估的黄金标准。通过技术原理与实战经验的结合,为深度学习从业者提供了语义分

253 0
|
4月前
|
机器学习/深度学习 存储 编解码
|

PyTorch深度学习实战 | 手算卷积网络(Resnet-18)

ResNet-18是解决深层网络梯度消失与退化问题的经典模型,核心在于残差连接(Shortcut):让输入X直接跳跃传递,与卷积学习的残差F(X)相加(F(X)+X),实现恒等映射。其含4个stage、18层可训练层,每个BasicBlock由两个3×3卷积+BN+ReLU构成,并通过1×1卷积适配尺寸/通道差异,显著提升深层网络训练稳定性与性能。(239字)

317 2
|
5月前
|
机器学习/深度学习 人工智能 JSON
|

别被“HTML 万能论”带偏:Markdown 才是人机协作的真正基石

Claude工程师提出“未来AI只需输出HTML,Markdown已是过去式”的观点。本文从AI底层运行逻辑、Token经济学、注意力机制与真实协作场景出发,指出该观点混淆了表现层与数据层,低估了人类微调的必要性。Markdown之所以不可替代,恰恰因为它信息纯净、容错高、对人与AI都极为友好——它是未来很长一段时间里的“认知JSON”。

393 5
|
5月前
|
人工智能 运维 决策智能
|

从实践探讨不同智能体的应用场景

2026年5月15日14:00,CXOUNION联合艺赛旗举办线上活动,聚焦OpenClaw、Hermes、Agentic Automation三类主流AI智能体,邀请企业CIO与一线实践者,从个人提效与企业落地双视角,解析适用场景、选型逻辑与发展路径,助力智能体规模化、规范化应用。(239字)

272 1
|
5月前
|
人工智能 自然语言处理 安全
|

普通人也能用的 AI 自动化 OpenClaw 配置方法(附下载 + 问题解决)

OpenClaw(小龙虾AI)是2026年热门的本地化AI自动化工具,无需联网或账号,用自然语言即可实现键鼠控制、文件处理、浏览器操作等,大幅提升办公效率。Win11一键部署,全程自动安装,支持纯离线运行。

672 2
来自: 人工智能平台PAI  版块
|
5月前
|
消息中间件 编解码 JSON
|

如何同时使用多个Logstash进行不同的日志传输

项目需新增Logstash处理Spring Boot日志,但与现有实例共用默认data目录导致启动失败。错误提示“another instance using the configured data directory”。解决方法:为新实例指定独立data路径,支持命令行`--path.data`、配置文件或环境变量三种方式,确保目录存在且有写权限。

445 0
|
6月前
|
分布式计算 MaxCompute 流计算
|

PAI-FeatureStore特征平台的相关问答

本栏目解答FeatureStore常见问题:实时视图时间戳支持BIGINT/TIMESTAMP;ODPS同步需字段完全匹配;Item特征表由关联视图确定;离线视图禁止写入;实时数据查询延迟通常仅数秒。(238字)

320 1
来自: 人工智能平台PAI  版块
|
6月前
|
人工智能 监控 算法
|

GEO推广:企业营销的下一个必争之地?

当5亿用户转向AI提问“该买哪个”,传统SEO已不够用!2026年中国生成式AI用户达5.15亿,GEO(生成式引擎优化)成为抢占AI答案页的必选项。

675 0
来自: 智能搜索推荐  版块
|
6月前
|
监控 搜索推荐 API
|

1688图片搜索API:通过图片地址获取1688相似商品

本文详解1688图片搜索API(item_search_img),含接口调用、标准返回结构、关键字段(标题/价格/SKU/库存等)解析及避坑指南,支持外链图转ID,集成多场景商业数据接口,开箱即用,适配中小卖家批量采集需求。(239字)

483 0
|
6月前
|
人工智能 JSON 监控
|

天猫商品详情API数据解析

天猫商品详情API解析方案,涵盖taobao/tmall.item.get接口字段说明、JSON结构、解析代码及SKU/详情图/规格提取。支持价格库存、竞品监测、舆情预警等场景,AI智能清洗、卖点解析与爆款预测,助力中小卖家高效用数。(239字)

344 0
|
6月前
|
人工智能 API 调度
|

Hermes Agent 与 OpenClaw:本质区别与选型深度解析

Hermes Agent 与 OpenClaw 同为热门开源AI框架,但理念迥异:OpenClaw 是“配置驱动”的灵活工具箱,强调人工编排与多模型调度;Hermes Agent 则是“学习驱动”的长期搭档,具备自主反思、记忆沉淀与持续进化能力。选前者重掌控力,选后者重省心度与长期协同效率。(239字)

788 6
|
6月前
|
安全 Java 索引
|

java工具:《对Collections.sort排序后我想制定查询几条,比如list有10条,我只想获取前4条》

java工具:《对Collections.sort排序后我想制定查询几条,比如list有10条,我只想获取前4条》

196 12
|
6月前
|
JSON 监控 5G
|

某宝店铺商品全量接口-item_search_shop

淘宝item_search_shop_pro接口支持按店铺ID全量获取在售商品,含分页、字段筛选与类目过滤;提供完整参数说明、返回字段详解、Python调用示例及风控规范,开箱即用,适用于竞品监控、ERP同步与选品分析。(239字)

646 2
|
6月前
|
API C++ Python
|

EasyRec和TorchEasyRec中FG NORMAL 和 FG DAG 的区别

TorchEasyRec提供两种特征生成模式:FG_NORMAL(Python逐特征处理,适合调试)与FG_DAG(C++ DAG引擎批量处理,性能更优、支持依赖、stub_type及自动侧识别)。推荐生产环境优先使用FG_DAG。

260 5
来自: 人工智能平台PAI  版块
|
7月前
|
SQL 存储 人工智能
|

选型必算 ROI:Aloudata CAN 指标平台如何量化降本增效与统一口径价值

通过统一语义层、声明式定义与智能物化技术,实现可量化的降本增效与 100% 口径一致。

376 5
|
7月前
|
JSON API 数据格式
|

洞察电商数据:京东商品详情API 数据模型

该JD商品数据接口提供jd.item_get(基础)与jd.item_get_pro(全量)两大核心服务,支持POST/GET调用,返回JSON格式。无需申请密钥,传入item_id/sku_id及timestamp即可一键获取含图文、价格、库存、规格、销量、售后等7大模块的标准化商品数据,适配批量查询与中小卖家需求。(239字)

406 6
|
7月前
|
Java
|

java工具:《检测一个字符串是否是时间格式》

java工具:《检测一个字符串是否是时间格式》

238 4
|
7月前
|
分布式计算 运维 Kubernetes
|

别再手搓集群了:用 Terraform + Helm 把数据平台“养成宠物”变“放养牛群”

别再手搓集群了:用 Terraform + Helm 把数据平台“养成宠物”变“放养牛群”

349 5

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70453
内容
128
活动
440246
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务