|
10月前
|
机器学习/深度学习 数据采集 人工智能
|

构建AI智能体:五十九、特征工程:数据预处理到特征创造的系统性方法

摘要:特征工程是将原始数据转化为机器学习模型可理解格式的关键步骤,类比于食材烹饪过程。其核心包括数据清洗(处理缺失值、异常值)、特征转换(标准化、分箱)、特征创造和特征选择。通过员工离职预测案例,展示了如何通过单变量分析(满意度、工作时长分布)、多变量分析(满意度与绩效关系)和业务分析(部门薪资组合)构建有效特征。特征工程能提升模型性能(如使用简单模型获得好效果)、增强可解释性(明确风险因素)并减少数据需求。

576 5
|
10月前
|
存储 Linux 数据处理
|

实用程序:基于Python+Tkinter开发表格比对&整理工具

一款基于Python+Tkinter开发的免费开源Excel处理工具,支持表格差异比对与错乱行整理,完整保留图片,兼容.xlsx和.csv格式。操作简单,支持自定义比对列、多线程处理,解决日常办公中数据比对、行合并及图片丢失等痛点,适用于各类Excel数据清理场景。(239字)

765 12
|
10月前
|
人工智能 搜索推荐 开发者
|

GEO 驱动商业增长:非标行业如何通过新闻源布局,抢占 AI 推荐入口

AI正重塑非标行业获客逻辑,GEO优化成关键。通过结构化内容、多源交叉验证与精准新闻源布局,低成本提升AI推荐概率,抢占客户决策入口,实现高效转化。

592 13
|
10月前
|
机器学习/深度学习 算法 PyTorch
|

机器学习:模型训练术语大扫盲——别再混淆Step、Epoch和Iter等

本文用通俗类比讲清机器学习核心术语:Epoch是完整训练一轮,Batch Size是每次训练的数据量,Step/Iter是每批数据处理及参数更新的最小单位。结合学习率、损失值、过拟合等概念,帮你快速掌握训练过程关键要点,打通术语任督二脉。(238字)

2660 9
|
10月前
|
JavaScript
|

IDEA创建thymeleaf模板 创建vue模板

IDEA创建thymeleaf模板 创建vue模板

423 95
|
11月前
|
数据采集 运维 DataWorks
|

【赵渝强老师】阿里云大数据集成开发平台DataWorks

DataWorks是阿里云一站式大数据开发治理平台,支持数据集成、开发、建模、分析、质量监控、服务化及迁移等全链路功能,兼容多种计算引擎,助力企业高效构建数据中台,实现数据资产化与价值挖掘。

883 6
|
11月前
|
分布式计算 Hadoop 大数据
|

到底该选谁?Hadoop、Spark、Flink、云大数据的“江湖全景图”

到底该选谁?Hadoop、Spark、Flink、云大数据的“江湖全景图”

784 6
|
11月前
|
人工智能 自然语言处理 人机交互
|

《智能语》:十进制驱动的多模态人工语言系统构建与协同机制研究

《智能语》是全球首个融合十进制逻辑、多模态表达与东方哲学的人工语言系统,实现文字、语音、词汇、语法全链条协同。通过笔画-音素-数字三重绑定,构建“形音义理”统一的创新架构,具备语义精准、无限扩展、跨文化普适等优势,为语言学习、人机交互与文化传播提供全新范式。(238字)

574 4
|
11月前
|
供应链 API 定位技术
|

1688工厂数据API开发指南

1688工厂数据API是阿里巴巴提供的工厂信息查询接口,支持通过工厂ID、品类、地理位置等多维度检索,涵盖基础信息、生产能力、资质认证、产品分类及信用数据,助力企业高效采购与供应链管理。

517 3
|
11月前
|
监控 安全 数据安全/隐私保护
|

U盘如何防泄密?这几个技术手段迎刃而解

安得卫士提供U盘防泄密四大核心措施:准入控制、操作管控、行为审计与离线防护。通过注册授权、权限细分、敏感数据拦截、全流程操作审计及加密外发控制,实现U盘数据全周期安全防护,有效防范数据泄露风险。

601 6
|
11月前
|
JSON 编解码 API
|

京东商品视频API:轻松获取视频数据

京东商品视频API通过商品ID获取视频信息,支持主视频、详情视频及AR链接,返回JSON格式数据。具备高并发、低延迟、智能适配与增量更新特性,适用于电商开发、推荐优化等场景。

423 3
|
11月前
|
存储 人工智能 分布式计算
|

ODPS十五周年实录|为 AI 而生的数据平台

本文根据ODPS十五周年·年度升级发布实录整理而成,演讲信息如下: 陈守元(巴真):阿里云智能集团计算平台事业部大数据产品总监 活动:【数据进化·AI启航】ODPS年度升级发布

871 0
|
11月前
|
人工智能 弹性计算 运维
|

EMR AI助手开启公测:用AI重塑大数据运维,更简单、更智能

EMR AI 助手开启公测,通过合理利用 EMR AI 助手的各项功能,可以快速查询资源信息、唤起相关操作、诊断组件异常、获取技术支持等,能帮您提升运维效率和操作体验。

657 1
|
12月前
|
机器学习/深度学习 算法 搜索推荐
|

京东图片识别搜索API,搜索相似商品用于多模态数据训练

京东图片识别搜索API(拍立淘)基于深度学习,通过CNN提取图像特征,结合近似最近邻算法实现以图搜图。支持图片URL/Base64输入,返回结构化商品信息,具备多维度筛选与智能排序功能,提升视觉购物体验。(238字)

647 1
|
12月前
|
机器学习/深度学习 数据采集 人工智能
|

从ChatGPT到文心一言:AI为什么能“懂人话”?——大语言模型的底层逻辑揭秘

从ChatGPT到文心一言:AI为什么能“懂人话”?——大语言模型的底层逻辑揭秘

1340 9
|
12月前
|
机器学习/深度学习 数据采集 人工智能
|

别怪推荐系统不懂你,可能是你的数据“太模糊”了

别怪推荐系统不懂你,可能是你的数据“太模糊”了

572 9
|
12月前
|
数据采集 存储 供应链
|

第三方电商数据 API 数据来源深度解析:合规与稳定背后的核心逻辑

本文揭秘第三方电商数据API的底层逻辑:通过官方授权、生态共享与合规采集三重来源,结合严格清洗校验,确保数据稳定、合规、高质。企业选型应关注来源合法性与场景匹配度,避开数据陷阱,实现真正数据驱动增长

965 4
|
12月前
|
Kubernetes Cloud Native Go
|

Kubeflow-KServe-架构学习指南

KServe是基于Kubernetes的生产级AI推理平台,支持多框架模型部署与管理。本指南从架构解析、代码结构到实战部署,系统讲解其核心组件如InferenceService、控制器模式及与Knative、Istio集成原理,并提供学习路径与贡献指南,助你快速掌握云原生AI服务技术。

1637 139
|
20天前
|
数据采集 人工智能 搜索推荐
|

小微主体AI搜索优化实践:平台分发机制与内容结构验证

本文面向小微主体与开发者,揭示AI搜索优化新逻辑:AI引擎引用高度依赖平台推荐,需优先深耕少数高引用平台。内容涵盖引用链路机制、可引用信息块构建、多平台差异化改写、引擎偏好验证及可信度边界把控,强调结构化、可核验、分发适配的实战策略。

106 0
来自: 智能搜索推荐  版块
|
29天前
|
SQL 人工智能 自然语言处理
|

企业 AI 数据底座成熟度指南:如何判断能否接入Data Agent

AI-ready 不只是“数据存得好”,而是“数据能被理解、能被执行、能被审计”。

126 0
|
29天前
|
数据采集 人工智能 安全
|

语义治理 vs 数据治理:为什么统一数据不等于统一业务理解

选择核心经营场景协同推进:一边治理关键指标的底层数据质量和血缘,一边统一上层口径和维度关系,以业务价值牵引治理落地。

131 0
|
1月前
|
数据采集 监控 前端开发
|

micro常用 API:商品详情|关键字搜索商品|快递费用

微店开放API提供商品搜索、详情获取、运费实时计算三大核心接口,打通选品→采集→铺货→下单全链路,助力ERP厂商、跨境货源中台及代购平台实现自动化运营,提升数据准确率与用户转化。

132 0
|
1月前
|
人工智能
|

成果彰显实力:企业资质与认证的价值解析

王涛(Taomir)获阿里云ACA大模型认证(2026.08,编号可查),并开源TaoHtml、发布50题企业GEO Benchmark、沉淀GEO五断点诊断法。本文剖析资质认证与实操成果的互补价值:认证建立初始信任,成果验证真实能力,二者协同方显长期实力。(239字)

109 0
|
1月前
|
人工智能 自然语言处理 数据挖掘
|

从“数据呈现”到“智能决策”:瓴羊Quick BI四大Agent重塑企业数据消费范式

瓴羊Quick BI搭载智能Agent“小Q”,以问数、解读、报告、搭建四大能力,实现自然语言取数、秒级归因、20分钟自动生成报告、对话式报表搭建,打破数据与决策间的壁垒,推动企业从“人找数”迈向“数找人”的智能决策新时代。

154 1
|
2月前
|
数据采集 人工智能 算法
|

5.15亿AI用户涌入:房产内容在AI引擎中的引用机制与决策路径分析

本文解析AI时代房产获客新逻辑:5.15亿生成式AI用户中,40岁以上占比达30.3%,购房决策正转向AI提问。文章揭示AI内容引用机制——依赖平台推荐→爬虫抓取→语义匹配,强调生产“决策前问题”分析内容(如片区对比、政策解读),适配头条/知乎等平台调性,并提供可复现的引用验证方法。

153 0
来自: 智能搜索推荐  版块
|
2月前
|
数据采集 人工智能 算法
|

30亿次日均查询下的内容引用机制:民宿客源入口迁移的底层逻辑拆解

AI搜索日均查询超30亿次,占搜索市场38%,客源正从OTA向AI答案页迁移。本文基于2026年Q1实测数据,拆解AI引用链路,提出信息块拆解法(重数据锚点、轻形容词)、五平台适配公式、三平台聚焦策略及12个月内容资产模型,助力民宿建立可持续的AI可见度。

118 0
来自: 智能搜索推荐  版块
|
3月前
|
人工智能 运维 Serverless
|

开发者生态的AI信任基建:睿擎GEO双五模型在技术社区场景的工程化落地与量化运营路径

本文提出GEO双五模型V1.2,以“先治理、后建设、再验证、长迭代”路径,构建面向大模型的AI信任基建。通过五层架构(L4-L5)与五级成熟度(M1-M5)量化体系,助力技术社区从“内容分发平台”升级为AI时代“可信技术基础设施”,抢占开发者决策入口。(239字)

160 0
来自: 智能搜索推荐  版块
|
3月前
|
机器学习/深度学习 人工智能 算法
|

银行敢用 AI 审批贷款,凭什么让我相信它?——金融合规时代,可解释 AI 才是算法的“身份证”

银行敢用 AI 审批贷款,凭什么让我相信它?——金融合规时代,可解释 AI 才是算法的“身份证”

201 0
|
3月前
|
人工智能 JSON 开发者
|

OPC中国智能体如何降低幻觉:从 RAG 知识库到可追溯评测的工程实践

本文面向个人开发者和小型 AI 项目,讨论 RAG 问答中“检索到了相似内容,但证据仍不足”的问题。文章以阿里云百炼知识库与工作流能力为参考,并使用一个纯 Python 最小程序验证来源召回和拒答逻辑。实验重点不是证明 RAG 可以消除幻觉,而是展示如何发现错误召回、增加证据覆盖检查并保留人工审批。

202 0
|
3月前
|
分布式计算 安全 Hadoop
|

【赵渝强老师】Hadoop HDFS的回收站和快照

本文详解HDFS两大核心高级功能:回收站(支持文件误删恢复,需配置fs.trash.interval启用)与快照(目录级时间点镜像,用于备份、测试及灾难恢复)。涵盖配置方法、操作命令及典型应用场景。

218 1
|
3月前
|
人工智能 安全 大数据
|

一眼识隐患!AR 智能眼镜,重塑新时代警务执法力量

AR智能眼镜融合AR、AI与大数据,以轻便无感优势赋能智慧警务,覆盖日常巡逻、重大安保、临时卡口、交通执法、运管稽查五大场景,实现人脸动态识别、无感核验、实时联动与精准处置,全面提升执法智能化、规范化与响应效率。

279 0
|
3月前
|
数据采集 人工智能 缓存
|

为什么你的推荐系统越做越“笨”?一文讲透电商个性化推荐全链路:从召回到在线排序

为什么你的推荐系统越做越“笨”?一文讲透电商个性化推荐全链路:从召回到在线排序

386 3
|
3月前
|
人工智能 搜索推荐 数据挖掘
|

AI搜索引用转化链路的数据分析:三层漏斗与优化方法

本文提出AI搜索“引用→点击→咨询”三层转化漏斗模型,基于45条引用记录发现:首位引用点击率15%–25%,第5位后不足3%;内容完整度70%时咨询率最高(超15%),过高反致用户自助流失;决策型关键词转化率是学习型的10倍。实证优化60天,咨询量增长约10倍。

309 0
来自: 智能搜索推荐  版块
|
3月前
|
SQL 人工智能 数据挖掘
|

传统 ChatBI vs 企业级数据分析智能体:差别不只是“能不能聊天”

企业应将 ChatBI 视为数据能力演进的早期阶段,而不是终点。长期来看,应逐步构建语义层与数据整合能力,将数据能力从查询工具升级为分析系统。

217 1
|
4月前
|
数据采集 运维 中间件
|

深度对比:Scrapy vs PySpider,谁更适合作为企业级分布式底层?

本文深度对比Scrapy与PySpider两大Python爬虫框架:Scrapy基于Twisted异步单线程,生态成熟、分布式扩展强(需Scrapy-Redis),适合高SLA、千万级企业级系统;PySpider原生分布式但Master单点、维护停滞,适合中小规模快速上线。附代理集成实战与运维选型建议。(239字)

312 0
|
4月前
|
供应链 监控 数据可视化
|

21克 x Quick BI:仅需3天完成数据驾驶舱全面搭建

21克通过Quick BI构建数据中台,统一多源数据口径,实现销售、财务、供应链等全场景可视化分析。管理层实时洞察大盘数据,营销团队精准投放广告,业务人员自助分析,推动订单与会员双倍增。

335 1
|
4月前
|
人工智能 运维 供应链
|

某能源集团 x Quick BI:数据赋能户用光伏建站全流程,提效高达50%

国内户用光伏领军企业借助瓴羊Quick BI实现数据智能升级:业务报表1小时生成、建站全流程提效50%、沉淀700+张内部报表。支持6类角色分权看数,覆盖管理层、员工、代理商、运维、农户及资方,推动光伏业务可视化、数字化。

239 0
|
4月前
|
数据采集 运维 分布式计算
|

数据治理做了3年,老板却说“没效果”?聊聊数据治理KPI到底该怎么定

数据治理做了3年,老板却说“没效果”?聊聊数据治理KPI到底该怎么定

276 3
|
4月前
|
存储 人工智能 自然语言处理
|

数字化转型赋能GEO(生成式引擎优化)全链路实践指南

本文系统阐述生成式引擎优化(GEO)与数字化转型的深度协同:以GEO五层架构为骨架、四标融合为治理准绳,从数据、流程、组织、技术四维推动企业构建AI可信数字资产,实现从“被搜索”到“被引用”的价值跃迁。(239字)

451 0
来自: 智能搜索推荐  版块
|
4月前
|
机器学习/深度学习 PyTorch 算法框架/工具
|

PyTorch深度学习实战 |手算GCN (图神经网络)模型

本文介绍了使用PyTorch实现图神经网络(GNN)处理分子结构数据的实战方法。主要内容包括:1) GNN的基本原理,通过节点特征矩阵和邻接矩阵处理图结构数据;2) 分子图的表示方式,将SMILES字符串转换为PyTorch Geometric图对象;3) 图卷积运算过程,包括特征变换和邻接特征聚合;4) 代码实现示例,构建包含GCN层和全局池化的模型,对乙醇分子进行特征提取和分类预测。文章通过具体案例展示了GNN在化学领域的应用,为读者提供了从理论到实践的完整指导。

240 0
|
4月前
|
机器学习/深度学习 人工智能 编解码
|

人工智能|手算Swin Transformer模型

Swin Transformer是一种高效视觉Transformer,通过移位窗口注意力(Shifted Window)替代全局自注意力,结合分层下采样与局部窗口计算,显著降低计算复杂度,同时保持强大建模能力。其核心包括Patch划分、线性嵌入、W-MSA/SW-MSA交替模块及Patch Merging,构成多尺度特征金字塔,已成为目标检测、分割等任务的主流骨干网络。(239字)

356 1
|
4月前
|
PyTorch 算法框架/工具 计算机视觉
|

基于YOLO11路口交通信号灯通识别 交通指引信号识别 交通标识别识别

基于YOLO11路口交通信号灯通识别 交通指引信号识别 交通标识别识别

210 0
|
4月前
|
机器学习/深度学习 编解码 算法
|

PyTorch深度学习实战 | 标准化和归一化

本文介绍了数据预处理中的标准化和归一化方法,包括计算过程、特性对比及实际应用。以波士顿房价数据集为例,展示了原始数据、标准化和归一化后的模型效果差异。同时讲解了深度学习中常用的层归一化(LN)和批量归一化(BN)技术,分别适用于文本和图像处理任务,并给出了PyTorch实现示例。LN通过调整词向量分布缓解梯度消失等问题,而BN则对图像各通道单独处理。两种技术都能提升模型训练效果,但适用场景不同。

268 0
|
5月前
|
SQL 人工智能 自然语言处理
|

数据平台主管做智能问数选型,最该先看技术路线还是实施能力?

本文为数据平台主管提供智能问数选型的系统化框架,聚焦2026年关键矛盾:技术路线决定能力上限与长期成本曲线,实施能力决定上限能否落地。从四类主流路线(预置SQL、宽表、指标平台、本体语义层)对比出发,结合实施能力三要素(语义构建、知识校准、持续运营)与场景成熟度判断,助力企业在“先进性”与“可行性”间找到平衡点。

538 4
|
5月前
|
数据采集 JSON 监控
|

阐述:微店商品详情API实战经验

微店商品详情API(micro.item_get)提供标准化接口,通过商品ID一键获取标题、价格、库存、图片、SKU、详情页及店铺信息等全量公开数据。支持AppKey+Secret签名鉴权,HTTPS/JSON,稳定易对接,适用于数据采集、多平台同步、价格监控、多店管理等场景。(239字)

364 4
|
5月前
|
JSON API 数据格式
|

阐述:通过商品ID获取京东商品评论数据教程

京东商品评论API(jd.item_review)提供结构化评论数据,含评分、晒图、追评、用户互动及标签聚合等维度,支持POST/GET调用,返回JSON格式。含风控过滤与脱敏处理,助力精准分析与风控决策。(239字)

261 1
|
5月前
|
存储 安全 应用服务中间件
|

PbootCMS常见报错与解决方案大全:从权限配置到版本兼容

本文汇总PbootCMS常见报错(权限不足、SQLite扩展未启用、伪静态异常、图片压缩、PHP版本不兼容等),提供精准原因分析与实操解决方案,涵盖static/data/runtime目录权限设置、php.ini配置、配置文件参数调优等,助力高效建站运维。(239字)

400 0
|
6月前
|
机器学习/深度学习 数据采集 运维
|

深度学习如何重塑三维重建:从任务定义到工程落地全流程解析

本文系统梳理深度学习在三维重建全链路中的工程化落地方法,涵盖任务入口定义、数据采集治理、几何前端增强、深度估计、稠密建模、外观恢复、动态一致性、语义增强及后处理优化九大环节,提出“学习增强+几何约束+质量闭环”的可持续演进框架。(239字)

483 0
|
6月前
|
JSON 供应链 API
|

B2B-1688获取工厂信息接口总览

1688 B2B工厂接口提供工厂详情(item_get_factory)与搜索(item_search_factory)两大核心能力,覆盖工商、产能、认证、信用等60+字段。企业认证后可获全量数据与高QPS,支持供应商尽调、选品及ERP集成。含官方/第三方两种接入方案及调用示例。(239字)

916 0

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

50
今日
70447
内容
128
活动
440242
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务