带你读《Elastic Stack 实战手册》之60:——3.5.16.4.Data frame analytics(2)

简介: 带你读《Elastic Stack 实战手册》之60:——3.5.16.4.Data frame analytics(2)


《Elastic Stack 实战手册》——三、产品能力——3.5 进阶篇——3.5.16. Machine learning——3.5.16.4.Data frame analytics(1) https://developer.aliyun.com/article/1227193



Outlier Detection 展示

 

使用一个真实的例子来进行演示。我们可以到地址:House Sales in King County, USA | Kaggle下载。这是一个在美国 King County 地区的房屋销售真实数据。一旦下载完数据,我们可以使用 Kibana 来把数据导入:

image.png


image.png


我们选择解压缩文件中的 kc_house_data.csv 文件:

image.png


image.png


我们把索引的名字取为 king-county-house-prices。我们在摄入时,会发现 ingest pipeline 会自动帮我们把数值进行转换,并创建一个叫做 location 的字段。它里面包含有文档中的经纬度。点击上面的 Import 按钮:

image.png


image.png

image.png


这样,我们就成功地创建了一个叫做 king-county-house-prices 的索引。我们点击上面的按钮,这样我们可以在 Discover 的页面中进行查看:

image.png


很显然这不是一个时序的数据。在这个页面,我们可以查看这个数据集的各个字段,比如面积,多少个 bed rooms,多少个 bath rooms 地理位置信息等。

 

在进行下面的操作之前,我们先来创建一个运行时字段 bedrooms_per_bath,它表示一个

bathroom 对应于多少个 bedrooms。这对于有些客户来说,也是一个比较感兴趣的参数。打开 Kibana:

image.png


image.png

image.png

我们把如下的脚本填入到 Define script 框中:

if(doc['bathrooms'].value == 0) {
  emit(0);
} else {
    emit((double)doc['bedrooms'].value/(double)doc['bathrooms'].value);
}

点击 Save 按钮。这样我们就生成了一个叫做 bedrooms_per_bath 的动态字段。


image.png



《Elastic Stack 实战手册》——三、产品能力——3.5 进阶篇——3.5.16. Machine learning——3.5.16.4.Data frame analytics(3) https://developer.aliyun.com/article/1227191

相关实践学习
以电商场景为例搭建AI语义搜索应用
本实验旨在通过阿里云Elasticsearch结合阿里云搜索开发工作台AI模型服务,构建一个高效、精准的语义搜索系统,模拟电商场景,深入理解AI搜索技术原理并掌握其实现过程。
ElasticSearch 最新快速入门教程
本课程由千锋教育提供。全文搜索的需求非常大。而开源的解决办法Elasricsearch(Elastic)就是一个非常好的工具。目前是全文搜索引擎的首选。本系列教程由浅入深讲解了在CentOS7系统下如何搭建ElasticSearch,如何使用Kibana实现各种方式的搜索并详细分析了搜索的原理,最后讲解了在Java应用中如何集成ElasticSearch并实现搜索。  
相关文章
|
传感器 机器学习/深度学习 数据采集
【航迹关联】基于NNDA、PDA、JPDA三种算法实现航迹关联附matlab代码
【航迹关联】基于NNDA、PDA、JPDA三种算法实现航迹关联附matlab代码
1476 0
|
6月前
|
弹性计算 运维 安全
阿里云服务器镜像怎么选?公共、自定义、共享、云市场、社区镜像区别、适用群体与选择指南
在选择阿里云ECS服务器时,镜像选择至关重要,决定了服务器的初始环境、预装软件及运维复杂度。阿里云提供公共、自定义、共享、云市场和社区五大类镜像。公共镜像适合新手、资深运维及有合规要求的企业;自定义镜像适合中大型企业及需快速复制环境的用户;共享镜像适合团队协作;云市场镜像适合缺乏运维经验的用户;社区镜像适合技术极客及开源爱好者。用户应根据需求、成本、权限、地域及技术支持等因素,选择最适合的镜像。
828 3
|
3月前
|
Ubuntu 关系型数据库 Docker
Docker 跑 Memos 镜像:私有 Markdown 笔记部署实测记录
Memos 是一款开源、可自托管的轻量笔记工具:镜像仅约20MB,SQLite默认存储,一条 `docker run` 即可启动;浏览器写Markdown、打#标签、按时间线浏览,手机电脑同步,数据完全掌握在自己服务器上。
430 0
Docker 跑 Memos 镜像:私有 Markdown 笔记部署实测记录
|
3月前
|
人工智能 数据可视化 机器人
5个硬性指标:海外仓跨境呼叫中心选型,区域分配准确率98%+背后的技术能力盘点
本文深度解析海外仓跨境客服选型困境与方案,聚焦多渠道统一接入、区域/经理精准分配(≥98%)、AI对接物流接口、全链路质控、高稳定性(SLA≥99.9%)五大硬指标,横向对比合力亿捷等5家主流厂商,为中大型海外仓企业提供可落地的选型决策依据。(239字)
213 0
|
10月前
|
人工智能 缓存 运维
【本不该故障系列】从 runC 到 runD:SAE 如何化解安全泄露风险
阿里云SAE默认采用runD安全容器,通过轻量虚拟化实现硬件级隔离,彻底解决runC共享内核导致的逃逸、噪声邻居、侧信道攻击等多租户安全风险。
|
11月前
|
传感器 运维 前端开发
Python离群值检测实战:使用distfit库实现基于分布拟合的异常检测
本文解析异常(anomaly)与新颖性(novelty)检测的本质差异,结合distfit库演示基于概率密度拟合的单变量无监督异常检测方法,涵盖全局、上下文与集体离群值识别,助力构建高可解释性模型。
744 10
Python离群值检测实战:使用distfit库实现基于分布拟合的异常检测
|
9月前
|
运维 监控 数据可视化
别再手画 Visio 了!如何实现 L2/L3 层网络拓扑自动发现与实时监控?
运维十年老兵感慨:网络故障如黑屋寻针。OpManager以SNMP自动构建动态拓扑,实现全网可视,精准定位根因,屏蔽无效告警,让运维从“盲人摸象”变为“一目了然”,真正掌控复杂环境。
269 0
|
11月前
|
数据采集 缓存 大数据
【赵渝强老师】大数据日志采集引擎Flume
Apache Flume 是一个分布式、可靠的数据采集系统,支持从多种数据源收集日志信息,并传输至指定目的地。其核心架构由Source、Channel、Sink三组件构成,通过Event封装数据,保障高效与可靠传输。
571 1
|
人工智能 安全 API
构建面向未来的数据安全技术建设方案
以 数据分类分级(DC/CG) 为核心策略,按 “先行业领域、后业务属性” 建立 4–5 级密级体系,并把密级标签写入数据目录 / API / 日志。 围绕 API 与数据流 落地 发现 → 识别 → 分级 → 策略编排 → 实时监测与留痕 的全生命周期控制。 零信任 + 微隔离 配合 IAM/ABAC/MFA 执行最小权限与动态授权;高密级走审批流 + JIT。 加密 / 脱敏 / 令牌化 按密级差异化,DLP 联动出境 / 合规流程;UEBA + SOAR 驱动持续运营。 与 《数据安全法》《个人信息保护法》《网络数据安全管理条例(2024)》、GB/T 43697-2024 对标并可审计

热门文章

最新文章