【云上ELK系列】阿里云Elasticsearch的Apache日志分析实践

简介: 阿里云Elasticsearch采集上游数据的方式有很多种,其中有一个与开源完全兼容的方案:通过logstash及logstash周围的强大的plugin实现数据采集。 首先我们需要在ECS中来安装部署logstash,购买阿里云ECS服务,准备1.8以上版本的JDK。

阿里云Elasticsearch采集上游数据的方式有很多种,其中有一个与开源完全兼容的方案:通过logstash及logstash周围的强大的plugin实现数据采集。

首先我们需要在ECS中来安装部署logstash,购买阿里云ECS服务,准备1.8以上版本的JDK。

wget https://artifacts.elastic.co/downloads/logstash/logstash-5.5.3.tar.gz

解压安装

tar -xzvf logstash-5.5.3.tar.gz

通过logstash来做数据写elasticsearch的方案,我们需要创建一个logstash的管道,logstash的管道分为三个部分:

input {   
}
# 该部分被注释,表示filter是可选的
filter {  
}
output {   
}
  • 其中input中配置数据源;
  • output中配置目标源;
  • filter是可选配的部分,一般会配置数据过滤的逻辑;

这部分配置很简单,在logstash的目录下创建一个.conf的文件,按照上述的格式配置input和output:

input {
    file {
        path => "/usr/local/demoData/*.log"
        start_position => beginning
    }
}
output {
    elasticsearch {
        hosts => ["http://*******************:9200"]
        user => "*******"
        password => "***********"
    }
}

注:阿里云elasticsearch由于预置了X-Pack插件,所有的访问均需要做认证,您的output中需要配置username和password信息。

这次我希望将阿里云ECS上经常产生的Apache日志indexing到elasticsearch中,可以将logstash直接部署在web server所在的ECS中,如果担心影响业务,可以部署在网络可达的另一台ECS中。

注:logstash的input支持很多输入形式,如果将logstash部署在网络可达的另一台ECS中,则需要配置http的input格式模板,具体可以参考文档:

input {
 http {
      host => "**********"
   port => "**********"
 }
}

由于阿里云Elasticsearch部署在VPC环境内,如果部署logstash的ECS处于经典网络,需要通过Classiclink的方式与VPC做打通

接下来介绍如何通过logstash的filter快速解析Apache日志
Apache日志中一般会包含如下信息:
|Information|Field Name|
|-----------|----------|
|IP Address |clientip |
|User ID |ident |
|User Authentication|auth|
|timestamp | timestamp|
|HTTP Verb | verb|
|Request body | request|
|HTTP Version | httpversion|
|HTTP Status Code|response|
|Bytes served|bytes|
|Referrer URL|referrer|
|User agent|agent|

假设我们希望从日志中发觉一些用户分布的信息,并且让不关系技术的运营同学可以直观的感受到,我们选择用Gork过滤器来解析Apache网络日志。

filter {
    grok {
        match => { "message" => "%{COMBINEDAPACHELOG}"}
    }
}

可以将原始的日志信息:

66.249.73.135 - - [04/Jan/2015:05:30:06 +0000] "GET /blog/web/firefox-scrolling-fix.html HTTP/1.1" 200 8956 "-" "Mozilla/5.0 (iPhone; CPU iPhone OS 6_0 like Mac OS X) AppleWebKit/536.26 (KHTML, like Gecko) Version/6.0 Mobile/10A5376e Safari/8536.25 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"

过滤成标准的Json结构:

{
"clientip" : "66.249.73.135",
"ident" : ,
"auth" : ,
"timestamp" : "04/Jan/2015:05:30:06 +0000",
"verb" : "GET",
"request" : "/blog/web/firefox-scrolling-fix.html",
"httpversion" : "HTTP/1.1",
"response" : "200",
"bytes" : "8956",
"referrer" : "http://www.google.com/bot.html",
"agent" : "Mozilla/5.0 (iPhone; CPU iPhone OS 6_0 like Mac OS X) AppleWebKit/536.26 (KHTML, like Gecko) Version/6.0 Mobile/10A5376e Safari/8536.25"
}

其中,我们可以通过IP来解析用户访问地址信息(当然这个是不准确的),方式是使用 geoip 插件来完成。

filter {
    geoip {
        source => "clientip"
    }
}

根据IP查对应的地址信息,并将地址信息作为 geoip 字段写入日志信息中。
geoip可以查询IP,获取如下的描述信息:

"geoip":{
        "timezone":"America/Los_Angeles",
        "ip":"66.249.73.135",
        "latitude":37.419200000000004,
        "continent_code":"NA",
        "city_name":"Mountain View",
        "country_name":"United States",
        "country_code2":"US",
        "dma_code":807,
        "country_code3":"US",
        "region_name":"California",
        "location":{
               "lon":-122.0574,
               "lat":37.419200000000004
        },
        "postal_code":"94043",
        "region_code":"CA",
        "longitude":-122.0574
},

我们可以通过geoip中的坐标信息,如location,在Kibana中做基于地图的访问人群分布的可视化展现了。
undefined

通过上述描述的方式,我们可以批量的处理ECS中的日志信息,并在Kibana中完成配置,最终获取如下的展示效果:
image.png | center | 704x395

参考文档《Configuring Logstash》

相关实践学习
以电商场景为例搭建AI语义搜索应用
本实验旨在通过阿里云Elasticsearch结合阿里云搜索开发工作台AI模型服务,构建一个高效、精准的语义搜索系统,模拟电商场景,深入理解AI搜索技术原理并掌握其实现过程。
ElasticSearch 最新快速入门教程
本课程由千锋教育提供。全文搜索的需求非常大。而开源的解决办法Elasricsearch(Elastic)就是一个非常好的工具。目前是全文搜索引擎的首选。本系列教程由浅入深讲解了在CentOS7系统下如何搭建ElasticSearch,如何使用Kibana实现各种方式的搜索并详细分析了搜索的原理,最后讲解了在Java应用中如何集成ElasticSearch并实现搜索。  
相关文章
|
消息中间件 Java Kafka
搭建ELK日志收集,保姆级教程
本文介绍了分布式日志采集的背景及ELK与Kafka的整合应用。传统多服务器环境下,日志查询效率低下,因此需要集中化日志管理。ELK(Elasticsearch、Logstash、Kibana)应运而生,但单独使用ELK在性能上存在瓶颈,故结合Kafka实现高效的日志采集与处理。文章还详细讲解了基于Docker Compose构建ELK+Kafka环境的方法、验证步骤,以及如何在Spring Boot项目中整合ELK+Kafka,并通过Logback配置实现日志的采集与展示。
1505 64
搭建ELK日志收集,保姆级教程
|
存储 监控 安全
实时记录和查看Apache 日志
Apache 是一个开源、跨平台的 Web 服务器,保护其平台需监控活动和事件。Apache 日志分为访问日志和错误日志,分别记录用户请求和服务器错误信息。EventLog Analyzer 是一款强大的日志查看工具,提供集中收集、分析、实时警报和安全监控功能,帮助管理员识别趋势、检测威胁并确保合规性。通过直观的仪表板和自动化响应,它简化了大规模日志管理,增强了 Apache 服务器的安全性和性能。
535 5
|
数据可视化 关系型数据库 MySQL
ELK实现nginx、mysql、http的日志可视化实验
通过本文的步骤,你可以成功配置ELK(Elasticsearch, Logstash, Kibana)来实现nginx、mysql和http日志的可视化。通过Kibana,你可以直观地查看和分析日志数据,从而更好地监控和管理系统。希望这些步骤能帮助你在实际项目中有效地利用ELK来处理日志数据。
1069 90
|
存储 SQL Apache
为什么 Apache Doris 是比 Elasticsearch 更好的实时分析替代方案?
本文将从技术选型的视角,从开放性、系统架构、实时写入、实时存储、实时查询等多方面,深入分析 Apache Doris 与 Elasticsearch 的能力差异及性能表现
2117 17
为什么 Apache Doris 是比 Elasticsearch 更好的实时分析替代方案?
|
监控 安全 BI
优化 Apache 日志记录的 5 个最佳实践
Apache 日志记录对于维护系统运行状况和网络安全至关重要,其核心包括访问日志与错误日志的管理。通过制定合理的日志策略,如选择合适的日志格式、利用条件日志减少冗余、优化日志级别、使用取证模块提升安全性及实施日志轮换,可有效提高日志可用性并降低系统负担。此外,借助 Eventlog Analyzer 等专业工具,能够实现日志的高效收集、可视化分析与威胁检测,从而精准定位安全隐患、评估服务器性能,并满足合规需求,为强化网络安全提供有力支持。
408 0
优化 Apache 日志记录的 5 个最佳实践
|
人工智能 运维 监控
Aipy实战:分析apache2日志中的网站攻击痕迹
Apache2日志系统灵活且信息全面,但安全分析、实时分析和合规性审计存在较高技术门槛。为降低难度,可借助AI工具如aipy高效分析日志,快速发现攻击痕迹并提供反制措施。通过结合AI与学习技术知识,新手运维人员能更轻松掌握复杂日志分析任务,提升工作效率与技能水平。
|
存储 运维 监控
金融场景 PB 级大规模日志平台:中信银行信用卡中心从 Elasticsearch 到 Apache Doris 的先进实践
中信银行信用卡中心每日新增日志数据 140 亿条(80TB),全量归档日志量超 40PB,早期基于 Elasticsearch 构建的日志云平台,面临存储成本高、实时写入性能差、文本检索慢以及日志分析能力不足等问题。因此使用 Apache Doris 替换 Elasticsearch,实现资源投入降低 50%、查询速度提升 2~4 倍,同时显著提高了运维效率。
1353 3
金融场景 PB 级大规模日志平台:中信银行信用卡中心从 Elasticsearch 到 Apache Doris 的先进实践
|
存储 机器学习/深度学习 人工智能
Elasticsearch:使用阿里云 AI 服务进行向量化和重新排名
本文介绍了如何将阿里云 AI 功能与 Elasticsearch 集成,以提高语义搜索的相关性。
1016 0
|
存储 弹性计算 运维
海量日志接入 Elasticsearch Serverless 应用降本70%以上
本文将探讨在日志场景下,使用阿里云Elasticsearch Serverless相较于基于ECS自建Elasticsearch集群的成本与性能优势,展示如何通过Serverless架构实现高达 70%以上的成本节约。
1233 0
|
存储 消息中间件 网络协议
日志平台-ELK实操系列(一)
日志平台-ELK实操系列(一)

热门文章

最新文章

相关产品

  • 检索分析服务 Elasticsearch版
  • 推荐镜像

    更多