Python网络爬虫实战-抓取百合网真实相亲数据

简介: 百合网是一个相亲网站,里面拥有一些真实的妹子数据,如何抓取该网站的数据内容呢,接下来随我一探糗竟吧!

第一步:分析网页流程,确定目标

进入百合网首页,分析要抓取的数据内容

image.png

进入到首页推荐表的妹子界面 设置好筛选的条件;可以看到更多展示的妹子。这也是我们接下来要抓取的。

image.png

每张图片点开后 都有相应的详细介绍;比如我们要抓取的数据是 【名字、年龄、身高 、学历、婚姻使、自我介绍等】

image.png

第二步:请求网络网站,获取网页数据

import requests

import json

from lxml import etree

import pandas as pd

cookies = {

   'orderSource': '10130301',

   'accessID': '20220525160212300807',

   'lastLoginDate': 'Wed%20May%2025%202022%2016%3A02%3A12%20GMT+0800%20%28%u4E2D%u56FD%u6807%u51C6%u65F6%u95F4%29',

   'accessToken': 'BH1653465732565956999',

   'Hm_lvt_5caa30e0c191a1c525d4a6487bf45a9d': '1653465735',

   'tempID': '2328584815',

   'NTKF_T2D_CLIENTID': 'guest46B34559-18E8-1BB5-1B84-FA3D400112EF',

   'AuthCookie': '4BFFD62B611D896E561FCDFCA2AC50840C888FC5354A7C8F02C453B1F486849BA543E98E4E32B2920B4F70C256EF513E1B711A8BC10FC1DF9BF608CB30C4F468740A0A3FA06C20992D2ABCEAC15741654D3542C75E463CD2',

   'AuthMsgCookie': 'DF8460C627701442B7016AED70C6828D82D7E467447C72E69E49D2A6B8815481FFB474631E375FBDED51DD0A0BDFCBB06E580573940DA59132515B2BEA677360104068C9C41BBE1272765712500DB8532613ED82D5EDBD2F',

   'GCUserID': '307535896',

   'OnceLoginWEB': '307535896',

   'LoginEmail': '15565222558%40mobile.baihe.com',

   'userID': '307535896',

   'spmUserID': '307535896',

   'nTalk_CACHE_DATA': '{uid:kf_9847_ISME9754_307535896,tid:1653465759744600}',

   'AuthTokenCookie': 'bh.1653466069969_1800.04BE6CEADC682D6A9E8630E1E15B85A5190CC534.bhkOo8o.6',

   'noticeEvent_307535896': '25',

   'hasphoto': '1',

   'AuthCheckStatusCookie': '745B4B48B7EA1CC7BFDEB8D850A700D714D1D3015978705726A127B203C4931405E9D878DCC812E7',

   'tgw_l7_route': '0dd999c63b312678b82b8668ba91d54d',

   'Hm_lpvt_5caa30e0c191a1c525d4a6487bf45a9d': '1653466330',

   '_fmdata': 'Ewvc1t%2BSwfMTVNcjWwP%2B0uotvg7udIoQjotCEf9E17Cze%2FAmFlYoO9ck5kXksZIVSuxOcxl68ouCRX%2FOxc4Mjv2RNI6Ek7XQ8L5kbQaMQeA%3D',

}

headers = {

   'Connection': 'keep-alive',

   'Pragma': 'no-cache',

   'Cache-Control': 'no-cache',

   'Accept': 'text/javascript, application/javascript, application/ecmascript, application/x-ecmascript, */*; q=0.01',

   'X-Requested-With': 'XMLHttpRequest',

   'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.117 Safari/537.36',

   'Content-Type': 'application/x-www-form-urlencoded; charset=UTF-8',

   'Origin': 'https://search.baihe.com',

   'Sec-Fetch-Site': 'same-origin',

   'Sec-Fetch-Mode': 'cors',

   'Referer': 'https://search.baihe.com/',

   'Accept-Language': 'zh-CN,zh;q=0.9',

}

data = {

   'minAge': '19',

   'maxAge': '28',

   'minHeight': '155',

   'maxHeight': '170',

   'education': '1-7',

   'loveType': '',

   'marriage': '',

   'income': '1-6',

   'city': '8611',

   'nationality': '',

   'occupation': '',

   'children': '',

   'bloodType': '',

   'constellation': '',

   'religion': '',

   'online': '',

   'isPayUser': '',

   'isCreditedByAuth': '',

   'hasPhoto': '1',

   'housing': '',

   'car': '',

   'homeDistrict': '',

   'page': '1',

   'sorterField': '1',

}

response = requests.post('https://search.baihe.com/Search/getUserID?&jsonCallBack=jQuery183046819546986330085_1653466343209', cookies=cookies, headers=headers, data=data).text

data = response.lstrip('jQuery183046819546986330085_1653466343209(').rstrip(');')

data=json.loads(data)

data = data['data']

print(data)

image.png

第三步:筛选、解析数据 提取

# 存储数据
name=[]

age=[]

hg=[]

x_l=[]

city=[]

h_p=[]

content=[]

for item_id in data:
   # 拼接 url
   url = 'https://profile1.baihe.com/?oppID='+item_id

   response_2 = requests.get(url,headers=headers, cookies=cookies).text

   html=etree.HTML(response_2)

   # 姓名
   name.append(html.xpath('//div[@class="name"]/span[2]/text()')[0])

   # 年龄
   age.append(html.xpath('//div[@class="inter"]/p/text()')[0])

   # 身高
   hg.append(html.xpath('//div[@class="inter"]/p/text()')[1])

   # 学历
   x_l.append(html.xpath('//div[@class="inter"]/p/text()')[2])

   # 所在城市
   city.append(html.xpath('//div[@class="inter"]/p/text()')[3])

   # 是否婚配
   h_p.append(html.xpath('//div[@class="inter"]/p/text()')[4])

   # 自我介绍
   content.append(html.xpath('//div[@class="intr"]/text()')[0])

   print(name,age,hg,x_l,city,h_p,content)

image.png

第四步:持久化保存数据

df = pd.DataFrame()

df['网名']=name

df['年龄']=age

df['身高']=hg

df['学历']=x_l

df['所在城市']=city

df['是否婚配']=h_p

df['自我介绍']=content

df.to_excel('百合网Demo.xls',encoding='utf-8',index=False)

image.png

如此即可获取所有妹子数据,更多的信息,可以按照我的这种方式自己尝试获取呀!

有收获的话 ,可以点赞、关注奥 。

相关文章
|
10月前
|
数据采集 Web App开发 数据安全/隐私保护
实战:Python爬虫如何模拟登录与维持会话状态
实战:Python爬虫如何模拟登录与维持会话状态
|
10月前
|
数据采集 Web App开发 数据可视化
Python零基础爬取东方财富网股票行情数据指南
东方财富网数据稳定、反爬宽松,适合爬虫入门。本文详解使用Python抓取股票行情数据,涵盖请求发送、HTML解析、动态加载处理、代理IP切换及数据可视化,助你快速掌握金融数据爬取技能。
8304 1
|
10月前
|
运维 监控 数据可视化
Python 网络请求架构——统一 SOCKS5 接入与配置管理
通过统一接入端点与标准化认证,集中管理配置、连接策略及监控,实现跨技术栈的一致性网络出口,提升系统稳定性、可维护性与可观测性。
|
10月前
|
Java 数据挖掘 数据处理
(Pandas)Python做数据处理必选框架之一!(一):介绍Pandas中的两个数据结构;刨析Series:如何访问数据;数据去重、取众数、总和、标准差、方差、平均值等;判断缺失值、获取索引...
Pandas 是一个开源的数据分析和数据处理库,它是基于 Python 编程语言的。 Pandas 提供了易于使用的数据结构和数据分析工具,特别适用于处理结构化数据,如表格型数据(类似于Excel表格)。 Pandas 是数据科学和分析领域中常用的工具之一,它使得用户能够轻松地从各种数据源中导入数据,并对数据进行高效的操作和分析。 Pandas 主要引入了两种新的数据结构:Series 和 DataFrame。
774 0
|
10月前
|
JSON 算法 API
Python采集淘宝商品评论API接口及JSON数据返回全程指南
Python采集淘宝商品评论API接口及JSON数据返回全程指南
|
10月前
|
JSON API 数据安全/隐私保护
Python采集淘宝拍立淘按图搜索API接口及JSON数据返回全流程指南
通过以上流程,可实现淘宝拍立淘按图搜索的完整调用链路,并获取结构化的JSON商品数据,支撑电商比价、智能推荐等业务场景。
|
10月前
|
数据采集 运维 监控
爬虫与自动化技术深度解析:从数据采集到智能运维的完整实战指南
本文系统解析爬虫与自动化核心技术,涵盖HTTP请求、数据解析、分布式架构及反爬策略,结合Scrapy、Selenium等框架实战,助力构建高效、稳定、合规的数据采集系统。
1376 62
爬虫与自动化技术深度解析:从数据采集到智能运维的完整实战指南
|
10月前
|
数据采集 机器学习/深度学习 人工智能
反爬虫机制深度解析:从基础防御到高级对抗的完整技术实战
本文系统阐述了反爬虫技术的演进与实践,涵盖基础IP限制、User-Agent检测,到验证码、行为分析及AI智能识别等多层防御体系,结合代码实例与架构图,全面解析爬虫攻防博弈,并展望智能化、合规化的发展趋势。
3185 62
反爬虫机制深度解析:从基础防御到高级对抗的完整技术实战
|
10月前
|
机器学习/深度学习 大数据 关系型数据库
基于python大数据的青少年网络使用情况分析及预测系统
本研究基于Python大数据技术,构建青少年网络行为分析系统,旨在破解现有防沉迷模式下用户画像模糊、预警滞后等难题。通过整合多平台亿级数据,运用机器学习实现精准行为预测与实时干预,推动数字治理向“数据驱动”转型,为家庭、学校及政府提供科学决策支持,助力青少年健康上网。
|
10月前
|
数据采集 人工智能 JSON
Prompt 工程实战:如何让 AI 生成高质量的 aiohttp 异步爬虫代码
Prompt 工程实战:如何让 AI 生成高质量的 aiohttp 异步爬虫代码

推荐镜像

更多