Python爬虫-爬取贴吧中每个帖子内的楼主图片

简介: 1.根据输入的关键字筛选贴吧 2.获得贴吧内的帖子,支持分页爬取 3.爬取并下载帖子内仅和楼主相关的图片


# -*- coding:utf-8 -*-

import urllib.request
from lxml import etree


def loadPage(url):
	"""
	 作用:根据url发送请求,获取服务器响应文件
	 url: 需要爬取的url地址
	"""
	# headers = {"User-Agent" : "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11"}
	
	request = urllib.request.Request(url)
	html = urllib.request.urlopen(request).read()
	# 解析HTML文档为HTML DOM模型
	content = etree.HTML(html)
	# print content
	# 返回所有匹配成功的列表集合
	link_list = content.xpath('//div[@class="t_con cleafix"]/div/div/div/a/@href')
	
	# link_list = content.xpath('//a[@class="j_th_tit"]/@href')
	for link in link_list:
		fulllink = "http://tieba.baidu.com" + link
		# 组合为每个帖子的链接
		# print link
		loadImage(fulllink)


# 取出每个帖子里的每个图片连接
def loadImage(link):
	headers = {
		"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}
	request = urllib.request.Request(link, headers=headers)
	html = urllib.request.urlopen(request).read()
	# 解析
	content = etree.HTML(html)
	# 取出帖子里每层层主发送的图片连接集合
	# link_list = content.xpath('//img[@class="BDE_Image"]/@src')
	# link_list = content.xpath('//div[@class="post_bubble_middle"]')
	link_list = content.xpath('//img[@class="BDE_Image"]/@src')
	# 取出每个图片的连接
	for link in link_list:
		print("link:" + link)
		writeImage(link)


def writeImage(link):
	"""
	 作用:将html内容写入到本地
	 link:图片连接
	"""
	# print "正在保存 " + filename
	headers = {
		"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}
	# 文件写入
	request = urllib.request.Request(link, headers=headers)
	# 图片原始数据
	image = urllib.request.urlopen(request).read()
	# 取出连接后10位做为文件名
	filename = link[-10:]
	# 写入到本地磁盘文件内
	with open("/Users/didi/Downloads/crawlertest/" + filename, "wb") as f:
		f.write(image)
	# print("已经成功下载 " + filename)


def tiebaSpider(url, beginPage, endPage):
	"""
	 作用:贴吧爬虫调度器,负责组合处理每个页面的url
	 url : 贴吧url的前部分
	 beginPage : 起始页
	 endPage : 结束页
	"""
	for page in range(beginPage, endPage + 1):
		pn = (page - 1) * 50
		filename = "第" + str(page) + "页.html"
		print(filename)
		fullurl = url + "&pn=" + str(pn)
		print(fullurl)
		loadPage(fullurl)
		# print html
		
		print("下载完成")


if __name__ == "__main__":
	kw = input("请输入需要爬取的贴吧名:")
	beginPage = int(input("请输入起始页:"))
	endPage = int(input("请输入结束页:"))
	
	url = "http://tieba.baidu.com/f?"
	key = urllib.parse.urlencode({"kw": kw})
	fullurl = url + key
	tiebaSpider(fullurl, beginPage, endPage)


相关文章
|
10月前
|
机器学习/深度学习 编解码 Python
Python图片上采样工具 - RealESRGANer
Real-ESRGAN基于深度学习实现图像超分辨率放大,有效改善传统PIL缩放的模糊问题。支持多种模型版本,推荐使用魔搭社区提供的预训练模型,适用于将小图高质量放大至大图,放大倍率越低效果越佳。
787 3
|
10月前
|
机器学习/深度学习 文字识别 Java
Python实现PDF图片OCR识别:从原理到实战的全流程解析
本文详解2025年Python实现扫描PDF文本提取的四大OCR方案(Tesseract、EasyOCR、PaddleOCR、OCRmyPDF),涵盖环境配置、图像预处理、核心识别与性能优化,结合财务票据、古籍数字化等实战场景,助力高效构建自动化文档处理系统。
2587 0
|
数据采集 Web App开发 JavaScript
基于Selenium的Python爬虫抓取动态App图片
基于Selenium的Python爬虫抓取动态App图片
1098 68
|
12月前
|
数据采集 存储 监控
Python爬虫实战:批量下载亚马逊商品图片
Python爬虫实战:批量下载亚马逊商品图片
|
存储 机器学习/深度学习 人工智能
多模态RAG实战指南:完整Python代码实现AI同时理解图片、表格和文本
本文探讨了多模态RAG系统的最优实现方案,通过模态特定处理与后期融合技术,在性能、准确性和复杂度间达成平衡。系统包含文档分割、内容提取、HTML转换、语义分块及向量化存储五大模块,有效保留结构和关系信息。相比传统方法,该方案显著提升了复杂查询的检索精度(+23%),并支持灵活升级。文章还介绍了查询处理机制与优势对比,为构建高效多模态RAG系统提供了实践指导。
2907 0
多模态RAG实战指南:完整Python代码实现AI同时理解图片、表格和文本
|
数据采集 存储 JSON
Python网络爬虫:Scrapy框架的实战应用与技巧分享
【10月更文挑战第27天】本文介绍了Python网络爬虫Scrapy框架的实战应用与技巧。首先讲解了如何创建Scrapy项目、定义爬虫、处理JSON响应、设置User-Agent和代理,以及存储爬取的数据。通过具体示例,帮助读者掌握Scrapy的核心功能和使用方法,提升数据采集效率。
722 6
|
数据采集 JSON 前端开发
Python爬虫进阶:使用Scrapy库进行数据提取和处理
在我们的初级教程中,我们介绍了如何使用Scrapy创建和运行一个简单的爬虫。在这篇文章中,我们将深入了解Scrapy的强大功能,学习如何使用Scrapy提取和处理数据。
|
数据采集 前端开发 中间件
Python网络爬虫:Scrapy框架的实战应用与技巧分享
【10月更文挑战第26天】Python是一种强大的编程语言,在数据抓取和网络爬虫领域应用广泛。Scrapy作为高效灵活的爬虫框架,为开发者提供了强大的工具集。本文通过实战案例,详细解析Scrapy框架的应用与技巧,并附上示例代码。文章介绍了Scrapy的基本概念、创建项目、编写简单爬虫、高级特性和技巧等内容。
770 4
|
数据采集 存储 中间件
Python进行网络爬虫:Scrapy框架的实践
【8月更文挑战第17天】网络爬虫是自动化程序,用于从互联网收集信息。Python凭借其丰富的库和框架成为构建爬虫的首选语言。Scrapy作为一款流行的开源框架,简化了爬虫开发过程。本文介绍如何使用Python和Scrapy构建简单爬虫:首先安装Scrapy,接着创建新项目并定义爬虫,指定起始URL和解析逻辑。运行爬虫可将数据保存为JSON文件或存储到数据库。此外,Scrapy支持高级功能如中间件定制、分布式爬取、动态页面渲染等。在实践中需遵循最佳规范,如尊重robots.txt协议、合理设置爬取速度等。通过本文,读者将掌握Scrapy基础并了解如何高效地进行网络数据采集。
|
数据采集 存储 JSON
Python爬虫开发:BeautifulSoup、Scrapy入门
在现代网络开发中,网络爬虫是一个非常重要的工具。它可以自动化地从网页中提取数据,并且可以用于各种用途,如数据收集、信息聚合和内容监控等。在Python中,有多个库可以用于爬虫开发,其中BeautifulSoup和Scrapy是两个非常流行的选择。本篇文章将详细介绍这两个库,并提供一个综合详细的例子,展示如何使用它们来进行网页数据爬取。

推荐镜像

更多