如何用Beautiful Soup解析HTML内容

简介: 如何用Beautiful Soup解析HTML内容

Beautiful Soup是一种Python的解析库,主要用于解析和处理HTML/XML内容。它是基于Python的标准库和第三方库的结合,能够提供简便的方式实现文本的查找、修改和提取操作。

HTML指的是超文本标记语言(Hypertext Markup Language),即一种用于描述网页内容的标记语言。在我们访问一个网页的时候,浏览器便会将HTML内容下载到本地并以可视化的形式展示给我们。但是,在程序员的世界里我们需要能够对HTML内容进行更多的操作,而Beautiful Soup就是这种工具之一。

Beautiful Soup能够解析HTML内容并转化成一个复杂的树结构,然后可以通过标签名、属性名等多种方式进行内容的查找和修改。使用Beautiful Soup不仅能够让我们更高效地处理HTML内容,而且还能避免很多手动操作引起的误差。

下面我们来详细介绍Beautiful Soup的使用方式和应用场景。

Beautiful Soup的使用

Beautiful Soup提供的解析器有bs3、bs4,其中bs3逐渐被弃用,目前bs4为最新版。我们主要介绍bs4的使用。

首先,我们需要安装Beautiful Soup库。在终端输入以下命令:

pip install beautifulsoup4

安装成功后,我们通过import语句将Beautiful Soup库引入程序中。

from bs4 import BeautifulSoup

接下来假设我们有一个HTML文本:

<html>
  <head>
    <title>Beautiful Soup Tutorial</title>
  </head>
  <body>
    <div class="article">
      <h1>Python BeautifulSoup Tutorial</h1>
      <p class="intro">这是一篇Beautiful Soup入门教程</p>
      <p class="content">它将介绍Beautiful Soup的基本用法以及一些高级的应用场景</p>
      <a class="link" href="http://www.example.com">点击访问示例网站</a>
    </div>
  </body>
</html>

我们可以通过以下语句将HTML文本解析成BeautifulSoup对象:

soup = BeautifulSoup(html_doc, 'html.parser')

其中,html_doc为上述HTML文本,'html.parser’为指定的解析器。

标签选择器

Beautiful Soup提供了多种标签选择器,能够便捷地从HTML文本中选择需要的内容。

  • 选择标签名为h1的元素:
soup.select('h1')

结果为:

[<h1>Python BeautifulSoup Tutorial</h1>]
  • 选择标签名为p且class属性为“intro”的元素:
soup.select('p.intro')

结果为:

[<p class="intro">这是一篇Beautiful Soup入门教程</p>]
  • 选择标签名为a且class属性为“link”的元素,其href属性的值为"http://www.example.com":
soup.select('a.link[href="http://www.example.com"]')

结果为:

[<a class="link" href="http://www.example.com">点击访问示例网站</a>]

标签树操作

我们可以通过Beautiful Soup的树型结构,对HTML文本进行各种查找与修改操作。

  • 嵌套选择标签

可以通过嵌套选择标签,定位到HTML文本中需要的标签,例如选择“div”标签下的所有“p”标签。

content = soup.select('div.article > p')

可以看到,选择结果为两个“p”标签。

[<p class="intro">这是一篇Beautiful Soup入门教程</p>, 
 <p class="content">它将介绍Beautiful Soup的基本用法以及一些高级的应用场景</p>]
  • .string/.text属性获取标签内容

可以通过.string属性或.text属性获取标签内的文本内容。

例如,获取标题“h1”标签内的文本内容:

title = soup.select('h1')[0].string
print(title)

输出结果为:

Python BeautifulSoup Tutorial

可以看到,.string相比于.text属性更加精确,可以避免获取到标签内的其他内容干扰。

  • .get()方法获取标签属性值

可以通过.get()方法获取标签内的属性值。例如,获取“a”标签的href属性值:

link = soup.select('a.link')[0].get('href')
print(link)

输出结果为:

http://www.example.com

修改HTML文本

除了查找与获取HTML文本的内容,我们还可以使用Beautiful Soup对HTML文本进行修改操作。

  • 修改标签属性值

通过tag对象的.attrs属性可以获取标签的属性,使用该属性进行修改操作。

例如,将“a”标签的href属性值修改为“http://www.newexample.com”:

link_tag = soup.select('a.link')[0]
link_tag['href'] = 'http://www.newexample.com'
print(link_tag)

可以看到,输出结果中href属性值已经被修改。

<a class = "link" href = "http://www.newexample.com">点击访问示例网站</a>
  • 修改标签文本内容

通过tag对象的.string属性或replace_with()方法可以修改标签的文本内容。

例如,将第一个“p”标签的文本修改为“欢迎来到Beautiful Soup教程”:

p_tag = soup.select('p.intro')[0]
p_tag.string = '欢迎来到Beautiful Soup教程'
print(p_tag)

输出结果为:

<p class = "intro">欢迎来到Beautiful Soup教程</p>
  • 增加标签和删除标签

我们可以使用Beautiful Soup提供的函数,例如new_tag()、new_string()、append()和insert()等方法,创建新标签或文本,并插入HTML文本当中。

例如,我们通过append()方法在“body”标签的末尾增加一个“div”标签:

new_div = soup.new_tag('div')
new_div.string = '这是Beautiful Soup教程的结尾'
soup.select('body')[0].append(new_div)
print(soup)

可以看到,输出结果中的HTML文本结尾增加了一个新的“div”标签。

应用场景

美食网站信息爬取

我们将以美食网站中的“热门排行榜”为例进行演示。

首先,我们需要通过requests库获取HTML文本。以“热门排行榜”页面为例:

import requests
from bs4 import BeautifulSoup
 
url = 'https://www.meishij.net/chufang/diy/diy_rmphb/'
html = requests.get(url)
soup = BeautifulSoup(html.text, 'html.parser')

我们可以通过观察HTML文本,发现热门排行榜的信息在“div”标签中,具体位置在“div.zg_wrap”标签中,而餐品名称在“div.zg_wrap > li > div > p > a”标签中。因此,我们可以使用以下语句提取美食名称:

for i, li in enumerate(soup.select('div.zg_wrap > li')):
    name = li.select('div > p > a')[0].get('title')
    print(f'{i+1}. {name}')

可以看到,我们已成功提取出了美食名称,输出结果如下:

1. 汉堡
2. 糯米饭
3. 明炉烤鸭
4. 龙虾
5. 火锅
6. 美式薯条
7. 叉烧肉
8. 红烧肉
9. 快手美食
10. 韩国泡菜

至此,我们已经成功通过Beautiful Soup解析库,提取出了美食网站的热门排行榜信息,演示了Beautiful Soup在爬虫数据抓取和处理中的重要应用。

总结

Beautiful Soup作为一种解析库,能够方便地解析HTML/XML文本,提供多种标签选择器并支持树型结构操作,可以快速定位和处理HTML/XML中需要的内容,提高了爬虫数据抓取和处理的效率。对于Python爬虫初学者来说,掌握Beautiful Soup的使用是十分重要的。同时需要注意的是,在使用Beautiful Soup时需要遵循网络道德规范,遵守网站的规定,避免对网站造成过度访问和其他影响。


相关文章
|
5天前
|
XML 前端开发 数据格式
BeautifulSoup 是一个 Python 库,用于从 HTML 和 XML 文件中提取数据
【5月更文挑战第10天】BeautifulSoup 是 Python 的一个库,用于解析 HTML 和 XML 文件,即使在格式不规范的情况下也能有效工作。通过创建 BeautifulSoup 对象并使用方法如 find_all 和 get,可以方便地提取和查找文档中的信息。以下是一段示例代码,展示如何安装库、解析 HTML 数据以及打印段落、链接和特定类名的元素。BeautifulSoup 还支持更复杂的查询和文档修改功能。
23 1
|
5天前
|
XML JavaScript 数据格式
Beautiful Soup 库的工作原理基于解析器和 DOM(文档对象模型)树的概念
【5月更文挑战第10天】Beautiful Soup 使用解析器(如 html.parser, lxml, html5lib)解析HTML/XML文档,构建DOM树。它提供方法查询和操作DOM,如find(), find_all()查找元素,get_text(), get()提取信息。还能修改DOM,添加、修改或删除元素,并通过prettify()输出格式化字符串。它是处理网页数据的利器,尤其在处理不规则结构时。
38 2
|
5天前
|
数据采集 Python
Python HTML解析详解
Python HTML解析详解
11 0
|
5天前
|
前端开发 JavaScript
浏览器通过构建DOM树来解析HTML代码
【4月更文挑战第30天】浏览器通过构建DOM树来解析HTML代码
27 1
|
5天前
|
数据采集 XML 数据挖掘
使用Python打造爬虫程序之HTML解析大揭秘:轻松提取网页数据
【4月更文挑战第19天】本文介绍了HTML解析在爬虫技术中的重要性,并通过Python的BeautifulSoup库展示了如何解析和提取数据。文章涵盖了HTML文档结构、使用BeautifulSoup的基本方法,如`find_all()`、选择器(标签、类、ID选择器)以及提取文本、属性和链接。此外,还讨论了遍历和处理嵌套元素的技巧。
|
5天前
|
移动开发 HTML5
HTML5/CSS3粒子效果进度条代码
HTML5/CSS3进度条应用。这款进度条插件在播放进度过程中出现粒子效果,就像一些小颗粒从进度条上散落下来
19 0
HTML5/CSS3粒子效果进度条代码
|
5天前
|
移动开发 前端开发 JavaScript
:掌握移动端开发:HTML5 与 CSS3 的高效实践
:掌握移动端开发:HTML5 与 CSS3 的高效实践 “【5月更文挑战第6天】”
27 1
|
5天前
|
缓存 移动开发 前端开发
【专栏:HTML与CSS前端技术趋势篇】HTML与CSS在PWA(Progressive Web Apps)中的应用
【4月更文挑战第30天】PWA(Progressive Web Apps)结合现代Web技术,提供接近原生应用的体验。HTML在PWA中构建页面结构和内容,响应式设计、语义化标签、Manifest文件和离线页面的创建都离不开HTML。CSS则用于定制主题样式、实现动画效果、响应式布局和管理字体图标。两者协同工作,保证PWA在不同设备和网络环境下的快速、可靠和一致性体验。随着前端技术进步,HTML与CSS在PWA中的应用将更广泛。
|
5天前
|
前端开发 JavaScript 开发者
【专栏:HTML与CSS前端技术趋势篇】前端框架(React/Vue/Angular)与HTML/CSS的结合使用
【4月更文挑战第30天】前端框架React、Vue和Angular助力UI开发,通过组件化、状态管理和虚拟DOM提升效率。这些框架与HTML/CSS结合,使用模板语法、样式管理及组件化思想。未来趋势包括框架简化、Web组件标准采用和CSS在框架中角色的演变。开发者需紧跟技术发展,掌握新工具,提升开发效能。

推荐镜像

更多