Python Selenium库的使用【从安装到实战】(一)

简介: Python Selenium库的使用【从安装到实战】

Selenium简介


Selenium是一个Web的自动化测试工具,最初是为网站自动化测试而开发的,可以按指定的命令自动操作,直接运行在浏览器上,它支持所有主流的浏览器(包括PhantomJS这些无界面的浏览器,现在已经被弃用了,会报警告,但是仍然可以用)。


Selenium 可以根据我们的指令,模拟用户操作浏览器,让浏览器自动加载页面,获取需要的数据,甚至页面截屏,或者判断网站上某些动作是否发生。

Selenium 自己不带浏览器,不支持浏览器的功能,它需要与第三方浏览器结合在一起才能使用。


Selenium 的安装


使用pip安装


pip install Selenium


驱动的安装


Chrome浏览器驱动:https://registry.npmmirror.com/binary.html?path=chromedriver/

火狐浏览器驱动:https://liushilive.github.io/github_selenium_drivers/md/Firefox.html

PhantomJS 浏览器:https://phantomjs.org/download.html

注意:需要下载的驱动需要和自己电脑上的浏览器版本一样,不一致会导致报错程序无法运行


Selenium基础操作


实例化浏览器对象

from selenium import webdriver
from lxml import etree
# 驱动的位置
bro = webdriver.Chrome(executable_path='./chromedriver.exe')

发送请求

bro.get('http://www.baidu.com/')
page_text = bro.page_source    # 获取页面源码
tree = etree.HTML(page_text)   # 解析源码
title = tree.xpath('')  # 使用xpath提取数据


使用百度进行自动搜索


83b0fba36e4d4606b9fa256ac737a472.png


实现功能有

  • 自动填充关键字并搜索
  • 截图并保存
  • 清空内容重新搜索
  • 获取当前网页的cookies值和url
import time
from selenium import webdriver
# 路径放自己驱动的路径
driver = webdriver.webdriver.Chrome(executable_path=r"./chromedriver.exe")
driver.get('http://www.baidu.com/')
data = driver.find_element_by_id("wrapper").text   
print(data) # 输出文字
print(driver.title) # 网页的标题
# warnings.warn('Selenium support for PhantomJS has been deprecated, please use headless '
# selenium已经放弃Phantomjs,建议使用谷歌或者火狐的无界面浏览器。
# 搜索长城相关的内容
driver.find_element_by_id('kw').send_keys(u'长城')   #在搜索康框中填写内容
driver.save_screenshot('百度.png')  # 截屏
driver.find_element_by_id('su').click()  # 点击搜索按钮
time.sleep(1)  # 暂停1秒,给浏览器加载一定的时间
driver.save_screenshot("搜索.png")  
# 调用键盘按键操作,首先引入Keys包
from selenium.webdriver.common.keys import Keys
# 通过模拟键盘按键操作
# Ctrl + A 全选
driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'a')  
# 剪切
driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'x')
#  在输入框输入 新的搜索锁关键字python
driver.find_element_by_id('kw').send_keys('python')
# 模拟 Enter
driver.find_element_by_id('kw').send_keys(Keys.RETURN)
time.sleep(2)
driver.save_screenshot("新搜索.png")
# 清除输入框内容
driver.find_element_by_id('kw').click()
# 获取当前页面的Cookie
# 使用get_cookies()方法获当前页面的Cookie
print("cookies:",driver.get_cookies())
# 获取当前url
# 使用current_url
print('url:',driver.current_url)
# 关闭当前页面,
# close() 方法关闭当前页面,如果只有一个页面,就会关闭浏览器
driver.close()


定位UI元素

find_element_by_id()   # 通过id                     
find_element_by_name() # 通过name标签值                
find_element_by_class_name() # 通过class_name标签值    
find_element_by_css_selector() # 通过css样式名称        
find_element_by_link_text()  # 通过链接文本定位           
find_element_by_xpath() # 通过Xpath来定位页面元素          
find_element_by_partial_link_text() # 通过部分链接文本定位  
find_element_by_tag_name()  # 通过标签名称定位            


导包和实例浏览器对象

浏览器的需要可以根据需要进行选择,一般跟编写的代码都没有区别

在测试初期可以选择有界面的,这样方便观察,对项目的编写也是有很大帮助的

在项目测试或者上线的时候可以换成无头浏览器,这样可以提高效率

import time
from selenium import webdriver
# 这里的浏览器驱动推荐大家使用Chrome的
driver = webdriver.PhantomJS(executable_path="./phantomjs-2.1.1-windows/bin/phantomjs.exe")
driver.get('http://www.baidu.com/')


find_element_by_id() # 通过id


a5158e0add264bceb75fc48410de0d6b.png

定位到搜索框并在搜索框中输入要搜索内容

element = driver.find_element_by_id("kw")
element.send_keys(u'你好')
time.sleep(2)
driver.save_screenshot('t1.png')
第二种方式
from selenium.webdriver.common.by import By
element = driver.find_element(by=By.ID,value='kw')

结果

b6a59831053d43cda6a345a0e33649da.png


  • find_element_by_class_name() # 通过class_name标签值

选中百度以下,然后点击

driver.find_element_by_class_name('s_btn').click()   # 选中并点击
另一种方式
driver.find_element(by=By.CLASS_NAME,value='s_btn').click()

没有图片是加载时间不够,可以考延长time.sleep()的时间

368eb33ed7b3426a8cfa22fe98296d12.png

下面的都是类似的

  • find_element_by_name() # 通过name标签值
方式一
driver.find_element_by_name('wd') 
方式二
driver.find_element(by=By.NAME,value='title-content')
  • find_element_by_link_text() # 通过链接文本定位


driver.find_element_by_link_text('图片')  # 通过链接文本定位
driver.find_element(by=By.LINK_TEXT,value='图片')


  • find_element_by_xpath() # 通过Xpath来定位页面元素
    xpath也可以根据浏览器的工具进行复制,不过记住也不能完全相信浏览器,必要时需要看源码
driver.find_element_by_xpath('//*[@id="kw"]') # 通过Xpath来定位页面元素
driver.find_element(by=By.XPATH,value='//*[@id="kw"]')
  • find_element_by_partial_link_text() # 通过部分链接文本定位
driver.find_element_by_partial_link_text('图') # 通过部分链接文本定位
driver.find_element(by=By.PARTIAL_LINK_TEXT,value='图')
  • find_element_by_tag_name() # 通过标签名称定位
driver.find_element_by_tag_name('body')  # 通过标签名称定位
driver.find_element(by=By.TAG_NAME,value='body')

find_element_by_css_selector() # 通过css样式名称

这个css样式选择比较繁琐,这里可以根据浏览器自带的工具快捷选择

60e70094700246f08ceb94d001b9b4d6.png

7df16a398c0243db9c2e094fb32852ab.png

driver.find_element_by_css_selector('#s-top-left > a:nth-child(6)').click() # 通过css

e820be13802d4cfeaeccad13bfced6aa.png


相关文章
|
13天前
|
机器学习/深度学习 存储 数据挖掘
Python图像处理实用指南:PIL库的多样化应用
本文介绍Python中PIL库在图像处理中的多样化应用,涵盖裁剪、调整大小、旋转、模糊、锐化、亮度和对比度调整、翻转、压缩及添加滤镜等操作。通过具体代码示例,展示如何轻松实现这些功能,帮助读者掌握高效图像处理技术,适用于图片美化、数据分析及机器学习等领域。
53 20
|
7天前
|
测试技术 数据库 Python
Python装饰器实战:打造高效性能计时工具
在数据分析中,处理大规模数据时,分析代码性能至关重要。本文介绍如何使用Python装饰器实现性能计时工具,在不改变现有代码的基础上,方便快速地测试函数执行时间。该方法具有侵入性小、复用性强、灵活度高等优点,有助于快速发现性能瓶颈并优化代码。通过设置循环次数参数,可以更准确地评估函数的平均执行时间,提升开发效率。
85 61
Python装饰器实战:打造高效性能计时工具
|
3天前
|
测试技术 Python
【03】做一个精美的打飞机小游戏,规划游戏项目目录-分门别类所有的资源-库-类-逻辑-打包为可玩的exe-练习python打包为可执行exe-优雅草卓伊凡-持续更新-分享源代码和游戏包供游玩-1.0.2版本
【03】做一个精美的打飞机小游戏,规划游戏项目目录-分门别类所有的资源-库-类-逻辑-打包为可玩的exe-练习python打包为可执行exe-优雅草卓伊凡-持续更新-分享源代码和游戏包供游玩-1.0.2版本
【03】做一个精美的打飞机小游戏,规划游戏项目目录-分门别类所有的资源-库-类-逻辑-打包为可玩的exe-练习python打包为可执行exe-优雅草卓伊凡-持续更新-分享源代码和游戏包供游玩-1.0.2版本
|
3天前
|
运维 Shell 数据库
Python执行Shell命令并获取结果:深入解析与实战
通过以上内容,开发者可以在实际项目中灵活应用Python执行Shell命令,实现各种自动化任务,提高开发和运维效率。
40 20
|
4天前
|
人工智能 Java Python
python安装、vscode安装、conda安装:一文搞定Python的开发环境(史上最全)
尼恩架构团队推出了一系列《LLM大模型学习圣经》PDF,旨在帮助读者深入理解并掌握大型语言模型(LLM)及其相关技术。该系列包括Python基础、Transformer架构、LangChain框架、RAG架构及LLM智能体等内容,覆盖从理论到实践的各个方面。此外,尼恩还提供了配套视频教程,计划于2025年5月前发布,助力更多人成为大模型应用架构师,冲击年薪百万目标。
|
11天前
|
Shell Linux iOS开发
使用 pipx 安装并执行 Python 应用程序 (1)
使用 pipx 安装并执行 Python 应用程序 (1)
24 0
使用 pipx 安装并执行 Python 应用程序 (1)
|
1月前
|
Linux Python
Linux 安装python3.7.6
本教程介绍在Linux系统上安装Python 3.7.6的步骤。首先使用`yum`安装依赖环境,包括zlib、openssl等开发库。接着通过`wget`下载Python 3.7.6源码包并解压。创建目标文件夹`/usr/local/python3`后,进入解压目录执行配置、编译和安装命令。最后设置软链接,使`python3`和`pip3`命令生效。
|
21天前
|
人工智能 编译器 Python
python已经安装有其他用途如何用hbuilerx配置环境-附带实例demo-python开发入门之hbuilderx编译器如何配置python环境—hbuilderx配置python环境优雅草央千澈
python已经安装有其他用途如何用hbuilerx配置环境-附带实例demo-python开发入门之hbuilderx编译器如何配置python环境—hbuilderx配置python环境优雅草央千澈
python已经安装有其他用途如何用hbuilerx配置环境-附带实例demo-python开发入门之hbuilderx编译器如何配置python环境—hbuilderx配置python环境优雅草央千澈
|
24天前
|
数据采集 存储 XML
python实战——使用代理IP批量获取手机类电商数据
本文介绍了如何使用代理IP批量获取华为荣耀Magic7 Pro手机在电商网站的商品数据,包括名称、价格、销量和用户评价等。通过Python实现自动化采集,并存储到本地文件中。使用青果网络的代理IP服务,可以提高数据采集的安全性和效率,确保数据的多样性和准确性。文中详细描述了准备工作、API鉴权、代理授权及获取接口的过程,并提供了代码示例,帮助读者快速上手。手机数据来源为京东(item.jd.com),代理IP资源来自青果网络(qg.net)。
|
Python
PYTHON实战两数之和
1. 两数之和 难度:简单 收藏 给定一个整数数组 nums 和一个整数目标值 target,请你在该数组中找出 和为目标值 target 的那 两个 整数,并返回它们的数组下标。 你可以假设每种输入只会对应一个答案。但是,数组中同一个元素在答案里不能重复出现。 你可以按任意顺序返回答案。
199 0
PYTHON实战两数之和

热门文章

最新文章