Python Selenium库的使用【从安装到实战】(一)

简介: Python Selenium库的使用【从安装到实战】

Selenium简介


Selenium是一个Web的自动化测试工具,最初是为网站自动化测试而开发的,可以按指定的命令自动操作,直接运行在浏览器上,它支持所有主流的浏览器(包括PhantomJS这些无界面的浏览器,现在已经被弃用了,会报警告,但是仍然可以用)。


Selenium 可以根据我们的指令,模拟用户操作浏览器,让浏览器自动加载页面,获取需要的数据,甚至页面截屏,或者判断网站上某些动作是否发生。

Selenium 自己不带浏览器,不支持浏览器的功能,它需要与第三方浏览器结合在一起才能使用。


Selenium 的安装


使用pip安装


pip install Selenium


驱动的安装


Chrome浏览器驱动:https://registry.npmmirror.com/binary.html?path=chromedriver/

火狐浏览器驱动:https://liushilive.github.io/github_selenium_drivers/md/Firefox.html

PhantomJS 浏览器:https://phantomjs.org/download.html

注意:需要下载的驱动需要和自己电脑上的浏览器版本一样,不一致会导致报错程序无法运行


Selenium基础操作


实例化浏览器对象

from selenium import webdriver
from lxml import etree
# 驱动的位置
bro = webdriver.Chrome(executable_path='./chromedriver.exe')

发送请求

bro.get('http://www.baidu.com/')
page_text = bro.page_source    # 获取页面源码
tree = etree.HTML(page_text)   # 解析源码
title = tree.xpath('')  # 使用xpath提取数据


使用百度进行自动搜索


83b0fba36e4d4606b9fa256ac737a472.png


实现功能有

  • 自动填充关键字并搜索
  • 截图并保存
  • 清空内容重新搜索
  • 获取当前网页的cookies值和url
import time
from selenium import webdriver
# 路径放自己驱动的路径
driver = webdriver.webdriver.Chrome(executable_path=r"./chromedriver.exe")
driver.get('http://www.baidu.com/')
data = driver.find_element_by_id("wrapper").text   
print(data) # 输出文字
print(driver.title) # 网页的标题
# warnings.warn('Selenium support for PhantomJS has been deprecated, please use headless '
# selenium已经放弃Phantomjs,建议使用谷歌或者火狐的无界面浏览器。
# 搜索长城相关的内容
driver.find_element_by_id('kw').send_keys(u'长城')   #在搜索康框中填写内容
driver.save_screenshot('百度.png')  # 截屏
driver.find_element_by_id('su').click()  # 点击搜索按钮
time.sleep(1)  # 暂停1秒,给浏览器加载一定的时间
driver.save_screenshot("搜索.png")  
# 调用键盘按键操作,首先引入Keys包
from selenium.webdriver.common.keys import Keys
# 通过模拟键盘按键操作
# Ctrl + A 全选
driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'a')  
# 剪切
driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'x')
#  在输入框输入 新的搜索锁关键字python
driver.find_element_by_id('kw').send_keys('python')
# 模拟 Enter
driver.find_element_by_id('kw').send_keys(Keys.RETURN)
time.sleep(2)
driver.save_screenshot("新搜索.png")
# 清除输入框内容
driver.find_element_by_id('kw').click()
# 获取当前页面的Cookie
# 使用get_cookies()方法获当前页面的Cookie
print("cookies:",driver.get_cookies())
# 获取当前url
# 使用current_url
print('url:',driver.current_url)
# 关闭当前页面,
# close() 方法关闭当前页面,如果只有一个页面,就会关闭浏览器
driver.close()


定位UI元素

find_element_by_id()   # 通过id                     
find_element_by_name() # 通过name标签值                
find_element_by_class_name() # 通过class_name标签值    
find_element_by_css_selector() # 通过css样式名称        
find_element_by_link_text()  # 通过链接文本定位           
find_element_by_xpath() # 通过Xpath来定位页面元素          
find_element_by_partial_link_text() # 通过部分链接文本定位  
find_element_by_tag_name()  # 通过标签名称定位            


导包和实例浏览器对象

浏览器的需要可以根据需要进行选择,一般跟编写的代码都没有区别

在测试初期可以选择有界面的,这样方便观察,对项目的编写也是有很大帮助的

在项目测试或者上线的时候可以换成无头浏览器,这样可以提高效率

import time
from selenium import webdriver
# 这里的浏览器驱动推荐大家使用Chrome的
driver = webdriver.PhantomJS(executable_path="./phantomjs-2.1.1-windows/bin/phantomjs.exe")
driver.get('http://www.baidu.com/')


find_element_by_id() # 通过id


a5158e0add264bceb75fc48410de0d6b.png

定位到搜索框并在搜索框中输入要搜索内容

element = driver.find_element_by_id("kw")
element.send_keys(u'你好')
time.sleep(2)
driver.save_screenshot('t1.png')
第二种方式
from selenium.webdriver.common.by import By
element = driver.find_element(by=By.ID,value='kw')

结果

b6a59831053d43cda6a345a0e33649da.png


  • find_element_by_class_name() # 通过class_name标签值

选中百度以下,然后点击

driver.find_element_by_class_name('s_btn').click()   # 选中并点击
另一种方式
driver.find_element(by=By.CLASS_NAME,value='s_btn').click()

没有图片是加载时间不够,可以考延长time.sleep()的时间

368eb33ed7b3426a8cfa22fe98296d12.png

下面的都是类似的

  • find_element_by_name() # 通过name标签值
方式一
driver.find_element_by_name('wd') 
方式二
driver.find_element(by=By.NAME,value='title-content')
  • find_element_by_link_text() # 通过链接文本定位


driver.find_element_by_link_text('图片')  # 通过链接文本定位
driver.find_element(by=By.LINK_TEXT,value='图片')


  • find_element_by_xpath() # 通过Xpath来定位页面元素
    xpath也可以根据浏览器的工具进行复制,不过记住也不能完全相信浏览器,必要时需要看源码
driver.find_element_by_xpath('//*[@id="kw"]') # 通过Xpath来定位页面元素
driver.find_element(by=By.XPATH,value='//*[@id="kw"]')
  • find_element_by_partial_link_text() # 通过部分链接文本定位
driver.find_element_by_partial_link_text('图') # 通过部分链接文本定位
driver.find_element(by=By.PARTIAL_LINK_TEXT,value='图')
  • find_element_by_tag_name() # 通过标签名称定位
driver.find_element_by_tag_name('body')  # 通过标签名称定位
driver.find_element(by=By.TAG_NAME,value='body')

find_element_by_css_selector() # 通过css样式名称

这个css样式选择比较繁琐,这里可以根据浏览器自带的工具快捷选择

60e70094700246f08ceb94d001b9b4d6.png

7df16a398c0243db9c2e094fb32852ab.png

driver.find_element_by_css_selector('#s-top-left > a:nth-child(6)').click() # 通过css

e820be13802d4cfeaeccad13bfced6aa.png


相关文章
|
3天前
|
存储 数据库 时序数据库
InfluxDB的安装与Python调用
InfluxDB是一个高性能的时序数据库(Time-Series Database, TSDB),用于存储和分析时间序列数据的开源数据库,它非常适合于处理大量的时间戳数据,如金融市场数据、IoT 设备数据、监控数据等,尤其适合处理大量的时序数据和高频数据。 主要特性有: • 内置HTTP接口,使用方便 • 数据可以打标记,查询可以很灵活 • 类SQL的查询语句 • 安装管理很简单,并且读写数据很高效 • 能够实时查询,数据在写入时被索引后就能够被立即查出
InfluxDB的安装与Python调用
|
3天前
|
存储 JSON API
Pydantic:目前最流行的Python数据验证库
在处理来自系统外部的数据,如API、终端用户输入或其他来源时,我们必须牢记开发中的一条基本原则:“永远不要相信用户的输入”。 因此,我们必须对这些数据进行严格的检查和验证,确保它们被适当地格式化和标准化。这样做的目的是为了确保这些数据符合我们的程序所需的输入规范,从而保障项目能够正确且高效地运行。
|
4天前
|
存储 缓存 索引
Python中的NumPy库详解
Python中的NumPy库详解
|
4天前
|
Python
Mac安装Python3.12开发环境
Mac安装Python3.12开发环境
21 2
|
5天前
|
Linux Python
Linux 升级安装 Python 3
Linux 升级安装 Python 3
13 2
|
5天前
|
前端开发 计算机视觉
Building wheel for opencv-python (pyproject.toml) ,安装命令增加 --verbose 参数
Building wheel for opencv-python (pyproject.toml) ,安装命令增加 --verbose 参数
25 2
|
5天前
|
Web App开发 数据采集 测试技术
五分钟轻松掌握 Python 自动化测试 Selenium
本文主要介绍了 Selenium 相关内容,主要涉及 Selenium 知识面,从开始的 Python 小案例,到后面的 API 全面了解,以及 Selenium 的常用功能,到最后的 XPATH 以及爬虫的认知。这些内容已经能够全面,且具有实践性。
|
5天前
|
Linux 网络安全 Python
Linux离线安装Python时ssh和hashlib死活安装不上的解决方案
本文提供了Linux环境下离线安装Python时遇到的"ImportError: No module named _ssl"和"ERROR:root:code for hash md5|sha1|sha224|sha256|sha384|sha512 was not found"两个问题的解决方案,通过设置OpenSSL环境变量和编辑Python源码配置文件来解决。
9 1
|
Python
PYTHON实战两数之和
1. 两数之和 难度:简单 收藏 给定一个整数数组 nums 和一个整数目标值 target,请你在该数组中找出 和为目标值 target 的那 两个 整数,并返回它们的数组下标。 你可以假设每种输入只会对应一个答案。但是,数组中同一个元素在答案里不能重复出现。 你可以按任意顺序返回答案。
173 0
PYTHON实战两数之和
|
8天前
|
算法 程序员 开发工具
百万级Python讲师又一力作!Python编程轻松进阶,豆瓣评分8.1
在学习Python的旅程中你是否正在“绝望的沙漠”里徘徊? 学完基础教程的你,是否还在为选择什么学习资料犹豫不决,不知从何入手,提高自己?
百万级Python讲师又一力作!Python编程轻松进阶,豆瓣评分8.1