Selenium简介
Selenium是一个Web的自动化测试工具,最初是为网站自动化测试而开发的,可以按指定的命令自动操作,直接运行在浏览器上,它支持所有主流的浏览器(包括PhantomJS这些无界面的浏览器,现在已经被弃用了,会报警告,但是仍然可以用)。
Selenium 可以根据我们的指令,模拟用户操作浏览器,让浏览器自动加载页面,获取需要的数据,甚至页面截屏,或者判断网站上某些动作是否发生。
Selenium 自己不带浏览器,不支持浏览器的功能,它需要与第三方浏览器结合在一起才能使用。
Selenium 的安装
使用pip安装
pip install Selenium
驱动的安装
Chrome浏览器驱动:https://registry.npmmirror.com/binary.html?path=chromedriver/
火狐浏览器驱动:https://liushilive.github.io/github_selenium_drivers/md/Firefox.html
PhantomJS 浏览器:https://phantomjs.org/download.html
注意:需要下载的驱动需要和自己电脑上的浏览器版本一样,不一致会导致报错程序无法运行
Selenium基础操作
实例化浏览器对象
from selenium import webdriver from lxml import etree # 驱动的位置 bro = webdriver.Chrome(executable_path='./chromedriver.exe')
发送请求
bro.get('http://www.baidu.com/') page_text = bro.page_source # 获取页面源码 tree = etree.HTML(page_text) # 解析源码 title = tree.xpath('') # 使用xpath提取数据
使用百度进行自动搜索
实现功能有
- 自动填充关键字并搜索
- 截图并保存
- 清空内容重新搜索
- 获取当前网页的cookies值和url
import time from selenium import webdriver # 路径放自己驱动的路径 driver = webdriver.webdriver.Chrome(executable_path=r"./chromedriver.exe") driver.get('http://www.baidu.com/') data = driver.find_element_by_id("wrapper").text print(data) # 输出文字 print(driver.title) # 网页的标题 # warnings.warn('Selenium support for PhantomJS has been deprecated, please use headless ' # selenium已经放弃Phantomjs,建议使用谷歌或者火狐的无界面浏览器。 # 搜索长城相关的内容 driver.find_element_by_id('kw').send_keys(u'长城') #在搜索康框中填写内容 driver.save_screenshot('百度.png') # 截屏 driver.find_element_by_id('su').click() # 点击搜索按钮 time.sleep(1) # 暂停1秒,给浏览器加载一定的时间 driver.save_screenshot("搜索.png") # 调用键盘按键操作,首先引入Keys包 from selenium.webdriver.common.keys import Keys # 通过模拟键盘按键操作 # Ctrl + A 全选 driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'a') # 剪切 driver.find_element_by_id('kw').send_keys(Keys.CONTROL,'x') # 在输入框输入 新的搜索锁关键字python driver.find_element_by_id('kw').send_keys('python') # 模拟 Enter driver.find_element_by_id('kw').send_keys(Keys.RETURN) time.sleep(2) driver.save_screenshot("新搜索.png") # 清除输入框内容 driver.find_element_by_id('kw').click() # 获取当前页面的Cookie # 使用get_cookies()方法获当前页面的Cookie print("cookies:",driver.get_cookies()) # 获取当前url # 使用current_url print('url:',driver.current_url) # 关闭当前页面, # close() 方法关闭当前页面,如果只有一个页面,就会关闭浏览器 driver.close()
定位UI元素
find_element_by_id() # 通过id find_element_by_name() # 通过name标签值 find_element_by_class_name() # 通过class_name标签值 find_element_by_css_selector() # 通过css样式名称 find_element_by_link_text() # 通过链接文本定位 find_element_by_xpath() # 通过Xpath来定位页面元素 find_element_by_partial_link_text() # 通过部分链接文本定位 find_element_by_tag_name() # 通过标签名称定位
导包和实例浏览器对象
浏览器的需要可以根据需要进行选择,一般跟编写的代码都没有区别
在测试初期可以选择有界面的,这样方便观察,对项目的编写也是有很大帮助的
在项目测试或者上线的时候可以换成无头浏览器,这样可以提高效率
import time from selenium import webdriver # 这里的浏览器驱动推荐大家使用Chrome的 driver = webdriver.PhantomJS(executable_path="./phantomjs-2.1.1-windows/bin/phantomjs.exe") driver.get('http://www.baidu.com/')
find_element_by_id() # 通过id
定位到搜索框并在搜索框中输入要搜索内容
element = driver.find_element_by_id("kw") element.send_keys(u'你好') time.sleep(2) driver.save_screenshot('t1.png') 第二种方式 from selenium.webdriver.common.by import By element = driver.find_element(by=By.ID,value='kw')
结果
- find_element_by_class_name() # 通过class_name标签值
选中百度以下,然后点击
driver.find_element_by_class_name('s_btn').click() # 选中并点击 另一种方式 driver.find_element(by=By.CLASS_NAME,value='s_btn').click()
没有图片是加载时间不够,可以考延长time.sleep()
的时间
下面的都是类似的
- find_element_by_name() # 通过name标签值
方式一 driver.find_element_by_name('wd') 方式二 driver.find_element(by=By.NAME,value='title-content')
- find_element_by_link_text() # 通过链接文本定位
driver.find_element_by_link_text('图片') # 通过链接文本定位 driver.find_element(by=By.LINK_TEXT,value='图片')
- find_element_by_xpath() # 通过Xpath来定位页面元素
xpath也可以根据浏览器的工具进行复制,不过记住也不能完全相信浏览器,必要时需要看源码
driver.find_element_by_xpath('//*[@id="kw"]') # 通过Xpath来定位页面元素 driver.find_element(by=By.XPATH,value='//*[@id="kw"]')
- find_element_by_partial_link_text() # 通过部分链接文本定位
driver.find_element_by_partial_link_text('图') # 通过部分链接文本定位 driver.find_element(by=By.PARTIAL_LINK_TEXT,value='图')
- find_element_by_tag_name() # 通过标签名称定位
driver.find_element_by_tag_name('body') # 通过标签名称定位 driver.find_element(by=By.TAG_NAME,value='body')
find_element_by_css_selector() # 通过css样式名称
这个css样式选择比较繁琐,这里可以根据浏览器自带的工具快捷选择
driver.find_element_by_css_selector('#s-top-left > a:nth-child(6)').click() # 通过css