Python实现网页自动化-浏览器查找元素(二)
前言
在上一节中(https://mp.weixin.qq.com/s/lqYEjiqA4eLI59GkDEpKcg)已经部署了Selenium+chromedriver的开发环境,在真正的开发之前,还需要学会利用浏览器来查找网页元素。
因为Selenium是通过程序来自动操控网页的控件元素,比如单击某个按钮、输入文本框内容等,若网页中有多个同类型的元素,好比有多个按钮,想要Selenium精准地单击目标元素,需要将目标元素的具体信息告知Selenium,让它根据这些信息在网页上找到该元素并进行操控。
浏览器开发者工具部分讲解
网页的元素信息是通过浏览器的开发者工具来获取。以Google Chrome为例,在浏览器上访问
(https://www.qq.com/)
然后按快捷键F12打开Chrome的开发者工具(部分电脑要用 fn +12 ),如下图
开发者工具以Web开发调试为主,如果只是获取网页元素信息,只需熟练掌握Elements标签页即可。Elements标签页允许从浏览器的角度查看页面,也就是说,可以看到Chrome渲染页面所需要的HTML、CSS和DOM(Document Object Model)对象,此外,还可以编辑内容更改页面显示效果,它一共分为两部分,左边是当前网页的HTML内容,右边是某个元素的CSS布局内容;查找元素信息以左边的HTML内容为主。
#声明为HTML5标准的文档 DOTYPE html> #元素是html也没的根元素 <html> #包含了文档部分的元(meta)数据 <head> #提供主要页面的元信息,主要是描述和关键词 <meta charset="utf-8"> #元素描述了文档的标题 <title>编程技术圈title> head> #元素包含了可见的页面内容 <body> #定义一个一级(h1)标题 <h1>我的一级标题h1> #定义一个段落(p标签) <p>我的第一个段落p> body> html>
整个HTML可分为两部分:
(1)是对网页的描述、图片和JavaScript的引用。元素包含所有的头部标签元素。在元素中可以插入脚本(scripts)、样式文件(CSS)及各种meta信息。该区域可添加的元素标签有