Python学习之beautifulsoup4库的使用
一、beautifulsoup4库简介
使用requests库获取HTML页面并将其转换成字符串后,需要进一步分析HTML页面格式,提取有用信息,这个需要处理HTML和XML函数库。
beautifulsoup4库,也成为Beautiful Soup库或者bs4库,用于解析和处理HTML和XML。需要注意的是,他不是Beautifulsoup库。它最大的优点是能根据HTML和XML语法建立解析树,进而高效解析其中的内容。
HTML建立的web页面一般是比较复杂的,除了有用的信息外,还包括大量的页面格式信息元素,直接解析一个web网页需要深入了解HTML语法。而beautifulsoup4库将专业的web网页格式解析部分封装成函数,提供了若干有用快捷的处理函数。
二、beautifulsoup4库使用
1. beautifulsoup4库中最主要的是BeautifulSoup类,每个实例化的对象相当于一个页面。
使用BeautifulSoup()创建一个BeautifulSoup对象:
创建的BeautifulSoup对象是一个树形结构,它包含HTML页面中的每一个Tag(标签)元素,如、等。具体描述的话,是HTML中主要结构都变成了BeautifulSoup对象的一个属性,
可以直接用.形式获取,其中的名字采用HTML中标签的名字。
2. BeautifulSoup对象常用的属性
head HTML页面的内容
title HTML页面标题,在中,由
body HTML页面的内容
p HTML页面中第一个 内容
strings HTML页面所有呈现在web上的字符,即标签的内容
stripped_strings HTML页面所有呈现在web上的非空字符串
如略去