使用python实现简单的爬虫


python爬虫的简单实现

  • anaconda
    选择下载64位即可 

    pycharm
    下载Community社区版即可 

    在打开pycharm创建新项目的时候如下图所示,那么就代表了环境已经安装好了 

    https://yz.chsi.com.cn/sch/?start=0

    我们可以看到整个界面是十分复杂的,但是我们可以进行一个分析,我们所需要的数据仅仅是最下面的表格内的数据

    在handleSchoolInfo方法中同样使用到了findAll("tr")来对数据进行一个清洗,通过tr的筛选之后,table标签已经没有了 

    同理我们使用findAll("td")来进行td的筛选,同时可以发现一个数据是为空的,因为通过前面tr的筛选的首行信息里面是th而不是td的 

    接下来由于只需要每个数据的前三行,所以只需要将前三个数据保存即可,然后将保存的数据进行一个有效数据的剥离

    1  school_list.append(school[0:3])
    2  for item in school_list:
    3             school_name = item[0].get_text().strip()
    4             school_shengfen = item[1].get_text()
    5             shcool_belong = item[2].get_text()

    但是此时爬取到的数据也仅仅是当前页的数据,通过分析研招网的链接不难得知,每一页之间的差距仅仅是在最后的参数不同,那么在爬虫的URL进行修改即可

    https://yz.chsi.com.cn/sch/?start=0
    https://yz.chsi.com.cn/sch/?start=20

    1 index = 0
    2 while index < 44:
    3     shcoolInfo = findSchoolInfo("https://yz.chsi.com.cn/sch/search.do?start="+str(index*20))
    4     handleSchoolInfo(shcoolInfo)
    5     index+=1

    Ryan Mitchell. Web Scraping with Python[M]. O'Reilly Media ,2015.
    [2] Python连接SQL Server入门