爬虫基础-爬虫初识
认识爬虫
我们生活中最常见的爬虫,应该是指搜索引擎。搜索引擎的前身是1990年由Montreal的McGill University三名学生(Alan Emtage、Peter Deutsch、Bill Wheelan)发明的Archie(Archie FAQ)。第一代真正基于互联网的搜索引擎是1994年麦克·马丁博士(Dr.Michael Mauldin)在Carnegie Mellon大学的一个搜索项目,当时的Lycos搜索引擎被用于该校的数字图书馆工程。“Lycos”是Lycosidae(一种很善于捕捉猎物的狼蛛)的缩写。到了现在,我们接触到的更多的是谷歌啊,百度啊,搜狐等等这些搜索引擎。
而现在我们所说的爬虫,更多的是指通过编写程序模拟浏览器向服务器发起请求,得到自己想要的有价值的数据。为了尊重网站的权利,各大搜索引擎通过邮件形式讨论定下了一个君子协议——robots.txt。只要在你的网站根目录上放上一个robots文件,告诉搜索引擎哪些内容不能抓取,网络爬虫就会遵守约定,不抓取这些内容。随着互联网的发展, 信息量快速发展,整个网络世界,充满着许多很有价值的信息,商品信息、机票信息、个人隐私数据满天飞。一些不法分子从中看到了巨大的利益。在利益的诱惑下,这些人开始违反爬虫协议,编写爬虫程序,恶意爬取目标网站的内容。
历史上第一件关于爬虫的官司出现在2000年,eBay将一家聚合价格信息的网站告上法庭。eBay认为自己已经使用robot协议,明确告诉哪些信息不能抓取,哪些信息可以抓取,但这家公司违反了协议,非法抓取商品价格等信息。但被告认为,eBay上的用户数据、以及用户上传的商品信息,应属于用户集体所有,并不属于eBay,robot协议无效。最终,法院判决eBay胜诉。这个案件开启了爬虫协议作为主要参考证据的先河。
爬虫的基本步骤:
-
- 模拟对服务器发请求,得到服务器回应
- 从服务器的回应中得到有价值的数据
- 将数据保存到本地