01爬虫基础


爬虫是什么

模拟用户上网,不借助浏览器,自动抓取所浏览的数据

爬虫能做什么

抢票神器
投票神器
预测(股市预测、票房预测)
国民情感分析
社交关系网络
政府部门舆情监控
等等

爬虫的合法性

查看robots协议(也叫爬虫协议)
例如淘宝的爬虫协议https://www.taobao.com/robots.txt

搜索引擎工作原理

抓取网页
数据存储
预处理
排名,提供检索服务

访问背后互联网的过程

输入url之后:

  1. 域名解析出ip地址
  2. 向对应ip服务器发出请求
  3. 服务器响应请求,发出所请求内容
  4. 浏览器解析内容给用户展示

加密方式

通过TCP/IP,和http/https协议

http

80端口

  1. 将域名解析出来的信息,和本机信息打包成http请求数据包,再将http包封装为tcp包因为tcp更底层,先建立tcp才能建立http,之后建立连接
  2. 建立连接后,客户机发送请求命令
  3. 服务器响应,发出 空白的头信息+Content-Type的实体内容
  4. TCP断开连接
    一般情况下,一旦Web服务器向浏览器发送了请求数据,它就要关闭TCP连接,然后如果浏览器或者服务器在其头信息加入了这行代码
    Connection:keep-alive
    TCP连接在发送后将仍然保持打开状态,于是,浏览器可以继续通过相同的连接发送请求。保持连接节省了为每个请求建立新连接所需的时间,还节约了网络带宽。

https

即HTTP下加入SSL层,HTTPS的安全基础是SSL。其所用的端口号是443。

对称加密

非对称密钥加密:安全,典型的非对称加密算法有RSA、DSA等

升级:非对称+数字签名