01爬虫基础
爬虫是什么
模拟用户上网,不借助浏览器,自动抓取所浏览的数据
爬虫能做什么
抢票神器
投票神器
预测(股市预测、票房预测)
国民情感分析
社交关系网络
政府部门舆情监控
等等
爬虫的合法性
查看robots协议(也叫爬虫协议)
例如淘宝的爬虫协议https://www.taobao.com/robots.txt
搜索引擎工作原理
抓取网页
数据存储
预处理
排名,提供检索服务
访问背后互联网的过程
输入url之后:
- 域名解析出ip地址
- 向对应ip服务器发出请求
- 服务器响应请求,发出所请求内容
- 浏览器解析内容给用户展示
加密方式
通过TCP/IP,和http/https协议
http
80端口
- 将域名解析出来的信息,和本机信息打包成http请求数据包,再将http包封装为tcp包因为tcp更底层,先建立tcp才能建立http,之后建立连接
- 建立连接后,客户机发送请求命令
- 服务器响应,发出 空白的头信息+Content-Type的实体内容
- TCP断开连接
一般情况下,一旦Web服务器向浏览器发送了请求数据,它就要关闭TCP连接,然后如果浏览器或者服务器在其头信息加入了这行代码
Connection:keep-alive
TCP连接在发送后将仍然保持打开状态,于是,浏览器可以继续通过相同的连接发送请求。保持连接节省了为每个请求建立新连接所需的时间,还节约了网络带宽。
https
即HTTP下加入SSL层,HTTPS的安全基础是SSL。其所用的端口号是443。
对称加密
非对称密钥加密:安全,典型的非对称加密算法有RSA、DSA等
升级:非对称+数字签名