爬取豆瓣电影前250,借此熟悉python的request,数据入库,正则表达式
1.确定爬取的标签

获取排名 x.find('em')
获取title
问题:
- 三年前用urllib2,现在不这么用了
- itemlist = soup.find_all("div",class_="item") 找到所以class为item的标签存入列表
- url = i.find('a',class_='').get('href') 找到a标签的href属性的内容
- title = i.find('span',class_='title').text
- 正则表达式分割 aa11a123/bbb2(sjd,下提取出任意位数数字+/ 以及任意位数数字+(
- 爬取过程中第一个网页,li里面的信息是动态加载的,用目前的方法爬不下来。
- 电脑装了phpstudy,自带mysql,跟本地mysql冲突,到本地mysql的安装目录下,bin文件夹下,cmd管理员模式运行cd C:\D\mysql-8.0.19-winx64\bin mysqld.exe -install 出现:Service successfully installed. 接下来启动mysql:net start mysql
- Navicat Premium 出现2059错误,改了mysql的密码
- navicat过期,注册,下破解机,注意选择破解版本是navicat for mysql的,破解时断网,下注册机关360.参见 navicat15 for mysql激活
- 数据库添加 的sql写法
- 数据库update的sql写法