想把一个小网站的阿Q正传搞出来,写了一个python爬虫
1 # -*- coding: utf-8 -*- 2 3 import requests 4 import re 5 from fake_useragent import UserAgent 6 7 '''https://www.ppzuowen.com/book/nahan/8996.html''' 8 for chp_num in range(8, 10): 9 url = 'https://www.ppzuowen.com/book/nahan/8996_' + str(chp_num) + '.html' 10 # url = 'https://www.ppzuowen.com/book/nahan/8996.html' # 第一章 11 header = { 12 'Users-Agent': UserAgent().random 13 } 14 html = requests.get(url, headers=header) 15 html.encoding = 'gbk' # requests 编码与网页编码保持一致 16 print(html.text) 17 18 pat = r'(.*?)
' 19 result = re.findall(pat, html.text) 20 21 print(result) 22 23 for i in range(len(result)-3): 24 with open('{}.txt'.format(result[0]), 'a+') as outfile: 25 strr = '\t' + str(result[i]) + '\n' 26 outfile.write(strr) 27 28 outfile.close()
啊啊啊,过几天还要考试,还没复习好,怎么办,渗透复习吧