想把一个小网站的阿Q正传搞出来,写了一个python爬虫


 1 # -*- coding: utf-8 -*-
 2 
 3 import requests
 4 import re
 5 from fake_useragent import UserAgent
 6 
 7 '''https://www.ppzuowen.com/book/nahan/8996.html'''
 8 for chp_num in range(8, 10):
 9     url = 'https://www.ppzuowen.com/book/nahan/8996_' + str(chp_num) + '.html'
10     # url = 'https://www.ppzuowen.com/book/nahan/8996.html' # 第一章
11     header = {
12         'Users-Agent': UserAgent().random
13     }
14     html = requests.get(url, headers=header)
15     html.encoding = 'gbk' # requests 编码与网页编码保持一致
16     print(html.text)
17 
18     pat = r'

(.*?)

' 19 result = re.findall(pat, html.text) 20 21 print(result) 22 23 for i in range(len(result)-3): 24 with open('{}.txt'.format(result[0]), 'a+') as outfile: 25 strr = '\t' + str(result[i]) + '\n' 26 outfile.write(strr) 27 28 outfile.close()

啊啊啊,过几天还要考试,还没复习好,怎么办,渗透复习吧