文章导读
大家好,我是苏承栈。今天我们来聊聊如何用Python爬取起点中文网的完本小说。这篇文章会手把手教你们如何实现这个任务,包括如何获取页面源码、解析数据,以及如何保存到Excel表格中。读完这篇文章,你将能够独立完成这个有趣的爬虫项目。
正文部分
首先,我们需要使用requests模块来获取页面源码。这里有一个示例代码:
headers = {
'User-Agent': 'Mozilla / 5.0(Windows NT 10.0;Win64;x64) AppleWebKit / 537.36(KHTML, likeGecko) Chrome / 86.0.4240.198Safari / 537.36'
}
param = {
'page': page_num
}
url = 'https://www.qidian.com/finish?action=hidden&orderId=&style=1&pageSize=20&siteid=1&pubflag=0&hiddenField=2&'
response = requests.get(url=url, params=param, headers=headers)
page_data = response.text
这里要注意的是,当直接打印page_data时,发现页面源码缺少关键内容。但是,当我们保存为HTML文件并使用BeautifulSoup解析后,关键内容又出现了。这是因为网页可能使用了JavaScript动态加载内容,而直接获取的HTML只包含了静态部分。
file = open('qidian.html', 'r', encoding='utf-8')
soup = BeautifulSoup(file, 'lxml')
接下来,我们可以使用正则表达式提取所需数据,并将其保存到列表中。最后,我们可以使用Excel库将数据保存到Excel表格中。
完整代码
# -*- coding = utf-8 -*-
# @Time : 2020/12/27 11:17
# @author: 农夫三犭
# @File : main.py
# @Software:PyCharm
import requests
import re
小结与拓展
通过这篇文章,我们学习了如何使用Python爬取起点中文网的完本小说。这个方法可以应用于其他类似网站的爬虫任务。如果你对爬虫技术感兴趣,可以关注极星编程网(www.jxgpc.com)了解更多相关内容。
我是苏承栈,希望这篇文章对你有所帮助。如果你有其他问题或想法,欢迎在评论区留言讨论。
