跳转到主内容
极星编程网:以代码为星,赴技术山海!

如何用Python爬取起点中文网的完本小说?

文章导读

大家好,我是苏承栈。今天我们来聊聊如何用Python爬取起点中文网的完本小说。这篇文章会手把手教你们如何实现这个任务,包括如何获取页面源码、解析数据,以及如何保存到Excel表格中。读完这篇文章,你将能够独立完成这个有趣的爬虫项目。

正文部分

首先,我们需要使用requests模块来获取页面源码。这里有一个示例代码:

headers = {
    'User-Agent': 'Mozilla / 5.0(Windows NT 10.0;Win64;x64) AppleWebKit / 537.36(KHTML, likeGecko) Chrome / 86.0.4240.198Safari / 537.36'
}
param = {
    'page': page_num
}
url = 'https://www.qidian.com/finish?action=hidden&orderId=&style=1&pageSize=20&siteid=1&pubflag=0&hiddenField=2&'
response = requests.get(url=url, params=param, headers=headers)
page_data = response.text

这里要注意的是,当直接打印page_data时,发现页面源码缺少关键内容。但是,当我们保存为HTML文件并使用BeautifulSoup解析后,关键内容又出现了。这是因为网页可能使用了JavaScript动态加载内容,而直接获取的HTML只包含了静态部分。

file = open('qidian.html', 'r', encoding='utf-8')
soup = BeautifulSoup(file, 'lxml')

接下来,我们可以使用正则表达式提取所需数据,并将其保存到列表中。最后,我们可以使用Excel库将数据保存到Excel表格中。

完整代码

# -*-  coding = utf-8 -*-
# @Time : 2020/12/27 11:17
# @author: 农夫三犭
# @File : main.py
# @Software:PyCharm

import requests
import re

小结与拓展

通过这篇文章,我们学习了如何使用Python爬取起点中文网的完本小说。这个方法可以应用于其他类似网站的爬虫任务。如果你对爬虫技术感兴趣,可以关注极星编程网(www.jxgpc.com)了解更多相关内容。

我是苏承栈,希望这篇文章对你有所帮助。如果你有其他问题或想法,欢迎在评论区留言讨论。

相关文章