大家好,我是苏承栈。今天我们来聊聊Python爬虫的实战技巧,特别是如何用关键词词频分析A股上市公司年报。
在前面的文章中,我们已经学会了如何爬取和转换年报数据。今天,我们将深入挖掘这些数据,通过关键词词频分析,看看哪家公司对数字化最感兴趣。
准备工作
首先,我们需要安装两个库:jieba(用于中文分词)和xlwt(用于创建Excel文件)。
pip install jieba xlwt
关键词提取
接下来,我们定义一个函数 extract_keywords,用于从文本文件中提取关键词并统计它们的出现次数。
def extract_keywords(filename, keywords):
keyword_counts = [0] * len(keywords)
try:
with open(filename, 'r', encoding='utf-8') as f:
content = f.read()
words = jieba.cut(content)
words = [word for word in words if word.strip()]
for i, keyword in enumerate(keywords):
keyword_counts[i] = words.count(keyword)
except Exception as e:
print(f
