- 博客(1)
- 收藏
- 关注
原创 Python3-LDA主题模型+TF/IDF gensim实现,中文案例
LDA主题模型+TF/IDF gensim实现文本预处理当我们拿到文本数据时,我们需要将其转化为词袋,才能进行标准化处理,但是往往在这些数据中存在着一些噪音数据,如“的、我、吗、需要”这些对我们结果没有意义的词语,同时在进行切词时可能将一个词切成多个,如将“泸州老窖”切成“泸州”,“老窖”两个词,其次繁体字英文也会对结果进行一些干扰,综上所述我们将进行数据清晰,生成规范的数据。#导入库from gensim import corporafrom gensim.models import LdaMo
2020-08-07 16:00:28 6996 5
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人