盘点一个英文文本中统计关键词的方法

大家好,我是皮皮。

一、前言

前几天在Python最强王者交流群【Wendy Zheng】问了一个英文文本中统计关键词的问题,这里拿出来给大家分享下。

image

二、实现过程

针对这个问题,本文给出一个思路方法,也许有帮助,首先我们需要将Excel中的文本进行导入到一个文本文件中去,代码如下:

1# coding: utf-8 2import pandas as pd 3df = pd.read_excel('./文本.xlsx') 4# print(df.head()) 5# df['专业关键词'] 6for text in df['工作要求']: 7 # print(text) 8 if text is not None: 9 with open('工作要求.txt', mode='a', encoding='utf-8') as file: 10 file.write(str(text)) 11 12print('写入完成') 13

接下来就可以针对这个文本文件进行相关的词频统计了,如果你有自己自定义的关键词,也可以就着关键词去统计,没有的话,就自己在关键词范围内,任意取多少个关键词都可以,相关的代码如下所示:

1from collections import Counter 2import pandas as pd 3df = pd.read_excel('./文本.xlsx') 4# print(df.head()) 5 6words = [] 7 8with open('工作要求.txt', 'r', encoding='utf-8') as f: 9 line = f.readlines() 10 for word in line[0].split(' '): 11 words.append(word) 12 13print(len(words)) 14 15counter = Counter(words) 16# print(counter) 17 18# df['专业关键词'] 19for text in df['专业关键词']: 20 for k, v in counter.items(): 21 if k == text: 22 print(k, v) 23

这个代码对于英文文本还是适用的,不过有个小问题,如下。

image

最后这里也给出中文分词的代码和可视化代码,两者结合在一起的,感兴趣的小伙伴们可以试试看。

1from collections import Counter # 统计词频 2from pyecharts.charts import Bar 3from pyecharts import options as opts 4from snownlp import SnowNLP 5import jieba # 分词 6with open('text_分词后_outputs.txt', 'r',encoding='utf-8') as f: 7 read = f.read() 8with open('stop_word.txt', 'r', encoding='utf-8') as f: 9 stop_word = f.read() 10word = jieba.cut(read) 11words = [] 12for i in list(word): 13 if i not in stop_word: 14 words.append(i) 15 16columns = [] 17data = [] 18for k, v in dict(Counter(words).most_common(10)).items(): 19 20 columns.append(k) 21 data.append(v) 22bar = ( 23 Bar() 24 .add_xaxis(columns) 25 .add_yaxis("词频", data) 26 .set_global_opts(title_opts=opts.TitleOpts(title="词频top10")) 27 ) 28bar.render("词频.html") 29

三、总结

大家好,我是皮皮。这篇文章主要盘点了一个英文文本中统计关键词方法处理的问题,文中针对该问题,给出了具体的解析和代码实现,帮助粉丝顺利解决了问题。

最后感谢粉丝【Wendy Zheng】提问,感谢【Python进阶者】给出的思路和代码解析,感谢【Python狗】等人参与学习交流。

点赞
收藏

评论区

加载中...

相关推荐

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

编写一个闭包函数,要实现的功能是计数功能

大家好,我是皮皮。一、前言前几天在Python最强王者交流群有个叫【杰】的粉丝问了一个Python装饰器的问题,这里拿出来给大家分享下,一起学习下。二、解决过程这里【东哥】给出了解答,其实这个题目就是在考你装饰器的内容。代码如下:count0defwrapper(func):definner(args,kwargs):g

有哪个大神知道这个词频要计算出具体的数,怎么添加代码吗?

大家好,我是皮皮。一、前言前几天在Python最强白银交流群【王王雪饼】问了一个Python处理词频的问题,这里拿出来给大家分享下。下图是他的代码:统计词频fromcollectionsimportCounterwordcountCounter(allwo

如果想要删除四列中都有相同项的数据,有什么方便的方法吗?

大家好,我是皮皮。一、前言前几天在Python最强王者交流群【WendyZheng】问了一个重复值删除的问题,这里拿出来给大家分享下。二、实现过程针对这个问题,【郑煜哲·Xiaopang】给了一个思路,使用dropduplicates(subset)去重。

盘点一个Python列表的基础题目

大家好,我是皮皮。一、前言前几天在Python最强王者群【eric】问了一个Python列表基础的问题,这里拿出来给大家分享下。代码如下:pythonlist1三、总结大家好,我是皮皮。这篇文章主要盘点了一个Python列表基础的问题,文中针对该问题,给出