有哪个大神知道这个词频要计算出具体的数,怎么添加代码吗?

大家好,我是皮皮。

一、前言

前几天在Python最强白银交流群【王王雪饼】问了一个Python处理词频的问题,这里拿出来给大家分享下。

image.png

下图是他的代码:

image.png

1# 统计词频 2from collections import Counter 3 4wordcount = Counter(all_words) 5word_count = wordcount.most_common(30) 6 7frequence_list = [] 8for i in range(len(word_count)): 9 frequence_list.append(word_count[i][0]) 10frequence_list 11

二、实现过程

这里【Python进阶者】给了一个答案,如下所示:

image.png

代码如下:

1#!/usr/bin/env python3 2# -*- coding:utf-8 -*- 3 4import sys 5import jieba 6import jieba.analyse 7import xlwt # 写入Excel表的库 8 9# reload(sys) 10# sys.setdefaultencoding('utf-8') 11 12if __name__ == "__main__": 13 wbk = xlwt.Workbook(encoding='ascii') 14 sheet = wbk.add_sheet("wordCount") # Excel单元格名字 15 word_lst = [] 16 key_list = [] 17 for line in open('./《都挺好》阿耐_分词后_outputs.txt', 'r', encoding='utf-8'): # 需要分词统计的原始目标文档 18 19 item = line.strip('\n\r').split('\t') # 制表格切分 20 # print item 21 tags = jieba.analyse.extract_tags(item[0]) # jieba分词 22 for t in tags: 23 word_lst.append(t) 24 25 word_dict = {} 26 with open("分词结果.txt", 'w') as wf2: # 指定生成文件的名称 27 for item in word_lst: 28 if item not in word_dict: # 统计数量 29 word_dict[item] = 1 30 else: 31 word_dict[item] += 1 32 33 orderList = list(word_dict.values()) 34 orderList.sort(reverse=True) 35 # print orderList 36 for i in range(len(orderList)): 37 for key in word_dict: 38 if word_dict[key] == orderList[i]: 39 wf2.write(key + ' ' + str(word_dict[key]) + '\n') # 写入txt文档 40 key_list.append(key) 41 word_dict[key] = 0 42 43 for i in range(len(key_list)): 44 sheet.write(i, 1, label=orderList[i]) 45 sheet.write(i, 0, label=key_list[i]) 46 wbk.save('wordCount_all_lyrics.xls') # 保存为 wordCount.xls文件 47

顺利地解决了粉丝的问题。

image.png

后来【Yif18】也给了一个方法,他是把分词结果存成df然后groupby,如下所示:

image.png

后来【甯同学】也给了一个代码,如下图所示:

image.png

看上去不太美观,给它排个序再看看:

image.png

三、总结

大家好,我是皮皮。这篇文章主要盘点了一个Python处理词频的问题,文中针对该问题,给出了具体的解析和代码实现,帮助粉丝顺利解决了问题。

最后感谢粉丝【王王雪饼】提问,感谢【Python进阶者】、【论草莓如何成为冻干莓】、【瑜亮老师】、【甯同学】、【Yif18】给出的思路和代码解析,感谢【eric】等人参与学习交流。

点赞
收藏

评论区

加载中...

相关推荐

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

编写一个闭包函数,要实现的功能是计数功能

大家好,我是皮皮。一、前言前几天在Python最强王者交流群有个叫【杰】的粉丝问了一个Python装饰器的问题,这里拿出来给大家分享下,一起学习下。二、解决过程这里【东哥】给出了解答,其实这个题目就是在考你装饰器的内容。代码如下:count0defwrapper(func):definner(args,kwargs):g

大佬们,这个导包怎么写呀?本地执行可以,Linux执行报错

大家好,我是皮皮。一、前言前几天在Python最强白银交流群【喜靓仔】问了一个Python路径处理的问题,这里拿出来给大家分享下。下图是他的代码:二、实现过程这里【小王子】给了一个答案,如下所示:代码如下:fromsysimportpathpath.ins

大神们,函数定义到底哪块错了?

大家好,我是皮皮。一、前言前几天在Python白银交流群【王王雪饼】问了一个Python基础的问题,这里拿出来给大家分享下。其实就是一个函数处理的问题,她的函数定义有问题,一开始看半天,都没觉得有问题。二、实现过程这里【姜明松】、【eric】给了一个解决思

在计算语义相似度中,我看网上说要加range,我不知道往哪里加?

大家好,我是皮皮。一、前言前几天在Python白银交流群【王王雪饼】问了一个Python处理语义相似度的问题,这里拿出来给大家分享下。二、实现过程这里【eric】了解到她的原始数据和停用词啥的都在自己的,代码套用的作者的,估计还是会遇到些问题的,如下图所示

盘点一个Python正则表达式的问题

大家好,我是皮皮。一、前言前几天在Python白银群【whoisme】问了一个Python正则表达式的问题,这里拿出来给大家分享下。下图是他的正则表达式:二、实现过程这个正则表达式还是蛮复杂的,在Python中,正则表达式中的问号?表示前面的字符出现0次或

有哪个大神知道这个词频要计算出具体的数,怎么添加代码吗? - HelloWorld