结巴库及词频统计bb

下面是利用云图和结巴库完成词频统计。代码如下：

# -*- coding:utf- -*-

from wordcloud import WordCloud

import matplotlib.pyplot as plt

import numpy as np

from PIL import Image

from jieba import *

def Replace(text,old,new): #替换列表的字符串

    for char in old:

        text = text.replace(char,new)

    return text

def getText(filename): #读取文件内容（utf- 编码格式）

    #特殊符号和部分无意义的词

    sign = '''！~·@￥……*“”‘’\n（）{}【】；："'「，」。-、？'''

    txt = open('{}.txt'.format(filename),encoding='utf-8').read()

    return Replace(txt,sign," ")

def creat_word_cloud(filename): #将filename 文件的词语按出现次数输出为词云图

    text = getText(filename) #读取文件

    wordlist = lcut(text) #jieba库精确模式分词

    wl = ' '.join(wordlist) #生成新的字符串

    #设置词云图

    font = r'C:\Windows\Fonts\simfang.ttf' #设置字体路径

    wc = WordCloud(

        background_color = 'black', #背景颜色

        max_words = ,           #设置最大显示的词云数

        font_path = font,           #设置字体形式（在本机系统中）

        height = ,              #图片高度

        width = ,               #图片宽度

        max_font_size = ,        #字体最大值

        random_state = ,         #配色方案的种类

        )

    myword = wc.generate(wl) #生成词云

    #展示词云图

    plt.imshow(myword)

    plt.axis('off')

    plt.show()

    #以原本的filename命名保存词云图

    wc.to_file('{}.png'.format(filename))

if __name__ == '__main__':

    creat_word_cloud('Detective_Novel') #输入文件名生成词云图

注：代码使用的文档 >>> Detective_Novel(utf-8).zip[点击下载]，也可自行找 utf-8 编码格式的txt文件。

效果如下：

结巴库及词频统计bb的更多相关文章

软工结对项目之词频统计update
队友胡展瑞 031602215 作业页面 GitHub 具体分工 111500206 赵畅:负责WordCount的升级,添加新的命令行参数支持(自定义输入输出文件,权重词频统计,词组统计等所有新功 ...
作业3-个人项目<词频统计>
上了一天的课,现在终于可以静下来更新我的博客了. 越来越发现,写博客是一种享受.来看看这次小林老师的“作战任务”. 词频统计单词: 包含有4个或4个以上的字 ...
C语言实现词频统计——第二版
原需求 1.读取文件,文件内包可含英文字符,及常见标点,空格级换行符. 2.统计英文单词在本文件的出现次数 3.将统计结果排序 4.显示排序结果新需求: 1.小文件输入. 为表明程序能跑 2.支持命 ...
c语言实现词频统计
需求: 1.设计一个词频统计软件,统计给定英文文章的单词频率. 2.文章中包含的标点不计入统计. 3.将统计结果以从大到小的排序方式输出. 设计: 1.因为是跨专业0.0···并不会c++和java, ...
软件工程第一次个人项目——词频统计by11061153柴泽华
一.预计工程设计时间明确要求: 15min: 查阅资料: 1h: 学习C++基础知识与特性: 4-5h: 主函数编写及输入输出部分: 0.5h: 文件的遍历: 1h: 编写两种模式的词频统计函数: ...
python瓦登尔湖词频统计
#瓦登尔湖词频统计: import string path = 'D:/python3/Walden.txt' with open(path,'r',encoding= 'utf-8') as tex ...
Hadoop上的中文分词与词频统计实践（有待学习 http://www.cnblogs.com/jiejue/archive/2012/12/16/2820788.html）
解决问题的方案 Hadoop上的中文分词与词频统计实践首先来推荐相关材料:http://xiaoxia.org/2011/12/18/map-reduce-program-of-rmm-word-c ...
pyspark进行词频统计并返回topN
Part I:词频统计并返回topN 统计的文本数据: what do you do how do you do how do you do how are you from operator imp ...
使用storm分别进行计数和词频统计
计数直接上代码 public class LocalStormSumTopology { public static void main(String[] agrs) { //Topology是通过 ...

随机推荐

JS数组循环的性能和效率分析（for、while、forEach、map、for of）
从最简单的for循环说起 for( 初始化:条件; ){} 条件为Trusy 值时候,可以继续执行for 循环,当条件变为Falsy 时跳出for循环.for循环常见的四种写法const person ...
前端开发-日常开发沉淀之git提交文件忽略
.gitignore文件里添加需忽略的文件,或需要提交的文件 # Created by .ignore support plugin (hsz.mobi) ### VisualStudioCode t ...
CSS实现标题/段落省略效果的三剑客
white-space: nowrap;overflow:hidden;text-overflow:ellipsis; 效果如下:
Autofac之依赖注入
这里主要学习一下Autofac的依赖注入方式默认构造函数注入 class A { public B _b; public A() { } public A(B b) { this._b = b; } ...
python摸爬滚打之day030----进程
1.操作系统了解现代的计算机系统主要是由一个或者多个处理器,主存,硬盘,键盘,鼠标,显示器,打印机,网络接口及其他输入输出设备组成, 这些都是硬件设备, 而操作系统就是负责调用这些硬件为用户服务的. ...
Linux环境下虚拟环境virtualenv安装和使用
virtualenv用于创建独立的Python环境,多个Python相互独立,互不影响,它能够: 1. 在没有权限的情况下安装新套件 2. 不同应用可以使用不同的套件版本 3. 套件升级不影响其他应用 ...
@ResponseBody ResponseEntity
1.产生疑问我们知道,如果在 Controller 的某个方法上加上 @ResponseBody 注解,那么你就能拿到 json 数据. 如果你只是知道这么用,那么你应该知道 ResponseBod ...
LeetCode-7-反转整数-c# 版本
c# 版本 // 给定一个 32 位有符号整数,将整数中的数字进行反转. public class Solution { public int Reverse(int x) { / // 边界判断 / ...
sort();对结构体数组的排序
sort(); 位于C++ 头文件 #include<algorithm>中数组排序(从小到大,从大到小) 结构体排序(数字参数从大到小...字符串为参数字典序....) 代码示例:( ...
常见的四种文本自动分词详解及IK Analyze的代码实现
以下解释来源于网络-百度百科 1.word分词器 word分词 [1] 是一个Java实现的分布式的中文分词组件,提供了多种基于词典的分词算法,并利用ngram模型来消除歧义.能准确识别英文.数字, ...

结巴库及词频统计bb

结巴库及词频统计bb的更多相关文章

随机推荐

热门专题