python 网页爬取数据生成文字云图

1. 需要的三个包：

from wordcloud import WordCloud        #词云库

import matplotlib.pyplot as plt        #数学绘图库

import jieba;

2. 定义变量（将对于的变量到一个全局的文件中）：

import re;

pdurl_first='https://movie.douban.com/subject/26363254/comments?start=0'

head={'User-Agent':'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Ubuntu Chromium/59.0.3071.109 Chrome/59.0.3071.109 Safari/537.36'}

reg=re.compile(r'<a href="(.*?)&amp;.*?class="next">') #下一页

cookies={"__utma":"30149280.503249607.1504402391.1504402391.1504402391.1",

         "_utmb":"30149280.2.9.1504402391","__utmc":"","__utmt":"",

         "__utmz":"30149280.1504402391.1.1.utmcsr=(direct)|utmccn=(direct)|utmcmd=(none)",

         "ap":"","as":'"https://movie.douban.com/subject/26363254/comments?start=225&limit=20&sort=new_score&status=P"',

         "bid":"g7k4BGd2sRk","ck":"76vs","dbcl2":'"166279730:fohmXhoM9uU"',"ps":"y","push_doumail_num":"",

         "push_doumail_num":""}

3. 抓取数据

import requests;

import re;

from GrabData import Param;

import pandas as pd;

from bs4 import BeautifulSoup;

class GrabComent:

    ren = re.compile(r'<span class="votes">(.*?)</span>.*?comment">.*?</span>.*?<span.*?class="">(.*?)</a>.*?<span>(.*?)</span>.*?title="(.*?)"></span>.*?title="(.*?)"><p .*? > (.*?)</p>',re.S)

    def __init__(self):

        print('开始抓取数据');

        html = requests.get(Param.pdurl_first, headers=Param.head, cookies=Param.cookies);

        while html.status_code == 200:

            url_next = 'https://movie.douban.com/subject/26363254/comments' + re.findall(Param.reg, html.text)[0]

            zhanlang = re.findall(self.ren, html.text)

            print(zhanlang)

            data = pd.DataFrame(zhanlang)

            data.to_csv('H:\\python_projects\\ticket\\zhanlangpinglun.csv', header=False, index=False,

                        mode='a+')  # 写入csv文件,'a+'是追加模式

            data = []

            zhanlang = []

            print("下一页地址："+url_next);

            html = requests.get(url_next, cookies=Param.cookies, headers=Param.head)

if __name__ == '__main__':

    GrabComent();

4. 生成云图

from wordcloud import WordCloud        #词云库

import matplotlib.pyplot as plt        #数学绘图库

import jieba;

class WordYun:

    def __init__(self):

        print("开始读取文件!");

        self.main();

    def main(self):

        text = self.readFile();

        self.showTitle(text);

    def showTitle(self,text1):

        wc1 = WordCloud(

            background_color="white",

            width=1000,

            height=860,

            font_path="D:\\Windows\\Fonts\\STFANGSO.ttf",  # 不加这一句显示口字形乱码

            margin=2);

        wc2 = wc1.generate(text1)  # 我们观察到generate()接受一个Unicode的对象，所以之前要把文本处理成unicode类型

        plt.imshow(wc2)

        plt.axis("off")

        plt.show();

    def readFile(self):

        a = []

        f = open(r'H:\\python_projects\\ticket\\zhanlangpinglun.csv', 'r').read()

        words = list(jieba.cut(f))

        for word in words:

            if len(word) > 1:

                a.append(word);

        txt = r' '.join(a)

        print("readFile返回的结果："+txt);

        return txt;

if __name__ == '__main__':

    WordYun();

python 网页爬取数据生成文字云图的更多相关文章

Python分页爬取数据的分析
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 向右奔跑 PS:如有需要Python学习资料的小伙伴可以加点击下方链 ...
Python爬虫爬取数据的步骤
爬虫: 网络爬虫是捜索引擎抓取系统(Baidu.Google等)的重要组成部分.主要目的是将互联网上的网页下载到本地,形成一个互联网内容的镜像备份. 步骤: 第一步:获取网页链接 1.观察需要爬取的多 ...
菜鸟学IT之python网页爬取多页爬取
作业来源:https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/3002 0.从新闻url获取点击次数,并整理成函数 newsUrl news ...
菜鸟学IT之python网页爬取初体验
作业来源:https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/2881 1. 简单说明爬虫原理爬虫简单来说就是通过程序模拟浏览器放松请求站 ...
python requests 爬取数据
import requests from lxml import etree import time import pymysql import json headers={ 'User-Agent' ...
python爬虫—爬取百度百科数据
爬虫框架:开发平台 centos6.7 根据慕课网爬虫教程编写代码片区百度百科url,标题,内容分为4个模块:html_downloader.py 下载器 html_outputer.py 爬取数 ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
Python实训day07pm【Selenium操作网页、爬取数据-下载歌曲】
练习1-爬取歌曲列表任务:通过两个案例,练习使用Selenium操作网页.爬取数据.使用无头模式,爬取网易云的内容. ''' 任务:通过两个案例,练习使用Selenium操作网页.爬取数据. 使用无 ...

随机推荐

YDNJS（上卷）：this 的绑定对象
函数中的 this 是在调用时被绑定的,this 指向谁完全取决于函数的调用位置. 确定 this 的绑定对象的方式有 4 种. 默认绑定默认绑定就是将函数中的 this 绑定给了全局对象 wind ...
第04章-面向切面的Spring
1. 什么是面向切面编程 AOP是什么切面帮助我们模块化横切关注点. 横切关注点可被描述为影响应用[多处的]功能.如安全,应用许多方法会涉及安全规则. 继承与委托是最常见的实现重用通用功能的面向 ...
datetime 2017-10-21 10:09:02.560 转年月日的时间类型
sql语句时间转年月日格式: 适用于多种时间格式 select REPLACE(STUFF(CONVERT(char(10), REPLACE(CONVERT(varchar(10),'2017-1 ...
编写高质量代码改善C#程序的157个建议——建议15：使用dynamic来简化反射实现
建议15: 使用dynamic来简化反射实现 dynamic是Framework 4.0的新特性.dynamic的出现让C#具有了弱语言类型的特性.编译器在编译的时候不再对类型进行检查,编译器默认dy ...
如何将一个用utf-8编码的文本用java程序转换成ANSI编码的文本
jdk有一个关于UTF-8的bug所以加了一句 br.skip(1); bugID: http://bugs.java.com/view_bug.do?bug_id=4508058 public st ...
linq to sql 实现左（右）连接，那个方法是对的,该怎么处理
linq to sql 实现左(右)连接,那个方法是对的var query2 = from tb0 in db.table_0 join tb1 in db.table_1 on table_0.关 ...
开源IMS平台中间件Mobicents
下面内容来自百度百科 Mobicents 是一个高伸缩性.事件驱动的应用服务器.是一款专业的.开放源代码的 VoIP 中间件平台.Mobicents是首个采用JAIN SLEE标准的开放式源代码电信应 ...
关于JAVA数组的几点注意事项与一些低级错误
1.数组不是集合,它只能保存同种类型的多个原始类型或者对象的引用.数组保存的仅仅是对象的引用,而不是对象本身. 2.数组本身就是对象,Java中对象是在堆中的,因此数组无论保存原始类型还是其他对象类型 ...
Task ContinueWith
前正无生意,且记Task.ContinueWith之用法. using System; using System.Collections.Generic; using System.Diagnosti ...
笔记本小键盘提示 C#
穷人家的孩子,买了个笔记本愣是没有小键盘提示灯. 牛的是人家给了一个大写提示灯. 更牛的是他妈给了音量关闭打开的提示灯,还他妈是橙色的!!!!!! 没办法弄了小程序来判断是否打开小键盘了. 本来是 ...

python 网页爬取数据生成文字云图

python 网页爬取数据生成文字云图的更多相关文章

随机推荐

热门专题