[Python爬虫] 之三十一：Selenium +phantomjs 利用 pyquery抓取消费主张信息

　　一、介绍

　　　　本例子用Selenium +phantomjs爬取央视栏目（http://search.cctv.com/search.php?qtext=消费主张&type=video）的信息（标题，时间）

　　二、网站信息

　　python 代码

# coding=utf-8

import os

import re

from selenium import webdriver

from datetime import datetime,timedelta

import time

from pyquery import PyQuery as pq

import re

import mongoDB

import datetime

class consumer:

    def __init__(self):

        #通过配置文件获取IEDriverServer.exe路径

        # IEDriverServer ='C:\Program Files\Internet Explorer\IEDriverServer.exe'

        # self.driver = webdriver.Ie(IEDriverServer)

        # self.driver.maximize_window()

        self.driver = webdriver.PhantomJS(service_args=['--load-images=false'])

        # self.driver = driver = webdriver.Chrome()

        self.driver.set_page_load_timeout(10)

        self.driver.maximize_window()

        self.db = mongoDB.mongoDbBase()

    def WriteLog(self, message,date):

        fileName = os.path.join(os.getcwd(), 'consumer/' + date  +   '.txt')

        with open(fileName, 'a') as f:

            f.write(message)

    # http://search.cctv.com/search.php?qtext=消费主张&type=video

    def CatchData(self,url='http://search.cctv.com/search.php?qtext=%E6%B6%88%E8%B4%B9%E4%B8%BB%E5%BC%A0&type=video'):

        error = ''

        try:

            self.driver.get(url)

            time.sleep(1)

            selenium_html = self.driver.execute_script("return document.documentElement.outerHTML")

            doc = pq(selenium_html)

            filename = datetime.datetime.now().strftime('%Y-%m-%d')

            message = '{0},{1}'.format( '标题', '时间')

            filename = datetime.datetime.now().strftime('%Y-%m-%d')

            self.WriteLog(message, filename)

            pages = doc("div[class='page']").find("a")

            # 2018-06-05 00:12:21

            pattern = re.compile("\d{4}-\d{2}-\d{2}\s\d{2}:\d{2}:\d{2}")

            for index in range(1,6):

                url = "get_data('{0}', '消费主张', 'relevance', 'video', '-1', '1', '', '20', '1')".format(index)

                self.driver.execute_script(url)

                selenium_html = self.driver.execute_script("return document.documentElement.outerHTML")

                doc = pq(selenium_html)

                Elements = doc("div[class='jvedio']").find("a")

                for sub in Elements.items():

                    title = sub.attr('title').encode('utf8')

                    ts = pattern.findall(title)

                    strtime = ''

                    if ts and len(ts) == 1:

                        strtime = ts[0]

                    if strtime:

                        index = title.index(strtime)

                        title = title[0:index]

                    title = '\n{0},{1}'.format(title,strtime)

                    self.WriteLog(title, filename)

        except Exception, e1:

            error = e1.message

    # def CatchData(self,url='http://search.cctv.com/search.php?qtext=%E6%B6%88%E8%B4%B9%E4%B8%BB%E5%BC%A0&type=video'):

    #     error = ''

    #     try:

    #         self.driver.get(url)

    #         time.sleep(1)

    #         selenium_html = self.driver.execute_script("return document.documentElement.outerHTML")

    #         doc = pq(selenium_html)

    #

    #         filename = datetime.datetime.now().strftime('%Y-%m-%d')

    #

    #         pages = doc("div[class='page']").find("a")

    #

    #         for element in pages.items():

    #             url = element.attr('onclick').encode('utf8')

    #             # get_data('1','消费主张','relevance','video','-1','1','','20','1')

    #             # get_data('2', '消费主张', 'relevance', 'video', '-1', '1', '', '20', '1')

    #             print url

    #             self.driver.execute_script(url)

    #             selenium_html = self.driver.execute_script("return document.documentElement.outerHTML")

    #             doc = pq(selenium_html)

    #

    #             Elements = doc("div[class='jvedio']").find("a")

    #             for sub in Elements.items():

    #                 title = sub.attr('title').encode('utf8')

    #                 print title

    #                 title = '\n{0}'.format(title)

    #                 self.WriteLog(title, filename)

    #     except Exception, e1:

    #         error = e1.message

obj = consumer()

obj.CatchData()

# obj.CatchContent('')

# obj.export('')

[Python爬虫] 之三十一：Selenium +phantomjs 利用 pyquery抓取消费主张信息的更多相关文章

[Python爬虫] 之二十八：Selenium +phantomjs 利用 pyquery抓取网站排名信息
一.介绍本例子用Selenium +phantomjs爬取中文网站总排名(http://top.chinaz.com/all/index.html,http://top.chinaz.com/han ...
[Python爬虫] 之二十一：Selenium +phantomjs 利用 pyquery抓取36氪网站数据
一.介绍本例子用Selenium +phantomjs爬取36氪网站(http://36kr.com/search/articles/电视?page=1)的资讯信息,输入给定关键字抓取资讯信息. 给 ...
[Python爬虫] 之三十：Selenium +phantomjs 利用 pyquery抓取栏目
一.介绍本例子用Selenium +phantomjs爬取栏目(http://tv.cctv.com/lm/)的信息二.网站信息三.数据抓取首先抓取所有要抓取网页链接,共39页,保存到数据库里 ...
[Python爬虫] 之十六：Selenium +phantomjs 利用 pyquery抓取一点咨询数据
本篇主要是利用 pyquery来定位抓取数据,而不用xpath,通过和xpath比较,pyquery效率要高. 主要代码: # coding=utf-8 import os import re fro ...
[Python爬虫] 之二十五：Selenium +phantomjs 利用 pyquery抓取今日头条网数据
一.介绍本例子用Selenium +phantomjs爬取今日头条(http://www.toutiao.com/search/?keyword=电视)的资讯信息,输入给定关键字抓取资讯信息. 给定 ...
[Python爬虫] 之二十二：Selenium +phantomjs 利用 pyquery抓取界面网站数据
一.介绍本例子用Selenium +phantomjs爬取界面(https://a.jiemian.com/index.php?m=search&a=index&type=news& ...
[Python爬虫] 之二十九：Selenium +phantomjs 利用 pyquery抓取节目信息信息
一.介绍本例子用Selenium +phantomjs爬取节目(http://tv.cctv.com/epg/index.shtml?date=2018-03-25)的信息二.网站信息三.数据抓 ...
[Python爬虫] 之十七：Selenium +phantomjs 利用 pyquery抓取梅花网数据
一.介绍本例子用Selenium +phantomjs爬取梅花网(http://www.meihua.info/a/list/today)的资讯信息,输入给定关键字抓取资讯信息. 给定关键字:数字: ...
[Python爬虫] 之二十七：Selenium +phantomjs 利用 pyquery抓取今日头条视频
一.介绍本例子用Selenium +phantomjs爬取今天头条视频(http://www.tvhome.com/news/)的信息,输入给定关键字抓取图片信息. 给定关键字:视频:融合:电视二 ...

随机推荐

深入浅出Spring（二） IoC详解
上次的博客深入浅出Spring(一)Spring概述中,我给大家简单介绍了一下Spring相关概念.重点是这么一句:Spring是为了解决企业应用开发的复杂性而创建的一个轻量级的控制反转(IoC)和面 ...
关于 bitset 的一些题目
参考 http://www.cplusplus.com/reference/bitset/bitset/ https://blog.csdn.net/snowy_smile/article/detai ...
Netstat -tln 命令是Linux查看端口使用情况
Netstat -tln 命令是Linux查看端口使用情况
python @classmethod 的使用场合
python @classmethod 的使用场合官方的说法: classmethod(function)中文说明:classmethod是用来指定一个类的方法为类方法,没有此参数指定的类的方法为实 ...
一文了解JVM全部垃圾回收器，从Serial到ZGC
<对象搜索算法与回收算法>介绍了垃圾回收的基础算法,相当于垃圾回收的方法论.接下来就详细看看垃圾回收的具体实现. 上文提到过现代的商用虚拟机的都是采用分代收集的,不同的区域用不同的收集器. ...
20172333 2017-2018-2 《Java程序设计》第11周学习总结
20172333 2017-2018-2 <Java程序设计>第11周学习总结教材学习内容对于Android Studio的安装以及对安卓的一些基本组成,比如说四大组件Acticity ...
LCA(倍增在线算法) codevs 2370 小机房的树
codevs 2370 小机房的树时间限制: 1 s 空间限制: 256000 KB 题目等级 : 钻石 Diamond 题目描述 Description 小机房有棵焕狗种的树,树上有N个节点, ...
11.m进制转十进制
Strlen是字符串有多长就是多长,包括所有的元素和\0这个结束符题目描述 Description 将m进制数n转化成一个十进制数 m<=16 题目保证转换后的十进制数<=100 输入描 ...
bzoj1977 次小生成树
Description 小 C 最近学了很多最小生成树的算法,Prim 算法.Kurskal 算法.消圈算法等等. 正当小 C 洋洋得意之时,小 P 又来泼小 C 冷水了.小 P 说,让小 C 求出一 ...
内功心法 -- java.util.LinkedList<E> (4)
写在前面的话:读书破万卷,编码如有神--------------------------------------------------------------------下文主要对java.util ...

[Python爬虫] 之三十一：Selenium +phantomjs 利用 pyquery抓取消费主张信息

一、介绍

二、网站信息

[Python爬虫] 之三十一：Selenium +phantomjs 利用 pyquery抓取消费主张信息的更多相关文章

随机推荐

热门专题

　　一、介绍

　　二、网站信息