Python-爬虫之股转系统下载文件自动翻页

上次代码只能抓取一个网页上的链接，本次可以自主设定抓取的页面个数。

代码如下：

from selenium import webdriver

import os, time

class DownloadFiles():

    def __init__(self):

        self.url = 'http://www.neeq.com.cn/disclosure/announcement.html'

        self.basePath = os.path.dirname(__file__)

        self.times = 7  #表示翻页的次数

    def makedir(self, name):

        path = os.path.join(self.basePath, name)

        isExist = os.path.exists(path)

        if not isExist:

            os.makedirs(path)

            print('File has been created.')

        else:

            print('The file is existed.')

        # 切换到该目录下

        os.chdir(path)

    def connect(self, url):

        driver = webdriver.PhantomJS()

        driver.get(url)

        return driver

    #翻页

    def nextPage(self, driver):

        #每次点击next之后停顿5秒钟

        next = driver.find_element_by_class_name('next')

        next.click()

        time.sleep(5)

    def getFiles(self):

        driver = self.connect(self.url)

        self.makedir('Files')

        #自动翻页

        for i in range(self.times):

            print('第' + str(i+1) + '页:')

            aList = driver.find_elements_by_tag_name('a')

            for r in aList:

                try:

                    link = r.get_attribute('href')

                    if link.endswith('pdf'):

                        print(r.text)

                        print(link)

                        fileName = r.text + '.pdf'

                        #urlretrieve(link, fileName)

                except:

                    pass

            self.nextPage(driver=driver)

if __name__ == '__main__':

    obj = DownloadFiles()

    obj.getFiles()

Python-爬虫之股转系统下载文件自动翻页的更多相关文章

【图文详解】python爬虫实战——5分钟做个图片自动下载器
python爬虫实战——图片自动下载器之前介绍了那么多基本知识[Python爬虫]入门知识,(没看的先去看!!)大家也估计手痒了.想要实际做个小东西来看看,毕竟: talk is cheap sho ...
使用FileZilla从Linux系统下载文件
需求:将Linux系统的的某个文件夹(里面包含文件夹和文件)下载到我Windows系统某个文件夹里之前我使用xshell下载,但是通过 rz :上传sz:下载命令中的sz命令,下载失败. 下载 c ...
python webdriver api-右键另存下载文件
右键另存下载文件先编辑SciTE脚本: ;ControlFocus("title","text",controlID) ;表示将焦点切换到标题为title窗体 ...
python爬虫实战——5分钟做个图片自动下载器
python爬虫实战——图片自动下载器制作爬虫的基本步骤顺便通过这个小例子,可以掌握一些有关制作爬虫的基本的步骤. 一般来说,制作一个爬虫需要分以下几个步骤: 分析需求(对,需求分析非常重要, ...
初级版python登录验证，上传下载文件加MD5文件校验
服务器端程序 import socket import json import struct import hashlib import os def md5_code(usr, pwd): ret ...
python网络编程-socket上传下载文件(包括md5验证，大数据发送，粘包处理)
ftp server 1) 读取文件名 2)检查文件是否存在 3)打开文件 4)检查文件大小 5)发送文件大小给客户端 6)等客户端确认 7)开始边读边(md5计算)发数据 8)给客户端发md5 ft ...
使用Python在自己博客上进行自动翻页
先上一张代码及代码运行后的输出结果的图! 下面上代码: # coding=utf-8 import os import time from selenium import webdriver #打开火 ...
Python 爬虫实例（13）下载 m3u8 格式视频
Python requests 下载 m3u8 格式视频最近爬取一个视频网站,遇到 m3u8 格式的视频需要下载. 抓包分析,视频文件是多个 ts 文件,什么是 ts文件,请去百度 ...
Python爬虫之记录一次下载验证码的尝试
好久没有写过爬虫的文章了,今天在尝试着做验证码相关的研究时,遇到了验证码的收集问题. 一般,验证码的加载都有着比较复杂的算法和加密在里边,但是笔者今天碰到的验证码却比较幸运,有迹可循.在此,给 ...

随机推荐

问题 |无法找到Python路径，需手动配置环境变量
问题: 在命令行cmd输入Python,如果出现以下无法识别命令行的报错,说明在系统环境变量中无法找到对应之前安装的Python的路径,则需手动配置一下怎么配置? 1.打开我的电脑——右键——属性— ...
read more阅读更多，文字超过三行字符后面添加省略号
var text;$('.blog-item').each(function (i) {text = $(this).find('.blog-excerpt').html();if (text.len ...
magento 多域名多店
在magento1.4中请参考官网 :http://www.magentocommerce.com/knowledge-base/entry/tutorial-multi-site-multi-dom ...
使用PaxScript为Delphi应用增加对脚本的支持
通过使用PaxScript可以为Delphi应用增加对脚本的支持. PaxScript支持paxC,paxBasic,paxPascle,paxJavaScript(对ECMA-262做了扩展) 四种 ...
DELPHI中枚举类型数据的介绍和使用方法
在看delphi程序的时候看到aa=(a,b,c,d);这样的东西,还以为是数组,同事说是函数,呵呵,当然这两个都不屑一击,原来这样式子是在声明并付值一个枚举类型的数据.下边写下来DELPHI中枚举类 ...
贪婪算法--Python
贪婪算法:每步都采取最优的做法,即每步都选择局部最优解,最终得到的就是全局最优解. 假设你办了个广播节目,要让全美50个州的听众都收听得到.为此你需要决定在哪些广播台播出.在每个广播台播出都需要支付费 ...
python sort 和sorted排序
当我们从数据库中获取一写数据后,一般对于列表的排序是经常会遇到的问题,今天总结一下python对于列表list排序的常用方法: 第一种:内建方法sort() 可以直接对列表进行排序用法: list. ...
JAVA学习之数组
一.数组定义同一种类型数据的集合,其实数组就是一个容器数组定义格式:1.数据类型[] 变量名 = new 数据类型[数组长度] int[] arr = new int[5]; 2.数据类型[] 数组名 ...
将某个Qt4项目升级到Qt5遇到的问题
本文转载自http://hi.baidu.com/xchinux/item/9044d8ce986accbb0d0a7b87 一.将某个QT4项目改成QT5遇到的问题该Qt4项目以前是使用Qt4.7 ...
scala 实现算法
快速排序 def sort(xs: Array[Int]): Array[Int] = if (xs.length <= 1) xs else { val pivot = xs(xs.lengt ...

Python-爬虫之股转系统下载文件自动翻页

Python-爬虫之股转系统下载文件自动翻页的更多相关文章

随机推荐

热门专题