Python-爬虫之股转系统下载文件自动翻页

上次代码只能抓取一个网页上的链接，本次可以自主设定抓取的页面个数。

代码如下：

from selenium import webdriver

import os, time

class DownloadFiles():

    def __init__(self):

        self.url = 'http://www.neeq.com.cn/disclosure/announcement.html'

        self.basePath = os.path.dirname(__file__)

        self.times = 7  #表示翻页的次数

    def makedir(self, name):

        path = os.path.join(self.basePath, name)

        isExist = os.path.exists(path)

        if not isExist:

            os.makedirs(path)

            print('File has been created.')

        else:

            print('The file is existed.')

        # 切换到该目录下

        os.chdir(path)

    def connect(self, url):

        driver = webdriver.PhantomJS()

        driver.get(url)

        return driver

    #翻页

    def nextPage(self, driver):

        #每次点击next之后停顿5秒钟

        next = driver.find_element_by_class_name('next')

        next.click()

        time.sleep(5)

    def getFiles(self):

        driver = self.connect(self.url)

        self.makedir('Files')

        #自动翻页

        for i in range(self.times):

            print('第' + str(i+1) + '页:')

            aList = driver.find_elements_by_tag_name('a')

            for r in aList:

                try:

                    link = r.get_attribute('href')

                    if link.endswith('pdf'):

                        print(r.text)

                        print(link)

                        fileName = r.text + '.pdf'

                        #urlretrieve(link, fileName)

                except:

                    pass

            self.nextPage(driver=driver)

if __name__ == '__main__':

    obj = DownloadFiles()

    obj.getFiles()

Python-爬虫之股转系统下载文件自动翻页的更多相关文章

【图文详解】python爬虫实战——5分钟做个图片自动下载器
python爬虫实战——图片自动下载器之前介绍了那么多基本知识[Python爬虫]入门知识,(没看的先去看!!)大家也估计手痒了.想要实际做个小东西来看看,毕竟: talk is cheap sho ...
使用FileZilla从Linux系统下载文件
需求:将Linux系统的的某个文件夹(里面包含文件夹和文件)下载到我Windows系统某个文件夹里之前我使用xshell下载,但是通过 rz :上传sz:下载命令中的sz命令,下载失败. 下载 c ...
python webdriver api-右键另存下载文件
右键另存下载文件先编辑SciTE脚本: ;ControlFocus("title","text",controlID) ;表示将焦点切换到标题为title窗体 ...
python爬虫实战——5分钟做个图片自动下载器
python爬虫实战——图片自动下载器制作爬虫的基本步骤顺便通过这个小例子,可以掌握一些有关制作爬虫的基本的步骤. 一般来说,制作一个爬虫需要分以下几个步骤: 分析需求(对,需求分析非常重要, ...
初级版python登录验证，上传下载文件加MD5文件校验
服务器端程序 import socket import json import struct import hashlib import os def md5_code(usr, pwd): ret ...
python网络编程-socket上传下载文件(包括md5验证，大数据发送，粘包处理)
ftp server 1) 读取文件名 2)检查文件是否存在 3)打开文件 4)检查文件大小 5)发送文件大小给客户端 6)等客户端确认 7)开始边读边(md5计算)发数据 8)给客户端发md5 ft ...
使用Python在自己博客上进行自动翻页
先上一张代码及代码运行后的输出结果的图! 下面上代码: # coding=utf-8 import os import time from selenium import webdriver #打开火 ...
Python 爬虫实例（13）下载 m3u8 格式视频
Python requests 下载 m3u8 格式视频最近爬取一个视频网站,遇到 m3u8 格式的视频需要下载. 抓包分析,视频文件是多个 ts 文件,什么是 ts文件,请去百度 ...
Python爬虫之记录一次下载验证码的尝试
好久没有写过爬虫的文章了,今天在尝试着做验证码相关的研究时,遇到了验证码的收集问题. 一般,验证码的加载都有着比较复杂的算法和加密在里边,但是笔者今天碰到的验证码却比较幸运,有迹可循.在此,给 ...

随机推荐

自定义checkbox,radio样式
input[type=radio] { margin-right: 5px; cursor: pointer; font-size: 14px; width: 15px; height: 15px; ...
elementUi-复选框，使用v-for循环出来的复选框,默认多个值为勾选状态
1. 使用 v-model="BottomSelectFor[index].tick" 绑定要默认勾选的状态 2.在数组中定义 tick:true,没有的字段默认为false 3. ...
DELPHI常用类型及定义单元
Controls Application (the variable not a type) Forms Beep SysUtils or Windows (different functions) ...
JS 变量相关内容
JS变量按存储方式区分为哪些类型?: js变量按照存储方式分为两种类型:值类型和引用类型 1.值类型(基本类型): 布尔值(boolean) . null .undefined .数值(numbe ...
HDU 1700 Points on Cycle (坐标旋转)
题目链接:HDU 1700 Problem Description There is a cycle with its center on the origin. Now give you a poi ...
certbot免费证书
yum install python-certbot-nginx 开启防火墙443端口 firewall-cmd --add-port=443/tcp --permanent 别忘了重启 firewa ...
.net 委托 +lamda表达式
1.委托与类同级想当于定义了一个类型如 delegate int Sum(int a, int b);// 在声明类之前声明 2.这里可以在类里写个函数 public int sumAB(int ...
总分 Score Inflation
题目背景学生在我们USACO的竞赛中的得分越多我们越高兴. 我们试着设计我们的竞赛以便人们能尽可能的多得分,这需要你的帮助题目描述我们可以从几个种类中选取竞赛的题目,这里的一个"种类& ...
Android网络(3):HttpClient作client,Tomcat Servlet作server的交互演示样例
前面相继介绍了Android网络编程里的Socket传输图片.HttpURLConnection,今天看HttpClient. 第一部分:JavaEE版的Eclipse配置Tomcat [备注:开发后 ...
kali环境配置
1.配置源及刷新软件列表建议用官方默认源: # vi /etc/apt/sources.list deb http://http.kali.org/kali kali-rolling main no ...

Python-爬虫之股转系统下载文件自动翻页

Python-爬虫之股转系统下载文件自动翻页的更多相关文章

随机推荐

热门专题