贪心学院 scrapy爬虫

生成爬虫

scrapy genspider 爬虫名 网址

打开调试用shell

scrapy shell 网址

主体 stock.py

# -*- coding: utf-8 -*-

import re

from urllib import parse

import scrapy

from stock_spider.items import StockItem

class StockSpider(scrapy.Spider):

    name = 'stock'

    allowed_domains = ['pycs.greedyai.com/']  #域名

    start_urls = ['http://pycs.greedyai.com/']    #地址

    def parse(self, response):

        post_urls= response.xpath("//a/@href").extract()  #获取子网址

        for post_url in post_urls:

            yield scrapy.Request(url=parse.urljoin(response.url,post_url),callback=self.parse_detail,dont_filter=True)  #整合成可访问的网址

    def parse_detail(self,response):

        stock_item= StockItem()

        #董事会成员

        stock_item['names']=self.get_name(response)

        #性别

        # stock_item['sexs']=self.get_sex(response)  #部分人员无性别资料导致后来的list越界

        #股票代码

        stock_item['codes']=self.get_code(response)

        #成员职位

        stock_item['positions']=self.get_position(response)

        yield stock_item

    def get_name(self,response):

        name=response.xpath("//td[@class=\"tc name\"]/a/text()").extract()

        return name

    def get_sex(self,response):

        sex_temp = response.xpath("//td[@class=\"intro\"]/text()").extract()

        sex_list=[]

        for sex_info in sex_temp:

            try:

                sex=re.findall("男|女",sex_info)[0]

                sex_list.append(sex)

            except(IndexError):  #捕获到该异常，则继续往下读取，因为视频上显示在有用数据前后有一些无效的转义字符

                continue

        return sex_list

    def get_code(self,response):

        code_temp=response.xpath("/html/body/div[3]/div[1]/div[2]/div[1]/h1/a/@title").extract()

        for code_info in code_temp:

            code=re.findall("\d+",code_info)

        return code

    def get_position(self,response):

        position = response.xpath("//td[@class=\"tl\"]/text()").extract()

        return position

main.py

from scrapy.cmdline import execute  #调试用

import sys

import os

sys.path.append(os.path.dirname(os.path.abspath(__file__)))

execute(["scrapy","crawl","stock"])

items.py

# -*- coding: utf-8 -*-

import scrapy

class StockSpiderItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    pass

class StockItem(scrapy.Item):  #新添加

    names=scrapy.Field()

    # sexs=scrapy.Field()

    codes=scrapy.Field()

    positions=scrapy.Field()

pipelines.py

# -*- coding: utf-8 -*-

# Define your item pipelines here

#

# Don't forget to add your pipeline to the ITEM_PIPELINES setting

# See: https://docs.scrapy.org/en/latest/topics/item-pipeline.html

import os

class StockSpiderPipeline(object):

    def process_item(self, item, spider):

        return item

class StockPipeline(object): #新添加

    # 类被加载时创建一个文件

    def __init__(self):

        self.file=open("executive_prep.csv","a+") # a+有则追加，无则创建

    def process_item(self, item, spider):

        #判断文件是否为空，为空则写入标头：姓名,性别,股票代码,职位

        #为空则追加写文件

        if os.path.getsize("executive_prep.csv"): #获取文件大小

            #开始写文件

            self.write_content(item)

        else:

            self.file.write("姓名,性别,股票代码,职位\n")

        self.file.flush()

    def write_content(self,item):

        names = item['names']

        # sexs = item['sexs']

        codes = item['codes']

        positions = item['positions']

        for i in range(len(names)):

            result=names[i]+","+codes[0]+","+positions[i]+"\n"

            self.file.write(result)

settings.py

# -*- coding: utf-8 -*-

BOT_NAME = 'stock_spider'

SPIDER_MODULES = ['stock_spider.spiders']

NEWSPIDER_MODULE = 'stock_spider.spiders' #新添加

# Configure item pipelines

# See https://docs.scrapy.org/en/latest/topics/item-pipeline.html

ITEM_PIPELINES = {

   'stock_spider.pipelines.StockSpiderPipeline': 300,

    'stock_spider.pipelines.StockPipeline': 300, #新添加

}

贪心学院 scrapy爬虫的更多相关文章

scrapy爬虫结果插入mysql数据库
1.通过工具创建数据库scrapy
Python之Scrapy爬虫框架安装及简单使用
题记:早已听闻python爬虫框架的大名.近些天学习了下其中的Scrapy爬虫框架,将自己理解的跟大家分享.有表述不当之处,望大神们斧正. 一.初窥Scrapy Scrapy是一个为了爬取网站数据,提 ...
Linux搭建Scrapy爬虫集成开发环境
安装Python 下载地址:http://www.python.org/, Python 有 Python 2 和 Python 3 两个版本, 语法有些区别,ubuntu上自带了python2.7. ...
Scrapy 爬虫
Scrapy 爬虫使用指南完全教程 scrapy note command 全局命令: startproject :在 project_name 文件夹下创建一个名为 project_name ...
[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
同时运行多个scrapy爬虫的几种方法（自定义scrapy项目命令）
试想一下,前面做的实验和例子都只有一个spider.然而,现实的开发的爬虫肯定不止一个.既然这样,那么就会有如下几个问题:1.在同一个项目中怎么创建多个爬虫的呢?2.多个爬虫的时候是怎么将他们运行起来 ...
如何让你的scrapy爬虫不再被ban之二（利用第三方平台crawlera做scrapy爬虫防屏蔽）
我们在做scrapy爬虫的时候,爬虫经常被ban是常态.然而前面的文章如何让你的scrapy爬虫不再被ban,介绍了scrapy爬虫防屏蔽的各种策略组合.前面采用的是禁用cookies.动态设置use ...
如何让你的scrapy爬虫不再被ban
前面用scrapy编写爬虫抓取了自己博客的内容并保存成json格式的数据(scrapy爬虫成长日记之创建工程-抽取数据-保存为json格式的数据)和写入数据库(scrapy爬虫成长日记之将抓取内容写入 ...
scrapy爬虫成长日记之将抓取内容写入mysql数据库
前面小试了一下scrapy抓取博客园的博客(您可在此查看scrapy爬虫成长日记之创建工程-抽取数据-保存为json格式的数据),但是前面抓取的数据时保存为json格式的文本文件中的.这很显然不满足我 ...

随机推荐

MySQL基础练习---牛客网的数据以及典型题目
1 部门表departments 部门no和部门名称 2 部门员工表 dept_emp 每个部门对应的员工信息 3 部门经理表 dept_manager 每个部门的经理信息 4 员工表 employe ...
kubernetes 存储volume，pv和pvc的使用
emptyDIR 临时目录 hostPath :使用主机的路径网络存储: 传统的设备存储:NAS,SAN 分布式存储:glusterfs,rbd,cephfs 云存储:EBS,Azure,阿里云的 ...
Mybatis源码学习之DataSource（七）_1
简述在数据持久层中,数据源是一个非常重要的组件,其性能直接关系到整个数据持久层的性能.在实践中比较常见的第三方数据源组件有Apache Common DBCP.C3P0.Proxool等,MyBat ...
Java基础__Java中自定义集合类
Java基础__Java中集合类传送门自定义MyArrayList集合实现:增加数据.取数据.查看集合中数据个数方法 package com.Gary; public class MyArrayL ...
solr系列之solr-5.5.5 window单机版jdk-1.7 tomcat8安装
一.Solr5.5.5.Tomcat8-x64.jdk-1.7-64单机部署 1.准备安装包,下载solr和tomcat的安装,直接解压即可(上篇一提供solr的下载路径) 2.在Solr5之前都还存 ...
nginx 实现高并发和高负载
一.Nginx是如何实现高并发的 service nginx start之后,然后输入#ps -ef|grep nginx,会发现Nginx有一个master进程和若干个worker进程,这些work ...
js将正整数转化为二进制
//正整数转化为二进制 function divideBy2(decNumber) { var decStack = []; var rem; var decString = ''; while (d ...
chrome中如何查看元素的hover事件
chrome中如何查看元素的hover事件一.总结一句话总结: Elements->Styles里面可以看到":hov":点开选择":hover"就可 ...
Flutter移动电商实战 --（12）首页导航区域编写
1.导航单元素的编写从外部看,导航是一个GridView部件,但是每一个导航又是一个上下关系的Column.小伙伴们都知道Flutter有多层嵌套的问题,如果我们都写在一个组件里,那势必造成嵌套严重 ...
koa 项目实战（九）passport验证token
1.安装模块 npm install koa-passport -D npm install passport-jwt -D 2.解析token 根目录/config/passport.js cons ...

贪心学院 scrapy爬虫

生成爬虫

打开调试用shell

主体 stock.py

main.py

items.py

pipelines.py

settings.py

贪心学院 scrapy爬虫的更多相关文章

随机推荐

热门专题