股票数据Scrapy爬虫实例（亲测有效）

步骤：

步骤1：建立工程和Spider模板

scrapy startproject BaiduStocks
cd BaiduStocks
scrapy genspider stocks baidu.com
进一步修改spiders/stocks.py

这一步自行完成~

步骤2：编写Spider

配置stocks.py文件
修改对返回页面的处理
修改对新增URL爬取请求的处理（stocks.py）

# -*- coding: utf-8 -*-

import scrapy

import re

class StocksSpider(scrapy.Spider):

    name = 'stocks'

    start_urls = ['http://quote.eastmoney.com/stock_list.html']

    def parse(self, response):

        for href in response.css('a::attr(href)').extract():

            try:

                stock = re.findall(r"[s][hz]\d{6}", href)[0]

                url = 'http://gu.qq.com/' + stock + '/gp'

                yield scrapy.Request(url, callback=self.parse_stock)

            except:

                continue

    def parse_stock(self, response):

        infoDict = {}

        stockName = response.css('.title_bg')

        stockInfo = response.css('.col-2.fr')

        name = stockName.css('.col-1-1').extract()[0]

        code = stockName.css('.col-1-2').extract()[0]

        info = stockInfo.css('li').extract()

        for i in info[:13]:

            key = re.findall('>.*?<', i)[1][1:-1]

            key = key.replace('\u2003', '')

            key = key.replace('\xa0', '')

            try:

                val = re.findall('>.*?<', i)[3][1:-1]

            except:

                val = '--'

            infoDict[key] = val

        infoDict.update({'股票名称': re.findall('\>.*\<', name)[0][1:-1] + \

                                 re.findall('\>.*\<', code)[0][1:-1]})

        yield infoDict

其中的key=re.replace('\u2003','')，key=re.replace('\xa0','')分别是为了除去爬取的字符串中的无用部分，如&nbsp等，网页抓取时会因为编码原因转化成\xa0，所以我们需要进行替换，得到较为美观的字符串.

步骤3：编写ITEM Pipelines

配置pipelines.py文件
定义对爬取项（Scrapy Item）的处理类（pipelines.py）

# -*- coding: utf-8 -*-

# Define your item pipelines here

#

# Don't forget to add your pipeline to the ITEM_PIPELINES setting

# See: https://docs.scrapy.org/en/latest/topics/item-pipeline.html

class ScrapyGupiaoPipeline:

    def process_item(self, item, spider):

        return item

class ScrapyGupiaoPipeline:

    def open_spider(self, spider):

        self.f = open('gupiao.txt', 'w')

    def close_spider(self, spider):

        self.f.close()

    def process_item(self, item, spider):

        try:

            line = str(dict(item)) + '\n'

            self.f.write(line)

        except:

            pass

        return item

步骤四：配置ITEM_PIPELINES选项（settings.py）

# Configure item pipelines

# See https://docs.scrapy.org/en/latest/topics/item-pipeline.html

ITEM_PIPELINES = {

   'BaiduStocks.pipelines.ScrapyGupiaoPipeline': 300,

}

股票数据Scrapy爬虫实例（亲测有效）的更多相关文章

股票数据Scrapy爬虫
功能描述: 技术路线:scrapy 目标:获取上交所和深交所所有股票的名称和交易信息输出:保存到文件中数据网站的确定获取股票列表: 东方财富网:http://quote.eastmoney.co ...
简单scrapy爬虫实例
简单scrapy爬虫实例流程分析抓取内容:网站课程页面:https://edu.hellobi.com 数据:课程名.课程链接及学习人数观察页面url变化规律以及页面源代码帮助我们获取所有数据 ...
scrapy爬虫实例(1)
爬虫实例对象阳光问政平台目标 : 主题,时间,内容爬取思路预先设置好items import scrapy class SuperspiderItem(scrapy.Item): title ...
Scrapy爬虫实例——校花网
学习爬虫有一段时间了,今天使用Scrapy框架将校花网的图片爬取到本地.Scrapy爬虫框架相对于使用requests库进行网页的爬取,拥有更高的性能. Scrapy官方定义:Scrapy是用于抓取网 ...
Scrapy爬虫实例教程（二）---数据存入MySQL
书接上回实例教程(一) 本文将详细描述使用scrapy爬去左岸读书所有文章并存入本地MySql数据库中,文中所有操作都是建立在scrapy已经配置完毕,并且系统中已经安装了Mysql数据库(有权限操 ...
Scrapy 爬虫实例教程（一）---简介及资源列表
Scrapy(官网 http://scrapy.org/)是一款功能强大的,用户可定制的网络爬虫软件包.其官方描述称:" Scrapy is a fast high-level screen ...
python scrapy 爬虫实例
1 创建一个项目 scrapy startproject basicbudejie 2 编写爬虫 import scrapy class Basicbudejie(scrapy.Spider): na ...
C++ Const 使用总结，代码实例亲测
1. 修饰普通变量修饰变量语法 const TYPE value <==> TYPE const value 两者等价, 变量不可修改,无需说明. 2. 修饰指针首先看下面一段代码 ...
【Python爬虫实战】Scrapy框架的安装搬运工亲测有效
windows下亲测有效 http://blog.csdn.net/liuweiyuxiang/article/details/68929999这个我们只是正确操作步骤详解的搬运工
实时获取股票数据，免费！——Python爬虫Sina Stock实战
更多精彩内容,欢迎关注公众号:数量技术宅,也可添加技术宅个人微信号:sljsz01,与我交流. 实时股票数据的重要性对于四大可交易资产:股票.期货.期权.数字货币来说,期货.期权.数字货币,可以从交 ...

随机推荐

5.26 学习SSH
1.ssh客户端是一种使用Secure Shell协议连接到运行了ssh服务端的远程服务器上 ssh是比较可靠的,专为远程登录会话和其他网络服务提供安全性的协议 2.
java Comparator和Comparable的区别？
参考:https://blog.csdn.net/m0_71087031/article/details/124850080 Comparable是一个内比较器,可以和自己比较的 Comparator ...
【摘】python和它的内置类型子类化
python和它的内置类型子类化看个好玩的东西 class Folder(list): def __init__(self, name): self.name = name def dir(self ...
2月21日python程序设计
Python变量 1.不需要事先声明变量名及其类型,直接赋值即可. 2.强类型编程语言,根据赋值或运算来推断变量类型. 3.动态类型语言,变量的类型也是可以随时变化的. >>> x ...
对Java要学东西的认识（一点点javascript见解）
JavaScript是一种脚本语言,它采用小程序段的方式实现编程.像其它脚本语言一样,JavaScript同样已是一种解释性语言,它提供了一个易的开发过程.它的基本结构形式与C.C++.VB十分类似. ...
2003031126-石升福-python数据分析第四周作业-第二次作业
项目 matplotlib 博客名称 2003031126-石升福-Python数据分析第四周作业班级链接 20级数据班作业链接第二次作业要求每道题要有题目,代码(使用插入代码,不会插入代码 ...
Python测试——安装篇总结
测试用到的工具自己知道的有: 写脚本类:sublime ,PyCharm,Eclipse+PyDev,目前我知道的只有这么多,大家知道的肯定还有很多,欢迎留言哈录制脚本类:火狐自带的seleniu ...
python实现录屏功能(亲测好用)
更新时间:2020年03月02日 13:59:52 作者:linnahan https://www.jb51.net/article/181757.htm import time,threading ...
Ubuntu常用命令(二)
clash 启动 #.clash -d . sudo /home/lizhenyun/clash/clash -d /home/lizhenyun/clash/ deb包安装 sudo dpkg -i ...
Think Python 学习笔记
#!/usr/bin/env python# coding: utf-8# # Think Python 学习笔记# 1.关于异或计算符# In[2]:6^2# 2.关于函数# 注意:变量名称不能用数 ...

股票数据Scrapy爬虫实例（亲测有效）

股票数据Scrapy爬虫实例（亲测有效）的更多相关文章

随机推荐

热门专题