scrapy

安装scrapy

pip install scrapy

windows可能安装失败，需要先安装c++库或twisted，pip install twisted

创建项目

scrapy startproject tutorial

该命令将会创建包含下列内容的 tutorial 目录:

tutorial/

    scrapy.cfg

    tutorial/

        __init__.py

        items.py

        pipelines.py

        settings.py

        spiders/

            __init__.py

            ...

    scrapy.cfg: 项目的配置文件

    tutorial/: 该项目的python模块。之后您将在此加入代码。

    tutorial/items.py: 项目中的item文件.

    tutorial/pipelines.py: 项目中的pipelines文件.

    tutorial/settings.py: 项目的设置文件.

    tutorial/spiders/: 放置spider代码的目录.

编写第一个爬虫

为了创建一个Spider，您必须继承 scrapy.Spider 类，定义以下三个属性

scrapy genspider dmoz dmoz.com 终端命令可以直接完成这步操作

属性
- name: 用于区别Spider。该名字必须是唯一的，您不可以为不同的Spider设定相同的名字
- start_urls: 包含了Spider在启动时进行爬取的url列表。因此，第一个被获取到的页面将是其中之一。后续的URL则从初始的URL获取到的数据中提取
- parse() 是spider的一个方法。被调用时，每个初始URL完成下载后生成的
- Response 对象将会作为唯一的参数传递给该函数。该方法负责解析返回的数据(response data)，提取数据(生成item)以及生成需要进一步处理的URL的 Request 对象

 import scrapy

 class DmozSpider(scrapy.Spider):

     name = "dmoz"

     allowed_domains = ["dmoz.org"]

     start_urls = [

         "http://www.dmoz.org/Computers/Programming/Languages/Python/Books/",

         "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/"

     ]

     def parse(self, response):

         filename = response.url.split("/")[-2]

         with open(filename, 'wb') as f:

             f.write(response.body)

爬取

scrapy crawl dmoz

过程：Scrapy为Spider的 start_urls 属性中的每个URL创建了 scrapy.Request 对象，并将 parse 方法作为回调函数(callback)赋值给了Request；Request对象经过调度，执行生成 scrapy.http.Response 对象并送回给spider parse() 方法。



    xpath(): 传入xpath表达式，返回该表达式所对应的所有节点的selector list列表 。

    css(): 传入CSS表达式，返回该表达式所对应的所有节点的selector list列表.

    extract(): 序列化该节点为unicode字符串并返回list。

    re(): 根据传入的正则表达式对数据进行提取，返回unicode字符串list列表。

scrapy shell

scrapy shell "http://www.dmoz.org/Computers/Programming/Languages/Python/Books/"

response
- response.body：包体
- response.headers：包头
- response.xpath()：xpath选择器
- response.css()：css选择器

 import scrapy

 class DmozSpider(scrapy.Spider):

     name = "dmoz"

     allowed_domains = ["dmoz.org"]

     start_urls = [

         "http://www.dmoz.org/Computers/Programming/Languages/Python/Books/",

         "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/"

     ]

     def parse(self, response):

         for sel in response.xpath('//ul/li'):

             title = sel.xpath('a/text()').extract()

             link = sel.xpath('a/@href').extract()

             desc = sel.xpath('text()').extract()

             print title, link, desc

请使用手机"扫一扫"x

爬虫——scrapy入门的更多相关文章

网页爬虫--scrapy入门
本篇从实际出发,展示如何用网页爬虫.并介绍一个流行的爬虫框架~ 1. 网页爬虫的过程所谓网页爬虫,就是模拟浏览器的行为访问网站,从而获得网页信息的程序.正因为是程序,所以获得网页的速度可以轻易超过单 ...
[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
Scrapy 爬虫框架入门案例详解
欢迎大家关注腾讯云技术社区-博客园官方主页,我们将持续在博客园为大家推荐技术精品文章哦~ 作者:崔庆才 Scrapy入门本篇会通过介绍一个简单的项目,走一遍Scrapy抓取流程,通过这个过程,可以对 ...
0.Python 爬虫之Scrapy入门实践指南（Scrapy基础知识）
目录 0.0.Scrapy基础 0.1.Scrapy 框架图 0.2.Scrapy主要包括了以下组件: 0.3.Scrapy简单示例如下: 0.4.Scrapy运行流程如下: 0.5.还有什么? 0. ...
小白学 Python 爬虫（34）：爬虫框架 Scrapy 入门基础（二）
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（35）：爬虫框架 Scrapy 入门基础（三） Selector 选择器
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（36）：爬虫框架 Scrapy 入门基础（四） Downloader Middleware
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（37）：爬虫框架 Scrapy 入门基础（五） Spider Middleware
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（38）：爬虫框架 Scrapy 入门基础（六） Item Pipeline
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...

随机推荐

StringJdbc :jdbcTemplate
Spring框架对Jdbc进行了封装提供了一个JDBCTemplated对象简化Jdbc开发步骤 1 导包 2 创建JDBCTemplate 对象依赖于DataSource 3 调用JDBCTe ...
gdb core 调试多线程
ref :http://blog.sina.com.cn/s/blog_62dc94eb0100flyn.html 如果目标进程已经core dump了,那么 gdb -c core xxx xx ...
利用 /proc/sys/kernel/core_pattern隐藏系统后门
ref:https://xz.aliyun.com/t/1098/ 这里所说的core_pattern 指的是:/proc/sys/kernel/core_pattern. 我们知道在Linux系统中 ...
JS转换HTML转义符，编码及解码
JS转换HTML转义符 //去掉html标签 function removeHtmlTab(tab) { return tab.replace(/<[^<>]+?>/g,'') ...
[物理学与PDEs]第5章习题10 多凸函数一个例子
证明函数 $$\bex \hat W({\bf F})=\sedd{\ba{ll} \cfrac{1}{\det{\bf F}},&if\ \det{\bf F}>0,\\ +\inft ...
PHP中的常用数组操作方法
一.数组操作的基本函数数组的键名和值array_values($arr); 获得数组的值array_keys($arr); 获得数组的键名array_flip($arr); 数组中的值与键名互 ...
Celery - 一个懂得异步任务 , 定时任务 , 周期任务的芹菜
1.什么是Celery?Celery 是芹菜Celery 是基于Python实现的模块, 用于执行异步定时周期任务的其结构的组成是由 1.用户任务 app 2.管道 broker 用于存储 ...
Javascript模块化简史
Script标签和闭包 RequireJS, AngularJS以及依赖注入 Node.js以及CommonJS的出现 ES6, import, Babel和Webpack https://ponyf ...
转 -Filebeat + Redis 管理 LOG日志实践
Filebeat + Redis 管理 LOG日志实践小赵营关注 2019.01.06 17:52* 字数 1648 阅读 24评论 0喜欢 2 引用转载请注明出处某早上,领导怒吼声远远传来 ...
centos7.5环境下编译安装php7.0.30并安装redis和mongo扩展
.安装php7..30的脚本 # vim install_php.sh #!/bin/bash # 安装基本依赖 yum install -y gcc gcc-c++ htop telnet ioto ...

爬虫——scrapy入门

scrapy

爬虫——scrapy入门的更多相关文章

随机推荐

热门专题