scrapy安装过程问题解决、新建项目、调试断点
一、安装问题
1. 下载速度太慢
使用国外源,下载速度很慢,可以考虑使用豆瓣的镜像下载
pip install -i https://pypi.douban.com/simple/ scrapy
2. 安装scrapy需要Microsoft Visual C++ 14.0 支持
在下面下载在线安装(可能需要半个小时以上,好几个G),注意安装时选择自定义安装,默认好像是win8.1,记得改为win10的
Download the Visual C++ Build Tools (standalone C++ compiler, libraries and tools)
二、新建scrapy项目
1. cmd新建项目
(SCRAPY~) F:\Python Script\Scrapy>scrapy startproject ArticleSpider
新建完后,就会生成项目,下面这个是Pycharm界面,怎么进入这个界面呢?File->Open 然后选择创建的项目文件夹 ArticleSpider

2. 创建初始模板
创建模板之前,要cd进入项目
(SCRAPY~1) F:\Python Script\Scrapy>cd ArticleSpider (SCRAPY~1) F:\Python Script\Scrapy\ArticleSpider>scrapy genspider jobbole blog.jobbole.com
#jobbole 是我们的爬虫名
#blog.jobbole.com 是我们爬虫开始的页面
 
打开看一下,里面的代码

3. 选择开发环境
我们打开项目后,还没有选择我们的开发环境
-1. File->Setting,操作如图,选择我们之前搭建的Python3.5虚拟环境:scrapy_py3

4. 尝试运行爬虫
运行前,先安装pypiwin32
(SCRAPY~1) F:\Python Script\Scrapy\ArticleSpider>pip install -i https://pypi.douban.com/simple/ pypiwin32
运行
(SCRAPY~1) F:\Python Script\Scrapy\ArticleSpider>scrapy crawl jobbole
5. 改配置
在setting.py里改下配置

6. 调试
调试断点的简单说明,看这里:PyCharm 教程(五)断点 调试
继续调试快捷键是,F8
由于pycharm没有scrapy的模板,所以是没办法调试的,但是我们通过自定义一个main文件,来调试
#main.py
#coding:utf-8 from scrapy.cmdline import execute
import os,sys sys.path.append(os.path.dirname(os.path.abspath(__file__))) execute(['scrapy','crawl','jobbole'])
在jobbole.py设置断点

点下右上角的甲虫图标,或者快捷键Shift+F9 ,调试main.py
调试完成后会自动跳到jobbole.py文件的断点处。
我们可以查看下变量信息
看看,response里的变量

7. scrapy shell 调试
在虚拟环境中venv,进入scrapy项目所在的目录
(SCRAPY~1) F:\Python Script\Scrapy\ArticleSpider>
键入如下命令,进入scrapy shell环境
(SCRAPY~1) F:\Python Script\Scrapy\ArticleSpider>scrapy shell http://blog.jobbole.com/111121/
后面的url,看你要调试哪个网址,就填哪个
进入后,就可以发现有这么多变量可以使用了,这里我们主要关注response

利用scrapy shell带上User-Agent
scrapy shell -s USER_AGENT:'拷贝进来' https://www.zhihu.com
scrapy增加表头
$ scrapy shell
...
...
>>> from scrapy import Request
>>> req = Request('yoururl.com', headers={"header1":"value1"})
>>> fetch(req)
scrapy安装过程问题解决、新建项目、调试断点的更多相关文章
- Nodejs新建博客练习(一)安装express并新建项目
		安装express npm install -g express-generator 新建工程 express blog //新建项目 cd blog && npm install / ... 
- 命令行安装django以及新建项目及应用
		1:安装django项目,使用pip命令进行安装,默认安装的是最高版本,可以使用pip install django==1.1.11进行指定版本安装 2:新建django项目 2.1:首先切换到创建项 ... 
- robot framework-requests库安装过程问题解决
		这几天本想研究下用robotframework+HTTP library (Requests)来做接口测试(http协议), 安装完Requests库后,在RIDE里导入该库时显示是红色,即导入失败( ... 
- 安装Eclipse(android)新建项目时遇到的问题
		---恢复内容开始--- 解决方案: 我先删掉了新建的项目,重新建立项目时 将API都选成相同的API19:... 然后就成功了 ---恢复内容结束--- 
- Visual Studio 2017 安装过程问题解决
		VS已经发布了两三天了,我也着手安装,但是折腾了两个晚上,怎么都到不了安装界面(选择模块的界面),各种尝试,各种重启,也并不顶什么卵用~ 后来经过各种查LOG,发现我电脑访问不了https://dow ... 
- opencv3.4+vs2015+win10安装过程问题解决
		在使用cmake configure生成vs的工程文件时,有几个第三方的库和文件会频繁下载不成功,分别是: ffmpeg_version.cmake opencv_ffmpeg.dll opencv_ ... 
- vs2008安装mvc3后新建项目报错 -- 类型“System.Web.Mvc.ModelClientValidationRule”同时存在
		解决方案: 找到主目录的.csproj文件,用文字编辑器打开你找到它找到 <Reference Include="System.Web.WebPages" /> &l ... 
- Python -- Scrapy 框架简单介绍(Scrapy 安装及项目创建)
		Python -- Scrapy 框架简单介绍 最近在学习python 爬虫,先后了解学习urllib.urllib2.requests等,后来发现爬虫也有很多框架,而推荐学习最多就是Scrapy框架 ... 
- Windows下安装Scrapy方法及常见安装问题总结——Scrapy安装教程
		这几天,很多朋友在群里问Scrapy安装的问题,其实问题方面都差不多,今天小编给大家整理一下Scrapy的安装教程,希望日后其他的小伙伴在安装的时候不再六神无主,具体的教程如下. Scrapy是Pyt ... 
随机推荐
- JAVA集合类——难得的总结
			本文是在学习中的总结,欢迎转载但请注明出处:http://blog.csdn.net/pistolove/article/details/41346969 以下资料是在学习中总结出来的,希望对你有所帮 ... 
- Android之BaseAdapter的优雅实现
			在android的开发过程中,我们不可避免的要使用ListView来展示我们的Activity上面的内容.你可以使用很多种方式来实现这一功能,但是如何优雅快速的来实现呢?这就是我要写的了,既为了大家共 ... 
- iOS 动画总结—UIView动画
			1.概述 UIKit直接将动画集成到UIView类中,实现简单动画的创建过程.UIView类定义了几个内在支持动画的属性声明,当这些属性发生改变时,视图为其变化过程提供内建的动画支持. 执行动画所需要 ... 
- mybatis 配置 log4j 日志
			mybatis 配置 log4j 日志 使用Mybatis的时候,可能需要输出(主要是指sql,参数,结果)日志,查看执行的SQL语句,以便调试,查找问题. 测试Java类中需要加入代码: stati ... 
- Ajax核心--XMLHttpRequest对象
			XMLHttpRequest 对象是AJAX功能的核心,学习XMLHttpRequest对象就先从创建XMLHttpRequest 对象开始,了解在不同的浏览器中创建XMLHttpRequest 对象 ... 
- C++ Primer 有感(函数)
			1.函数应该在头文件中声明,并在源文件中定义.(定义函数的源文件应包含声明该函数的头文件)将提供函数声明的头文件包含在定义该函数的源文件中,可使编译器能检查该函数的定义和声明是否一致. 2.既可以在函 ... 
- Windows CE Notification API的使用方法
			1 引言 以Windows CE 为操作系统的掌上电脑(如PocketPC或HPC),除具备PC的功能外,还具备很强的自身控制能力.Windows CE API超越微软其他操作系统的 API ... 
- Linux用户管理命令(第二版)
			添加用户 1.useradd -设置选项 用户名 [-D 查看缺省参数 ] 选项: u: UID [必须是系统中没有的] g:缺省所属用户组GID[最好有] G: 指定用户所属多个组[可以指定这个用户 ... 
- ThreadPoolExecutor运行机制
			最近发现几起对ThreadPoolExecutor的误用,其中包括自己,发现都是因为没有仔细看注释和内部运转机制,想当然的揣测参数导致,先看一下新建一个ThreadPoolExecutor的构建参数: ... 
- 恶补web之二:css知识(3)
			css有3种定位机制:普通流,浮动和绝对定位. 除非专门指定,否则所有框都在普通流中定位,即普通流中的元素位置由元素在(x)html中的位置决定. 通过使用position属性,可以选择4种不同类型的 ... 
