芝麻HTTP：Scrapy-Splash的安装

芝麻HTTP代理 2024-10-25 15:43:54 原文

Scrapy-Splash是一个Scrapy中支持JavaScript渲染的工具，本节来介绍它的安装方式。

Scrapy-Splash的安装分为两部分。一个是Splash服务的安装，具体是通过Docker，安装之后，会启动一个Splash服务，我们可以通过它的接口来实现JavaScript页面的加载。另外一个是Scrapy-Splash的Python库的安装，安装之后即可在Scrapy中使用Splash服务。

1. 相关链接

GitHub：https://github.com/scrapy-plugins/scrapy-splash
PyPI：https://pypi.python.org/pypi/scrapy-splash
使用说明：https://github.com/scrapy-plugins/scrapy-splash#configuration
Splash官方文档：http://splash.readthedocs.io

2. 安装Splash

Scrapy-Splash会使用Splash的HTTP API进行页面渲染，所以我们需要安装Splash来提供渲染服务。这里通过Docker安装，在这之前请确保已经正确安装好了Docker。

安装命令如下：

docker run -p : scrapinghub/splash

安装完成之后，会有类似的输出结果：

-- ::+ [-] Log opened.
-- ::28.447291 [-] Splash version: 3.0
-- ::, PyQt , Twisted , Lua 5.2
-- :: ( , ::) [GCC  ]
-- ::
-- ::28.454258 [-] Can't bump open files limit
-- ::', '1024x768x24', '-nolisten', 'tcp']
QStandardPaths: XDG_RUNTIME_DIR not set, defaulting to '/tmp/runtime-root'
-- ::29.041973 [-] proxy profiles support is enabled, proxy profiles path: /etc/splash/proxy-profiles
-- ::
-- ::
-- ::
-- ::29.316564 [-] Web UI: enabled, Lua: enabled (sandbox: enabled)
-- ::
-- ::29.317801 [-] Starting factory <twisted.web.server.Site object at 0x7ffaa4a98cf8>

这样就证明Splash已经在8050端口上运行了。这时我们打开http://localhost:8050，即可看到Splash的主页，如图1-80所示。

图1 运行页面

当然，Splash也可以直接安装在远程服务器上。我们在服务器上以守护态运行Splash即可，命令如下：

docker run -d -p : scrapinghub/splash

这里多了-d参数，它代表将Docker容器以守护态运行，这样在中断远程服务器连接后，不会终止Splash服务的运行。

3. Scrapy-Splash的安装

成功安装Splash之后，接下来再来安装其Python库，命令如下：

pip3 install scrapy-splash

命令运行完毕后，就会成功安装好此库。

芝麻HTTP：Scrapy-Splash的安装的更多相关文章

scrapy splash 之一二
scrapy splash 用来爬取动态网页,其效果和scrapy selenium phantomjs一样,都是通过渲染js得到动态网页然后实现网页解析, selenium + phantomjs ...
Python之Scrapy爬虫框架安装及简单使用
题记:早已听闻python爬虫框架的大名.近些天学习了下其中的Scrapy爬虫框架,将自己理解的跟大家分享.有表述不当之处,望大神们斧正. 一.初窥Scrapy Scrapy是一个为了爬取网站数据,提 ...
scrapy之环境安装
scrapy之环境安装在之前我安装了scrapy,但是在pycharm中却无法使用. 具体情况是: 我的电脑上存在多个python,有python2,python3,anaconda,其中anaco ...
Python3.5在Windows7环境下Scrapy库的安装
Python3.5在Windows7环境下Scrapy库的安装忙活了一下午,总算是把Scrapy库给装完了,记下来给需要帮助的人首先安装的环境:Windows7 64位 Python的版本是:3. ...
scrapy初体验 - 安装遇到的坑及第一个范例
scrapy,python开发的一个快速,高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据.scrapy用途广泛,可以用于数据挖掘.监测和自动化测试.scrapy的安装稍 ...
Scrapy框架的安装
Win+R 输入cmd打开命令行我们先把pip升级到最新版,输入代码如下: pip install --upgrade pip 不过一般这种更新方式会经常性出错,安装文件在下载到一半时就会超时报错 ...
scrapy+splash 爬取京东动态商品
作业来源:https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/3159 splash是容器安装的,从docker官网上下载windows下的 ...
scrapy 和 scrapy_redis 安装
安装sqlslte,scrapy需要这个模块 yum install sqlite-devel python3.5 下载包自己编译安装 ./configure make make install 自带 ...
Windows平台下，Scrapy Installation，安装问题解决
按理说直接:pip install scrapy 就可以成功,但是出现了错误"libxml/xpath.h: No such file or directory" "er ...

随机推荐

MySQL用户授权与权限
MySQL权限如下表权限名字权限说明 Context CREATE 允许创建新的数据库和表 Databases, tables, or indexes DROP 允许删除现有数据库.表和视图 Da ...
Linux中的Buffer 与 Cache
A buffer is something that has yet to be "written" to disk. A cache is something tha ...
bzoj 4033: [HAOI2015]树上染色 [树形DP]
4033: [HAOI2015]树上染色我写的可是\(O(n^2)\)的树形背包! 注意j倒着枚举,而k要正着枚举,因为k可能从0开始,会使用自己更新一次 #include <iostream ...
PHP码农在Golang压力下的生存之道－PHP性能优化实践
随着国内Golang的火爆,phper的生存压力越来越大,在一次内部技术讨论中,gopher甚至提出,要什么php,写php的全部开掉,唉,码农何苦为难码农. 本文试图寻找一种有效实践,减少php w ...
git服务器配置http请求
使用apache 配置http协议的git库在CentOS上基于Apache http服务搭建git远程仓库(一) 基于http方式的git服务器搭建搭建http协议的git服务器 Linux g ...
★Linux桌面系统技巧（作为客户端）
[安装chrome浏览器]* 下载(已下载完成):32位:wget https://dl.google.com/linux/direct/google-chrome-stable_current_i3 ...
在Linux/Centos下用wondershaper限速
wondershaper是国外人开发的一款在Linux内核下基于TC工具的对整块网卡的限度工具,虽然有很久没有更新了,但是测试老版本在Centos6.3上依然可以使用. 首先下载wondershape ...
同步博客—CSDN推广
niiickのCSDN 用CSDN也有几个月了其实一开始有人让我转到博客园我是拒绝的 (毕竟强迫症接受不了一边博客只有一半= =) 不过最近有幸观赏了某位dalao的博客园发现没有广告好棒!!!设 ...
二分图最大匹配模板【匈牙利；Dinic最大流】
二分图最大匹配模板[匈牙利:Dinic最大流] 匈牙利算法 int n,m; vector<int> map[100010]; int match[100010];//保存匹配的互相点 b ...
编译安装python3.6后pip3无法安装模块问题处理
编译安装python3.6之后,使用pip3命令安装第三方库效果如图所示: pip is configured with locations that require TLS/SSL, however ...