scrapy爬虫笔记(一)------环境配置

Koala's_Dream 2024-10-20 06:21:08 原文

前言：

　　本系列文章是对爬虫的简单介绍，以及教你如何用简单的方法爬取网站上的内容。

　　需要阅读者对html语言及python语言有基本的了解。

　　（本系列文章也是我在学习爬虫过程中的学习笔记，随着学习的深入会不断地更新）

爬虫简介：

　　网络爬虫是一种自动获取网页内容的程序，是搜索引擎的重要组成部分。

　　网络爬虫先获取某网站的源代码，通过源码解析（如<a><p>标签等）来获得想要的内容。

环境配置：

　　ubuntu系统（安装方法请自行百度。由于在ubuntu系统下对以下所需的软件安装及运行比windows中方便很多，故我们选用ubuntu系统）

　　爬虫可用的软件很多，我们选择在ubuntu系统下使用python进行网页爬取，并将爬取下的内容放入mysql数据库中。

所需软件：

　　python：ubuntu系统自带，无需安装

　　pip：python包管理工具(需要下载python内的库进行网页爬取，安装pip方便我们对python中库的下载)

　　scrapy：Python开发的一个快速,高层次的屏幕抓取和web抓取框架。即从web站点爬取信息，读入到本地。

　　BeautifulSoup：通过标签解析（如<a>,<p>,id,class等）从html或xml文件中提取数据的python库。

　　mysql：一种关联数据库管理系统，将数据保存在不同的表中，用来存储数据。

软件安装步骤：

　　使用Ctrl+Alt+T打开命令行

　　1.pip安装
sudo
apt-get install python-pip

　　2.scrapy安装
pip
install scrapy

　　3.beautifulsoup4安装
pip
install beautifulsoup4

　　4.安装与mysql相关的python库

　　(1)
pip
install mysql-connector-python

　　5.安装mysql

　　(1)
sudo
apt-get install mysql-server

　　(2)
sudo
apt-get install mysql-client

*注：1.用pip安装时如出现错误，可能是权限不够，最前面加上sudo命令即可。

　　 2.如安装python相关模块中出现'error:command 'gcc' failed with exit status 1'的错误信息，可通过安装如下库解决：

　　　　 sudo apt-get install python-dev

　　 3.如安装mysql-connector-python时出现error:

　　Could not find any downloads that satisfy the requirement mysql-connector-python
　　Some externally hosted files were ignored

　　   (use --allow-external mysql-connector-python to allow).

　　输入命令

　　　　 pip install --allow-external mysql-connector-python mysql-connector-python

　　环境配置是个挺麻烦的工作，要有耐心哦～不同ubuntu系统版本可能会遇到各种奇葩问题，由于个人水平所限，请自行百度(-.-)

　　如果环境已经配置好了，那么下面我们可以开始爬取网页了^v^

scrapy爬虫笔记(一)------环境配置的更多相关文章

Qt5学习笔记(1)-环境配置(win+64bit+VS2013)
Qt5学习笔记(1)-环境配置工欲善其事必先-不装-所以装软件久不露面,赶紧打下酱油. 下载地址:http://download.qt.io/ 这个小网页就可以下载到跟Qt有关的几乎所有大部分东 ...
Linux搭建Scrapy爬虫集成开发环境
安装Python 下载地址:http://www.python.org/, Python 有 Python 2 和 Python 3 两个版本, 语法有些区别,ubuntu上自带了python2.7. ...
Scrapy爬虫笔记
Scrapy是一个优秀的Python爬虫框架,可以很方便的爬取web站点的信息供我们分析和挖掘,在这记录下最近使用的一些心得. 1.安装通过pip或者easy_install安装: 1 sudo p ...
Android自学笔记：环境配置
Info: 自学Android之旅第二篇,初步学习会有疏漏,以后我会不断修改补全,直到完美. 2014-10-09:初版 2014-11-12: 重新配置了一台电脑,更新在学习robotium过程中, ...
【lua学习笔记】——环境配置
1 开发平台 windows7 64位 2 下载链接 http://www.lua.org/download.html 3 安装完成-环境配置 4 运行 WIN+R 运行 cmd 运行lua,显示配 ...
学习笔记-ionic3 环境配置搭建到打包
折腾了两周总算理清楚了,参考的链接如下: https://blog.csdn.net/zeternityyt/article/details/79655150 环境配置 https://segmen ...
windows7 64，32位下scrapy爬虫框架的环境搭建
适用于python 2.7 64位安装一.操作系统:WIN7 64位二.python版本:2.7 64位(scrapy目前不支持3.x) 不确定位数的,看图三.安装相关软件:(可以从我的百度网盘 ...
2.1 Python3.5安装以及爬虫需要的环境配置
之所以选用Python,是因为对于网络爬虫来说,Python是最好上手的一种语言.本文讲述的安装配置都是基于Windows的环境. 另外我想说的是,文中用到的下载链接尽量官方网站上的下载链接,这是我比 ...
Scrapy爬虫框架(1)--安装配置与常用命令
安装与配置 Scrapy有几个安装依赖,一般来说可以直接pip install scrapy,这个过程会自动下载安装其他几个依赖. 上述安装方法不成功,则需要手动安装依赖包步骤安装 lxmlpip ...

随机推荐

java8入门错误：找不到或者无法加载主类
如果你也遇上的这个问题,但是如果你的Java版本不是6以上,这个解决方案可能就不适合你... 最近在跟着李兴华老湿的视频<<编程开发入门Java 8>>的学习Java... 但 ...
App-Pass the password
V1.0 初始版本注册一个帐号却不想使用简单密码? Pass the Password! 输入任意字符串,如反写或截取网站域名,我们帮你生成高安全性密码. 记住规则,忘记密码 . 下一次依照你的规则 ...
[Machine Learning] 机器学习常见算法分类汇总
声明:本篇博文根据http://www.ctocio.com/hotnews/15919.html整理,原作者张萌,尊重原创. 机器学习无疑是当前数据分析领域的一个热点内容.很多人在平时的工作中都或多 ...
Apache限制某个目录下的PHP文件没有执行权限
为了安全期间,有时我们需要限制网站下的某些目录对于php脚本不能执行. 有两种方法可以参考: 1. 使用.htaccess 文件限制在要限制php执行的目录下,创建.htaccess文件,加入内容 ...
Shell入门教程：流程控制（1）命令的结束状态
在Bash Shell中,流程控制命令有2大类:“条件”.“循环”.属于“条件”的有:if.case:属于“循环”的有:for.while.until:命令 select 既属于“条件”,也属于“循环 ...
css pre标签
浏览器:firfox49.0.2 在使用<pre>标签输出格式化文本的时候,遇到了一个小问题. 要在页面的底部输出两行文本,但是最后一行的文字总是距离屏幕的底部太大.下面图中的样子: 相关 ...
jstl param url redirect import
import标签 import标签用来导入其他页面属性: * url :引入页面的路径 * context :工程名 * var :将引入的页面保存到一个变量中 * scope :保存到一个作用域中 ...
Ubuntu 14.4 配置
1.安装 Orcal Java 使用下面的命令安装,只需一些时间,它就会下载许多的文件,所及你要确保你的网络环境良好: sudo add-apt-repository ppa:webupd8team/ ...
web前端学习部落22群开源分享左边菜单导航
有大量web前端开发工具及学习资料,可以搜群[ web前端学习部落22群 ]进行下载,遇到学习问题也可以问群内专家以及课程老师哟 <!DOCTYPE html> <html lang ...
【Java EE 学习 28 上】【oracle学习第二天】【子查询】【集合运算】【几种数据库对象】
一.子查询 1.为什么要使用子查询:问题不能一步求解或者一个查询不能通过一步查询得到. 2.分类:单行子查询和多行子查询. 3.子查询的本质:一个查询中包含了另外一个或者多个查询. 4.使用子查询的规 ...