长期枯燥的生活，敲代码的时间三天两头往吸烟室跑，被项目经理抓去训话。

“入门”是学习Python最重要的阶段，虽然这个过程也许会非常缓慢。当你心里有一个目标时，那么你学习起来就不会像别人学习的学习进度一样慢慢学习，你会为了这个目标而奋斗。其实有人说这样的学习方式会导致我们的基础不够扎实，但是说心里话，我特别推崇这样的学习方式。

在整个Python学习的体系里，朝目标学习累积的经验可以帮助你学习基础知识。所以，你不需要花费更多的时间学习怎样“入门”，“入门”点根本不存在！当你学习直接做一个整体项目的过程中，你学习它所需要的基础知识将变得非常快。当然，很多人就要争论说学习Python爬虫之前必须要先懂python，然而事实是，你完全能够在学习Python爬虫的时候弄懂python。

网络爬虫怎么工作、如何用python实现？

你需要学习

1）首先你要明白爬虫怎样工作

好的，理论上如果所有的页面可以从initial page达到的话，那么可以证明你一定可以爬完所有的网页。

那么在python里怎么实现呢？

写得已经很通俗了。

所有的爬虫的back bone都在这里，下面分析一下为什么爬虫事实上是个非常复杂的东西——搜索引擎公司通常有一整个团队来维护和开发。

2）效率

如果你直接加工一下上面的代码直接运行的话，你需要一整年才能爬下整个豆瓣的内容。更别说Google这样的搜索引擎需要爬下全网的内容了。

问题出在哪呢？

查重处理最快的方法。不管你的带宽有多大，你的机器下载网页的速度都有个限制，那么你可以用多台机器加快这个速度。当然，我们使用Python多进程，假设每台机子都已经进了最大的效率。

3）集群化抓取

我爬取豆瓣，总共用了80多台机器昼夜不停地运行了一个月。那么可以知道只用一台电脑我们要等80个月都算少的。

那么，假设你现在有80台机器可以用，怎么用python实现一个分布式的爬取算法呢？

考虑如何用python实现：

每个slave上安装scrapy，那么所有的电脑就变成了一台有抓取能力的slave，在master上装好Redis和rq用作分布式队列。

python代码：

好的，其实你能想到，有人已经给你写好了你需要的：darkrho/scrapy-redis · GitHub

4）展望及后处理

虽然上面用很多东西看似简单，但是真正要实现一个商业规模可用的python爬虫还是有挑战的。上面的所陈述的python代码，用来爬取一个整体的网站是没有太大的问题的。

你想象不到，这里每一个点都可以供无数程序员数十年的研究。

然而不要怕，路就在脚下，直接上手即可。

Python爬虫三年没入门，传授一下绝世神功，经理唏嘘不已！的更多相关文章

0.Python 爬虫之Scrapy入门实践指南（Scrapy基础知识）
目录 0.0.Scrapy基础 0.1.Scrapy 框架图 0.2.Scrapy主要包括了以下组件: 0.3.Scrapy简单示例如下: 0.4.Scrapy运行流程如下: 0.5.还有什么? 0. ...
Python爬虫的简单入门(一)
Python爬虫的简单入门(一) 简介这一系列教学是基于Python的爬虫教学在此之前请确保你的电脑已经成功安装了Python(本教程使用的是Python3).爬虫想要学的精通是有点难度的,尤其是遇 ...
Python爬虫Scrapy框架入门（0）
想学习爬虫,又想了解python语言,有个python高手推荐我看看scrapy. scrapy是一个python爬虫框架,据说很灵活,网上介绍该框架的信息很多,此处不再赘述.专心记录我自己遇到的问题 ...
这个Python爬虫的简单入门及实用的实例，你会吗？
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理.作者:HOT_and_COOl 利用爬虫可以进行数据挖掘,比如可以爬取别人的网 ...
Python爬虫零基础入门（系列）
一.前言上一篇演示了如何使用requests模块向网站发送http请求,获取到网页的HTML数据.这篇来演示如何使用BeautifulSoup模块来从HTML文本中提取我们想要的数据. update ...
Python爬虫基础知识入门一
一.什么是爬虫,爬虫能做什么爬虫,即网络爬虫,大家可以理解为在网络上爬行的一直蜘蛛,互联网就比作一张大网,而爬虫便是在这张网上爬来爬去的蜘蛛咯,如果它遇到资源,那么它就会抓取下来.比如它在抓取一个网 ...
python爬虫基本原理及入门
爬虫:请求目标网站并获得数据的程序爬虫的基本步骤: 使用python自带的urllib库请求百度: import urllib.request response = urllib.request.u ...
Python爬虫Scrapy框架入门（2）
本文是跟着大神博客,尝试从网站上爬一堆东西,一堆你懂得的东西附上原创链接: http://www.cnblogs.com/qiyeboy/p/5428240.html 基本思路是,查看网页元素,填写 ...
Python爬虫Scrapy框架入门（1）
也许是很少接触python的原因,我觉得是Scrapy框架和以往Java框架很不一样:它真的是个框架. 从表层来看,与Java框架引入jar包.配置xml或.property文件不同,Scrapy的模 ...

随机推荐

【11】-java递归和非递归二叉树前序中序后序遍历
二叉树的遍历对于二叉树来讲最主要.最基本的运算是遍历. 遍历二叉树是指以一定的次序访问二叉树中的每个结点.所谓访问结点是指对结点进行各种操作的简称.例如,查询结点数据域的内容,或输出它的值,或 ...
Jmeter4.0版本实现背景色切换
今天下载了Jmeter4.0新版本,看着这高大上的黑曜石般的界面,着实不适应. 尤其是在右击,希望enable和disable一个线程组时候,老眼昏花,不太看得清楚哪一个是灰色的不能点击花了时间看了 ...
SQLServer2PostgreSQL迁移过程中的几个问题
1.PostgreSQL 跨平台迁移工具Migration Toolkit的使用指南:http://www.enterprisedb.com/docs/en/8.4/mtkguide/Table%20 ...
/usr/lib/uwsgi/plugins/python_plugin.so: cannot open shared object file: No such file or directory
Django uwsgi部署方式下产生这个Bug,后来发现把uwsgi配置ini文件里面的 #plugins = python 把上面这句配置语句注释掉,uwsgi就可以运行了,当然,是正常可用运行状 ...
Python自学编程开发路线图(文中有免费资源)
Python核心编程免费视频资源<Python入门教程>:http://yun.itheima.com/course/145.html Python 基础学习大纲所处阶段主讲内容技 ...
在WinForm应用程序中快速实现多语言的处理
在国际化环境下,越来越多的程序需要做多语言版本,以适应各种业务需求的变化.在Winform应用程序中实现多语言也有常规的处理方式处理,不过需要针对每个语言版本,重新修改Winform界面的显示,对一些 ...
es6（一）：es6介绍以及let,const
es是js的规范,而js是具体实现将es6转化为es5代码工具:运用的多的是babel 在线转换地址:babel,traceur(属于谷歌) 1.let申明变量:let其实可以完全取代var,并 ...
JSP转译成Servlet详细过程【转】
JSP转译成Servlet详细过程 JSP是Servlet的扩展,在没有JSP之前,就已经出现了Servlet技术.Servlet是利用输出流动态生成HTML页面,包括每一个HTML标签和每个在HTM ...
python的约束库constraint解决《2018刑侦科题目》
Github地址:https://github.com/ZJW9633/hello-word/blob/master/Xingzhenke 题目分析: 10道题互相关联,耦合性强,暴力求解需4^10种 ...
HTTP协议简单记录
http协议的格式 1. 首行 2. 头 3. 空行 4. 体 http请求头 #Referer 请求来自哪里,如果是在http://www.baidu.com上点击链接发出的请求,那么Referer ...

Python爬虫三年没入门，传授一下绝世神功，经理唏嘘不已！

网络爬虫怎么工作、如何用python实现？

Python爬虫三年没入门，传授一下绝世神功，经理唏嘘不已！的更多相关文章

随机推荐

热门专题