使用python实现简单爬虫

简单的爬虫架构

调度器

URL管理器

管理待抓取的URL集合和已抓取的URL，防止重复抓取，防止死循环

功能列表

1：判断新添加URL是否在容器中

2：向管理器添加新URL

3：判断容器是否为空

4：将已爬取URL移动到已爬取集合

5：获取待爬取URL

实现方式

1:使用set（自动去除重复项目）

2:使用关系数据库(MySQL)

3：使用缓存数据库（redis）：大型公司使用这玩意

网页下载器

功能列表

1:get

2:post

3:伪装头信息

4:HTTPCookieProcessor

5:ProxyHandler

6:HTTPSHandler

7:HTTPRedirectHAndler

实现方法

1:urllib2

2:URLlib3

3:requests

此处使用request实现

#coding=utf-8

import requests,json

url = 'http://www.baidu.com'

headers = {'user-agent':'Mozilla/5.0'}	#模拟Mozilla浏览器头,此行可以为空

get_data = {'wd':'linux'}

r = requests.get(url,headers=headers,params = get_data)

if r.status_code == 200:

	'访问成功'

	try:

		file = open('baidu.com','w')

		file.write('本次访问网址是：' + r.url)

		print('本次访问网址是：' + r.url)

	except IOError as e:

		print('文件读取错误：' + str(e))

	try:

		file = open('baidu.com','a+')

		text = r.text

		file.write('\n得到数据如下：\n' + text)

		print('得到数据长度：' + str(len(r.content)))

	except IOError as e:

		print('文件读取错误：' + str(e))

else:

	print('我是假的404')

解析器

1:正则表达式			传统经典，语法奇葩难懂

2:html.parser		python自带

3:BeautifulSoup		可以使用上下两种解析器，集合天地精华

4:lxml				可以解析html和xml

#coding=utf-8

from bs4 import BeautifulSoup,re

try:

	file = open('baidu.com','r')

	html_str = file.read()

	print(type(html_str))

except IOError as e:

	print(str(e))

finally:

	if 'file' in locals():

		file.close()

if 'html_str' in locals():

	#根据HTML网页字符串创建BeautifulSoup对象

	soup = BeautifulSoup(

		html_str,				#html文档字符串

		'html.parser',			#html解析器，可以使用py自带的html_parser

		from_encoding='utf-8'	#文档编码格式

		)

	#soup.find(name,attrs,string)	#只查找第一个匹配对象,支持正则表达式

	nodes = soup.find_all('a')

	for node in nodes:

		print(node.name)			#得到节点标签（参数1）

		print(node['href'])			#得到属性（参数2）

		print(node.get_text())		#得到文字（参数3）

	#正则匹配

	nodes2 = soup.find_all('a',href=re.compile(r"map"))

	print('\n\n\n\n\n---------------------------百年分割线------------------------\n')

	for node in nodes2:

		print(node.name)			#得到节点标签（参数1）

		print(node['href'])			#得到属性（参数2）

		print(node.get_text())		#得到文字（参数3）

使用python实现简单爬虫的更多相关文章

Python开发简单爬虫 - 慕课网
课程链接:Python开发简单爬虫环境搭建: Eclipse+PyDev配置搭建Python开发环境 Python入门基础教程用Eclipse编写Python程序课程目录第1章课程介绍 ...
python实现简单爬虫抓取图片
最近在学习python,正如大家所知,python在网络爬虫方面有着广泛的应用,下面是一个利用python程序抓取网络图片的简单程序,可以批量下载一个网站更新的图片,其中使用了代理IP的技术. imp ...
Python开发简单爬虫（一）
一 .简单爬虫架构: 爬虫调度端:启动爬虫,停止爬虫,监视爬虫运行情况 URL管理器:对将要爬取的和已经爬取过的URL进行管理:可取出带爬取的URL,将其传送给“网页下载器” 网页下载器:将URL指定 ...
Python开发简单爬虫
简单爬虫框架: 爬虫调度器 -> URL管理器 -> 网页下载器(urllib2) -> 网页解析器(BeautifulSoup) -> 价值数据 Demo1: # codin ...
Python做简单爬虫（urllib.request怎么抓取https以及伪装浏览器访问的方法）
一:抓取简单的页面: 用Python来做爬虫抓取网站这个功能很强大,今天试着抓取了一下百度的首页,很成功,来看一下步骤吧首先需要准备工具: 1.python:自己比较喜欢用新的东西,所以用的是Pyt ...
python多线程简单爬虫
爬虫本质就是将网站或者接口的数据经过筛选后按需求保存这里实现一个简单爬虫仅供参考 import requests import bs4 import threading import queue i ...
教你如何入手用python实现简单爬虫微信公众号并下载视频
主要功能如何简单爬虫微信公众号获取信息:标题.摘要.封面.文章地址自动批量下载公众号内的视频一.获取公众号信息:标题.摘要.封面.文章URL 操作步骤: 1.先自己申请一个公众号 2.登录自己 ...
python实现简单爬虫功能
在我们日常上网浏览网页的时候,经常会看到一些好看的图片,我们就希望把这些图片保存下载,或者用户用来做桌面壁纸,或者用来做设计的素材. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片鼠标右键的 ...
python scrapy简单爬虫记录(实现简单爬取知乎)
之前写了个scrapy的学习记录,只是简单的介绍了下scrapy的一些内容,并没有实际的例子,现在开始记录例子使用的环境是python2.7, scrapy1.2.0 首先创建项目在要建立项目的目 ...

随机推荐

Java爬虫初体验
年关将近,工作上该完成的都差不多了,上午闲着就接触学习了一下爬虫,抽空还把正则表达式复习了,Java的Regex和JS上还是有区别的,JS上的"\w"Java得写成"\\ ...
java如何导入Excel文件
Java使用POI导入Excel文件,操作起来比较简单,支持xlsx格式. 下载POI资源包从官网https://poi.apache.org/下载POI,笔者选择的是版本是3.17,下载后文件名是 ...
Flask之目录结构
学习Flask,整合其目录结构也是比较重要的.一个最基础的Flask目录如下所示: 一.SQLAlchemy-utils 由于sqlalchemy中没有提供choice方法,所以借助SQLAlchem ...
Java图形界面开发—简易登录注册小程序
登录注册小代码,将学过的一些小知识融合在一起进行了使用,加深印象.本例中如果有注释不详细的地方,详见其它博客. Java程序操作数据库SQLserver详解功能介绍:简单的登录注册系统,使用了数据库 ...
Android 关于Acitivity 的setFlag以及launchmode的总结
Intent几种常见的flags: .FLAG_ACTIVITY_NEW_TASK:当Intent对象包含这个标记时,系统会寻找或创建一个新的task来放置目标Activity,寻找时依据目标Acti ...
Linux命令行环境与桌面环境护切换
1.前言在大部分情况下,我们在使用Linux时习惯使用命令行环境,但是有时候也还是会使用到安装桌面环境,所以在这里介绍一下如何给没有安装桌面环境的系统安装桌面环境.以Centos 6.5 为例演示一 ...
Hibernate数据库的操作
参考网址: https://www.cnblogs.com/jack1995/p/6952704.html 1.最简单的查询 List<Special> specials = (List& ...
简析平衡树（二）——Treap
前言学完了替罪羊树,我决定再去学一学\(Treap\).一直听说\(Treap\)很难,我也花了挺久才学会. 简介 \(Treap\)这个名字真的挺有内涵: \(\color{red}{Tree}\ ...
【转】iOS 文件下载及断点续传
ios的下载我们可以使用的方法有:NSData.NSURLConnection.NSURLSession还有第三方框架AFNetworking和ASI 利用NSData方法和NSURLConnecti ...
subline 安装 package control
subline text2 输入 import urllib2,os,hashlib; h = '2915d1851351e5ee549c20394736b442' + '8bc59f460fa154 ...

使用python实现简单爬虫

简单的爬虫架构

调度器

URL管理器

功能列表

实现方式

网页下载器

功能列表

实现方法

解析器

使用python实现简单爬虫的更多相关文章

随机推荐

热门专题