Python爬虫第一个成功版

爬取http://www.mzitu.com/all里面的图片

 import urllib.request

 import re

 import os

 url = 'http://www.mzitu.com/all/' # 爬虫入口

 req = urllib.request.Request(url)

 req.add_header('Referer','http://www.mzitu.com/all/')

 req.add_header('User-Agent','Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36')

 html = urllib.request.urlopen(req).read().decode('utf-8') # 得到入口页面的HTML

 reg = re.compile(r'<a.+?href="(.+?)"')

 hrlist = re.findall(reg,html) # 得到所有图片的页面链接

 print(hrlist)

 def getImgUrl(url): # 根据图片页面的链接得到图片链接

     html = getHtml(url).decode('utf-8')

     reg = re.compile(r'<img.+?src="(.+?\.jpg)"')

     imgUrl = re.findall(reg,html)

     return imgUrl # 返回得到的图片链接

 def getHtml(url): # 得到HTML页面信息

     req = urllib.request.Request(url)

     req.add_header('Referer','http://www.mzitu.com/all/')

     req.add_header('User-Agent','Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36')

     res = urllib.request.urlopen(req)

     html = res.read() # 得到入口页面的HTML

     return html # 返回得到的字符串形式的HTML页面

 # 根据图片的链接下载图片

 def download(url):

     filename = url.split('/')[-1]

     with open(filename,'wb') as f:

         img = getHtml(url)

         f.write(img)

 # 保存所有图片

 def save_all(folder='mm'):

     os.mkdir(folder)

     os.chdir(folder)

     for each in hrlist:

         imgUrl_list = getImgUrl(each)

         for imgUrl in imgUrl_list:

             download(imgUrl)

 if __name__=='__main__':

     save_all()

Python爬虫第一个成功版的更多相关文章

python爬虫第一天
python爬虫第一天太久没折腾爬虫又要重头开始了....感谢虫师大牛的文章. 接下来的是我的随笔 0x01 获取整个页面我要爬的是百度贴吧的图,当然也是跟着虫师大牛的思路. 代码如下: #co ...
Python爬虫第一步
这只是记录一下自己学习爬虫的过程,可能少了些章法.我使用过的是Python3.x版本,IDE为Pycharm. 这里贴出代码集合,这一份代码也是以防自己以后忘记了什么,方便查阅. import req ...
猿人学python爬虫第一题
打开网站.F12,开启devtools.发现有段代码阻止了我们调试好的.接下来有几种解决方法 1- 绕过阻止调试方法方法1(推荐) 鼠标放在debugger该行,左边数字行号那一列.右键选择不在永 ...
Python爬虫第一集
import urllib2 response = urllib2.urlopen("http://www.baidu.com") print response.read() 简单 ...
Python爬虫入门教程 12-100 半次元COS图爬取
半次元COS图爬取-写在前面今天在浏览网站的时候,忽然一个莫名的链接指引着我跳转到了半次元网站 https://bcy.net/ 打开之后,发现也没有什么有意思的内容,职业的敏感让我瞬间联想到了 c ...
Python爬虫入门教程：半次元COS图爬取
半次元COS图爬取-写在前面今天在浏览网站的时候,忽然一个莫名的链接指引着我跳转到了半次元网站 https://bcy.net/ 打开之后,发现也没有什么有意思的内容,职业的敏感让我瞬间联想到了 c ...
孤荷凌寒自学python第七十六天开始写Python的第一个爬虫6
孤荷凌寒自学python第七十六天开始写Python的第一个爬虫6 (完整学习过程屏幕记录视频地址在文末) 今天在上一天的基础上继续完成对我的第一个代码程序的书写. 不过由于对python-docx模 ...
孤荷凌寒自学python第七十五天开始写Python的第一个爬虫5
孤荷凌寒自学python第七十五天开始写Python的第一个爬虫5 (完整学习过程屏幕记录视频地址在文末) 今天在上一天的基础上继续完成对我的第一个代码程序的书写. 直接上代码.详细过程见文末屏幕录像 ...
孤荷凌寒自学python第七十四天开始写Python的第一个爬虫4
孤荷凌寒自学python第七十四天开始写Python的第一个爬虫4 (完整学习过程屏幕记录视频地址在文末) 今天在上一天的基础上继续完成对我的第一个代码程序的书写. 直接上代码.详细过程见文末屏幕录像 ...

随机推荐

【Java基础】System的arraycopy方法拷贝数组
一.在System类中查看方法的定义二.示例 public class SystemArrayCopyTest { /** * @Description: System的arrayCopy方法测试 ...
使用 CSS MARK 改变 SVG 背景色
CSS masks -webkit-mask 这个属性是相当强大的,详细的介绍请到这里查看,它非常值得深入研究. -webkit-mask 让为一个元素添加蒙板成为可能,从而你可以创建任意形状的花样. ...
本版本延续MVC中的统一验证机制~续的这篇文章，本篇主要是对验证基类的扩展和改善(转)
本版本延续MVC中的统一验证机制~续的这篇文章,本篇主要是对验证基类的扩展和改善 namespace Web.Mvc.Extensions { #region 验证基类 /// <summary ...
windows 电脑配置信息检测
内存条 DDR4 DDR4相比DDR3最大的区别有: 1)处理器:每次内存升级换代时,必须支持的就是处理器.Haswell-E平台的内存同IVB-E/SNB-E一样为四通道设计,DDR4内存频率原生支 ...
LeetCode 18 4Sum (4个数字之和等于target)
题目链接 https://leetcode.com/problems/4sum/?tab=Description 找到数组中满足 a+b+c+d=0的所有组合,要求不重复. Basic idea is ...
linux各种版本下载地址
本文转载地址:http://52199999.blog.51cto.com/740826/290179 觉得好大家给顶顶,先谢谢了!呵呵首先提供两个镜像站:http://mirrors.sohu.c ...
jenkins部署war包到远程服务器的tomcat
一.目的 jenkins上将war包,部署到远程服务器的tomcat上. 这边tomcat在windows 主机A上,版本apache-tomcat-8.5.23. jenkins在主机B上,cent ...
Unity3D 边缘高光Shader
Shader "Custom/NewShader" { Properties { _MainTex ("Base (RGB)", 2D) = "whi ...
更新jenkins插件，报错 Perhaps you need to run your container with "-Djava.awt.headless=true"?
Configuring the Java environment variables vi ~/.bash_profile 在最后一行加入: export JAVA_OPTS=-Djava.awt.h ...
【咸鱼教程】EUI多图片滑动组件ScrollView
先看看实际效果实现原理1. ScrollView继承eui.Scroll2. 监听eui.Sroll的CHANGE_START和CHANGE_END事件, 根据鼠标滑动距离,来改变视口 ...

Python爬虫第一个成功版

Python爬虫第一个成功版的更多相关文章

随机推荐

热门专题