Python 2.7_爬取妹子图网站单页测试图片

1、url= http://www.mzitu.com/74100/x，2为1到23的值

2、用到模块 os 创建文件目录; re模块正则匹配目录名图片下载地址; time模块限制下载时间;requests模块获取网页源代码;urllib模块 urllib.urlretrieve(图片url,保存的带扩展名的文件名x.jpg)方法下载图片

3、知识点文件目录处理函数封装调用全局变量

4、代码

#coding:utf-8

import os

import re

import requests as rq

import urllib

import time

#创建目录函数 保存文件位置

def create_catename():

    #取出网页的上层目录名称

    url=urls[0]

    html=rq.get(url).text

    cate_name=re.findall(r'<a href="http://www.mzitu.com/xinggan" rel="category tag">(.*?)</a>',html)[0]

    path='D:\\%s' % cate_name

    return path

#下载图片 定义n为全局变量 以n计数为图片的文件名n.jpg  定义n全面变量 以免for循环时候上次循环n的值被重新赋值

def getimg():

    global n

    n=1

    for url in urls:

        html = rq.get(url).text

        regex = re.compile('<img src="(.*?.jpg)" alt=')

        img_url = re.findall(regex, html)[0]

        urllib.urlretrieve(img_url,'%s.jpg' % n)

        n+=1

#main函数 调用上面的两个函数  urls是个全局变量 取23张页面 下载23张图

def main():

    global urls

    urls = ['http://www.mzitu.com/74100/{}'.format(str(i)) for i in range(1, 24)]

    path=create_catename()

    #创建文件目录

    os.mkdir(path)

    # 切换到该目录

    os.chdir(path)

    time.sleep(2)

    getimg()

main()

Python 2.7_爬取妹子图网站单页测试图片_20170114的更多相关文章

Python 2.7和3.6爬取妹子图网站单页测试图片
1.url= http://www.mzitu.com/74100/x,2为1到23的值 2.用到模块 os 创建文件目录; re模块正则匹配目录名图片下载地址; time模块限制下载时间;req ...
Python协程爬取妹子图(内有福利，你懂得~)
项目说明: 1.项目介绍本项目使用Python提供的协程+scrapy中的选择器的使用(相当好用)实现爬取妹子图的(福利图)图片,这个学会了,某榴什么的.pow(2, 10)是吧! 2.用到的知 ...
Python网络爬虫 | Scrapy爬取妹子图网站全站照片
根据现有的知识,写了一个下载妹子图(meizitu.com)Scrapy脚本,把全站两万多张照片下载到了本地. 网站的分析网页的网址分析打开网站,发现网页的网址都是以 http://www.mei ...
Python3爬虫系列：理论+实验+爬取妹子图实战
Github: https://github.com/wangy8961/python3-concurrency-pics-02 ,欢迎star 爬虫系列: (1) 理论 Python3爬虫系列01 ...
Python爬虫入门教程 2-100 妹子图网站爬取
妹子图网站爬取---前言从今天开始就要撸起袖子,直接写Python爬虫了,学习语言最好的办法就是有目的的进行,所以,接下来我将用10+篇的博客,写爬图片这一件事情.希望可以做好. 为了写好爬虫,我们 ...
python爬取妹子图全站全部图片-可自行添加-线程-进程爬取，图片去重
from bs4 import BeautifulSoupimport sys,os,requests,pymongo,timefrom lxml import etreedef get_fenlei ...
利用python实现爬虫爬取某招聘网站，北京地区岗位名称包含某关键字的所有岗位平均月薪
#通过输入的关键字,爬取北京地区某岗位的平均月薪 # -*- coding: utf-8 -*- import re import requests import time import lxml.h ...
Python 2.7_爬取CSDN单页面博客文章及url(二)_xpath提取_20170118
上次用的是正则匹配文章title 和文章url,因为最近在看Scrapy框架爬虫需要了解xpath语法学习了下拿这个例子练手 1.爬取的单页面还是这个rooturl:http://blog.csd ...
Python 2.7_爬取CSDN单页面利用正则提取博客文章及url_20170114
年前有点忙,没来的及更博,最近看爬虫正则的部分巩固下 1.爬取的单页面:http://blog.csdn.net/column/details/why-bug.html 2.过程解析url获得网站 ...

随机推荐

Nginx反向代理+负载均衡简单实现
一.基础环境: 负载机:A机器: 192.168.71.223后端机器1:B机器:192.168.71.224后端机器2:C机器:192.168.71.226 需求: 1)访问A机器的808 ...
算法寒假实习面试经过之滴滴（电话一面二面 offer）
一面:1h 介绍比赛项目. lr与xgb的区别? xgb 为什么不用归一化,onehot? xgb 与 gbdt的区别. 做这些比赛你们的优势在哪,既然全是相同的套路. RCNN的原理, CNN的原理 ...
HackerRank - fibonacci-modified 【大数】
思路用PYTHON 或 JAVA 干掉 AC代码 a, b, n = map(int, input().split()) for i in range (2, n, 1) : temp = b b ...
每天一个Linux命令（60）ip命令
ip命令是Linux下较新的功能强大的网络配置工具. (1)用法: 用法: ip [OPTIONS] OBJECT [COMMAND [ARGUMENTS]] ...
Git版本控制系统VCS
Git版本控制系统VCS 一.版本控制系统基本情况说明版本控制是一种记录一个或者若干个文件内容的变化,以便将来查阅特定版本修订情况的系统 1.作用记录文件的所有历史变化随时可回复到任何一个历史状 ...
https网站无法加载http路径的js和css
在https的网站中引用http路径的js或css会导致不起作用,其形如: <script src="http://code.jquery.com/jquery-1.11.0.min. ...
win7 与 Ubuntu 16.04 文件传送
win7 与 Ubuntu 16.04 文件传送环境:主机系统为win7,虚拟机为vmware12, 虚拟系统为ubuntu 16.04 方案一: 通过虚拟机vmware的共享文件夹实现. 方案二: ...
Java public class 与 class 区别
在编写类的时候可以使用两种定义方式: public class 定义类 class 定义类 1.public class 定义类如果一个类声明的时候使用了public class,则类名必须与文件名 ...
Go Log模块生成日志文件
使用log模块示例代码: package main import ( "fmt" "time" "log" "os" ) ...
Grafana连接Prometheus监控Docker平台
Grafana是一款开源的分析平台. Grafana allows you to query, visualize, alert on and understand your metrics no m ...

Python 2.7_爬取妹子图网站单页测试图片_20170114

Python 2.7_爬取妹子图网站单页测试图片_20170114的更多相关文章

随机推荐

热门专题