python 简单的爬虫

import urllib.request

import re

import ssl  # 处理https请求

import time

import os  # 创建目录用

def get_html(url):

    page = urllib.request.urlopen(url)

    html = page.read()  # 返回的是 <class 'bytes'> 需要转码为字符串类型

    html = html.decode('utf-8')  # 返回的是 <class 'str'>

    return html

reg = 'src="(.+?\.jpg)" width'  # 正则表达式

reg_img = re.compile(reg)  # 编译一下，运行更快

ssl._create_default_https_context = ssl._create_unverified_context  # 因为爬虫对象是https链接，导入一个ssl模块就可以解决问题

imglist = reg_img.findall(get_html('http://tieba.baidu.com/p/1753935195'))  # 进行匹配

def mkdir(path):

    # 去除首位空格

    path = path.strip()

    # 去除尾部 \ 符号

    path = path.rstrip("\\")

    # 判断路径是否存在

    # 存在     True

    # 不存在   False

    isExists = os.path.exists(path)

    # 判断结果

    if not isExists:

        # 如果不存在则创建目录

        # 创建目录操作函数

        os.makedirs(path)

        print(path + ' 创建成功')

        return True

    else:

        # 如果目录存在则不创建，并提示目录已存在

        print(path + ' 目录已存在')

        return False

# 定义要创建的目录

mkpath = "picture"

# 调用函数

picture = mkdir(mkpath)

x = 0

for img in imglist:

    urllib.request.urlretrieve(img, mkpath+'/%s.jpg' % time.time())

    x += 1

print("图片下载完成")

python 简单的爬虫的更多相关文章

Selenium + PhantomJS + python 简单实现爬虫的功能
Selenium 一.简介 selenium是一个用于Web应用自动化程序测试的工具,测试直接运行在浏览器中,就像真正的用户在操作一样 selenium2支持通过驱动真实浏览器(FirfoxDrive ...
Python简单网络爬虫实战—下载论文名称，作者信息（下）
在Python简单网络爬虫实战—下载论文名称,作者信息(上)中,学会了get到网页内容以及在谷歌浏览器找到了需要提取的内容的数据结构,接下来记录我是如何找到所有author和title的 1.从sou ...
亲身试用python简单小爬虫
前几天基友分享了一个贴吧网页,有很多漂亮的图片,想到前段时间学习的python简单爬虫,刚好可以实践一下. 以下是网上很容易搜到的一种方法: #coding=utf-8 import urllib i ...
python简单页面爬虫入门 BeautifulSoup实现
本文可快速搭建爬虫环境,并实现简单页面解析 1.安装 python 下载地址:https://www.python.org/downloads/ 选择对应版本,常用版本有2.7.3.4 安装后,将安装 ...
Python 简单网页爬虫学习
#coding=utf-8 # 参考文章: # 1. python实现简单爬虫功能 # http://www.cnblogs.com/fnng/p/3576154.html # 2. Python 2 ...
python简单的爬虫，网页图片
1 #!/usr/bin/python 2 #coding=utf-8 3 import urllib 4 import re 5 6 def gethtml(url): 7 page=urllib. ...
Python简单分布式爬虫
分布式爬虫采用主从模式.主从模式是指由一台主机作为控制节点,负责管理所有运行网络爬虫的主机(url管理器,数据存储器,控制调度器),爬虫只需要从控制节点哪里接收任务,并把新生成任务提交给控制节点.此次 ...
python简单小爬虫爬取易车网图片
上代码: import requests,urllib.request from bs4 import BeautifulSoup url = 'http://photo.bitauto.com/' ...
Python简单网页爬虫——极客学院视频自动下载
http://blog.csdn.net/supercooly/article/details/51003921

随机推荐

Unity3D笔记切水果一
最终效果: 一.选择背景图片,选择GUI Texture 二.创建一个空的GameObject,然后添加背景音乐三.创建GUISkin 四.主要代码 #pragma strict var myGUI ...
关于*** WARNING L15: MULTIPLE CALL TO SEGMENT
编写51程序的时候,有时候会在主函数和中断函数里面调用同一个函数,如果正的出现这种情况,编译器会提出这种警告: *** WARNING L15: MULTIPLE CALL TO SEGMENT(重 ...
Context对象还提供了相应的属性来调整线条及填充风格
创建一个Canvas画布的方法如下: 复制代码代码如下: <canvas id=”canvas” width=”600” height=”400”></canvas> 可以在 ...
ubuntu16.04下安装wps
首先下载安装下载 wps for linux 在终端用命令安装 sudo dpkg -i wps-office_10.~a21_amd64.deb 字体缺失问题下载 wps_symbol_font ...
Codeforces 349C - Mafia
time limit per test 2 seconds memory limit per test 256 megabytes input standard input output standa ...
HDU 6008 - Worried School
Worried School Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others) T ...
ORACLE中Drop table cascade constraints之后果.
当你要drop一个table时,如果删除table的动作会造成trigger或constraint产生矛盾,系统会出现错误警告的讯息而不会允许执行..一个极简单的例子,例如你有一个员工基本资料表,上面 ...
hadoop 2.x HA(QJM)安装部署规划
一.主机服务规划: db01 db02 ...
Python开发【Tornado】：搭建文件下载服务、音频文件播放
Tornado 如何做文件下载要求:浏览器输入url地址,直接弹窗提示下载 Tornado服务端,搭建文件下载服务 #!/usr/bin/env python # -*- coding:utf-8 ...
linux删除指定行&删除行首空格&替换字符
打印并删除2~1000行 nl /etc/passwd | sed '2,1000d' |more 删除行首空格 sed -i 's/^[][ ]*//g' file 替换分隔符说明:文件中数据是由 ...

python 简单的爬虫

python 简单的爬虫的更多相关文章

随机推荐

热门专题