使用python爬取百度贴吧内的图片

1. 首先通过urllib获取网页的源码

# 定义一个getHtml()函数

def getHtml(url):

    try:

        page = urllib.urlopen(url)  # urllib.urlopen()方法用于打开一个URL地址

        html = page.read()  # read()方法用于读取URL上的数据

    except Exception as e:

        html = ''

    return html

2. 获取下一页的url链接，当本页的图片链接获取完毕，再继续获取下一页的。使用Python正则表达式匹配需要的字段

# 得到下一页的url

def get_page_url(html):

    url_reg = r'<a href="(.*)">下一页</a>'

    url_pattern = re.compile(url_reg)

    fanye_urls = url_pattern.findall(html)

    fanye_url = 'https://tieba.baidu.com' + fanye_urls[0] if fanye_urls else ''

    return fanye_url

3. 获取每一页的图片链接，将之放入一个总的数组，最后通过链接下载图片

def getImg(html):

    img_reg = r'https://.[^\s]+?.jpg|https://.[^\s]+?.png'  # 正则表达式，得到图片地址

    img_pattern = re.compile(img_reg)  # re.compile() 可以把正则表达式编译成一个正则表达式对象.

    imgList = img_pattern.findall(html)  # img_pattern.findall() 方法读取html 中包含 img_reg（正则表达式）的  数据，数组形式

    return imgList

4. 下载图片。使用urllib.urlretrieve()方法，直接根据链接将图片下载到本地

def down_img(imgList):

    x = 0

    for imgUrl in imgList:

        try:

            # 核心是urllib.urlretrieve()方法,直接将远程数据下载到本地，图片通过x依次递增命名

            urllib.urlretrieve(imgUrl, 'E:\img\%s.jpg' % str(x + 1))

            print '成功下载第%s张图片时：%s' % (str(x + 1), str(imgUrl))

            x += 1

        except Exception as e:

            print '下载第%s张图片时失败：%s' % (str(x + 1), str(imgUrl))

            print e

            continue

    return imgList

5. 先爬取第一页的图片链接，然后通过while循环，继续读取第二页，.....，等到最后，将所有从网上爬取的图片链接使用extend()方法放入总的数组内，然后统一下载

all_img_urls = []

    # 得到网页源码

    html = getHtml("https://tieba.baidu.com/p/5407739329")

    fanye_url = get_page_url(html)

    # 得到图片链接的数组

    imgList = getImg(html)

    # 将imgList数组存入总的图片数组内

    all_img_urls.extend(imgList)

    fanye_count = 0  # 累计翻页数

    while 1:

        try:

            next_html = getHtml(fanye_url)

            fanye_url = get_page_url(next_html)

            next_imgList = getImg(next_html)

            fanye_count += 1

            print('第%s页' % fanye_count)

            all_img_urls.extend(next_imgList)

            if fanye_url == '' and next_imgList == []:

                print('已到最后一页, 开始下载：')

                break

        except Exception as e:

            print e

            continue

    down_img(all_img_urls)

总的代码如下：

# coding=utf-8

"""下载百度贴吧内的图片"""

import re

import urllib

# 定义一个getHtml()函数

def getHtml(url):

    try:

        page = urllib.urlopen(url)  # urllib.urlopen()方法用于打开一个URL地址

        html = page.read()  # read()方法用于读取URL上的数据

    except Exception as e:

        html = ''

    return html

# 得到下一页的url

def get_page_url(html):

    url_reg = r'<a href="(.*)">下一页</a>'

    url_pattern = re.compile(url_reg)

    fanye_urls = url_pattern.findall(html)

    fanye_url = 'https://tieba.baidu.com' + fanye_urls[0] if fanye_urls else ''

    return fanye_url

def getImg(html):

    img_reg = r'https://.[^\s]+?.jpg|https://.[^\s]+?.png'  # 正则表达式，得到图片地址

    img_pattern = re.compile(img_reg)  # re.compile() 可以把正则表达式编译成一个正则表达式对象.

    imgList = img_pattern.findall(html)  # img_pattern.findall() 方法读取html 中包含 img_reg（正则表达式）的  数据，数组形式

    return imgList

def down_img(imgList):

    x = 0

    for imgUrl in imgList:

        try:

            # 核心是urllib.urlretrieve()方法,直接将远程数据下载到本地，图片通过x依次递增命名

            urllib.urlretrieve(imgUrl, 'E:\img\%s.jpg' % str(x + 1))

            print '成功下载第%s张图片时：%s' % (str(x + 1), str(imgUrl))

            x += 1

        except Exception as e:

            print '下载第%s张图片时失败：%s' % (str(x + 1), str(imgUrl))

            print e

            continue

    return imgList

if __name__ == '__main__':

    all_img_urls = []

    # 得到网页源码

    html = getHtml("https://tieba.baidu.com/p/5407739329")

    fanye_url = get_page_url(html)

    # 得到图片链接的数组

    imgList = getImg(html)

    # 将imgList数组存入总的图片数组内

    all_img_urls.extend(imgList)

    fanye_count = 0  # 累计翻页数

    while 1:

        try:

            next_html = getHtml(fanye_url)

            fanye_url = get_page_url(next_html)

            next_imgList = getImg(next_html)

            fanye_count += 1

            print('第%s页' % fanye_count)

            all_img_urls.extend(next_imgList)

            if fanye_url == '' and next_imgList == []:

                print('已到最后一页, 开始下载：')

                break

        except Exception as e:

            print e

            continue

    down_img(all_img_urls)

使用python爬取百度贴吧内的图片的更多相关文章

Python——爬取百度百科关键词1000个相关网页
Python简单爬虫——爬取百度百科关键词1000个相关网页——标题和简介网站爬虫由浅入深:慢慢来分析: 链接的URL分析: 数据格式: 爬虫基本架构模型: 本爬虫架构: 源代码: # codin ...
python 爬取百度url
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Date : 2017-08-29 18:38:23 # @Author : EnderZhou (z ...
python爬取百度贴吧帖子
最近偶尔学下爬虫,放上第二个demo吧 #-*- coding: utf-8 -*- import urllib import urllib2 import re #处理页面标签类 class Too ...
爬虫实战(一) 用Python爬取百度百科
最近博主遇到这样一个需求:当用户输入一个词语时,返回这个词语的解释我的第一个想法是做一个数据库,把常用的词语和词语的解释放到数据库里面,当用户查询时直接读取数据库结果但是自己又没有心思做这样一个数 ...
假期学习【十一】Python爬取百度词条写入csv格式 python 2020.2.10
今天主要完成了根据爬取的txt文档,从百度分类从信息科学类爬取百度词条信息,并写入CSV格式文件. txt格式文件如图: 为自己爬取内容分词后的结果. 代码如下: import requests fr ...
python爬取百度搜索结果ur汇总
写了两篇之后,我觉得关于爬虫,重点还是分析过程分析些什么呢: 1)首先明确自己要爬取的目标比如这次我们需要爬取的是使用百度搜索之后所有出来的url结果 2)分析手动进行的获取目标的过程,以便以程序 ...
Python 爬虫练习：爬取百度贴吧中的图片
背景:最近开始看一些Python爬虫相关的知识,就在网上找了一些简单已与练习的一些爬虫脚本实现功能:1,读取用户想要爬取的贴吧 2,读取用户先要爬取某个贴吧的页数范围 3,爬取每个贴吧中用户输入的页 ...
python 爬取百度云资源
pan1 1 import urllib.request 2 import re 3 import random 4 5 def get_source(key): 6 7 print('请稍等,爬取中 ...
python爬取百度翻译返回：{'error': 997, 'from': 'zh', 'to': 'en', 'query 问题
解决办法: 修改url为手机版的地址:http://fanyi.baidu.com/basetrans User-Agent也用手机版的测试代码: # -*- coding: utf-8 -*- & ...

随机推荐

Spring Error : No unique bean of type [org.apache.ibatis.session.SqlSessionFactory] is defined
报错信息: Injection of autowired dependencies failed; nested exception is org.springframework.beans.fa ...
golang sql database drivers
https://github.com/golang/go/wiki/SQLDrivers SQL database drivers The database/sql and database/sql/ ...
css scroll bug
滚动区域不能设置overflow var doc = $(document), win = $(window), h = $("#head"), b = $("#body ...
webpack3.x基本配置与总结
基本配置 1.开始之前,请确定你已经安装了当前 Node 的较新版本. 2.然后在文件夹根目录下执行以下命令初始化项目并全局安装webpack: 1.$ cnpm init // 初始化项目 2.$ ...
thinkinginjava学习笔记07_多态
在上一节的学习中,强调继承一般在需要向上转型时才有必要上场,否则都应该谨慎使用: 向上转型和绑定向上转型是指子类向基类转型,由于子类拥有基类中的所有接口,所以向上转型的过程是安全无损的,所有对基类进 ...
Struts2内部执行过程
首先是Struts2的流程图. 一.当有一个请求的时候.执行以下流程. 1 客户端初始化一个指向Servlet容器的请求: 2 这个请求经过一系列的过滤器(Filter)(这些过滤器中有一个叫做Act ...
jQuery 效果函数（三）
方法描述 animate() 对被选元素应用“自定义”的动画 clearQueue() 对被选元素移除所有排队的函数(仍未运行的) delay() 对被选元素的所有排队函数(仍未运行)设置延迟 de ...
【转载】MySQL事务以及SELECT ... FOR UPDATE的使用
MySQL中的事务,默认是自动提交的,即autocommit = 1: 但是这样的话,在某些情形中就会出现问题:比如: 如果你想一次性插入了1000条数据,mysql会commit1000次的, 如果 ...
html5 storage事件
HTML5 虽然很多年了,但是真的了解不不够不够.主题说的是 storage时间,说起对 storage 事件的了解还是从 QQ音乐说起. QQ音乐的主页是 https://y.qq.com , 而 ...
iOS libyuv
libyuv是Google开源库,可用作图像数据格式的转换,比如视频流编解码时格式的转换,YUV数据转化RGB等 libyuv静态库为了方便使用,已经将libyuv源代码打包成了iOS静态库,lib ...

使用python爬取百度贴吧内的图片

使用python爬取百度贴吧内的图片的更多相关文章

随机推荐

热门专题