Python简易爬虫爬取百度贴吧图片

　　　通过python 来实现这样一个简单的爬虫功能，把我们想要的图片爬取到本地。(Python版本为3.6.0)

一.获取整个页面数据

def getHtml(url):

    page=urllib.request.urlopen(url)

    html=page.read()

    return html

　说明:　

　　向getHtml()函数传递一个网址，就可以把整个页面下载下来.
　　urllib.request 模块提供了读取web页面数据的接口，我们可以像读取本地文件一样读取www和ftp上的数据.

二.筛选页面中想要的数据

　　在百度贴吧找到了几张漂亮的图片,想要下载下来.使用火狐浏览器,在图片位置鼠标右键单单击有查看元素选项,点进去之后就会进入开发者模式,并且定位到图片所在的前段代码

现在主要观察图片的正则特征,编写正则表达式.

reg=r'src="(https://imgsa[^>]+\.(?:jpeg|jpg))"'
#参考正则

编写代码

def getImg(html):

    reg=r'src="(https://imgsa[^>]+\.(?:jpeg|jpg))"'

    imgre = re.compile(reg)

    imglist = re.findall(imgre,html.decode('utf-8'))

    return imglist

说明:

　　　re.compile() 可以把正则表达式编译成一个正则表达式对象.

　　　re.findall() 方法读取html 中包含 imgre（正则表达式）的数据。

　　　　运行脚本将得到整个页面中包含图片的URL地址。

三.将页面筛选的数据保存到本地

　　编写一个保存的函数

def saveFile(x):

    if not os.path.isdir(path):

        os.makedirs(path)

    t = os.path.join(path,'%s.img'%x)

    return  t

完整代码:

'''

Created on 2017年7月15日

@author: Administrator

'''

import urllib.request,os

import re

def getHtml(url):

    page=urllib.request.urlopen(url)

    html=page.read()

    return html

path='D:/workspace/Python1/reptile/__pycache__/img'

def saveFile(x):

    if not os.path.isdir(path):

        os.makedirs(path)

    t = os.path.join(path,'%s.img'%x)

    return  t

html=getHtml('https://tieba.baidu.com/p/5248432620')

print(html)

print('\n')

def getImg(htnl):

    reg=r'src="(https://imgsa[^>]+\.(?:jpeg|jpg))"'

    imgre=re.compile(reg)

    imglist=re.findall(imgre,html.decode('utf-8'))

    x=

    for imgurl in imglist:

        urllib.request.urlretrieve(imgurl,saveFile(x))

        print(imgurl)

        x+=

        if x==:

            break

    print(x)

    return imglist

getImg(html)

print('end')

核心是用到了urllib.request.urlretrieve()方法，直接将远程数据下载到本地

最后,有点问题还没有完全解决,这里也向大家请教一下.

　　当下载图片超过23张时会报错:

　　　　urllib.error.HTTPError: HTTP Error 500: Internal Server Error
　　不知道是什么问题,求助.

Python简易爬虫爬取百度贴吧图片的更多相关文章

【Python】Python简易爬虫爬取百度贴吧图片
通过python 来实现这样一个简单的爬虫功能,把我们想要的图片爬取到本地.(Python版本为3.6.0) 一.获取整个页面数据 def getHtml(url): page=urllib.requ ...
python简单爬虫爬取百度百科python词条网页
目标分析:目标:百度百科python词条相关词条网页 - 标题和简介入口页:https://baike.baidu.com/item/Python/407313 URL格式: - 词条页面URL:/ ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
python爬虫-爬取百度图片
python爬虫-爬取百度图片(转) #!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:16# 文件 :spider ...
如何利用Python网络爬虫爬取微信朋友圈动态--附代码（下）
前天给大家分享了如何利用Python网络爬虫爬取微信朋友圈数据的上篇(理论篇),今天给大家分享一下代码实现(实战篇),接着上篇往下继续深入. 一.代码实现 1.修改Scrapy项目中的items.py ...
利用Python网络爬虫爬取学校官网十条标题
利用Python网络爬虫爬取学校官网十条标题案例代码: # __author : "J" # date : 2018-03-06 # 导入需要用到的库文件 import urll ...
百度图片爬虫-python版-如何爬取百度图片?
上一篇我写了如何爬取百度网盘的爬虫,在这里还是重温一下,把链接附上: http://www.cnblogs.com/huangxie/p/5473273.html 这一篇我想写写如何爬取百度图片的爬虫 ...
写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...
04 Python网络爬虫 <<爬取get/post请求的页面数据>>之requests模块
一. urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib ...

随机推荐

14.Java中的Future模式
jdk1.7.0_79 本文实际上是对上文<13.ThreadPoolExecutor线程池之submit方法>的一个延续或者一个补充.在上文中提到的submit方法里出现了Future ...
Spring事务管理—aop:pointcut expression解析
先来看看这个spring的配置文件的配置:  <bean id="transactionManager" class="o ...
TIOBE：全球编程语言最新排名（Kotlin排名进入前50名）
作为coder,大家当然关心自己所使用语言的应用趋势.要是几年后所用语言变得默默无闻,那岂不是之前的知识储备与经验积累都会大打折扣.TIOBE排行榜是根据互联网上有经验的程序员.课程和第三方厂商的数量 ...
.Net Mvc Automated Migration 数据迁移
1.打开程序包管理器控制台 PM> enable-migrations –EnableAutomaticMigration:$true 2.项目工程文件中会生成Migrations文件夹 3.找 ...
phpcms v9模版调用代码
首页调用栏目{pc:content action="category" siteid="$siteid" num="15" order=&q ...
php5.6在yum下安装gd库
yum install php-gd --enablerepo=remi,remi-php56 php.ini配置文件中增加 extension=gd.so 重启web服务器即可
PHP按值合并数组
/** * PHP按值合并数组 * */ function my_array_merge(&$array1, &$array2) { $result = Array(); foreac ...
【Android Developers Training】 48. 轻松拍摄照片
注:本文翻译自Google官方的Android Developers Training文档,译者技术一般,由于喜爱安卓而产生了翻译的念头,纯属个人兴趣爱好. 原文链接:http://developer ...
Linux中使用京东代码库JDCode创建私有Git仓库
国外Git经常被墙,所以目光转向国内.目前,云存储真的是很热,有很多公司在做. 看了一下,CSDN,开源中国,淘宝,京东,Gitcafe都在搞.淘宝只支持SVN. JD号称提供1G免费空间,而且支持私 ...
使用Scribefire在博客中插入语法高亮 II
效果如下, 这是我们在Scribefire中添加的code按钮,单击此按钮,则会出现在codeHere中直接输入代码就可以了. 查看html 可以看到,其中已经添加了<pre>标签. 下 ...

Python简易爬虫爬取百度贴吧图片

Python简易爬虫爬取百度贴吧图片的更多相关文章

随机推荐

热门专题