Python爬虫抓取糗百的图片，并存储在本地文件夹

思路：

1.观察网页，找到img标签

2.通过requests和BS库来提取网页中的img标签

3.抓取img标签后，再把里面的src给提取出来，接下来就可以下载图片了

4.通过urllib的urllib.urlretrieve来下载图片并且放进文件夹里面（第一之前的准备工作就是获取当前路径然后新建一个文件夹）

5.如果有多张图片，不断的重复3-4

由于爬虫写得少，通过自己的调试，终于写了出来了

下面直接上代码：

 #coding = 'utf-8'

 import requests

 from bs4 import BeautifulSoup

 import urllib

 import os

 import sys

 reload(sys)

 sys.setdefaultencoding("utf-8")

 if __name__ == '__main__':

     url = 'http://www.qiushibaike.com/'

     res = requests.get(url)

     res.encoding = 'utf-8'

     soup = BeautifulSoup(res.text, 'html.parser')

     imgs = soup.find_all("img")

     _path = os.getcwd()

     new_path = os.path.join(_path , 'pictures')

     if not os.path.isdir(new_path):

         os.mkdir(new_path)

     new_path += '\ '

     try:

         x = 1

         if imgs == []:

             print "Done!"

         for img in imgs:

             link = img.get('src')

             if 'http' in link:

                 print "It's downloading %s" %x + "th's piture"

                 urllib.urlretrieve(link, new_path + '%s.jpg' %x)

                 x += 1

     except Exception, e:

         print e

     else:

         pass

     finally:

         if x :

             print "It's Done!!!"

接下来上结果：

python3中的版本，略有有一点点不同，就是下载图片的方法需要加上request，然后才能使用urlretrieve方法进行下载

 #!/usr/bin/python3

 #coding = 'utf-8'

 import requests

 from bs4 import BeautifulSoup

 import urllib

 import os

 import sys

 #reload(sys)

 #sys.setdefaultencoding("utf_8")

 if __name__ == '__main__':

     url = 'http://www.qiushibaike.com/'

     res = requests.get(url)

     res.encoding = 'utf-8'

     print (res)

     soup = BeautifulSoup(res.text,'html.parser')

     #imgs = soup.find_all('img', attrs={'class': 'item_img'})

     imgs = soup.find_all('img')

     _path = os.getcwd()

     new_path = os.path.join(_path,'pictures\\')#需要添加斜杠，才能将图片放进单独的文件夹里面

     print(new_path)

     if not os.path.isdir(new_path):

         os.mkdir(new_path)

     #new_path = new_path + '\'

     #print (str(new_path))

     try:

         x = 1

         if imgs == []:

             print ("Done!")

             print (len(imgs))

         for img in imgs:

             link = img.get('src')

             link = 'http:' + link

             #print (link)

             if True:

                 print ("It's downloading %s" %x + "th's piture")

                 #python3如下使用urlretrieve

                 #_new111 = new_path + '%s.jpg'%5

                 #print (_new111)

                 urllib.request.urlretrieve(link,new_path + '%s.jpg' %x)

                 x += 1

     except Exception:

         pass

 #    else:

 #        pass

     finally:

         if x:

             print ("It's Done!")

结果都是一样，就不再另外贴结果截图了

总结：

虽然一开始思路不清晰，而且对怎样把图片保存下来，都不是很熟

但是经过自己的思考，只要思路清楚了，确定了方向就好办了，至于函数不会用的话，可以直接百度查，很方便的

总而言之，写程序之前一定要有思路，边写边想思路是不行的，那样容易返工

不过最后还是写出来了，哈哈

也请大家来共同学习和指正

----------------------

转载的话请大家注明出处哦，谢谢了

Python爬虫抓取糗百的图片，并存储在本地文件夹的更多相关文章

Python爬虫——抓取糗百段子
在别人博客里学习的抓取糗百段子,由于糗百不断的更新,代码需要改正. 抓取网页:http://www.qiushibaike.com/hot/page/1 修改后的代码如下: # -*- coding ...
Python 爬虫: 抓取花瓣网图片
接触Python也好长时间了,一直没什么机会使用,没有机会那就自己创造机会!呐,就先从爬虫开始吧,抓点美女图片下来. 废话不多说了,讲讲我是怎么做的. 1. 分析网站想要下载图片,只要知道图片的地址 ...
python 爬虫抓取心得
quanwei9958 转自 python 爬虫抓取心得分享 urllib.quote('要编码的字符串') 如果你要在url请求里面放入中文,对相应的中文进行编码的话,可以用: urllib.quo ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
Python爬虫----抓取豆瓣电影Top250
有了上次利用python爬虫抓取糗事百科的经验,这次自己动手写了个爬虫抓取豆瓣电影Top250的简要信息. 1.观察url 首先观察一下网址的结构 http://movie.douban.com/to ...
Python爬虫抓取东方财富网股票数据并实现MySQL数据库存储
Python爬虫可以说是好玩又好用了.现想利用Python爬取网页股票数据保存到本地csv数据文件中,同时想把股票数据保存到MySQL数据库中.需求有了,剩下的就是实现了. 在开始之前,保证已经安装好 ...
python学习-抓取知乎图片
#!/bin/usr/env python3 __author__ = 'nxz' """ 抓取知乎图片webdriver Chromedriver驱动需要安装,并指定d ...
python爬虫抓取哈尔滨天气信息（静态爬虫）
python 爬虫爬取哈尔滨天气信息 - http://www.weather.com.cn/weather/101050101.shtml 环境: windows7 python3.4(pip i ...
Python爬虫 —— 抓取美女图片
代码如下: #coding:utf-8 # import datetime import requests import os import sys from lxml import etree im ...

随机推荐

01 Linux入门介绍
一.Linux 初步介绍 Linux的优点免费的,开源的支持多线程,多用户安全性好对内存和文件管理优越系统稳定消耗资源少 Linux的缺点操作相对困难一些专业软件以及游戏支持度不足 L ...
Creating Classes 创建类
The dojo/_base/declare module is the foundation of class creation within the Dojo Toolkit. declare a ...
[转载]深入了解 Struts 1.1
转载自:http://www.ibm.com/developerworks/cn/java/l-struts1-1/ 摘要:作为基于 MVC 模式的 Web 应用最经典框架,Struts 已经正式推出 ...
DHTMLX-Form
DHTMLX-Form dhtmlxForm提供了一个标准形式与一些有用的补充,如不同风格,使用的数据从客户端和服务器端,与其他dhtmlx组件的集成.验证等. 例子 <!DOCTYPE htm ...
Oracle补习班第七天
Keep conscience clear, then never fear. 问心无愧,永无畏惧服务端监听 lsnrctl status #查看监听服务 netca #配置动态监听 lsnrct ...
JLINK通过JFLASH烧写bin文件报错处理方法
错误原因:烧写开始地址出错,打开BIN文件后弹出的设置开始地址不正确不能为0 解决措施:用J-FLASH LITE或者将开始地址设置成正确的地址(KEILMDK中IROM1的开始地址
MySQL MEM_ROOT详细讲解
这篇文章会详细解说MySQL中使用非常广泛的MEM_ROOT的结构体,同时省去debug部分的信息,仅分析正常情况下,mysql中使用MEM_ROOT来做内存分配的部分. 在具体分析之前我们先例举在该 ...
高质量C++/C编程指南（林锐）
推荐-高质量C++/C编程指南(林锐) 版本/状态作者参与者起止日期备注 V 0.9 草稿文件林锐 2001-7-1至 2001-7-18 林锐起草 V 1.0 正式文件林锐 20 ...
Shogun网站上的关于主流机器学习工具包的比较
Shogun网站上的关于主流机器学习工具包的比较: http://www.shogun-toolbox.org/page/features/ created last updated main l ...
openlayers3 画扇形
参考了http://www.cnblogs.com/lingxue3769/archive/2011/11/01/2231409.html同学的博客和百度知道https://zhidao.baid ...

Python爬虫抓取糗百的图片，并存储在本地文件夹

Python爬虫抓取糗百的图片，并存储在本地文件夹的更多相关文章

随机推荐

热门专题