手动爬虫之京东笔记本栏（ptyhon3）

 import urllib.request as ur

 import urllib.error as ue

 import re

 # 目标网址

 url = 'https://list.jd.com/list.html?cat=670,671,672'

 # 存放路径

 save_path = 'E:/workspace/PyCharm/codeSpace/books/python_web_crawler_book/chapter6/demo1/images/'

 # 代理服务器ip

 proxy_add = '115.174.66.148:8118'

 def get_JD_pictures(url, save_path, proxy_add, page):

     # 根据页面设置url

     url = url+"&page="+str(page)

     # 添加报头

     req = ur.Request(url)

     req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 10.0; WOW64; rv:52.0) Gecko/20100101 Firefox/52.0')

     # 设置代理

     proxy = ur.ProxyHandler({'http': proxy_add})

     opener = ur.build_opener(proxy, ur.HTTPHandler)

     ur.install_opener(opener)

     # 爬取页面

     info = ur.urlopen(req).read()

     # 信息存档

     info = str(info)

     pattern_1 = '<div id="plist".+? <div class="page clearfix">'

     info = re.compile(pattern=pattern_1).findall(info)

     info = info[]

     pattern_2 = '<img width="220" height="220" data-img="1" src="//(.+?\.jpg)">'

     image_list = re.compile(pattern=pattern_2).findall(info)

     x =

     for image_url in image_list:

         image_name = save_path+str(page)+"_"+str(x)+".jpg"

         image_url = "http://"+image_url

         try:

             ur.urlretrieve(image_url, filename=image_name)

         except ue.HTTPError as e:

             if hasattr(e, 'code'):

                 print(e.code)

             if hasattr(e, 'reason'):

                 print(e.reason)

         except ue.URLError as e:

             if hasattr(e, 'code'):

                 print(e.code)

             if hasattr(e, 'reason'):

                 print(e.reason)

         x += 

 get_JD_pictures(url, save_path, proxy_add, )

手动爬虫之京东笔记本栏（ptyhon3）的更多相关文章

手动爬虫之流程笔记1(python3)
一.引入拓展库由于刚刚起步学习爬虫,故从urllib库开始首先引入urllib,这里主要用到urllib中request类 import urllib.request as ur 二.设置全局参数 ...
Ubuntu下配置python完成爬虫任务（笔记一）
Ubuntu下配置python完成爬虫任务(笔记一) 目标: 作为一个.NET汪,是时候去学习一下Linux下的操作了.为此选择了python来边学习Linux,边学python,熟能生巧嘛. 前期目 ...
Scrapy爬虫大战京东商城
Scrapy爬虫大战京东商城引言上一篇已经讲过怎样获取链接,怎样获得参数了,详情请看python爬取京东商城普通篇代码详解首先应该构造请求,这里使用scrapy.Request,这个方法默认调 ...
scrapy爬虫框架学习笔记(一)
scrapy爬虫框架学习笔记(一) 1.安装scrapy pip install scrapy 2.新建工程: (1)打开命令行模式 (2)进入要新建工程的目录 (3)运行命令: scrapy sta ...
手动爬虫之淘宝笔记本栏（ptyhon3）
1.这次爬虫用到了之前封装的Url_ProxyHelper类,源代码如下 import urllib.request as ur class Url_ProxyHelper: def __init__ ...
手动爬虫之糗事百科（ptyhon3）
一.调用封装的Url_ProxyHelper类,源码如下 import urllib.request as ur class Url_ProxyHelper: def __init__(self, u ...
Python网络爬虫与信息提取笔记
直接复制粘贴笔记发现有问题文档下载地址//download.csdn.net/download/hide_on_rush/12266493 掌握定向网络数据爬取和网页解析的基本能力常用的 Pytho ...
《用Python写爬虫》学习笔记（二）编写第一个网络爬虫
1.首先,下载网页使用Python的urllib2模块,或者Python HTTP模块request来实现 urllib2会出现问题,解决方法1.重试下载(设置下载次数) 2.设置用户代理 2.其次, ...
《用Python写爬虫》学习笔记（一）
注:纯文本内容,代码独立另写,属于本人学习总结,无任何商业用途,在此分享,如有错误,还望指教. 1.为什么需要爬虫? 答:目前网络API未完全放开,所以需要网络爬虫知识. 2.爬虫的合法性? 答:爬虫 ...

随机推荐

pandas数据处理基础——基础加减乘除的运算规则
上周公司对所有员工封闭培训了一个星期,期间没收手机,基本上博客的更新都停止了,尽管培训时间不长,但还是有些收获,不仅来自于培训讲师的,更多的是发现自己与别人的不足,一个优秀的人不仅仅是自己专业那块的精 ...
STL 容器（vector 和 list ）
1.这个容器的知识点比较杂迭代器的理解: 1.erase()函数的返回值,它的迭代器在循环遍历中的奇特之处: #define _CRT_SECURE_NO_WARNINGS #include < ...
本体论与OWL
http://semanticweb.org/wiki/Main_Page.html http://owl.man.ac.uk/documentation.shtml https://zh.wiki ...
Lintcode---二叉树的最大深度
给定一个二叉树,找出其最大深度. 二叉树的深度为根节点到最远叶子节点的距离. 您在真实的面试中是否遇到过这个题? Yes 样例给出一棵如下的二叉树: 1 / \ 2 3 / \ 4 5 这个二叉树的 ...
Vue 中的组件
VUE中的组件一个自定义的标签,vue就会把他看成一个组件,vue可以给这些标签赋予一定意义:一个页面就是一个组件好处: 1.提高开发效率 2.方便重复使用 3.便于协同开发 4.更容易被管理和维 ...
计算机系统监控 PerformanceCounter
PerformanceCounter 컴퓨터 성능 머니터링 CUP Processor 메모리 하터웨어 DB (CPU,User Connection,Batch Request,Blocking ...
phpcms 模板学习
1.phpcms\modules\content 里面可以自己定义常量变量,常量在魔板不用$,变量要用2.\phpcms_v9_UTF8\caches\configs system.php 设置魔板是 ...
sqlite-在数据库中创建默认时间
create table log( content ), logtime TIMESTAMP default (datetime('now', 'localtime')) )
matplotlib极坐标系应用之雷达图
#!/usr/bin/env python3 #-*- coding:utf-8 -*- ############################ #File Name: test.py #Autho ...
碉堡完整的高性能PHP应用服务器appserver
完全企业级的开发模式,是一个多线程的 PHP 应用服务器,实现真正多线程的 PHP 编程,高效安全而且快速,以Magento 为例比基于 Nginx的标准安装要快 50%.概念上非常像 Java 的 ...

手动爬虫之京东笔记本栏（ptyhon3）

手动爬虫之京东笔记本栏（ptyhon3）的更多相关文章

随机推荐

热门专题