前言
本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。
作者:huhanghao

Cookie,指某些网站为了辨别用户身份、进行session跟踪而储存在用户本地终端上的数据(通常经过加密)。 比如说有些网站需要登录后才能访问某个页面,在登录之前,你想抓取某个页面内容,登陆前与登陆后是不同的,或者不允许的。另外如果你刚学不久。对这方面还不熟,建议先去小编的Python交流.裙 :一久武其而而流一思(数字的谐音)转换下可以找到了,里面有最新Python教程项目可拿,多跟里面的人交流,比自己摸索效率更高哦!

在python中它为我们提供了cookiejar模块,它位于http包中,用于对Cookie的支持。通过它我们能捕获cookie并在后续连接请求时重新发送,比如可以实现模拟登录功能。该模块主要的对象有CookieJar、FileCookieJar、MozillaCookieJar、LWPCookieJar。

## cookie的获取

# -*- coding: UTF-8 -*-
from urllib import request
from http import cookiejar

if __name__ == '__main__':
   #声明一个CookieJar对象实例来保存cookie
   cookie = cookiejar.CookieJar()
   #利用urllib.request库的HTTPCookieProcessor对象来创建cookie处理器,也就CookieHandler
   handler=request.HTTPCookieProcessor(cookie)
   #通过CookieHandler创建opener
   opener = request.build_opener(handler)
   #此处的open方法打开网页
   response = opener.open('http://www.baidu.com')
   #打印cookie信息
   for item in cookie:
       print('Name = %s' % item.name)
       print('Value = %s' % item.value)

cookie的文件保存
# -*- coding: UTF-8 -*-
from urllib import request
from http import cookiejar

if __name__ == '__main__':

   #设置保存cookie的文件,同级目录下的cookie.txt
   filename = 'cookie.txt'
   #声明一个MozillaCookieJar对象实例来保存cookie,之后写入文件
   cookie = cookiejar.MozillaCookieJar(filename)
   #利用urllib.request库的HTTPCookieProcessor对象来创建cookie处理器,也就CookieHandler
   handler=request.HTTPCookieProcessor(cookie)
   #通过CookieHandler创建opener
   opener = request.build_opener(handler)
   #此处的open方法打开网页
   response = opener.open('http://www.baidu.com')
   #保存cookie到文件
   cookie.save(ignore_discard=True, ignore_expires=True)

加载保存的cookie,并进行网页访问
# -*- coding: UTF-8 -*-
from urllib import request
from http import cookiejar

if __name__ == '__main__':
   #设置保存cookie的文件的文件名,相对路径,也就是同级目录下
   filename = 'cookie.txt'
   #创建MozillaCookieJar实例对象
   cookie = cookiejar.MozillaCookieJar()
   #从文件中读取cookie内容到变量
   cookie.load(filename, ignore_discard=True, ignore_expires=True)
   #利用urllib.request库的HTTPCookieProcessor对象来创建cookie处理器,也就CookieHandler
   handler=request.HTTPCookieProcessor(cookie)
   #通过CookieHandler创建opener
   opener = request.build_opener(handler)
   #此用opener的open方法打开网页
   response = opener.open('http://www.baidu.com')
   #打印信息
   print(response.read().decode('utf-8'))
这里对cookie的使用类似于,之前我们用到的对代理的使用。

加载cookie,实现网站的登录
# -*- coding: UTF-8 -*-
from urllib import request
from urllib import error
from urllib import parse
from http import cookiejar

if __name__ == '__main__':
   #登陆地址
   login_url = 'http://www.jobbole.com/wp-admin/admin-ajax.php'    
   #User-Agent信息                  
   user_agent = r'Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.94 Safari/537.36'
   #Headers信息
   head = {'User-Agnet': user_agent, 'Connection': 'keep-alive'}
   #登陆Form_Data信息
   Login_Data = {}
   Login_Data['action'] = 'user_login'
   Login_Data['redirect_url'] = 'http://www.jobbole.com/'
   Login_Data['remember_me'] = '0'         #是否一个月内自动登陆
   Login_Data['user_login'] = '********'       #改成你自己的用户名
   Login_Data['user_pass'] = '********'        #改成你自己的密码
   #使用urlencode方法转换标准格式
   logingpostdata = parse.urlencode(Login_Data).encode('utf-8')
   #声明一个CookieJar对象实例来保存cookie
   cookie = cookiejar.CookieJar()
   #利用urllib.request库的HTTPCookieProcessor对象来创建cookie处理器,也就CookieHandler
   cookie_support = request.HTTPCookieProcessor(cookie)
   #通过CookieHandler创建opener
   opener = request.build_opener(cookie_support)
   #创建Request对象
   req1 = request.Request(url=login_url, data=logingpostdata, headers=head)

   #面向对象地址
   date_url = 'http://date.jobbole.com/wp-admin/admin-ajax.php'
   #面向对象
   Date_Data = {}
   Date_Data['action'] = 'get_date_contact'
   Date_Data['postId'] = '4128'
   #使用urlencode方法转换标准格式
   datepostdata = parse.urlencode(Date_Data).encode('utf-8')
   req2 = request.Request(url=date_url, data=datepostdata, headers=head)
   try:
       #使用自己创建的opener的open方法
       response1 = opener.open(req1)
       response2 = opener.open(req2)
       html = response2.read().decode('utf-8')
       index = html.find('jb_contact_email')
       #打印查询结果
       print('联系邮箱:%s' % html[index+19:-2])

   except error.URLError as e:
       if hasattr(e, 'code'):
           print("HTTPError:%d" % e.code)
       elif hasattr(e, 'reason'):
           print("URLError:%s" % e.reason)
​以上就是本期讲的内容,另外如果你对这方面还不熟,刚学不久,建议先去小编的Python交流.裙 :一久武其而而流一思(数字的谐音)转换下可以找到了,里面有最新Python教程项目可拿,多跟里面的人交流,比自己摸索效率更高哦!

Python爬虫之cookie的获取、保存和使用【新手必学】的更多相关文章

  1. Python爬虫beautifulsoup4常用的解析方法总结(新手必看)

    今天小编就为大家分享一篇关于Python爬虫beautifulsoup4常用的解析方法总结,小编觉得内容挺不错的,现在分享给大家,具有很好的参考价值,需要的朋友一起跟随小编来看看吧摘要 如何用beau ...

  2. Python + Selenium +Chrome 批量下载网页代码修改【新手必学】

    Python + Selenium +Chrome 批量下载网页代码修改主要修改以下代码可以调用 本地的 user-agent.txt 和 cookie.txt来达到在登陆状态下 批量打开并下载网页, ...

  3. Python实现一个桌面版的翻译工具【新手必学】

      Python 用了好长一段时间了,起初是基于对爬虫的兴趣而接触到的.随着不断的深入,慢慢的转了其它语言,毕竟工作机会真的太少了.很多技能长时间不去用,就会出现遗忘,也就有了整理一下,供初学者学习和 ...

  4. Python爬虫入门案例:获取百词斩已学单词列表

    百词斩是一款很不错的单词记忆APP,在学习过程中,它会记录你所学的每个单词及你答错的次数,通过此列表可以很方便地找到自己在记忆哪些单词时总是反复出错记不住.我们来用Python来爬取这些信息,同时学习 ...

  5. [Python爬虫] Selenium+Phantomjs动态获取CSDN下载资源信息和评论

    前面几篇文章介绍了Selenium.PhantomJS的基础知识及安装过程,这篇文章是一篇应用.通过Selenium调用Phantomjs获取CSDN下载资源的信息,最重要的是动态获取资源的评论,它是 ...

  6. Python实战:Python爬虫学习教程,获取电影排行榜

    Python应用现在如火如荼,应用范围很广.因其效率高开发迅速的优势,快速进入编程语言排行榜前几名.本系列文章致力于可以全面系统的介绍Python语言开发知识和相关知识总结.希望大家能够快速入门并学习 ...

  7. 使用Python爬虫库BeautifulSoup遍历文档树并对标签进行操作详解(新手必学)

    为大家介绍下Python爬虫库BeautifulSoup遍历文档树并对标签进行操作的详细方法与函数下面就是使用Python爬虫库BeautifulSoup对文档树进行遍历并对标签进行操作的实例,都是最 ...

  8. Python爬虫老是被封的解决方法【面试必问】

    在爬取的过程中难免发生 ip 被封和 403 错误等等,这都是网站检测出你是爬虫而进行反爬措施,在这里为大家总结一下 Python 爬虫动态 ip 代理防止被封的方法. PS:另外很多人在学习Pyth ...

  9. Python学习笔记—自动化部署【新手必学】

      前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理.作者:唯恋殊雨   目录 pexpect fabric pexpect P ...

随机推荐

  1. 使用Bootstrap制作简单的旅游主页

    页面效果 代码: 需要导入bootstrapt文件,解压至项目中. 下载地址:https://v3.bootcss.com/getting-started/#download <!DOCTYPE ...

  2. java 深拷贝与浅拷贝

    yls 2019年11月07日 拷贝分为引用拷贝和对象拷贝 深拷贝和浅拷贝都属于对象拷贝 浅拷贝:通过Object默认的clone方法实现 实现Cloneable接口 public class She ...

  3. PHPExcel数据导入(含图片)

    PHPExcel是一个PHP类库,用来帮助我们简单.高效实现从Excel读取Excel的数据和导出数据到Excel. 首先下载压缩包: https://codeload.github.com/PHPO ...

  4. [笔记]IDEA使用笔记

    1.IDEA的目录结构 2.所有的源文件都必须写在src文件夹下, 3.输入psvm再按回车,就会生成主函数: 4.输入sout就会生成输出语句的格式: 5.ALT+4   调出上次运行的结果出来看看 ...

  5. lqb 基础练习 十六进制转十进制

    基础练习 十六进制转十进制 时间限制:1.0s   内存限制:512.0MB     问题描述 从键盘输入一个不超过8位的正的十六进制数字符串,将它转换为正的十进制数后输出. 注:十六进制数中的10~ ...

  6. 百度全景地图使用时提示flash版本过低 如何处理?

    从Chrome 69.0 版本起,Flash权限受到进一步限制,默认仅在当前浏览器会话有效.关闭Enable Ephemeral Flash Permissions ,才能看到 “Add”按钮.解决方 ...

  7. 【Vue | ElementUI】Vue离开当前页面时弹出确认框实现

    Vue离开当前页面时弹出确认框实现 1. 实现目的 在某种业务场景下,用户不允许跳转到其他页面.于是,需要在用户误操作或者是点击浏览器跳转时提示用户. 2. 实现原理 使用路由守卫beforeRout ...

  8. 软件测试的原则,软件测试计划:5W1H

    1.测试应该尽早介入.        2.所有的测试都应追溯到用户需求.        3.程序员应该避免检查自己的程序.除了单元测试.因为程序员对于自己的作品,思维具有局限性.无法保证测试质量.交给 ...

  9. JVM 问题排查和性能优化常用的 JDK 工具

    JDK 提供了一系列用于监控.诊断 Java 进程的工具,它们在 JDK 安装目录的 bin 目录下,有 jps.jcmd.jstack.jinfo.jmap 等.其中jmc.jconsole.jvi ...

  10. AE安装部署以及监测ArcEngine runtime 9.3是否安装

    目的:用ArcEngine9.3开发项目以后,用Visual Studio2008打包工具打包: 同时监测别的机器上是否有ArcEngine Runtime或者Desktop的支持. 解决方案: 1. ...