【网络爬虫】【python】网络爬虫（三）：模拟登录—

一、关于抓包分析和debug Log信息

模拟登录访问需要设置request header信息，对于这个没有概念的朋友可以参见本系列前面的java版爬虫中提到的模拟登录过程，主要就是添加请求头request header。

而python抓包可以直接使用urllib2把debug Log打开，数据包的内容可以打印出来，这样都可以不用抓包了，直接可以看到request header里的内容。

import urllib2

httpHandler = urllib2.HTTPHandler(debuglevel = 1)

httpsHandler = urllib2.HTTPSHandler(debuglevel = 1)

opener = urllib2.build_opener(httpHandler, httpsHandler)

urllib2.install_opener(opener)

response = urllib2.urlopen(‘http://www.baidu.com’)

html = response.read()

另外对于抓包，对比里各款浏览器自带的开发者工具，觉得firefox的比Chrome的要好用，不仅数据包显示清晰，而且各种操作也比Chrome的方便得多，还有一些Chrome没有的功能。

分析下登录新浪微博过程的数据包。

登录前页面：

点击登录，看下这个过程：

打开看数据包可以看到详细的请求头、发送Cookie、响应头、传回的文件/数据等信息。

在Network选项卡里看看详细的情况，这里是请求头：

cookie存放的就是myuid和un账号，之后模拟登录要用到的cookie信息：

二、设置Headers到http请求

先看一个官方教程上的例子：

import urllib

import urllib2

url = 'http://s.weibo.com'

user_agent = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.11 (KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11'

values = {'name':'denny',

          'location':'BUPT',

          'language':'Python'

          }

headers = {'User-Agent':user_agent}

data = urllib.urlencode(values, 1)

request = urllib2.Request(url, data,headers)

response = urllib2.urlopen(request)

the_page = response.read()

print the_page

一个完整例子：

# -*- coding:utf8 -*-

import urllib2

import re

import StringIO

import gzip

ua = {#'User-Agent':'Mozilla/5.0 (compatible; Googlebot/2.1; +Googlebot - Webmaster Tools Help)',

      'User-Agent':'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/37.0.2062.124 Safari/537.36',

      'Connection':'Keep-Alive',

      'Accept-Language':'zh-CN,zh;q=0.8',

      'Accept-Encoding':'gzip,deflate,sdch',

      'Accept':'*/*',

      'Accept-Charset':'GBK,utf-8;q=0.7,*;q=0.3',

      'Cache-Control':'max-age=0'

      }

def get_html(url_address):

    '''open url and read it'''

    req_http = urllib2.Request(url_address, headers = ua)

    html = urllib2.urlopen(req_http).read()

    return html

def controller():

    '''make url list and download page'''

    url = 'http://s.weibo.com/wb/iPhone&nodup=1&page=10'

    reget = re.compile('(<div class=\"post-wrapper.*?)<p class=\"pagination\">', re.DOTALL)

    fp = open("e:/weibo/head.txt", "w+")

    for i in range(1, 131):

        html_c = get_html(url % (i))

        print url % (i)

        html_c = gzip.GzipFile(fileobj = StringIO.StringIO(html_c)).read()

        res = reget.findall(html_c)

        for x in res:

            fp.write(x)

            fp.write("\n\n\n")

    fp.close()

    return

if __name__ == '__main__':

    controller()

原创文章，转载请注明出处：http://blog.csdn.net/dianacody/article/details/39742711

【网络爬虫】【python】网络爬虫（三）：模拟登录——伪装浏览器登录爬取过程的更多相关文章

【python爬虫】对喜马拉雅上一个专辑的音频进行爬取并保存到本地
>>>内容基本框架: 1.爬虫目的 2.爬取过程 3.代码实现 4.爬取结果 >>>实验环境: python3.6版本,pycharm,电脑可上网. [一爬虫目 ...
爬虫系列4：scrapy技术进阶之多页面爬取
多页面爬取有两种形式. 1)从某一个或者多个主页中获取多个子页面的url列表,parse()函数依次爬取列表中的各个子页面. 2)从递归爬取,这个相对简单.在scrapy中只要定义好初始页面以及爬虫规 ...
Python post请求模拟登录淘宝并爬取商品列表
一.前言大概是一个月前就开始做淘宝的爬虫了,从最开始的用selenium用户配置到selenium模拟登录,再到这次的post请求模拟登录.一共是三篇博客,记录了我爬取淘宝网的经历.期间也有朋友向我 ...
爬虫（三）通过Selenium + Headless Chrome爬取动态网页
一.Selenium Selenium是一个用于Web应用程序测试的工具,它可以在各种浏览器中运行,包括Chrome,Safari,Firefox 等主流界面式浏览器. 我们可以直接用pip inst ...
python爬虫从入门到放弃（九）之实例爬取上海高级人民法院网开庭公告数据
通过前面的文章已经学习了基本的爬虫知识,通过这个例子进行一下练习,毕竟前面文章的知识点只是一个一个单独的散知识点,需要通过实际的例子进行融合分析网站其实爬虫最重要的是前面的分析网站,只有对要爬取 ...
Python爬虫入门教程 13-100 斗图啦表情包多线程爬取
斗图啦表情包多线程爬取-写在前面今天在CSDN博客,发现好多人写爬虫都在爬取一个叫做斗图啦的网站,里面很多表情包,然后瞅了瞅,各种实现方式都有,今天我给你实现一个多线程版本的.关键技术点 aioht ...
python模拟登陆知乎并爬取数据
一些废话看了一眼上一篇日志的时间已然是5个月前的事情了不禁感叹光阴荏苒其实就是我懒几周前心血来潮想到用爬虫爬些东西于是先后先重写了以前写过的求绩点代码爬了草榴贴图,妹子图网,后来想爬婚恋网 ...
爬虫入门之Scrapy框架基础框架结构及腾讯爬取(十)
Scrapy终端是一个交互终端,我们可以在未启动spider的情况下尝试及调试代码,也可以用来测试XPath或CSS表达式,查看他们的工作方式,方便我们爬取的网页中提取的数据. 如果安装了 IPyth ...
Python Requests库入门——应用实例-京东商品页面爬取+模拟浏览器爬取信息
京东商品页面爬取选择了一款荣耀手机的页面(给华为打广告了,荣耀play真心不错) import requests url = "https://item.jd.com/7479912.ht ...

随机推荐

EhCache Monitor的使用
1.在http://ehcache.org/documentation/monitor.html#Installation_And_Configuration下载ehcache-monitor-kit ...
Ubuntu14下Hadoop开发<2> 编译64位Hadoop2.4
Hadoop官方站点仅仅提供了32位的Hadoop包.我装的是64位的系统.自然无法使用,会报错误,导致的结果是无法启动hadoop libhadoop.so.1.0.0 which might ha ...
hive编程入门课程（加精）
hive编程入门课程 http://wenku.baidu.com/link?url=BfyZWjz48G_6UJImzWw39OLB0sUrIYEYxoxNpaFbADUQekmOvQy4FPY1f ...
使用 HttpWebRequest 向网站提交数据
HttpWebRequest 是 .net 基类库中的一个类,在命名空间 System.Net 下面,用来使用户通过 HTTP 协议和服务器交互. HttpWebRequest 对 HTTP 协议进行 ...
Linux学习笔记--ps命令(显示当前进程的命令)
ps:英文名process,进程的意思. 1. 命令格式: ps [选项] 2. 经常使用选项: "ps -a" 显示一个终端的全部进程.除了会话引线 "ps -e&qu ...
阿里云Redis开发规范（转）
一.键值设计 1. key名设计 (1)[建议]: 可读性和可管理性以业务名(或数据库名)为前缀(防止key冲突),用冒号分隔,比如业务名:表名:id ugc:video: (2)[建议]:简洁性 ...
java代码中的三元表达式
1.格式布尔型表达式?a:b,例子:boolean c;int a=1,b=2;c=a>b?10:15,这样子最终返回的结果是15
tomcat服务器配置java堆内存大小
我用的是绿色免安装的tomcat,找到tomcat下的bin文件夹下的catalina.bat文件: 编辑该文件,编辑参数,没有的话手动加上: set JAVA_OPTS=-server -Xms51 ...
【LeetCode】Jump Game II
Given an array of non-negative integers, you are initially positioned at the first index of the arra ...
解密阿里云Redis助力双十一背后的技术
摘要: Redis是一个使用范围很广的NOSQL数据库,阿里云Redis同时在公有云和阿里集团内部进行服务,本文介绍了阿里云Redis双11的一些业务场景:微淘社区之亿级关系链存储.天猫直播之评论商品 ...

【网络爬虫】【python】网络爬虫（三）：模拟登录——伪装浏览器登录爬取过程

一、关于抓包分析和debug Log信息

二、设置Headers到http请求

【网络爬虫】【python】网络爬虫（三）：模拟登录——伪装浏览器登录爬取过程的更多相关文章

随机推荐

热门专题