python使用requests模块模拟登陆知乎

from bs4 import  BeautifulSoup

import  requests

import  time

def captcha(captcha_data):

    with open("captcha.jpg",'wb') as f:

        f.write(captcha_data)

    text=input("请输入验证码")

def zhihuLogin():

   #构建一个session对象，可以保存cookie（相当于urllib中用的cookiejar）

   sess= requests.Session()

   #请求报头

   headers={"User-Agent":"Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36"}

   #首先获取登陆页面，找到需要POST的数据，同时记录当前页的cookie值

   html=sess.get("https://www.zhihu.com/#signin",headers=headers).text

   bs=BeautifulSoup(html,"lxml")

    #获取之前get的页面的_xsrf值

   #_xsrf防止CSRF攻击（跨站请求伪造），通常叫做跨域攻击，是一种利用网站对用户的一种信任机制来做坏事。

   #跨域攻击一般伪装成网站信任的用户请求（利用cookie），盗取用户信息，欺骗web服务器

   #所以网站会通过设置一个隐藏字段存放这个MD5字符串，这个字符串用来校验用户cookie和服务器cookie

   _xsrf=bs.find("input",attrs={"name":"_xsrf"}).get("value")

   #验证码的链接获取,观察发现r的值是根据unix时间戳变得

   captcha_url="https://www.zhihu.com/captcha.gif?r=%d&type=login" % (time.time()*1000)

   #发送请求得到图片数据流

   captcha_data=sess.get(captcha_url,headers=headers).content

   text=captcha(captcha_data)

   data={

       "_xsrf":_xsrf,

       "email":"邮箱",

       "password":"密码",

       "captcha":text

   }

   resqonse=sess.post("https://www.zhihu.com/login/email",data=data,headers=headers)

   print(resqonse.text)

   #获取个人主页源码

   #myhomepageresqonse=sess.get("主页url",headers=headers)

if __name__=="__main__":

    zhihuLogin()

python使用requests模块模拟登陆知乎的更多相关文章

【python爬虫】用requests库模拟登陆人人网
说明:以前是selenium登陆取cookie的方法比较复杂,改用这个 """ 用requests库模拟登陆人人网 """ import r ...
Python爬虫之使用Fiddler+Postman+Python的requests模块爬取各国国旗
介绍本篇博客将会介绍一个Python爬虫,用来爬取各个国家的国旗,主要的目标是为了展示如何在Python的requests模块中使用POST方法来爬取网页内容. 为了知道POST方法所需要传 ...
Python之requests模块-hook
requests提供了hook机制,让我们能够在请求得到响应之后去做一些自定义的操作,比如打印某些信息.修改响应内容等.具体用法见下面的例子: import requests # 钩子函数1 def ...
Python之requests模块-cookie
cookie并不陌生,与session一样,能够让http请求前后保持状态.与session不同之处,在于cookie数据仅保存于客户端.requests也提供了相应到方法去处理cookie. 在py ...
Python之requests模块-session
http协议本身是无状态的,为了让请求之间保持状态,有了session和cookie机制.requests也提供了相应的方法去操纵它们. requests中的session对象能够让我们跨http请求 ...
Python之requests模块-request api
requests所有功能都能通过"requests/api.py"中的方法访问.它们分别是: requests.request(method, url, **kwargs) req ...
Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
第十二篇 requests模拟登陆知乎
了解http常见状态码可以通过输入错误的密码来找到登陆知乎的post:url 把Headers拉到底部,可以看到form data _xsrf是需要发送的,需要发送给服务端,否则会返回403错误,提 ...
python模拟登陆知乎并爬取数据
一些废话看了一眼上一篇日志的时间已然是5个月前的事情了不禁感叹光阴荏苒其实就是我懒几周前心血来潮想到用爬虫爬些东西于是先后先重写了以前写过的求绩点代码爬了草榴贴图,妹子图网,后来想爬婚恋网 ...

随机推荐

【bzoj4011】[HNOI2015]落忆枫音容斥原理+拓扑排序+dp
题目描述给你一张 $n$ 个点 $m$ 条边的DAG,$1$ 号节点没有入边.再向这个DAG中加入边 $x\to y$ ,求形成的新图中以 $1$ 为根的外向树形图数目模 $10^9+7$ . 输入 ...
【bzoj4006】[JLOI2015]管道连接斯坦纳树+状压dp
题目描述给出一张 $n$ 个点 $m$ 条边的无向图和 $p$ 个特殊点,每个特殊点有一个颜色.要求选出若干条边,使得颜色相同的特殊点在同一个连通块内.输出最小边权和. 输入第一行包含三个整数 n ...
BZOJ3717 PA2014Pakowanie（状压dp）
显然贪心地有尽量先往容量大的背包里放.设f[i]为i子集物品最小占用背包数,g[i]为该情况下最后一个背包的剩余容量,转移显然. #include<iostream> #include&l ...
SPA页面性能优化
1. 快速启动 —— 极大提升加载速度(important) 快速启动应用,并行发起 Bundle 加载&拉取初始数据.相信大家已经发现了,SPA 初始化时候,不得不等待 bundle 返回并 ...
[BZOJ3166][Heoi2013]Alo 可持久化Trie树
3166: [Heoi2013]Alo Time Limit: 20 Sec Memory Limit: 256 MB DescriptionWelcome to ALO ( Arithmetic a ...
[AT2148] [arc063_c] Integers on a Tree
题目链接 AtCoder:https://arc063.contest.atcoder.jp/tasks/arc063_c 洛谷:https://www.luogu.org/problemnew/sh ...
那个执事，争先：我如何于 2015 年在 Java Web 项目中推动 HTTP/2
2015 年 5 月,HTTP/2 发布. 2015 年第 3 季度,我所在企业的一个战略级客户(而且是第二大客户)说,他们需要在当年年底之前支持 HTTP/2(原因忘了,且与本文无关,从略). 而在 ...
BZOJ5333 [Sdoi2018]荣誉称号【差分 + 树形dp】
题目链接 BZOJ5333 题解看到式子,立即想到二叉树上一个点及其$k$个父亲权值和[如果有的话]模$m$意义下为$0$ 考虑如何满足条件我们假设$1$号为第$0$层那么我 ...
Howto run google-chrome as root
Just want to add a permanent solution to the problem: 1. Open google-chrome located in /usr/bin with ...
【二维树状数组】【CF10D】 LCIS
传送门 Description 给你两个串,求他们的最长公共上升子序列 Input 第一行是第一个串的长度$n$ 第二行$n$个数代表第一个串第三行是第二个串的长度$m$ 第四行\(m\ ...

python使用requests模块模拟登陆知乎

python使用requests模块模拟登陆知乎的更多相关文章

随机推荐

热门专题