模拟登陆并爬取Github

因为崔前辈给出的代码运行有误，略作修改和简化了。

书上例题，不做介绍。

import requests

from lxml import etree

class Login(object):

    def __init__(self):

        self.headers = {

            'Referer': 'https://github.com/',

            'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/57.0.2987.133 Safari/537.36',

            'Host': 'github.com'

        }

        #登陆地址

        self.login_url = 'https://github.com/login'

        #POST请求地址

        self.post_url = 'https://github.com/session'

        #使用session保持状态，并自动处理Cookies(在访问其他子网页时，可以保持登陆，爬取网页)

        self.session = requests.Session()

    def token(self):

        #获取网页数据

        response = self.session.get(self.login_url, headers=self.headers)

        #提取网页中我们需要的authenticity_token并返回

        selector = etree.HTML(response.text)

        token = selector.xpath('//input[@name="authenticity_token"]/@value')

        return token

    def login(self, email, password):

        post_data = {

            'commit': 'Sign in',

            'utf8': '✓',

            'authenticity_token': self.token(),

            'login': email,

            'password': password

        }

        #使用post方法模拟登陆

        response = self.session.post(self.post_url, data=post_data, headers=self.headers)

        #登陆正常，输出登陆后的网页代码，并将它存储带D盘github.txt

        if response.status_code == 200:

            print(response.text)

            with open('D:/github.txt', 'w', encoding = 'utf-8') as f:

                f.write(response.text)

        else:

            print("Error!!!")

if __name__ == "__main__":

    login = Login()

    login.login(email='1024593536@qq.com', password='password')#输入你自己的账户密码

可以改成网页形式查看

模拟登陆并爬取Github的更多相关文章

模拟登陆+数据爬取 (python+selenuim)
以下代码是用来爬取LinkedIn网站一些学者的经历的,仅供参考,注意:不要一次性大量爬取会被封号,不要问我为什么知道 #-*- coding:utf-8 -*- from selenium impo ...
Python爬虫学习笔记之模拟登陆并爬去GitHub
(1)环境准备: 请确保已经安装了requests和lxml库 (2)分析登陆过程: 首先要分析登陆的过程,需要探究后台的登陆请求是怎样发送的,登陆之后又有怎样的处理过程. 如果已经 ...
爬取github项目。
import requests from bs4 import BeautifulSoup url = 'https://github.com/login' headers = { 'User-Age ...
【转】详解抓取网站，模拟登陆，抓取动态网页的原理和实现（Python，C#等）
转自:http://www.crifan.com/files/doc/docbook/web_scrape_emulate_login/release/html/web_scrape_emulate_ ...
通过scrapy，从模拟登录开始爬取知乎的问答数据
这篇文章将讲解如何爬取知乎上面的问答数据. 首先,我们需要知道,想要爬取知乎上面的数据,第一步肯定是登录,所以我们先介绍一下模拟登录: 先说一下我的思路: 1.首先我们需要控制登录的入口,重写star ...
运用cookie登陆人人网爬取数据
浏览器访问WEB服务器的过程在用户访问网页时,不论是通过URL输入域名或IP,还是点击链接,浏览器向WEB服务器发出了一个HTTP请求(Http Request),WEB服务器接收到客户端浏览器的请 ...
Scrapy模拟登陆豆瓣抓取数据
scrapy startproject douban 其中douban是我们的项目名称 2创建爬虫文件进入到douban 然后创建爬虫文件 scrapy genspider dou douban. ...
python爬取github数据
爬虫流程在上周写完用scrapy爬去知乎用户信息的爬虫之后,github上star个数一下就在公司小组内部排的上名次了,我还信誓旦旦的跟上级吹牛皮说如果再写一个,都不好意思和你再提star了,怕你们 ...
新浪微博模拟登陆+数据抓取(java实现)
模拟登陆部分实现: package token.exe; import java.math.BigInteger; import java.util.Random; import org.apache ...

随机推荐

Required plugin could not be found. Videos requires to install plugins to play files of the following types : MPEG-4-AAC decoder and H.264 decoder
https://linuxconfig.org/how-to-install-mpeg-4-aac-decoder-for-centos-7-linux 记得联网情况下才能下载.
PDG转图像、PDF的若干方法
作者:马健邮箱:stronghorse_mj@hotmail.com发布:2006.05.26更新:2008.08.24 补充说明:此文成文较早,其中对Pdg2Pic.FreePic2Pdf的描述早已 ...
动态合并Repeater控件数据列 Ver2
前一版本<动态合并Repeater控件数据列>http://www.cnblogs.com/insus/p/3240848.html .今天Insus.NET重新演示它,为什么? 因为两点 ...
网易云易盾中标浙报反作弊服务助力浙江新闻App健康发展
欢迎访问网易云社区,了解更多网易技术产品运营经验. 近日,国内领先的智能业务安全平台网易云易盾和浙报传媒旗下"浙江新闻"达成合作,易盾将为浙江新闻客户端提供大数据反作弊服务,助力浙 ...
PCANet: A Simple Deep Learning Baseline for Image Classification?--名词解释
1 上采样与下采样缩小图像(或称为下采样(subsampled)或降采样(downsampled))的主要目的有两个: 使得图像符合显示区域的大小生成对应图像的缩略图下采样原理:对于一幅图像I尺 ...
L - Large Division (大数，同余)
Given two integers, a and b, you should check whether a is divisible by b or not. We know that an in ...
【转】C# 中的委托和事件(详解)
源地址:http://www.cnblogs.com/SkySoot/archive/2012/04/05/2433639.html
Spark大数据处理之从WordCount看Spark大数据处理的核心机制（2）
在上一篇文章中,我们讲了Spark大数据处理的可扩展性和负载均衡,今天要讲的是更为重点的容错处理,这涉及到Spark的应用场景和RDD的设计来源. Spark的应用场景 Spark主要针对两种场景: ...
POI操作Excel:cell的背景颜色类型
POI中背景颜色设置方法如下: HSSFCellStyle style = workbook.createCellStyle(); style.setFillBackgroundColor(HSSFC ...
django导入 views.py
网上找了各种教程..均无解....自己摸索出来了..分享给大家... 首先INSTALLED_APP 加入自己的 app pili,然后如下图 from App名称 import views 就 ...

模拟登陆并爬取Github

模拟登陆并爬取Github的更多相关文章

随机推荐

热门专题