爬取github项目。

import requests

from bs4 import BeautifulSoup

url = 'https://github.com/login'

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/57.0.2987.133 Safari/537.36',

    'Referer': 'https://github.com/',

    'Upgrade-Insecure-Requests': '1',  # 此处的1 必须是字符串，不是数字

    'Host': 'github.com',

    'Connection': 'keep-alive',

    'Accept-Language': 'zh-CN,zh;q=0.8',

    'Accept-Encoding': 'gzip, deflate, br',

    'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8'}

res1 = requests.get(url, headers=headers)

# 检验

print(res1.status_code)

print(res1.reason)

# 通过解析页面来获取动态token

soup = BeautifulSoup(res1.text, 'lxml')

tag_input = soup.find(name='input', attrs={'name': 'authenticity_token'})

authenticity_token = tag_input.get('value')

data = {'commit': 'Sign+in',

        'utf8': '✓',

        'authenticity_token': authenticity_token,

        'login': '295345t54341@qq.com',

        'password': '234523456345'}

cookies = res1.cookies.get_dict()

# 这里的url是https://github.com/session，不是https://github.com/login

res2 = requests.post(url='https://github.com/session', headers=headers, cookies=cookies, data=data)

print(authenticity_token)

print(res2.status_code)

print(res2.reason)

cookies.update(res2.cookies.get_dict())

res3 = requests.get(url='https://github.com/settings/repositories',

                    cookies=cookies,

                    headers=headers

                    )

print(res3.url)

print(res3.status_code)

print(res3.reason)

soup3 = BeautifulSoup(res3.text, 'lxml')

project = soup3.find(name='div', attrs={'class': 'listgroup'})

print(project)

project_list = project.find_all(name='a', attrs={'class': 'mr-1'})

for i in project_list:

    project_name = i.text

    project_ = i.get('href')

    project_href = 'https://github.com/' + project_.split('/', maxsplit=1)[1]

    print('项目名称：%s , 项目连接：%s' % (project_name, project_href), '\n')

    # 爬取github注意事项，1.以后携带的cookie使用的是登录后的cookie

    # 2.需要在登录页面找到token,该token是动态的需要使用bs4，或者正则表达式来获取动态值

爬取github项目。的更多相关文章

python爬取github数据
爬虫流程在上周写完用scrapy爬去知乎用户信息的爬虫之后,github上star个数一下就在公司小组内部排的上名次了,我还信誓旦旦的跟上级吹牛皮说如果再写一个,都不好意思和你再提star了,怕你们 ...
模拟登陆并爬取Github
因为崔前辈给出的代码运行有误,略作修改和简化了. 书上例题,不做介绍. import requests from lxml import etree class Login(object): def ...
爬取github上流行的python项目
# -*- coding:utf-8 -*- __author__ = "MuT6 Sch01aR" import requests from pyquery import PyQ ...
window 下拉取github项目失败 (Permission denied (publickey))
原因是github 帐号ssh 失效或者没有配置 1.找到gitcmd 并进入 2.在gitcmd 下切换到安装git路劲\Git\usr\bin 3.提示在C:\Users\Administrat ...
scrapy项目4：爬取当当网中机器学习的数据及价格（CrawlSpider类）
scrapy项目3中已经对网页规律作出解析,这里用crawlspider类对其内容进行爬取: 项目结构与项目3中相同如下图,唯一不同的为book.py文件 crawlspider类的爬虫文件book的 ...
scrapy爬取校花网男神图片保存到本地
爬虫四部曲,本人按自己的步骤来写,可能有很多漏洞,望各位大神指点指点 1.创建项目 scrapy startproject xiaohuawang scrapy.cfg: 项目的配置文件xiaohua ...
开源项目-网上公开http代理爬取、简单分类
爬取网上公开免费代理(http/socks),解析入库,可满足需要切换IP的场景(爬虫.投票等)需求. 项目地址: https://github.com/Jwnie/proxyservice 1.采用 ...
Python爬虫与一汽项目【一】爬取中海油，邮政，国家电网问题总结
项目介绍中国海洋石油是爬取的第一个企业,之后依次爬取了,国家电网,中国邮政,这三家公司的源码并没有多大难度, 采购信息地址: 国家电网电子商务平台 http://ecp.sgcc.com.cn/pr ...
Python爬虫开源项目代码，爬取微信、淘宝、豆瓣、知乎、新浪微博、QQ、去哪网等代码整理
作者:SFLYQ 今天为大家整理了32个Python爬虫项目.整理的原因是,爬虫入门简单快速,也非常适合新入门的小伙伴培养信心.所有链接指向GitHub,祝大家玩的愉快 1.WechatSogou [ ...

随机推荐

浅谈C#在网络波动时防重复提交
前几天,公司数据库出现了两条相同的数据,而且时间相同(毫秒也相同).排查原因,发现是网络波动造成了重复提交. 由于网络波动而重复提交的例子也比较多: 网络上,防重复提交的方法也很多,使用redis锁, ...
公司-半导体：Micron
ylbtech-公司-半导体:Micron 美光科技有限公司(Micron Technology, Inc.)是高级半导体解决方案的全球领先供应商之一.通过全球化的运营,美光公司制造并向市场推出DRA ...
oracle函数操作
感于总有些网友提出一些非常基础的问题,比如有没有实现某某功能的函数啊,某某函数是做什么用的啊,格式是什么等等,同时也感受到自己对oracle函数认识的不足,于是集中月余时间专注于oracle函数,小有 ...
SAS-决策树模型
决策树是日常建模中使用最普遍的模型之一,在SAS中,除了可以通过EM模块建立决策树模型外,还可以通过SAS代码实现.决策树模型在SAS系统中对应的过程为Proc split或Proc hpsplit, ...
ReentrantLock原理
ReentrantLock主要利用CAS+CLH队列来实现.它支持公平锁和非公平锁,两者的实现类似. CAS:Compare and Swap,比较并交换.CAS有3个操作数:内存值V.预期值A.要修 ...
spring suite tool 添加namespace时只有bean一个
在eclipse的windows->Preferences->Spring->Beans Support->Namespaces 在此记录此问题.
Linux守护进程管理利器——Supervisor
Supervisor是采用 Python(2.4+) 开发的,它是一个允许用户管理基于 Unix 系统进程的 Client/Server 系统,提供了大量功能来实现对进程的管理.安装: yum in ...
java 中的interface是否继承object
首先我们从C++说起, c++可以多继承.也就是一个类型 --- class,可以继承自2个以上的父类型.多继承导致一个问题,很多人知道.例如,如果类型B,类型C均继承自类型A.然后类型D继承自类型B ...
ORA-12560: TNS:protocol adapter error
C:\Users\dong>sqlplus/nolog SQL*Plus: Release 11.2.0.1.0 Production on Mon Nov 19 14:12:51 2018 C ...
Windows下android模拟器环境搭建
一.搭建java环境 1.下载jdk1.6.0_45 下载地址:http://www.oracle.com/technetwork/java/archive-139210.html ----> ...

爬取github项目。

爬取github项目。的更多相关文章

随机推荐

热门专题