写在前面

今天咱们抓取一下网易云课堂的课程数据，这个网站的数据量并不是很大，我们只需要使用requests就可以快速的抓取到这部分数据了。

你第一步要做的是打开全部课程的地址，找出爬虫规律，

我简单的看了一下，页面数据是基于

https://study.163.com/p/search/studycourse.json 这个地址进行异步加载的。你自己尝试的时候需要借助开发者工具

进行多次尝试，抓取到这个地址的数据为准。

还有一个地方需要注意，这次是post提交方式，并且提交数据是payload类型的，这个原因导致我们的代码和以前的略微有一些不同的地方。

提取post关键字，看一下各个参数的意思，如果你爬取的网站足够多，那么训练出来的敏感度能够快速的分析这些参数

{"pageIndex":55, # 页码

"pageSize":50,  # 每页数据大小

"relativeOffset":2700,

"frontCategoryId":-1,

"searchTimeType":-1,

"orderType":50,

"priceType":-1,

"activityId":0,

"keyword":""   # 搜索相关

}

好了，可以开始编写代码了，核心的代码就是通过requests模块发送post请求

def get_json(index):

    print(f"正在抓取{index}页数据")

    payload = {"pageIndex":index,

            "pageSize":50,

            "relativeOffset":50,

            "frontCategoryId":-1,

            "searchTimeType":-1,

            "orderType":50,

            "priceType":-1,

            "activityId":0,

            "keyword":""

    }

    headers = {"Accept":"application/json",

               "Host":"study.163.com",

               "Origin":"https://study.163.com",

               "Content-Type":"application/json",

               "Referer":"https://study.163.com/courses",

               "User-Agent":"自己去找个浏览器UA"

    }

    try:

    	# 请注意这个地方发送的是post请求

    	# CSDN 博客 梦想橡皮擦

        res = requests.post("https://study.163.com/p/search/studycourse.json",json=payload,headers=headers)

        content_json = res.json()

        if content_json and content_json["code"] == 0:

            data = get_content(content_json)  # 获取正确的数据

			############################################

            if len(data) > 0:

                save_mongo(data)   # 保存数据

           	############################################

    except Exception as e:

        print("出现BUG了")

        print(e)

    finally:

        time.sleep(1)

        index+=1

        get_json(index)

def get_content(content_json):

    if "result" in content_json:

        return content_json["result"]["list"]

因为获取到的数据是json类型的，所以，数据可以快速的保存到mongodb里面，保存数据的代码我依旧留空，希望你自己可以完善。

通过很短的时间，我们就捕获到了3000门课程

好了，需要代码和数据，请评论留下我能联系你的方式即可。

Python爬虫入门教程 21-100 网易云课堂课程数据抓取的更多相关文章

Python爬虫入门教程 39-100 天津市科技计划项目成果库数据抓取 scrapy
爬前叨叨缘由今天本来没有打算抓取这个网站的,无意中看到某个微信群有人问了一嘴这个网站,想看一下有什么特别复杂的地方,一顿操作下来,发现这个网站除了卡慢,经常自己宕机以外,好像还真没有什么特殊的.. ...
Python爬虫入门教程 33-100 《海王》评论数据抓取 scrapy
1. 海王评论数据爬取前分析海王上映了,然后口碑炸了,对咱来说,多了一个可爬可分析的电影,美哉~ 摘录一个评论零点场刚看完,温导的电影一直很不错,无论是速7,电锯惊魂还是招魂都很棒.打斗和音效方面 ...
Python爬虫入门教程 19-100 51CTO学院IT技术课程抓取
写在前面从今天开始的几篇文章,我将就国内目前比较主流的一些在线学习平台数据进行抓取,如果时间充足的情况下,会对他们进行一些简单的分析,好了,平台大概有51CTO学院,CSDN学院,网易云课堂,慕课网 ...
Python爬虫入门教程 20-100 慕课网免费课程抓取
写在前面美好的一天又开始了,今天咱继续爬取IT在线教育类网站,慕课网,这个平台的数据量并不是很多,所以爬取起来还是比较简单的准备爬取打开我们要爬取的页面,寻找分页点和查看是否是异步加载的数据. ...
Python爬虫入门教程 34-100 掘金网全站用户爬虫 scrapy
爬前叨叨已经编写了33篇爬虫文章了,如果你按着一个个的实现,你的爬虫技术已经入门,从今天开始慢慢的就要写一些有分析价值的数据了,今天我选了一个<掘金网>,我们去爬取一下他的全站用户数据. ...
Python爬虫入门教程 11-100 行行网电子书多线程爬取
行行网电子书多线程爬取-写在前面最近想找几本电子书看看,就翻啊翻,然后呢,找到了一个叫做周读的网站 ,网站特别好,简单清爽,书籍很多,而且打开都是百度网盘可以直接下载,更新速度也还可以,于是乎, ...
Python爬虫入门教程 13-100 斗图啦表情包多线程爬取
斗图啦表情包多线程爬取-写在前面今天在CSDN博客,发现好多人写爬虫都在爬取一个叫做斗图啦的网站,里面很多表情包,然后瞅了瞅,各种实现方式都有,今天我给你实现一个多线程版本的.关键技术点 aioht ...
Python爬虫入门教程 48-100 使用mitmdump抓取手机惠农APP-手机APP爬虫部分
1. 爬取前的分析 mitmdump是mitmproxy的命令行接口,比Fiddler.Charles等工具方便的地方是它可以对接Python脚本. 有了它我们可以不用手动截获和分析HTTP请求和响应 ...
Python爬虫入门教程 43-100 百思不得姐APP数据-手机APP爬虫部分
1. Python爬虫入门教程爬取背景 2019年1月10日深夜,打开了百思不得姐APP,想了一下是否可以爬呢?不自觉的安装到了夜神模拟器里面.这个APP还是比较有名和有意思的. 下面是百思不得姐的 ...

随机推荐

MySQL 栏位修改为区分大小写
) BINARY CHARACTER SET utf8 COLLATE utf8_bin DEFAULT NULL; ) BINARY CHARACTER SET utf8 COLLATE utf8_ ...
（二）stm32f103~~GPIO基本操作二（按键）
GPIO基本配置之按键输入操作(通过按键控制小灯的翻转) KEY0 对用端口PE4,KEY1 对用端口PE3,这两个按键是一段接地,另一端接单片机.KEYWKUP 对用端口PA0,这个按键是一段接高电 ...
<算法图解>读书笔记:第2章选择排序
第2章选择排序 2.1 内存的工作原理需要将数据存储到内存时,请求计算机提供存储空间,计算机会给一个存储地址.需要存储多项数据时,有两种基本方式-数组和链表 2.2 数组和链表 2.2.1 链表 ...
MySql由于编码问题，存储过程执行出错。
在存储过程后面加了一段话.红色部分 DELIMITER $$ USE `mysql_wispeed01-test1`$$ DROP PROCEDURE IF EXISTS `sp_crebillno` ...
user-agent | what is the "user-agent" ?
User Agent(用户代理) UA是一个特殊字符串头,使得服务器能够识别客户使用的操作系统及版本.CPU 类型.浏览器及版本.浏览器渲染引擎.浏览器语言.浏览器插件等通过抓包可以得到下面是几个 ...
tf.contrib.slim arg_scope
缘由最近一直在看深度学习的代码,又一次看到了slim.arg_scope()的嵌套使用,具体代码如下: with slim.arg_scope( [slim.conv2d, slim.separab ...
http 缓存学习.
mark 一下 HTTP 缓存机制一二三 http://web.jobbole.com/92773/ 彻底弄懂HTTP缓存机制及原理 https://www.cnblogs.com/chenqf/p/ ...
python 错误记录
class Func: d = dict() def __setitem__(self, key, value): # xxx object does not support item assignm ...
node05
1.ejs: const ejs = require('ejs') ejs.renderFile('./template/a.ejs', {name:'cc'}, function (err, dat ...

Python爬虫入门教程 21-100 网易云课堂课程数据抓取

写在前面

Python爬虫入门教程 21-100 网易云课堂课程数据抓取的更多相关文章

随机推荐

热门专题