简单python爬虫案例(爬取慕课网全部实战课程信息)

技术选型

下载器是Requests

解析使用的是正则表达式

效果图:

准备好各个包

# -*- coding: utf-8 -*-

import requests #第三方下载器

import re #正则表达式

import json #格式化数据用

from requests.exceptions import RequestException #做异常处理

from multiprocessing import Pool #使用多进程

开始编写代码,new一个py文件

1.requests下载页面

response =requests.get(url)

url:当前需要爬取的链接

requests.get()获取页面

这里需要注意编码的问题;

就像下面这样：

  response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

这样返回的就是一个string类型的数据

2.except RequestException:捕捉异常

为了代码更加健壮，我们在可能发生异常的地方做异常捕获

  try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

    except RequestException:

        return None

到这里，我们就可以编写main方法进行调用程序了

代码如下:

# -*- coding: utf-8 -*-

import requests

from requests.exceptions import RequestException

def get_one_page(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

    except RequestException:

        return None

def main():

    url = 'https://coding.imooc.com/?page=1'

    html = get_one_page(url)

    print(html)

if __name__ == '__main__':

    main()

这样就可以把页面下载下来了

接着,就是解析页面

3.正则表达式介绍

re.compile()方法:编译正则表达式

通过一个正则表达式字符串编译生成一个字符串对象

re.findall(pattern,html)方法:找到所有匹配的内容

参数:

pattern：编译过的正则表达式

html：用response.content.decode("utf-8")得到的页面内容

def parse_one_page(html):

    pattern = re.compile('<div class="box">.*?lecturer-info.*?<span>(.*?)</span>.*?shizhan-intro-box.*?title=".*?">'

                         '(.*?)</p>.*?class="grade">(.*?)</span>.*?imv2-set-sns.*?</i>'

                         '(.*?)</span>.*?class="big-text">(.*?)</p>.*?shizan-desc.*?>'

                         '(.*?)</p>.*?</div>',re.S)

    items = re.findall(pattern,html)

    for item in items:

    #格式化每一条数据为字典类型的数据

        yield {

            'teacher': item[0],

            'title': item[1],

            'grade': item[2],

            'people':item[3],

            'score': item[4],

            'describe': item[5]

        }

完整代码:

# -*- coding: utf-8 -*-

import requests

import re

from requests.exceptions import RequestException

def get_one_page(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

    except RequestException:

        return None

def parse_one_page(html):

    pattern = re.compile('<div class="box">.*?lecturer-info.*?<span>(.*?)</span>.*?shizhan-intro-box.*?title=".*?">'

                         '(.*?)</p>.*?class="grade">(.*?)</span>.*?imv2-set-sns.*?</i>'

                         '(.*?)</span>.*?class="big-text">(.*?)</p>.*?shizan-desc.*?>'

                         '(.*?)</p>.*?</div>',re.S)

    items = re.findall(pattern,html)

    for item in items:

        yield {

            'teacher': item[0],

            'title': item[1],

            'grade': item[2],

            'people':item[3],

            'score': item[4],

            'describe': item[5]

        }

def main():

    url = 'https://coding.imooc.com/?page=1'

    html = get_one_page(url)

    for item in parse_one_page(html):

        print(item)

if __name__ == '__main__':

    main()

保存解析后的数据到本地文件

4.保存文件操作

with open('imooctest.txt','a',encoding='utf-8') as f

		with as :打开自动闭合的文件并设立对象f进行操作

		参数:

		imooctest.txt:文件名字

		a:追加方式

		encoding:编码格式 不这样设置可能保存的数据会乱码

 f.write(json.dumps(content,ensure_ascii =False)+'\n')

		 json.dumps:将刚才被格式化后的字典转为字符串

		 ensure_ascii =False  不这样设置可能保存的数据会乱码

		 +'\n' 每条数据为一行

代码如下:

# -*- coding: utf-8 -*-

import requests

import re

import json

from requests.exceptions import RequestException

def get_one_page(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

    except RequestException:

        return None

def parse_one_page(html):

    pattern = re.compile('<div class="box">.*?lecturer-info.*?<span>(.*?)</span>.*?shizhan-intro-box.*?title=".*?">'

                         '(.*?)</p>.*?class="grade">(.*?)</span>.*?imv2-set-sns.*?</i>'

                         '(.*?)</span>.*?class="big-text">(.*?)</p>.*?shizan-desc.*?>'

                         '(.*?)</p>.*?</div>',re.S)

    items = re.findall(pattern,html)

    for item in items:

        yield {

            'teacher': item[0],

            'title': item[1],

            'grade': item[2],

            'people':item[3],

            'score': item[4],

            'describe': item[5]

        }

def write_to_file(content):

    with open('imooctest.txt','a',encoding='utf-8') as f:

        f.write(json.dumps(content,ensure_ascii=False)+'\n')

        f.close()

def main():

    url = 'https://coding.imooc.com/?page=1'

    html = get_one_page(url)

    for item in parse_one_page(html):

        print(item)

        write_to_file(item)

if __name__ == '__main__':

    main()

5.爬取所有页面并以多进程方式

分析页面,会发现,需要爬取的页面如下

https://coding.imooc.com/?page=1

https://coding.imooc.com/?page=2

https://coding.imooc.com/?page=3

https://coding.imooc.com/?page=4

我们需要构造这种格式的页面

url = 'https://coding.imooc.com/?page='+str(page)

主函数可以类似这样:

for i in range(4):

main(i+1)

完整代码:

# -*- coding: utf-8 -*-

import requests

import re

import json

from requests.exceptions import RequestException

from multiprocessing import Pool

def get_one_page(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.content.decode("utf-8")

        return None

    except RequestException:

        return None

def parse_one_page(html):

    pattern = re.compile('<div class="box">.*?lecturer-info.*?<span>(.*?)</span>.*?shizhan-intro-box.*?title=".*?">'

                         '(.*?)</p>.*?class="grade">(.*?)</span>.*?imv2-set-sns.*?</i>'

                         '(.*?)</span>.*?class="big-text">(.*?)</p>.*?shizan-desc.*?>'

                         '(.*?)</p>.*?</div>',re.S)

    items = re.findall(pattern,html)

    for item in items:

        yield {

            'teacher': item[0],

            'title': item[1],

            'grade': item[2],

            'people':item[3],

            'score': item[4],

            'describe': item[5]

        }

def write_to_file(content):

    with open('imoocAll.txt','a',encoding='utf-8') as f:

        f.write(json.dumps(content,ensure_ascii=False)+'\n')

        f.close()

def main(page):

    url = 'https://coding.imooc.com/?page='+str(page)

    html = get_one_page(url)

    # parse_one_page(html)

    # print(html)

    for item in parse_one_page(html):

        print(item)

        write_to_file(item)

if __name__ == '__main__':

    pool = Pool()

    pool.map(main,[i+1 for i in range(4)])

    # for i in range(4):

    #     main(i+1)

到这里,我们就能够把慕课网上面的全部实战课程的信息爬取下来,拿到这些数据,你就可以做自己喜爱的分析了

简单python爬虫案例(爬取慕课网全部实战课程信息)的更多相关文章

Python爬虫之爬取慕课网课程评分
BS是什么? BeautifulSoup是一个基于标签的文本解析工具.可以根据标签提取想要的内容,很适合处理html和xml这类语言文本.如果你希望了解更多关于BS的介绍和用法,请看Beautiful ...
python 爬虫之爬取大街网（思路）
由于需要,本人需要对大街网招聘信息进行分析,故写了个爬虫进行爬取.这里我将记录一下,本人爬取大街网的思路. 附:爬取得数据仅供自己分析所用,并未用作其它用途. 附:本篇适合有一定爬虫基础 crawl ...
Python爬虫项目--爬取自如网房源信息
本次爬取自如网房源信息所用到的知识点: 1. requests get请求 2. lxml解析html 3. Xpath 4. MongoDB存储正文 1.分析目标站点 1. url: http:/ ...
Python爬虫，爬取腾讯漫画实战
先上个爬取的结果图最后的结果为每部漫画按章节保存运行环境 IDE VS2019 Python3.7 先上代码,代码非常简短,包含空行也才50行,多亏了python强大的库 import os im ...
Node.js爬虫-爬取慕课网课程信息
第一次学习Node.js爬虫,所以这时一个简单的爬虫,Node.js的好处就是可以并发的执行这个爬虫主要就是获取慕课网的课程信息,并把获得的信息存储到一个文件中,其中要用到cheerio库,它可以让 ...
[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
网络爬虫之定向爬虫：爬取当当网2015年图书销售排行榜信息（Crawler）
做了个爬虫,爬取当当网--2015年图书销售排行榜 TOP500 爬取的基本思想是:通过浏览网页,列出你所想要获取的信息,然后通过浏览网页的源码和检查(这里用的是chrome)来获相关信息的节点,最后 ...
from appium import webdriver 使用python爬虫,批量爬取抖音app视频（requests+Fiddler+appium）
使用python爬虫,批量爬取抖音app视频(requests+Fiddler+appium) - 北平吴彦祖 - 博客园 https://www.cnblogs.com/stevenshushu/p ...
Python爬虫之爬取站内所有图片
title date tags layut Python爬虫之爬取站内所有图片 2018-10-07 Python post 目标是 http://www.5442.com/meinv/ 如需在非li ...

随机推荐

Spring MVC内容协商实现原理及自定义配置【享学Spring MVC】
每篇一句在绝对力量面前,一切技巧都是浮云前言上文介绍了Http内容协商的一些概念,以及Spring MVC内置的4种协商方式使用介绍.本文主要针对Spring MVC内容协商方式:从步骤.原理 ...
python+unittest框架第六天unittest之优化测试报告
今天的内容主要是,用第三方的HTMLRUNner 第三方的报告来优化之前第五天批量执行案例的测试报告.案例的部分看第五天的批量执行笔记~ HTMLRUNner他可以生成更美观的测试报告,基于前辈造的车 ...
同步机制之一--Synchronized，以及此机制下的锁的本质和种类
Java中,为了实现同步的操作临界区,线程在执行临界区的代码时,需要获得某个对象的锁.本文介绍获得对象的锁的方法之一----Synchronized关键字. Synchronized关键字的用法 Cl ...
一行js代码实现时间戳转时间格式
javascript时间戳转换,支持自定义格式,可以显示年,月,周,日,时,分,秒多种形式的日期和时间. 推荐一个JavaScript常用函数库 jutils jutils - JavaScript常 ...
容器的进程与namespace、rootfs
一:容器是什么容器的本质是一种特殊的进程. 在linux容器中有三个重要的概念:Namespace.Cgroups.rootfs. Namespace做隔离,让进程只能看到Namespace中的世界 ...
第10章文档对象模型DOM 10.2 Document类型
Document 类型 JavaScript 通过 Document 类型表示文档.在浏览器中, document 对象是 HTMLDocument (继承自 Document 类型)的一个实例,表示 ...
HDOJ 4253 Two Famous Companies 二分+MST
题目意思:给出n个点,m条边,边分为两种,一种是A公司的,一种是B公司的.边上有权值, 问用n-1条边把n个点连起来的最小费用是多少,其中A公司的边刚好有k条.题目保证有解. 题解:题目意思很简单就是 ...
【强联通图 | 强联通分量】HDU 1269 迷宫城堡【Kosaraju或Tarjan算法】
为了训练小希的方向感,Gardon建立了一座大城堡,里面有N个房间(N<=10000)和M条通道(M<=100000),每个通道都是单向的,就是说若称某通道连通了A房间和B房间,只说明 ...
HDU2276 Kiki & Little Kiki 2 矩阵快速幂
Kiki & Little Kiki 2 Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java ...
洛谷题解 P3871 【[TJOI2010]中位数】
这题先定义一个大根堆(maxn)维护mid(n为奇数mid+1)的元素.再定义一个小根堆(minn)维护mid(n为奇数mid+1)到n的元素.然后对于插入元素的情况进行分类讨论. 当add x时一 ...