requests库爬取猫眼电影“最受期待榜”榜单 --网络爬虫

目标站点：https://maoyan.com/board/6

# coding:utf8

import requests, re, json

from requests.exceptions import RequestException

# from multiprocessing import Pool

# 获取页面

def get_one_page(url):

    try:

        resp = requests.get(url)

        if resp.status_code == requests.codes.ok:

            return resp.text

        else:

            return None

    except RequestException:

        return None

# 页面解析

def parse_one_page(html):

    pattern = re.compile('<dd>.*?board-index.*?>(\\d+)</i>.*?data-src="(.*?)"'

                         '.*?name"><a.*?">(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>'

                         '.*?</dd>', re.S)

    items = re.findall(pattern, html)  # result is a list,made up of tuples

    for item in items:

        # 生成字典

        yield {

            'index': item[0],

            'img_url': item[1],

            'title': item[2],

            'stars': item[3][3:],

            'releasetime': item[4],

        }

# 将爬取到的内容写入到文件中

def write_file(content):

    with open('content.txt', 'a', encoding='utf-8') as f:

        str_content = json.dumps(content, ensure_ascii=False)  # 转换成字符串

        f.write(str_content + '\n')

        f.close()

# 主函数

def main(offset):

    url = "https://maoyan.com/board/6/?offset=" + str(offset)

    html = get_one_page(url)

    for item in parse_one_page(html):

        write_file(item)

        print(item)

if __name__ == "__main__":

    # 请求5次

    for i in range(5):

        main(i * 10)

requests库爬取猫眼电影“最受期待榜”榜单 --网络爬虫的更多相关文章

Python 爬取猫眼电影最受期待榜
主要爬取猫眼电影最受期待榜的电影排名.图片链接.名称.主演.上映时间. 思路:1.定义一个获取网页源代码的函数: 2.定义一个解析网页源代码的函数: 3.定义一个将解析的数据保存为本地文件的函数: ...
用requests库爬取猫眼电影Top100
这里需要注意一下,在爬取猫眼电影Top100时,网站设置了反爬虫机制,因此需要在requests库的get方法中添加headers,伪装成浏览器进行爬取 import requests from re ...
python学习(23)requests库爬取猫眼电影排行信息
本文介绍如何结合前面讲解的基本知识,采用requests,正则表达式,cookies结合起来,做一次实战,抓取猫眼电影排名信息. 用requests写一个基本的爬虫排行信息大致如下图网址链接为ht ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
一起学爬虫——使用xpath库爬取猫眼电影国内票房榜
之前分享了一篇使用requests库爬取豆瓣电影250的文章,今天继续分享使用xpath爬取猫眼电影热播口碑榜 XPATH语法 XPATH(XML Path Language)是一门用于从XML文件中 ...
利用Python3的requests和re库爬取猫眼电影笔记
以下笔记,作为参考借鉴,如有疑问可以联系我进行交流探讨! 代码思路很简单,简单概括为: 首先利用requests的get方法获取页面的html文件,之后对得到的html文件进行相对应的正则处理,然 ...
Requests+正则表达式爬取猫眼电影
目标提取出猫眼电影TOP100的电影名称.时间.评分.图片等信息,提取站点的URL为http://maoyan.com/board/4,提取的结果以文本的形式保存下来. 准备工作请安装好reque ...
Requests+正则表达式爬取猫眼电影(TOP100榜)
猫眼电影网址:www.maoyan.com 前言:网上一些大神已经对猫眼电影进行过爬取,所用的方法也是各有其优,最终目的是把影片排名.图片.名称.主要演员.上映时间与评分提取出来并保存到文件或者数据库 ...
Python爬虫学习==>第十章：使用Requests+正则表达式爬取猫眼电影
学习目的: 通过一个一个简单的爬虫应用,初窥门径. 正式步骤 Step1:流程框架抓取单页内容:利用requests请求目标站点,得到单个页面的html代码,返回结果: 正则表达式分析:根据html ...

随机推荐

FB面经prepare: 3 Window Max Sum
Given a num array, find a window of size k, that has a maximum sum of the k entries. follow-up: Find ...
爬虫-----爬取所有国家的首都、面积，并保存到txt文件中
# -*- coding:utf-8 -*- import urllib2import lxml.htmlfrom lxml import etree def main(): file = open( ...
vue组件弹窗
定义弹窗组件先写一个普通的vue组件,其显示的内容就是弹窗的内容. 文件的位置 /src/views/toast/toast.vue <template> <div class=& ...
python值json与pickle模块
#json 是用来序列化对象的 # 只有2个方法,序列化与反序列化 # 但是不能序列化类与函数 import json dict={"key1":[1,2,3,4,5]} f ...
office2007每次打开都要配置文件，怎么取消配置
有时候 Office2007打开文档,每次都提示需要安装.配置,配置完成之后,下次打开又需要配置点击取消就不能打开.非常的烦.ffice2007下载后为什么每次打开总需要置?office2007每次打 ...
【DOM练习】淘宝购物车
HTML: <!DOCTYPE html> <html> <head> <meta charset="UTF-8"> <tit ...
ubuntu上传到百度网盘
1 2 亲测可以上传
HTML5培训入门基础知识了解CSS3 3D属性
CSS3 3D 什么是3d的场景呢? 2d场景,在屏幕上水平和垂直的交叉线x轴和y轴 3d场景,在垂直于屏幕的方法,相对于3d多出个z轴 Z轴:靠近屏幕的方向是正向,远离屏幕的方向是反向 CSS3中的 ...
python3 短网址和数字的相互转换的代码
下面内容是关于python3 短网址和数字的相互转换的内容. import mathimport decimal def convert_to_code(num): """ ...
Eclipse中tomcat启动时报jar包 it's not a class错误；
Console报错如上: 解决方法: 在Eclipse中Servers文件夹下对应的项目文件中catalina.properties文件中tomcat.util.scan.DefaultJarSca ...

requests库爬取猫眼电影“最受期待榜”榜单 --网络爬虫

requests库爬取猫眼电影“最受期待榜”榜单 --网络爬虫的更多相关文章

随机推荐

热门专题