python+requests+re匹配抓取猫眼上映电影信息

python+requests抓取猫眼中上映电影，re正则匹配获取对应电影的排名，图片地址，片名，主演及上映时间和评分

import requests

import re, json

def get_html(url):

    """

    获取网页html源码

    :return:

    """

    user_agent = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) " \

                 "AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.169 Safari/537.36"

    # 浏览器信息

    headers = {

        "User-Agent": user_agent

    }

    r = requests.get(url, headers=headers)

    html = r.text

    # print(html)

    return html

def parse_one_page(html):

    """

    正则匹配需要内容

    :param html:

    :return:

    """

    # 排名+图片地址+主演+上映时间+评分

    pattern = re.compile('<dd>.*?board-index.*?>(\d+)</i>.*?data-src="(.*?)".*?name"><a'

                         + '.*?>(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>'

                         + '.*?integer">(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>', re.S)

    items = re.findall(pattern, html)

    for item in items:

        yield {

            "排名": item[0],

            "图片地址": item[1],

            "片名": item[2],

            "主演": item[3].strip()[3:],

            "上映时间": item[4].strip()[4:],

            "分数": item[5] + item[6]

        }

# 数据存储

def write_file(content):

    with open("result.txt", 'a+', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False) + "\n")

def main():

    """

    主函数

    :return:

    """

    url = "http://maoyan.com/board/4"

    html = get_html(url)

    for item in parse_one_page(html):

        print(item)

        write_file(item)

if __name__ == '__main__':

    main()

python+requests+re匹配抓取猫眼上映电影信息的更多相关文章

Python爬虫【三】利用requests和正则抓取猫眼电影网上排名前100的电影
#利用requests和正则抓取猫眼电影网上排名前100的电影 import requests from requests.exceptions import RequestException imp ...
Python开发网络爬虫抓取某同城房价信息
前言: 苦逼的我从某某城市换到另一个稍微大点的某某城市,面临的第一个问题就是买房,奋斗10多年,又回到起点,废话就不多说了,看看如何设计程序把某同城上的房价数据抓取过来. 方案:方案思路很简单,先把网 ...
003.[python学习] 简单抓取豆瓣网电影信息程序
声明:本程序仅用于学习爬网页数据,不可用于其它用途. 本程序仍有很多不足之处,请读者不吝赐教. 依赖:本程序依赖BeautifulSoup4和lxml,如需正确运行,请先安装.下面是代码: #!/us ...
Python爬虫之requests+正则表达式抓取猫眼电影top100以及瓜子二手网二手车信息(四)
requests+正则表达式抓取猫眼电影top100 一.首先我们先分析下网页结构可以看到第一页的URL和第二页的URL的区别在于offset的值,第一页为0,第二页为10,以此类推. 二.< ...
使用Python抓取猫眼近10万条评论并分析
<一出好戏>讲述人性,使用Python抓取猫眼近10万条评论并分析,一起揭秘“这出好戏”到底如何? 黄渤首次导演的电影<一出好戏>自8月10日在全国上映,至今已有10天,其主演 ...
Python Spider 抓取猫眼电影TOP100
""" 抓取猫眼电影TOP100 """ import re import time import requests from bs4 im ...
用python抓取智联招聘信息并存入excel
用python抓取智联招聘信息并存入excel tags:python 智联招聘导出excel 引言:前一阵子是人们俗称的金三银四,跳槽的小朋友很多,我觉得每个人都应该给自己做一下规划,根据自己的进步 ...
Python 抓取网页并提取信息(程序详解)
最近因项目需要用到python处理网页,因此学习相关知识.下面程序使用python抓取网页并提取信息,具体内容如下: #---------------------------------------- ...
抓取猫眼TOP100的数据
import requests import re import json from multiprocessing import Pool from multiprocessing import M ...

随机推荐

windows下安装react
在 Windows 10 64 下创建 React App 由 SHUIJINGWAN · 2018/03/26 1.在官方网站:https://nodejs.org/zh-cn/ 下载推荐版本: ...
window2012安装oracle报INS-13001 环境不满足最低要求
在windows server 2012R2安装Oracle客户端或者服务端时,会弹窗报错INS-13001 环境不满足最低要求此时可以进行以下操作进行解决在解压后的Oracle安装文件目录中,找到 ...
mysql-python 安装错误: Cannot open include file: 'config-win.h': No such file or directory
问题描述: pip instal MySQL-python 出现如下错误: Installing collected packages: MySql-python Running setup.py i ...
7.8 Structured Streaming
一.Spark流计算组件的演进二.Structured Streaming的基本原理 Structured Streaming将数据建模成一个结构化的数据表DataFrame,后到达的数据就是一 ...
React中条件渲染
17==> 条件渲染 state初始化一般写在构造器当中 CharShop.js如下 import React, { Component } from "react"; ex ...
leetcode 752. 打开转盘锁
地址 https://leetcode-cn.com/problems/open-the-lock/ 你有一个带有四个圆形拨轮的转盘锁.每个拨轮都有10个数字: '0', '1', '2', '3', ...
【2019.8.20 NOIP模拟赛 T3】小X的图（history）（可持久化并查集）
可持久化并查集显然是可持久化并查集裸题吧... 就是题面长得有点恶心,被闪指导狂喷. 对于\(K\)操作,直接\(O(1)\)赋值修改. 对于\(R\)操作,并查集上直接连边. 对于\(T\)操作, ...
java之获取变量的类型
java要获取变量的类型必须自己定义一个函数: public class Test{ public static void main(String[] args) { short a = 1; a + ...
pytorch固定部分参数
pytorch固定部分参数不用梯度如果是Variable,则可以初始化时指定 j = Variable(torch.randn(5,5), requires_grad=True) 但是如果是m = ...
vim 下修改tab键为四个空格
最近在运行python的时候,发现tab键在在运行过程中无法使用,报错:IndentationError: unindent does not match any outer indentation ...

python+requests+re匹配抓取猫眼上映电影信息

python+requests+re匹配抓取猫眼上映电影信息的更多相关文章

随机推荐

热门专题