python+requests+re匹配抓取猫眼上映电影信息

python+requests抓取猫眼中上映电影，re正则匹配获取对应电影的排名，图片地址，片名，主演及上映时间和评分

import requests

import re, json

def get_html(url):

    """

    获取网页html源码

    :return:

    """

    user_agent = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) " \

                 "AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.169 Safari/537.36"

    # 浏览器信息

    headers = {

        "User-Agent": user_agent

    }

    r = requests.get(url, headers=headers)

    html = r.text

    # print(html)

    return html

def parse_one_page(html):

    """

    正则匹配需要内容

    :param html:

    :return:

    """

    # 排名+图片地址+主演+上映时间+评分

    pattern = re.compile('<dd>.*?board-index.*?>(\d+)</i>.*?data-src="(.*?)".*?name"><a'

                         + '.*?>(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>'

                         + '.*?integer">(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>', re.S)

    items = re.findall(pattern, html)

    for item in items:

        yield {

            "排名": item[0],

            "图片地址": item[1],

            "片名": item[2],

            "主演": item[3].strip()[3:],

            "上映时间": item[4].strip()[4:],

            "分数": item[5] + item[6]

        }

# 数据存储

def write_file(content):

    with open("result.txt", 'a+', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False) + "\n")

def main():

    """

    主函数

    :return:

    """

    url = "http://maoyan.com/board/4"

    html = get_html(url)

    for item in parse_one_page(html):

        print(item)

        write_file(item)

if __name__ == '__main__':

    main()

python+requests+re匹配抓取猫眼上映电影信息的更多相关文章

Python爬虫【三】利用requests和正则抓取猫眼电影网上排名前100的电影
#利用requests和正则抓取猫眼电影网上排名前100的电影 import requests from requests.exceptions import RequestException imp ...
Python开发网络爬虫抓取某同城房价信息
前言: 苦逼的我从某某城市换到另一个稍微大点的某某城市,面临的第一个问题就是买房,奋斗10多年,又回到起点,废话就不多说了,看看如何设计程序把某同城上的房价数据抓取过来. 方案:方案思路很简单,先把网 ...
003.[python学习] 简单抓取豆瓣网电影信息程序
声明:本程序仅用于学习爬网页数据,不可用于其它用途. 本程序仍有很多不足之处,请读者不吝赐教. 依赖:本程序依赖BeautifulSoup4和lxml,如需正确运行,请先安装.下面是代码: #!/us ...
Python爬虫之requests+正则表达式抓取猫眼电影top100以及瓜子二手网二手车信息(四)
requests+正则表达式抓取猫眼电影top100 一.首先我们先分析下网页结构可以看到第一页的URL和第二页的URL的区别在于offset的值,第一页为0,第二页为10,以此类推. 二.< ...
使用Python抓取猫眼近10万条评论并分析
<一出好戏>讲述人性,使用Python抓取猫眼近10万条评论并分析,一起揭秘“这出好戏”到底如何? 黄渤首次导演的电影<一出好戏>自8月10日在全国上映,至今已有10天,其主演 ...
Python Spider 抓取猫眼电影TOP100
""" 抓取猫眼电影TOP100 """ import re import time import requests from bs4 im ...
用python抓取智联招聘信息并存入excel
用python抓取智联招聘信息并存入excel tags:python 智联招聘导出excel 引言:前一阵子是人们俗称的金三银四,跳槽的小朋友很多,我觉得每个人都应该给自己做一下规划,根据自己的进步 ...
Python 抓取网页并提取信息(程序详解)
最近因项目需要用到python处理网页,因此学习相关知识.下面程序使用python抓取网页并提取信息,具体内容如下: #---------------------------------------- ...
抓取猫眼TOP100的数据
import requests import re import json from multiprocessing import Pool from multiprocessing import M ...

随机推荐

高通lk屏幕向kernel传参
LK把相关参数报存到cmdline上: 在Bootable\bootloader\lk\dev\gcdb\display\gcdb_display_param.c上gcdb_display_cmdli ...
轻量级监控平台之cpu监控
轻量级监控平台之cpu监控脚本 #!/bin/bash #进程监控脚本 #功能需求: 上报机器的硬件层面-cpu负载数据 . /etc/profile . ~/.bash_profile pushur ...
5.jenkins 构建任务2--PHP项目
推送代码 PHP 项目然后我们要做的就是将 .jenkins下面 workspace下的代码. 推送到我们的项目机器上面就ok了. 我们可以在php的jenkins的项目配置中选择使用shell ...
vscode笔记
一.修改操作栏字体 https://www.cnblogs.com/liuyangfirst/p/9759966.html 1.代码改写,进入默认安装的如下路径,搜索workbench 2.用Vs c ...
2个ajax的相互调用解决异步问题
vuex中module的命名空间概念
vuex中module的命名空间概念默认情况下,模块内部的 action.mutation 和 getter 是注册在全局命名空间的. 弊端1:不同模块中有相同命名的mutations.action ...
WPF Datagrid 控制第一行和第一列之间的空白
原文:WPF Datagrid 控制第一行和第一列之间的空白这个位置就是这里我们更改 DataGridControltemplate 模板看树形结构里面是一个BUtton 功能是全选能找 ...
Windows10 下利用Hyper-V安装CentOS系统
开启Windows10的Hyper-v功能(需要重启电脑) 控制面板→程序→启用或关闭Windows功能→打开Hyper-v→确定创建虚拟机在Windows管理工具中找到Hyper-v管理器并双击 ...
DRF--认证和权限
前戏大家都知道http协议是无状态的,每次发送请求他们怎么知道我们是不是登录过呢?我们可以在用户登录之后给用户一个“暗号”,下次请求的时候带着这个“暗号”来.我们拿自己存的和携带过来的进行对比,如果 ...
[学习笔记] Manacher与PAM
\(1\) Manacher 挺短,背是挺好背的 Manacher用于求回文串长度.思想大概就是: 1.加入字符集之外的识别字符(比如#)分隔开原来相邻的字母,这样所有的回文串都变成了以某个字符为中心 ...

python+requests+re匹配抓取猫眼上映电影信息

python+requests+re匹配抓取猫眼上映电影信息的更多相关文章

随机推荐

热门专题