Python 爬取猫眼

import requests

import re

import pymongo

MONGO_URL='localhost'#建立连接

MONGO_DB='Maoyan'#创建数据库

client=pymongo.MongoClient(MONGO_URL)#连接数据库

db=client[MONGO_DB]#创建数据库

#获得一页的响应提信息

def get_one_page(url):

    headers={

        'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'

    }

    response = requests.get(url,headers=headers)#发送请求，获得响应

    return response.text #获得响应体信息，并返回

#解析请求的信息，并通过正则表达式提取想要的信息：电影名称、排名等

def parse_page(html):

    #通过正则表达式进行匹配

    pattern=re.compile('<dd>.*?board-index.*?>(.*?)</i>.*?data-src.*?"(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)</p>.*?releasetime.*?>(.*?)</p>.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>',re.S)

    results=re.findall(pattern,html)#获得单页响应头的信息，获得的是一个列表

    #对产生的列表list进行for循环

    for result in results:

        #通过字典(dict)，组建信息

        movies={

            'rate':result[0],

            'img_url':result[1],

            'name':result[2],

            'actor':result[3].strip()[3:],

            'time':result[4][5:],

            'score':result[5]+result[6]

        }

        #保存到数据库

        save_mongo(movies)

#保存到数据库的函数

def save_mongo(info):

    if db['Movies'].insert(info):#将信息插入到数据库

        print('保存成功：',info)

    else:

        print('保存失败：',info)

#实现主流程

def main():

    #有10页，通过来获取每一页的信息

    for i in range(10):

        url='http://maoyan.com/board/4?offset='+str(i*10)#构建每一页的请求url

        html=get_one_page(url)#进行请求

        parse_page(html)#进行响应体的解析，并保存到数据库

if __name__=='__main__':

    main()#调用主体函数

import requests

import re

import pymongo

MONGO_URL='localhost'#

MONGO_DB='Maoyan'

MONGO_TABLE='MoviesTop100'

client=pymongo.MongoClient(MONGO_URL)

db=client[MONGO_DB]

def save_to_mongo(info):

    if db[MONGO_TABLE].insert(info):

        print('保存成功',info)

    else:

        print('保存失败',info)

def get_one_page(url):

    headers={

        'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'

    }

    html = requests.get(url=url,headers=headers).text

    return html

def get_movies_info(html):

    pattern=re.compile('<dd>.*?title="(.*?)".*?<p.*?star.*?>(.*?)</p>.*?<p.*?releasetime.*?>(.*?)</p>.*?<i.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>',re.S)

    results = re.findall(pattern,html)

    for result in results:

        movies = {}

        movies['name']=result[0]

        movies['actor']=result[1].strip()[3:]

        movies['time']=result[2].strip()[5:]

        movies['rate']=result[3]+result[4]

        save_to_mongo(movies)

#主体函数

def main():

    for i in range(10):

        url = 'http://maoyan.com/board/4?offset='+str(i*10)

        html=get_one_page(url)#完成请求，获取响应体的超文本

        get_movies_info(html)#完成信息提取

if __name__=='__main__':

    main()

Python 爬取猫眼的更多相关文章

Python 爬取猫眼 top100 电影例子
一个Python 爬取猫眼top100的小栗子 import json import requests import re from multiprocessing import Pool #//进程 ...
爬虫系列（1）-----python爬取猫眼电影top100榜
对于Python初学者来说,爬虫技能是应该是最好入门,也是最能够有让自己有成就感的,今天在整理代码时,整理了一下之前自己学习爬虫的一些代码,今天先上一个简单的例子,手把手教你入门Python爬虫,爬取 ...
python 爬取猫眼电影top100数据
最近有爬虫相关的需求,所以上B站找了个视频(链接在文末)看了一下,做了一个小程序出来,大体上没有修改,只是在最后的存储上,由txt换成了excel. 简要需求:爬虫爬取猫眼电影TOP100榜单数据 ...
票房和口碑称霸国庆档，用 Python 爬取猫眼评论区看看电影《我和我的家乡》到底有多牛
今年的国庆档电影市场的表现还是比较强势的,两名主力<我和我的家乡>和<姜子牙>起到了很好的带头作用. <姜子牙>首日破 2 亿,一举刷新由<哪吒之魔童降世&g ...
Python 爬取猫眼电影最受期待榜
主要爬取猫眼电影最受期待榜的电影排名.图片链接.名称.主演.上映时间. 思路:1.定义一个获取网页源代码的函数: 2.定义一个解析网页源代码的函数: 3.定义一个将解析的数据保存为本地文件的函数: ...
python爬取猫眼电影top100
最近想研究下python爬虫,于是就找了些练习项目试试手,熟悉一下,猫眼电影可能就是那种最简单的了. 1 看下猫眼电影的top100页面分了10页,url为:https://maoyan.com/b ...
Python爬取猫眼电影《飞驰人生》47858万条评论并对其进行数据分析
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: Yura不说数据说 ,PYuraL PS:如有需要Python学习资 ...
Python爬取猫眼电影100榜并保存到excel表格
首先我们前期要导入的第三方类库有; 通过猫眼电影100榜的源码可以看到很有规律如: 亦或者是: 根据规律我们可以得到非贪婪的正则表达式 """<div class ...
Python爬取猫眼top100排行榜数据【含多线程】
# -*- coding: utf-8 -*- import requests from multiprocessing import Pool from requests.exceptions im ...
记录python爬取猫眼票房排行榜(带stonefont字体网页),保存到text文件,csv文件和MongoDB数据库中
猫眼票房排行榜页面显示如下: 注意右边的票房数据显示,爬下来的数据是这样显示的: 网页源代码中是这样显示的: 这是因为网页中使用了某种字体的缘故,分析源代码可知: 亲测可行: 代码中获取的是国内票房榜 ...

随机推荐

Django整理(一) - 项目和应用创建及运行
一.项目组织结构 · 一个Project包含有多个App · 一个App就是一个Python包,就代表一个功能模块,比如: 用户模块,商品模块等 .各个功能模块间可以保持相对的独立 . ...
C语言实现简易计算器(可作加减乘除)
C语言实现简易计算器(加减乘除) 计算器作为课设项目,已完成答辩,先将代码和思路(注释中)上传一篇博客已增添.修改.整理至无错且可正常运行虽使用了栈,但初学者可在初步了解栈和结构语法后理解代码 # ...
Serverless 工程实践 | 零基础上手 Knative 应用
作者|刘宇前言:Knative 是一款基于 Kubernetes 的 Serverless 框架.其目标是制定云原生.跨平台的 Serverless 编排标准. Knative 介绍 Knative ...
☕【Java技术指南】「编译器专题」深入分析探究“静态编译器”（JAVA\IDEA\ECJ编译器）是否可以实现代码优化？
技术分析大家都知道Eclipse已经实现了自己的编译器,命名为 Eclipse编译器for Java (ECJ). ECJ 是 Eclipse Compiler for Java 的缩写,是 Jav ...
ThreadLocal概念以及使用场景
ThreadLocal概念以及使用场景根据自身的知识深度,这里只限于自己使用和学习的知识点整理,原理的解释还需要再沉淀. 该文章从项目开发中举例,希望能帮助到各位,不了解ThreadLocal的朋友 ...
hmac和socketserver
一,hmac 验证客户端的合法性 hmac,检测客户端是否合法,不依赖登录认证 server import os,socket,hmac sk=socket.socket() sk.bind(('12 ...
CQOI2021 退役记
Day -1 晚上去了酒店然后就睡觉了. Day 1 进考场之前互相奶. 进了考场之后看题,发现T1很水(伏笔1,然后直接开始写 \(\Theta(n\log^2n)\)(二分+动态开点线段树),调了 ...
bzoj4094 && luogu3097 最优挤奶
题目大意: 给定n个点排成一排,每个点有一个点权,有m次修改,每次改变某个点的点权并将最大点独立集计入答案,输出最终的答案其中\(n\le 40000\ , \ m\le 50000\) QWQ说实 ...
【.Net vs Java? 】看一看二者的类有多像？
1. 包(Package).命名空间(NameSpace) 1.1 概念在Java中常用的是包(Package),较少提到NameSpace的概念.Java官方文档中这样说: 为了使类型更易于查找和 ...
远程设备管理opendx平台搭建-appium和adb的安装
多年不见了,说起来也有3年了我又开始写博客了,这几年我还是没啥长进,还是干测试,但是测试行业的话,我已经成了一个测开了,也在搭建自己的测试网站本系列文章讲述的是一个系列的第一部分,最终可以搭建一整套 ...

Python 爬取 猫眼

Python 爬取 猫眼的更多相关文章

随机推荐

热门专题

Python 爬取猫眼

Python 爬取猫眼的更多相关文章