基础爬虫，谁学谁会，用requests、正则表达式爬取豆瓣Top250电影数据！

爬取豆瓣Top250电影的评分、海报、影评等数据！

本项目是爬虫中最基础的，最简单的一例；

后面会有利用爬虫框架来完成更高级、自动化的爬虫程序。

此项目过程是运用requests请求库来获取html，再用正则表达式来解析从中获取所需数据。

话不多说，直接上代码，盘！（具体代码解释在代码旁边）

1.加载包，requests请求库，re是正则表达式的包，json是后面来把字典序列化的包；



#请求库：requests    解析工具：正则表达式

import requests

import re

import json

import time

2.用requests库通过url获取响应，得到html文本。

def get_one_page(url):

    #头部的定义，自己在网页中可以获取（网页右击检查，network中的header）

    headers={

        'User-Agent':'ozilla/5.0 (iPhone; CPU iPhone OS 11_3 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Mobile/15E5216a QQ/7.5.5.426 V1_IPH_SQ_7.5.5_1_APP_A Pixel/1080 Core/UIWebView Device/Apple(iPhone 8Plus) NetType/WIFI QBWebViewType/1'

        }

    response=requests.get(url,headers=headers)

    if response.status_code==200:  #只有status_code为200时才表示响应正确

        return response.text

    return None

3.用正则表达式从html中匹配出想要数据

def parse_one_page(html):

    #re.compile是把正则化字符串对象化，方便复用。

    pattern=re.compile('<li>.*?<em\sclass.*?>(.*?)</em>.*?<img.*? src="(.*?)".*?title">(.*?)<.*?<p class="">(.*?)</p>.*?rating_num.*?>(.*?)<.*?<span>(.*?)</span>.*?.*?inq">(.*?)<.*?</li>',re.S)

    items=re.findall(pattern,html)

    #列表形成字典（通过findall获取的数据是一条条记录，形成一个列表）

    for item in items:

        yield{'index':item[0],  #电影排名

              'image':item[1],  #电影海报

              'title':item[2],  #电影名称

              'actor':item[3],  #电影导演，主演

              'score':item[4],  #评分

              'people_num':item[5],  #多少人评价

              'evaluate':item[6]     #影评

                }

4.把获得的数据存入到txt文件当中去



def write_to_file(content):

    #创建或打开result.txt以追加的读写方式写入数据

    with open('result.txt','a',encoding='utf-8') as f:

        print(json.dumps(content,ensure_ascii=False))  #json.dumps()用于把字典序列化，方便写入txt文件

        f.write(json.dumps(content,ensure_ascii=False)+'\n')

5.通过改变url中start的值来实现换页，进行下一页的切换。

def main(start):

    #更换url中的start值来切换页面，具体更换的数值要更具实际情况而变

    url='https://movie.douban.com/top250?start='+str(start)+'&filter='

    html=get_one_page(url)

    for item in parse_one_page(html):

        write_to_file(item)

if __name__=='__main__':

    for i in range(10):

        start=i*25

        main(start)

        time.sleep(1)#防止请求过快被网页检测出来，休眠1秒

本文所有代码复制可以直接运行欧！

基础爬虫，谁学谁会，用requests、正则表达式爬取豆瓣Top250电影数据！的更多相关文章

requests爬取豆瓣top250电影信息
''' 1.爬取豆瓣top250电影信息 - 第一页: https://movie.douban.com/top250?start=0&filter= - 第二页: https://movie ...
python爬虫知识点总结（九）Requests+正则表达式爬取猫眼电影
一.爬取流程二.代码演示 #-*- coding: UTF-8 -*- #_author:AlexCthon #mail:alexcthon@163.com #date:2018/8/3 impor ...
Scrapy爬虫入门系列4抓取豆瓣Top250电影数据
豆瓣有些电影页面需要登录才能查看. 目录 [隐藏] 1 创建工程 2 定义Item 3 编写爬虫(Spider) 4 存储数据 5 配置文件 6 艺搜参考创建工程 scrapy startproj ...
使用Requests+正则表达式爬取猫眼TOP100电影并保存到文件或MongoDB,并下载图片
需要着重学习的地方:(1)爬取分页数据时,url链接的构建(2)保存json格式数据到文件,中文显示问题(3)线程池的使用(4)正则表达式的写法(5)根据图片url链接下载图片并保存(6)MongoD ...
爬虫之爬取豆瓣top250电影排行榜及爬取斗图啦表情包解读及爬虫知识点补充
今日内容概要如何将爬取的数据直接导入Excel表格 #如何通过Python代码操作Excel表格 #前戏 import requests import time from openpyxl impo ...
Python爬虫学习==>第十章：使用Requests+正则表达式爬取猫眼电影
学习目的: 通过一个一个简单的爬虫应用,初窥门径. 正式步骤 Step1:流程框架抓取单页内容:利用requests请求目标站点,得到单个页面的html代码,返回结果: 正则表达式分析:根据html ...
爬虫系列1：Requests+Xpath 爬取豆瓣电影TOP
爬虫1:Requests+Xpath 爬取豆瓣电影TOP [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]: ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
requests+正则爬取豆瓣图书
#requests+正则爬取豆瓣图书 import requests import re def get_html(url): headers = {'User-Agent':'Mozilla/5.0 ...

随机推荐

（zxing.net）二维码QR Code的简介、实现与解码
一.简介二维码QR Code(Quick Response Code)是由Denso公司于1994年9月研制的一种矩阵二维码符号,它具有一维条码及其它二维条码所具有的信息容量大.可靠性高.可表示汉字 ...
Cesium Language (CZML) 入门2 — CZML Content（CZML的内容）
原文:https://github.com/AnalyticalGraphicsInc/cesium/wiki/CZML-Content 以下是描述CZML文档或者流中可能存在的内容.要解释CZML文 ...
SQL去除重复记录
SQL去除重复记录 if not object_id('Tempdb..#T') is null drop table #T Go Create table #T([ID] int,[Name ...
Visifire图表
引用DLL: WPFToolkit WPFVisifire.Charts.dll WPFVisifire.Gauges.dll 1.柱状图代码: public void BindChart1() { ...
WP8.1StoreApp(WP8.1RT)---本地Toast
WP7/8中的Toast是不能在前台弹出的. WP8.1StoreApp可以利用Win8中的方式: private void Toast(string title,string content) { ...
Android 如何查看源码（eclipse 按住 ctrl ）
首先要确认 Android SDK Manager 下载并安装了 sources.然后在代码中按住 ctrl 在点一个类名, 如果打开的页面是找不到源码,就点那个按钮,然后找到源码所在的文件夹,就可以 ...
mysql--mysql的安装与目录介绍
一.mysql的下载安装 1.下载安装 1.windows10下安装我们采用绿色免安装版, 打开你的mysql文件夹中的bin目录,我的是这个样子的将这个路径添加入系统环境变量,首先右键此电脑-- ...
Ubuntu16.04 - 怎么能够更好设置PATH变量，便于管理？
“/etc/profile”是linux里面的全局变量设置文件,加入这里的PATH变量,全局都可以使用,非常方便.加入时候很简单了,直接在PATH末尾加入":+要加入的变量"就可以 ...
63. 不同路径 II leetcode JAVA
题目一个机器人位于一个 m x n 网格的左上角 (起始点在下图中标记为“Start” ). 机器人每次只能向下或者向右移动一步.机器人试图达到网格的右下角(在下图中标记为“Finish”). 现在 ...
H - Graphics（dfs）
H - Graphics Time Limit:1000MS Memory Limit:131072KB 64bit IO Format:%lld & %llu Submi ...

基础爬虫，谁学谁会，用requests、正则表达式爬取豆瓣Top250电影数据！

爬取豆瓣Top250电影的评分、海报、影评等数据！

1.加载包，requests请求库，re是正则表达式的包，json是后面来把字典序列化的包；

2.用requests库通过url获取响应，得到html文本。

3.用正则表达式从html中匹配出想要数据

4.把获得的数据存入到txt文件当中去

5.通过改变url中start的值来实现换页，进行下一页的切换。

基础爬虫，谁学谁会，用requests、正则表达式爬取豆瓣Top250电影数据！的更多相关文章

随机推荐

热门专题