Python3编写网络爬虫04-爬取猫眼电影排行实例

利用requests库和正则表达式抓取猫眼电影TOP100 （requests比urllib使用更方便，由于没有学习HTML系统解析库选用re）

1.目标抓取电影名称时间评分图片等

url http://maoyan.com/board/4 结果以文件形式保存

2.分析

offset 代表偏移量如果为n 电影序号为n+1~n+10 每页显示10个

获取100 分开请求10次 offset 分别为0 10 20...90 利用正则提取相关信息

3.抓取页面

import requests

#爬取第一页 页面信息

def get_one_page(url):

header = {

"User-Agent":"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16",

}

response = requests.get(url,headers=header)

if response.status_code == 200:#判断是否请求成功

return response.text

return None

# 定义一个main函数调用get_one_page 发送请求打印结果

def main():

url = 'http://maoyan.com/board/4'

html = get_one_page(url)#调用请求函数

print(html)

main()

分析页面
电影信息对应节点为<dd>
提取排名 class 为 board-index i节点内正则 <dd>.*?board-index.*?>(.*?)
电影图片查看为第二个img链接 <dd>.*?board-index.*?>(.*?).*?data-src="(.*?)"
电影名字 p节点 class 为name <dd>.*?board-index.*?>(.*?).*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>
主演 <dd>.*?board-index.*?>(.*?).*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)
发布时间 <dd>.*?board-index.*?>(.*?).*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?).*?releasetime.*?>(.*?)
评分 <dd>.*?board-index.*?>(.*?).*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?).*?releasetime.*?>(.*?).*?integer.*?>(.*?).*?fraction.*?>(.*?).*?</dd>

定义分析页面的方法 parse_one_page()

import requests

import re

def get_one_page(url):

header = {

"User-Agent":"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16",

}

response = requests.get(url,headers=header)

if response.status_code == 200:

return response.text

return None

def parse_one_page(html):

pattern = re.compile(

'<dd>.*?board-index.*?>(.*?)</i>.*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)</p>.*?releasetime.*?>(.*?)</p>.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>.*?</dd>',re.S

)

items = re.findall(pattern,html)

print(items)

# 定义一个main函数 调用get_one_page 发送请求 打印结果

def main():

url = 'http://maoyan.com/board/4'

html = get_one_page(url)

# print(html)

parse_one_page(html)

main()

将匹配结果遍历生成字典

import requests

import re

def get_one_page(url):

header = {

"User-Agent":"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16",

}

response = requests.get(url,headers=header)

if response.status_code == 200:

return response.text

return None

def parse_one_page(html):# html为网页源码

pattern = re.compile(

'<dd>.*?board-index.*?>(.*?)</i>.*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)</p>.*?releasetime.*?>(.*?)</p>.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>.*?</dd>',re.S

)#定义规则

items = re.findall(pattern,html)#查找整个页面

# print(items)

#遍历结果生成字典

for item in items:

yield {

'index':item[0],

'image': item[1],

'title': item[2].strip(),

'actor': item[3].strip()[3:] if len(item[3]) > 3 else'',

'time': item[4].strip()[5:] if len(item[4]) > 5 else '',

'score': item[5].strip()+item[6].strip()

}

#返回一个生成器 yield

# 定义一个main函数 调用get_one_page 发送请求 打印结果

def main():

url = 'http://maoyan.com/board/4'

html = get_one_page(url)

# print(html)

for item in parse_one_page(html):#遍历生成器

print(item)

main()

写入文件

将提取结果 写入文件 通过json库 的dumps（） 实现字典的序列化 指定ensure_ascii 参数为 False

#写入文件

def write_to_file(content):

with open('result.txt','a',encoding='utf-8') as f:

print(type(json.dumps(content)))

f.write(json.dumps(content,ensure_ascii=False)+'\n')

整合代码单页面电影提取

import requests

import re

import json

# 请求页面

def get_one_page(url):

header = {

"User-Agent":"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16",

}

response = requests.get(url,headers=header)

if response.status_code == 200:

return response.text

return None

#解析页面

def parse_one_page(html):# html为网页源码

pattern = re.compile(

'<dd>.*?board-index.*?>(.*?)</i>.*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)</p>.*?releasetime.*?>(.*?)</p>.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>.*?</dd>',re.S

)#定义规则

items = re.findall(pattern,html)#查找整个页面

# print(items)

#遍历结果生成字典

for item in items:

yield {

'index':item[0],

'image': item[1],

'title': item[2].strip(),

'actor': item[3].strip()[3:] if len(item[3]) > 3 else'',

'time': item[4].strip()[5:] if len(item[4]) > 5 else '',

'score': item[5].strip()+item[6].strip()

}

#返回一个生成器 yield

#写入文件

def write_to_file(content):

with open('result.txt','a',encoding='utf-8') as f:

print(type(json.dumps(content)))

f.write(json.dumps(content,ensure_ascii=False)+'\n')

# 定义一个main函数 调用get_one_page 发送请求 打印结果

def main():

url = 'http://maoyan.com/board/4'

html = get_one_page(url)

# print(html)

for item in parse_one_page(html):#遍历生成器

write_to_file(item)

main()

分页爬取

# 定义一个main函数调用get_one_page 发送请求打印结果

def main(offset):

url = 'http://maoyan.com/board/4?offset=' + str(offset)

html = get_one_page(url)

# print(html)

for item in parse_one_page(html):#遍历生成器

write_to_file(item)

if __name__ == '__main__':

for i in range(10):

main(offset = i *10)

整理代码

#-*-coding:utf-8-*-

import requests #请求库

import re #正则模块

import json #json模块

import time #时间模块

from requests.exceptions import RequestException#捕获异常模块

# 请求页面

def get_one_page(url):

#异常处理

try:

header = {

"User-Agent":"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16",

}

response = requests.get(url,headers=header)

# 判断状态码是否为200

if response.status_code == 200:

return response.text

return None

except RequestException:

return None

#解析页面

def parse_one_page(html):# html为网页源码

#定义爬取规则

pattern = re.compile(

'<dd>.*?board-index.*?>(.*?)</i>.*?data-src="(.*?)".*?name.*?a.*?>(.*?)</a>.*?star.*?>(.*?)</p>.*?releasetime.*?>(.*?)</p>.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>.*?</dd>',re.S

)

# 查找整个页面

items = re.findall(pattern,html)

# print(items)

#遍历结果生成字典

for item in items:

yield {

'index':item[0],

'image': item[1],

'title': item[2].strip(),

'actor': item[3].strip()[3:] if len(item[3]) > 3 else'',

'time': item[4].strip()[5:] if len(item[4]) > 5 else '',

'score': item[5].strip()+item[6].strip()

}

#返回一个生成器 yield

#写入文件

def write_to_file(content):

with open('result.txt','a',encoding='utf-8') as f:

# print(type(json.dumps(content)))

# ensure_ascii=False 保证输出结果为中文

f.write(json.dumps(content,ensure_ascii=False)+'\n')

# 定义一个main函数 调用get_one_page 发送请求 参数offset 网页偏移量

def main(offset):

#拼接url地址

url = 'http://maoyan.com/board/4?offset=' + str(offset)

# 请求函数

html = get_one_page(url)

# print(html)

# 解析函数 和 文件保存函数

for item in parse_one_page(html):#遍历生成器

write_to_file(item)

if __name__ == '__main__':

for i in range(10):

main(offset = i *10)

#延时处理

time.sleep(3)

# 最基础的实例做好总结

Python3编写网络爬虫04-爬取猫眼电影排行实例的更多相关文章

python3编写网络爬虫19-app爬取
一.app爬取前面都是介绍爬取Web网页的内容,随着移动互联网的发展,越来越多的企业并没有提供Web页面端的服务,而是直接开发了App,更多信息都是通过App展示的 App爬取相比Web端更加容易 ...
爬虫--requests爬取猫眼电影排行榜
'''目标:使用requests分页爬取猫眼电影中榜单栏目中TOP100榜的所有电影信息,并将信息写入文件URL地址:http://maoyan.com/board/4 其中参数offset表示其实条 ...
Python爬虫项目--爬取猫眼电影Top100榜
本次抓取猫眼电影Top100榜所用到的知识点: 1. python requests库 2. 正则表达式 3. csv模块 4. 多进程正文目标站点分析通过对目标站点的分析, 来确定网页结构, ...
python学习(23)requests库爬取猫眼电影排行信息
本文介绍如何结合前面讲解的基本知识,采用requests,正则表达式,cookies结合起来,做一次实战,抓取猫眼电影排名信息. 用requests写一个基本的爬虫排行信息大致如下图网址链接为ht ...
零基础Python爬虫实现(爬取最新电影排行)
提示:本学习来自Ehco前辈的文章, 经过实现得出的笔记. 目标网站 http://dianying.2345.com/top/ 网站结构要爬的部分,在ul标签下(包括li标签), 大致来说迭代li ...
Python爬取猫眼电影排行
import requests import pyquery def crawl_page(url: str) -> None: headers = { 'user-agent': 'Mozil ...
爬虫系列（1）-----python爬取猫眼电影top100榜
对于Python初学者来说,爬虫技能是应该是最好入门,也是最能够有让自己有成就感的,今天在整理代码时,整理了一下之前自己学习爬虫的一些代码,今天先上一个简单的例子,手把手教你入门Python爬虫,爬取 ...
50 行代码教你爬取猫眼电影 TOP100 榜所有信息
对于Python初学者来说,爬虫技能是应该是最好入门,也是最能够有让自己有成就感的,今天,恋习Python的手把手系列,手把手教你入门Python爬虫,爬取猫眼电影TOP100榜信息,将涉及到基础爬虫 ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...

随机推荐

内核开发知识第一讲.内核中的数据类型.重要数据结构.常用内核API函数.
一丶内核中的数据类型在内核中.程序的编写不能简单的用基本数据类型了. 因为操作系统不同.很有可能造成数据类型的长度不一.而产生重大问题.所以在内核中. 数据类型都一定重定义了. 数据类型重定义数据 ...
RIP笔记
RIP(工作中没见人用过这种古老的协议,了解一下距离矢量的思想即可) RIPv2支持VLSM但不支持CIDR RIP工作在应用层,用UDP封装,端口是520 无论是RIPv1还是RIPv2都既支持周期 ...
nfs 提高传输速度
通常挂载 nfs 的命令为: mount -t nfs -o nolock 192.168.0.124:/home/admin/rootfs /mnt 之前我一直都是用这个命令来挂载,那个传输速度啊, ...
【转】 Apk文件及其编译过程
Apk文件概述 Android系统中的应用程序安装包都是以apk为后缀名,其实apk是Android Package的缩写,即android安装包. 注:apk包文件其实就是标准的zip文件,可以直接 ...
eclipse4.6.1安装SpringSource Tool Suite(sts-eclipse)插件
1. Spring Tool Suite(sts)简介 Spring Tool Suite(sts)就是一个基于Eclipse的开发环境, 用于开发Spring应用程序.它提供了一个现成的使用环境来实 ...
【Quartz】问题记录注意事项【四】
记录一:queartz 在同时启动多个任务是,触发器名称不能设置一致,不然第二次启动会不成功记录二:quartz 在使用任务与触发器分离写法时,任务必须要带(.StoreDurably()) IJo ...
Java并发编程：什么是CAS？这回总算知道了
无锁的思想众所周知,Java中对并发控制的最常见方法就是锁,锁能保证同一时刻只能有一个线程访问临界区的资源,从而实现线程安全.然而,锁虽然有效,但采用的是一种悲观的策略.它假设每一次对临界区资源的访 ...
java导出excel时合并同一列中相同内容的行
一.有时候导出Excel时需要按类别导出,一大类下好几个小类,小类下又有好几个小小类,就像下图: 要实现这个也不难, 思路如下:按照大类来循环,如上就是按照张江校区.徐汇校区.临港校区三个大类循环,然 ...
使用Maven搭建JFinal环境
使用Maven搭建JFinal环境工具:IDEA 2017 JFinal版本:3.4 一.Maven项目创建选择maven模板进行创建填写GroupId和ArtifactId 一路Next即可 ...
C#特性：ConditionalAttribute
ConditionalAttribute类 msdn解释: 指示编译器应忽略方法调用或属性,除非已定义指定的条件编译符号. 命名空间: System.Diagnostics 语法: // // 摘要: ...

Python3编写网络爬虫04-爬取猫眼电影排行实例

Python3编写网络爬虫04-爬取猫眼电影排行实例的更多相关文章

随机推荐

热门专题