requests + 正则表达式获取 ‘猫眼电影top100’。

使用进程池Pool 提高爬取数据的速度。

 1 # !/usr/bin/python

 2 # -*- coding:utf-8 -*-

 3 import requests

 4 from requests.exceptions import RequestException

 5 import re

 6 import json

 7 from multiprocessing import Pool,Lock

 8

 9

10 # 获取单页数据信息；

11 def get_one_page(url, headers):

12     try:

13         response = requests.get(url, headers=headers)

14         if response.status_code == 200:

15             return response.text

16         return None

17     except RequestException:

18         return None

19

20 # 使用正则表达式解析数据；

21 def parse_one_page(html):

22     pattern = re.compile('<dd>.*?board-index.*?>(\d+)</i>.*?data-src="(.*?)".*?name"><a.*?>'

23                          +'(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>.*?integer">'

24                          +'(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>', re.S)

25     items = re.findall(pattern, html)

26     # 将获取的数据以字典形式返回；

27     for item in items:

28         yield {

29             'index': item[0],

30             'image': item[1],

31             'title': item[2],

32             'actor': item[3].strip()[3:],

33             'time': item[4].strip()[5:],

34             'score': item[5]+item[6]

35         }

36

37 # 将字典转换为字符串保存，

38 def write_to_file(content):

39     lock.acquire()

40     with open('result.txt', 'a', encoding="utf-8") as f:

41         f.write(json.dumps(content, ensure_ascii=False) + "\n")

42         f.close()

43     lock.release()

44

45 def init(l):

46     global lock

47     lock = l

48

49 # 传入爬取链接，运行函数；

50 def main(offset):

51     url = "https://maoyan.com/board/4?offset=" + str(offset)

52     headers = {

53         "User-Agent": "Mozilla/5.0 (Windows NT 6.3; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.100 Safari/537.36"

54     }

55     html = get_one_page(url, headers=headers)

56     for item in parse_one_page(html):

57         write_to_file(item)

58

59 if __name__ == '__main__':

60     # for i in range(10):

61     #     main(i*10)

62     # 使用 进程池 提高爬取速度；

63     lock = Lock()

64     Pool = Pool(initializer=init, initargs=(lock,))

65     Pool.map(main, [i*10 for i in range(10)])

python限定了多进程要调用的函数不能是类方法，需把多进程调用的函数放到类外面，或者变成静态函数。

但静态函数不能被该类的方法调用（ self.ProcessWorker 形式），需在外部调用：如 mc = MyClass(), mc.ProcessWorker 或 MyClass().ProcessWorker 。

python 多进程编程中进程池锁共享问题参考博客：https://blog.csdn.net/qq_27292549/article/details/78929296

# 将数组中的每个元素提取出来当作函数的参数，创建一个个进程，放进进程池中；
# 第一个参数是函数，第二个参数是迭代器，将迭代器中的数字作为参数依次传入函数中

requests + 正则表达式获取 ‘猫眼电影top100’。的更多相关文章

requests+正则表达式提取猫眼电影top100
#requests+正则表达式提取猫眼电影top100 import requests import re import json from requests.exceptions import Re ...
1.requests+正则表达式爬猫眼电影TOP100
import requests from requests.exceptions import RequestException def get_one_page(url):try: response ...
使用requests爬取猫眼电影TOP100榜单
Requests是一个很方便的python网络编程库,用官方的话是"非转基因,可以安全食用".里面封装了很多的方法,避免了urllib/urllib2的繁琐. 这一节使用reque ...
利用多进程获取猫眼电影top100
猫眼电影top100 是数据是在加载网页时直接就已经加载了的,所以可以通过requests.get()方法去获取这个url的数据,能过对得到的数据进行分析从而获得top100的数据, 把获取的数据存入 ...
Python爬虫之requests+正则表达式抓取猫眼电影top100以及瓜子二手网二手车信息(四)
requests+正则表达式抓取猫眼电影top100 一.首先我们先分析下网页结构可以看到第一页的URL和第二页的URL的区别在于offset的值,第一页为0,第二页为10,以此类推. 二.< ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
用requests库爬取猫眼电影Top100
这里需要注意一下,在爬取猫眼电影Top100时,网站设置了反爬虫机制,因此需要在requests库的get方法中添加headers,伪装成浏览器进行爬取 import requests from re ...
爬虫练习之正则表达式爬取猫眼电影Top100
#猫眼电影Top100import requests,re,timedef get_one_page(url): headers={ 'User-Agent':'Mozilla/5.0 (Window ...
Python爬虫项目--爬取猫眼电影Top100榜
本次抓取猫眼电影Top100榜所用到的知识点: 1. python requests库 2. 正则表达式 3. csv模块 4. 多进程正文目标站点分析通过对目标站点的分析, 来确定网页结构, ...

随机推荐

题解 Omeed
传送门差了一点没想到正解-- 首先单次询问的 $O(n)$ 写法很好想,考虑如何优化首先基础分区间求和即可然后那个连击分的话,是一个关于 $f_i$ 和 $f_{i-1}$ 的柿子 ...
shell 函数返回值与字典
shell的函数只能返回整数值,如果想让函数返回字符串可以在函数调用处为变量赋值. # 定义函数function test() { name=$1 echo "123213" } ...
C# 通过反射实现对象映射：将2个属性相近的对象相互转换
前言我们在编程过程中,经常需要将一个对象转成另一个对象(一般称为对象映射). 比如我们有2个类: //第1个类 CLS1 class CLS1 { public int i {get; set;} ...
springboot整合zookeeper实现分布式锁
目录 01 安装并允许zookeeper 02 springboot应用配置CuratorFramework 03 使用zookeeper实现集群只一个应用实例执行定时任务 04 使用zookeepe ...
windows笔记-在可执行文件或DLL的多个实例之间共享静态数据
全局数据和静态数据不能被同一个. exe或DLL文件的多个映像共享,这是个安全的默认设置.但是,在某些情况下,让一个. exe文件的多个映像共享一个变量的实例是非常有用和方便的. 每个. exe或DL ...
QT 编译的过程
【java虚拟机】jvm调优
转自:https://www.cnblogs.com/starhu/p/6400348.html?utm_source=itdadao&utm_medium=referral 堆大小设置JVM ...
测试linux python import module
源码test.py #!/usr/bin/env python # -*- coding: UTF-8 -*- import os os.system("df -h") 运行结果( ...
centos7 权限更改，所属用户及用户组更改
2021-08-03 # 查看文件的权限 ll 第一个字符, "-" 表示是文件, "d" 表示是目录(directory) 后面 9 个字符每 3 个字符又作 ...
一键备份公众号的所有文章到PDF，再也不用担心想看的文章被删了
有的时候,我们会发现收藏的某个微信公众号文章会被删或者和谐了,尤其是对自己非常实用的文章,一定会后悔当初怎么没有复制或者备份下来. 单篇的公众号文章要备份,随便百度一下就能找到非常多方法,这里就不多废 ...

requests + 正则表达式 获取 ‘猫眼电影top100’。

requests + 正则表达式 获取 ‘猫眼电影top100’。的更多相关文章

随机推荐

热门专题

requests + 正则表达式获取 ‘猫眼电影top100’。

requests + 正则表达式获取 ‘猫眼电影top100’。的更多相关文章