python爬虫如何提高效率

开启线程池:

线程池
- asyncio
  - 特殊的函数
  - 协程
  - 任务对象
    - 任务对象绑定
  - 事件循环
from multiprocessing.dummy import Pool
map(func,alist):
- 可以让func回调函数处理alist中的每一个列表元素，这个处理的过程是基于异步。

In [7]:

import requests

import time

from multiprocessing.dummy import Pool

start = time.time()

pool = Pool(3)

urls = [

    'http://127.0.0.1:5000/index',

    'http://127.0.0.1:5000/index',

    'http://127.0.0.1:5000/index'

]

#用作与网络请求（耗时）

def req(url):

    return requests.get(url).text

page_text_list = pool.map(req,urls)

print(page_text_list)

print('总耗时：',time.time()-start)

['hello bobo!!!', 'hello bobo!!!', 'hello bobo!!!']

总耗时： 2.1126856803894043

单线程+多任务异步协程asyncio

1.asyncio初始

import asyncio

from time import sleep

#特殊的函数

async def get_request(url):

    print('正在下载:',url)

    sleep(2)

    print('下载完毕：',url)

    return 'page_text'

#回调函数的定义（普通的函数）

def parse(task):

    #参数表示的就是任务对象

    print('i am callback!!!',task.result())

#特殊函数的调用

c = get_request('www.1.com')

#创建一个任务对象

task = asyncio.ensure_future(c)

#给任务对象绑定一个回调函数

task.add_done_callback(parse)

#创建一个事件循环对象

loop = asyncio.get_event_loop()

#将任务对象注册到该对象中并且开启该对象

loop.run_until_complete(task)#让loop执行了一个任务

解释：

- ##### 特殊函数：

  - 就是async关键字修饰的一个函数的定义

  - 特殊之处：

    - 特殊函数被调用后会返回一个协程对象

    - 特殊函数调用后内部的程序语句没有被立即执行

- ##### 协程

  - 对象，协程==特殊的函数。协程表示的就是一组特定的操作。

- ##### 任务对象

  - 高级的协程（对协程的进一步的封装）

    - 任务对象==协程==特殊的函数

      - 任务对象==特殊的函数

  - 绑定回调：

    - task.add_done_callback(task)

      - 参数task：当前回调函数对应的任务对象

      - task.result():返回的就是任务对象对应的特殊函数的返回值

- ##### 事件循环对象

  - 创建事件循环对象

  - 将任务对象注册到该对象中并且开启该对象

  - 作用：loop可以将其内部注册的所有的任务对象进行异步执行

- ##### 挂起：

  就是交出cpu的使用权。

多任务异步爬虫：

import asyncio

import requests

import time

from bs4 import BeautifulSoup

#将被请求的url全部整合到一个列表中

urls = ['http://127.0.0.1:5000/bobo','http://127.0.0.1:5000/jay','http://127.0.0.1:5000/tom']

start = time.time()

async def get_request(url):

    #requests模块不支持异步，中断了整个的异步效果

    page_text = requests.get(url).text

    return page_text

def parse(task):

    page_text = task.result()

    soup = BeautifulSoup(page_text,'lxml')

    data = soup.find('div',class_="tang").text

    print(data)

tasks = []

for url in urls:

    c = get_request(url)

    task = asyncio.ensure_future(c)

    task.add_done_callback(parse)

    tasks.append(task)

loop = asyncio.get_event_loop()

loop.run_until_complete(asyncio.wait(tasks))

print('总耗时：',time.time()-start)

【重点】在特殊函数内部的实现中，不可以出现不支持异步的模块代码，如果出现了，

则会中断整个的异步效果！！！
requests一定是不支持异步

aiohttp是一个支持异步的网络请求模块

环境安装

编码流程：

大致的架构:

with aiohttp.ClientSession() as s:

   #s.get(url,headers,params,proxy="http://ip:port")

   with s.get(url) as response:

       #response.read()二进制（.content）

       page_text = response.text()

       return page_text

    - 补充细节

        - 在每一个with前加上async

        - 需要在每一个阻塞操作前加上await

        ```python

        async with aiohttp.ClientSession() as s:

            #s.get(url,headers,params,proxy="http://ip:port")

            async with await s.get(url) as response:

                #response.read()二进制（.content）

                page_text = await response.text()

                return page_text

代码的实现：

import asyncio

import aiohttp

import time

from bs4 import BeautifulSoup

#将被请求的url全部整合到一个列表中

urls = ['http://127.0.0.1:5000/bobo','http://127.0.0.1:5000/jay','http://127.0.0.1:5000/tom']

start = time.time()

async def get_request(url):

    async with aiohttp.ClientSession() as s:

        #s.get(url,headers,params,proxy="http://ip:port")

        async with await s.get(url) as response:

            #response.read()二进制（.content）

            page_text = await response.text()

            return page_text

def parse(task):

    page_text = task.result()

    soup = BeautifulSoup(page_text,'lxml')

    data = soup.find('div',class_="tang").text

    print(data)

tasks = []

for url in urls:

    c = get_request(url)

    task = asyncio.ensure_future(c)

    task.add_done_callback(parse)

    tasks.append(task)

loop = asyncio.get_event_loop()

loop.run_until_complete(asyncio.wait(tasks))

print('总耗时：',time.time()-start)

python爬虫如何提高效率的更多相关文章

paip.提高效率---集合的存取括号方式 uapi java python php js 的实现比较
paip.提高效率---集合的存取括号方式 uapi java python php js 的实现比较 ##java ----------- 在JDK1.7中,摒弃了Java集合接口的实现类,如:Ar ...
(转)python爬虫----（scrapy框架提高（1），自定义Request爬取）
摘要之前一直使用默认的parse入口,以及SgmlLinkExtractor自动抓取url.但是一般使用的时候都是需要自己写具体的url抓取函数的. python 爬虫 scrapy scrapy提 ...
python爬虫13 | 秒爬，这多线程爬取速度也太猛了，这次就是要让你的爬虫效率杠杠的
快快了啊嘿小老弟想啥呢今天这篇爬虫教程的主题就是一个字快想要做到秒爬就需要知道什么是多进程什么是多线程什么是协程(微线程) 你先去沏杯茶坐下来小帅b这就好好给你说道说道关 ...
Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
python爬虫：一些常用的爬虫技巧
python爬虫:一些常用的爬虫技巧 1.基本抓取网页 get方法: post方法: 2.使用代理IP 在开发爬虫过程中经常会遇到IP被封掉的情况,这时就需要用到代理IP; 在urllib2包中有Pr ...
Python爬虫：一些常用的爬虫技巧总结
爬虫在开发过程中也有很多复用的过程,这里总结一下,以后也能省些事情. 1.基本抓取网页 get方法 import urllib2 url = "http://www.baidu.com&qu ...
【Python爬虫】入门知识
爬虫基本知识这阵子需要用爬虫做点事情,于是系统的学习了一下python爬虫,觉得还挺有意思的,比我想象中的能干更多的事情,这里记录下学习的经历. 网上有关爬虫的资料特别多,写的都挺复杂的,我这里不打 ...
常用的 Python 爬虫技巧总结
用python也差不多一年多了,python应用最多的场景还是web快速开发.爬虫.自动化运维:写过简单网站.写过自动发帖脚本.写过收发邮件脚本.写过简单验证码识别脚本. 爬虫在开发过程中也有很多复用 ...
[转载]python 爬虫总结
1.基本抓取网页 get方法 import urllib2 url = "http://www.baidu.com" response = urllib2.urlopen(url) ...

随机推荐

jmeter性能测试-高并发分布式部署
jmeter什么要做分布式部署? jmeter是运行在JVM虚拟机上的,当模拟大量并发时,对运行机器的性能/网络负载会很大. 此时就需要使用jmeter的分布式部署功能,实现多台被控机器同时并发访问被 ...
Spring Cloud Ribbon之URL重构（三）
接着前面的说,前两篇中分析了解析和动态服务列表的获取,这两步完成后那接下来要做的事就是重组解析后的URL路径和发起通信了,这一步完成应该是在前面分析的RibbonLoadBalancerClient. ...
Python 中日期函数
导入日期库 datetime import datetime # 或者from datetime import datetime ,date 字符串转datetime
HTML 防盗链用src引用网上图片显示 403 Forbidden
比如 <img class="toto" src="http://img5.imgtn.bdimg.com/it/u=152658425,3125530872&am ...
HttpApplication执行顺序
类的实例(Global继承自该类)是在 ASP.NET 基础结构中创建的,而不是由用户直接创建的.HttpApplication 类的一个实例在其生存期内被用于处理多个请求,但它一次只能处理一个请求. ...
Linq基础知识
开发人员不需要关心将要访问的是关系数据库还是XML数据,或是远程对象,它都采用同样的访问方式. Linq包含一系列的查询技术,其中Linq到对象是对内存进行操作,LINQ到SQL是对数据库的操作,LI ...
Python代码打包成exe可执行程序
首先,打包成exe可执行程序是针对windows平台来说的. 目前比较主流的打包工具就是pyinstaller. 参考:Using PyInstaller 首先安装pyinstaller: pip i ...
为什么游戏公司的server不愿意微服务化?
背景介绍笔者最近去面试了家游戏公司(有上市).我问他,公司有没有做微服务架构的打算及考量?他很惊讶的,我没听说过微服务耶,你可以解释一下吗? 我大概说了,方便测试,方便维护,方便升级,服务之间松耦合 ...
发送微信通知 java
//实现类@Service public class WeChatServiceImpl implements IWeChatService { @Override public WeChatSend ...
Object[] cannot be converted to String[]
原因: 你应该是想把List数组转 String数组吧! 然后想当然的调用list.toArray()方法. 结果该方法返回的是Object[]数组,导致类型不匹配! 解决办法: 还在乖乖的用循环吧 ...

python爬虫如何提高效率

开启线程池:

单线程+多任务异步协程asyncio

1.asyncio初始

解释：

多任务异步爬虫：

python爬虫如何提高效率的更多相关文章

随机推荐

热门专题