aiohttp的模板

 import aiohttp

 import asyncio

 import async_timeout

 from urllib.parse import urljoin,urldefrag

 root_url = 'http://python/org/'  # 开始的url

 crawled_urls,url_hub = [], [root_url]

 headers = {'user-agent': 'Opera/9.80 (X11; Linux x86_64; U; en) Presto/2.2.15 Version/10.10'}

 async def get_body(url):

     async with aiohttp.ClientSession() as session:

         try:

             with async_timeout.timeout(10): #超时时间的设定

                 async with session.get(url,headers=headers) as response:

                     if response.status == 200:

                         html = await response.text()

                         return {'error':'','html':html,'url':url}

                     else:

                         return {'error':response.status,'html':'','url':url}

         except Exception as err:

             return {'error':response.status,'html':'','url':url}

 async def handle_task(task_id,work_queue):

     while not work_queue.empty():

         queue_url = await work_queue.get()

         if not queue_url in crawled_urls:

             body = await get_body(queue_url)

             if not body['error']:

                 crawled_urls.append(queue_url)

                 parse(body)

             else:

                 print('{}爬取失败'.format(queue_url))

 #解析返回的数据

 def parse(body):

     pass

 def remove_fragment(url):

     pure_url, frag = urldefrag(url)

     return pure_url

 #解析html，拼接新的url

 def get_urls(html):

     new_urls = [url.split('"')[0] for url in str(html).replace("'", '"').split('href="')[1:]]

     return [urljoin(root_url, remove_fragment(new_url)) for new_url in new_urls]

 if __name__ == '__main__':

     q = asyncio.Queue()  #初始化一个异步的队列

     [q.put_nowait(url) for url in url_hub]  #从初始的url队列中遍历，把url放入到队列中

     loop = asyncio.get_event_loop()

     tasks = [handle_task(task_id, q) for task_id in range(3)]  #3个并发

     loop.run_until_complete(asyncio.wait(tasks))

     loop.close()

     for u in crawled_urls:

         print(u)

     print('-' * 30)

     print(len(crawled_urls))

aiohttp的模板的更多相关文章

PYTHON --WebAPP项目转载(廖雪峰) -- Day 1 -- 搭建开发环境
Day 1 - 搭建开发环境搭建开发环境首先,确认系统安装的Python版本是3.5.x: $ python3 --version Python 3.5.1 然后,用pip安装开发Web Ap ...
aiohttp爬虫的模板，类的形式
import asyncio import aiohttp import async_timeout from lxml import html from timeit import default_ ...
python3异步爬虫 ——aiohttp模板使用
一.简单使用和讲解 import aiohttp import asyncio async def fetch(client): async with client.get('http://httpb ...
aiohttp笔记
目录简介采集模板一批,一次性采集动态添加任务动态添加任务,封装成类简介 aiohttp需要python3.5.3以及更高的版本,它不但能做客户端爬虫,也能做服务器端,利用asyncio,协 ...
python web开发框架模板 MVC
我是跟着廖雪峰老师学习的,对于我这样的纯小白来说,跟着他的网站学习,简直是被妈妈抱在怀里一样无忧无虑,这样的学习本来没有记录下来的必要,但是由于我的粗心大意,经常会出现一些错误,所以我决定把这些错误记 ...
Jade模板引擎让你飞
写在前面:现在jade改名成pug了一.安装 npm install jade 二.基本使用 1.简单使用 p hello jade! 渲染后: <p>hello jade!</p ...
ABP入门系列（2）——通过模板创建MAP版本项目
一.从官网创建模板项目进入官网下载模板项目依次按下图选择: 输入验证码开始下载下载提示: 二.启动项目使用VS2015打开项目,还原Nuget包: 设置以Web结尾的项目,设置为启动项目: 打 ...
CMS模板应用调研问卷
截止目前,已经有数十家网站与我们合作,进行了MIP化改造,在搜索结果页也能看到"闪电标"的出现.除了改造方面的问题,MIP项目组被问到最多的就是:我用了wordpress,我用了织 ...
PHP-自定义模板-学习笔记
1. 开始这几天,看了李炎恢老师的<PHP第二季度视频>中的“章节7:创建TPL自定义模板”,做一个学习笔记,通过绘制架构图.UML类图和思维导图,来对加深理解. 2. 整体架构图 ...

随机推荐

CentOS7路由、端口和服务排障常用命令
1. ip route 显示主机基本路由信息 ~]# ip route default via 172.25.0.254 dev eth0 proto static metric 1024 1 ...
NAT原理简介、各种 ADSL Modem 及路由器的端口映射方法
NAT原理简介 NAT英文全称是“Network Address Translation”,中文意思是“网络地址转换”,它是一个IETF(Internet Engineering Task Force ...
Python实例---利用正则实现计算器[FTL版]
import re # 格式化 def format_str(str): str = str.replace('--', '+') str = str.replace('-+', '-') str = ...
oracle sql练习菜鸟入门！
进入公司 ,首先是进行SQL培训一下是针对oracle的emp与dept表进行的基础查询 --1.选择部门30中的所有员工: ; --2.列出所有办事员(CLERK)的姓名,编号和部门编号: sel ...
深入浅出SharePoint——获取Choice Field的Mapping value
list field对应的caml定义如下 <Field Type="Choice" DisplayName="Inspection Result" Re ...
c++计算器后续（1）
自娱自乐: 大概是一直在说的代码规范,大概是玩一玩,以上. 代码规范: 参考原文:链接相关节选: 4 程序的版式 4.4规则:较长的语句(>80字符)要分成多行书写. 4.5规则:不允许把多个 ...
fill & stroke
- (void)stroke Draws a line along the receiver’s path using the current drawing properties. - (void) ...
BZOJ1016:[JSOI2008]最小生成树计数(最小生成树,DFS)
Description 现在给出了一个简单无向加权图.你不满足于求出这个图的最小生成树,而希望知道这个图中有多少个不同的最小生成树.(如果两颗最小生成树中至少有一条边不同,则这两个最小生成树就是不同的 ...
多GPU计算
多GPU计算已经可以说,只要是个成熟的模型,都使用了这一点. 例如: gluoncv:https://github.com/dmlc/gluon-cv/blob/master/scripts/dete ...
基于 Docker 搭建 MySQL 主从复制
本篇博文相对简单,因为是初次使用Docker,MySQL的主从复制之前也在Centos环境下搭建过,但是也忘的也差不多了,因此本次尝试在Docker中搭建. 根据网上教程走还是踩了一些坑,不过所幸最终 ...

aiohttp的模板

aiohttp的模板的更多相关文章

随机推荐

热门专题