aio 爬虫，去重，入库

#aio 爬虫，去重，入库

import asyncio

import aiohttp

import aiomysql

import re

from pyquery import PyQuery

stoping = False

start_url = 'http://www.jobbole.com/'

waiting_urls = []

seen_urls = set()

# url去重 --布隆过滤器 bloom filter

sem  = asyncio.Semaphore(3) #限制并发数量

async def fetch(url,session):

    async with sem:

        #await asyncio.sleep(0.5)

        try:

            async with session.get(url) as resp:

                print(resp.status)

                if resp.status in [200,201]:

                    data = await resp.text()

                    return data

        except Exception as e :

            print(e)

#因为不是耗费 io的 所以用普通函数

def extract_urls(html):

    urls = []

    pq = PyQuery(html)

    for link in pq.items('a'):

        url = link.attr('href')

        if url and url.startswith('http') and url not in seen_urls:

            urls.append(url)

            waiting_urls.append(url)

    return urls

async def init_urls(url,session):

    html = await fetch(url,session)

    seen_urls.add(url)

    extract_urls(html)

async def article_handeler(url,session,pool):

    #获取文章详情，并解析入库

    html = await fetch(url,session)

    seen_urls.add(url)

    extract_urls(html)

    pq = PyQuery(html)

    title = pq('title').text()

    async with pool.acquire() as conn:

        async with conn.cursor() as cur:

            await cur.execute('SELECT 42;')

            insert_sql = 'insert into aiomysql_test(title) VALUES ("{}")'.format(title)

            await cur.execute(insert_sql)

async def consumer(pool):

    async with aiohttp.ClientSession() as session:

        while not stoping:

            if len(waiting_urls) == 0:

                await asyncio.sleep(0.5)

                continue

            url = waiting_urls.pop()

            print('start get url:{}'.format(url))

            if re.match('http://.*?jobbole.com/\d+/',url):

                if url not in seen_urls:

                    asyncio.ensure_future(article_handeler(url,session,pool))

                    await asyncio.sleep(0.5)

            else:

                if url not in seen_urls:

                    asyncio.ensure_future(init_urls(url,session))

async def main(loop):

    #等待mysql链接建立好

    pool = await aiomysql.create_pool(host='127.0.0.1',port = 3306,

                                      user = 'root',password='',

                                      db = 'aiomysql_test',loop=loop,

                                      charset = 'utf8',autocommit = True)

    async with aiohttp.ClientSession() as session:

        html = await fetch(start_url, session)

        seen_urls.add(start_url)

        extract_urls(html)

    asyncio.ensure_future(consumer(pool))

if __name__ == "__main__":

    loop = asyncio.get_event_loop()

    asyncio.ensure_future(main(loop))

    loop.run_forever()

aio 爬虫，去重，入库的更多相关文章

笔记-爬虫-去重/bloomfilter
笔记-爬虫-去重/bloomfilter 1. 去重为什么要去重? 页面重复:爬的多了,总会有重复的页面,对已爬过的页面肯定不愿意再爬一次. 页面更新:很多页面是会更新的,爬取这种页面时就 ...
[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件
接着这篇文章[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件继续,在这篇文章中实现了采集与静态文件的生成,在实际的采集项目中, 应该是先入库再选择性的生成静态文件.那么我选 ...
scrapy-redis的搭建分布式爬虫去重
master:一.spider文件1.需要更改继承的类from scrapy_redis.spiders import RedisSpider 2.注释掉start_urls 3.在爬虫目录下新创建一 ...
Scrapy爬虫学习笔记 - 爬虫基础知识
一.正则表达式二.深度和广度优先三.爬虫去重策略
转载:爬虫技术浅析(Python)
http://drops.wooyun.org/tips/3915 0x00 前言网络爬虫(Web crawler),是一种“自动化浏览网络”的程序,或者说是一种网络机器人.它们被广泛用于互联网搜索 ...
discuz数据批量入库接口
近期在做社区,首选discuz,数据需要用scrapy爬虫批量入库,就写了一个php入库接口. <?php define('PW', 'abc123456');//一定要修改 if($_REQU ...
scrapy补充-分布式爬虫
spiders 介绍:在项目中是创建爬虫程序的py文件 #1.Spiders是由一系列类(定义了一个网址或一组网址将被爬取)组成,具体包括如何执行爬取任务并且如何从页面中提取结构化的数据. #2.换句 ...
[js高手之路]Node.js+jade+mongoose实战todolist(分页,ajax编辑,删除)
该系列文章索引: [js高手之路]node js系列课程-创建简易web服务器与文件读写 [js高手之路]node js系列课程-图解express+supervisor+ejs用法 [js高手之路] ...
Redis入门_上
Redis是基于内存的Key-Value数据库,包含Set.String.SortedSet.List.Hash等数据结构,可用于缓存.排名.爬虫去重等应用场景. 1.思维导图 2.安装与配置 2.1 ...

随机推荐

实用的ES6特性
1. 函数参数默认值不使用ES6 为函数的参数设置默认值: function foo(height, color) { var height = height || 50; var color = ...
什么是BCL
原文: 原文:https://www.cnblogs.com/1996V/p/9037603.html 什么是BCL 当你通过VS创建一个项目后,你这个项目就已经引用好了通过.NET下的语言编写好的一 ...
android入门 — ListView
ListView主要是用来解决大量数据展示的问题,它的用途很广泛,几乎所有的app都会用到,比如说知乎.今日头条.微博.通讯录等. ListView允许用户通过上下滑动的方式将屏幕外的数据滚动到屏幕中 ...
CCleaner专业版注册码
下载软件安装之后: 1.断网 2.用户名:任意,注册码:C2YW-XZT7-A4SE-UD89-YZPC
C# 中的语法糖
1. using 代替了 try-catch-finally 因为之前是学 Java 的,在连接数据库或者进行文件读写操作时很自然的就使用了 try-catch-finally-,在 C# 中这样 ...
[剑指Offer] 58.对称的二叉树
题目描述请实现一个函数,用来判断一颗二叉树是不是对称的.注意,如果一个二叉树同此二叉树的镜像是同样的,定义其为对称的. [思路]递归,关键是isSame函数中的最后一句 /* struct Tree ...
【.Net】C#文本文件(.txt)读写
目录前言读取txt文件写入txt文件前言计算机在最初只支持ASCII编码,但是后来为了支持其他语言中的字符(比如汉字)以及一些特殊字符(比如€),就引入了Unicode字符集.基于Unico ...
bzoj 4568 [SCOI 2016] 幸运数字
题目大意给定一棵$n$个点的树,每个点有权值 $q$次询问树上路径中每个点权值可选可不选的最大异或和 \(n\le 2*10^4,q\le 2*10^5,val[i]\le 2^{60}\ ...
【bzoj3036】绿豆蛙的归宿期望dp
题目描述随着新版百度空间的下线,Blog宠物绿豆蛙完成了它的使命,去寻找它新的归宿. 给出一个有向无环的连通图,起点为1终点为N,每条边都有一个长度.绿豆蛙从起点出发,走向终点.到达每一个顶点时,如 ...
hdu 1528 Card Game Cheater (二分匹配)
Card Game Cheater Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 65536/32768 K (Java/Others ...

aio 爬虫，去重，入库

aio 爬虫，去重，入库的更多相关文章

随机推荐

热门专题