python协程爬取某网站的老赖数据

import re

import json

import aiohttp

import asyncio

import time

import pymysql

from asyncio.locks import Semaphore

from functools import partial

headers = {

    'Cookie': 'auth_token=your_token_here',

    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.135 Safari/537.36'

}

def save_data(cursor, addr_dic, obj):

    try:

        data = obj.result()['data']

        name = data['iname']

        addr = addr_dic.get(name, '')

        idcard = data['cardnum']

        assert re.match('\d{10}[\d*]{4}\d{3}[\dxX]', idcard)

        birth = idcard[6:10]

        assert birth.isdigit()

        birth += '年'

        sex = data.get('sex')

        if not sex:

            n = int(idcard[-2])

            sex = '男' if (n % 2) == 1 else '女'

        tm = time.localtime(data.get('regdate', 0) / 1000)

        createtime = f'{tm.tm_year}-{tm.tm_mon}-{tm.tm_mday}'

        cursor.execute("insert into tianyancha(name, birth, sex, idcard, court, createtime, caseno, base, duty, status, detail, addr) values('%s', '%s', '%s', '%s', '%s', '%s', '%s', '%s', '%s', '%s', '%s', '%s')" % (

            name, birth, sex, idcard, data['courtname'], createtime, data['casecode'], data['gistunit'], data['duty'], data['performance'], data['disrupttypename'], addr

        ))

    except Exception as e:

        print('插入错误', e.args)

async def parse_case_data(sem, session, cid):

    # 爬取详情记录

    async with sem:  # 控制并发量

        async with session.get(f"https://shixin.tianyancha.com/shixin/getDishonestinfoDetailWeb.json?bussinessId={cid}") as rsp:

            return await rsp.json()

async def parse_province(sem, session, cursor, url):

    page = 1

    while True:

        # 翻页爬取

        page_url = f'{url}/p{page}'

        async with session.get(page_url) as rsp:

            try:

                txt = await rsp.text()

                # 解析出人名对应的地址

                addr_dic = {}

                pps = [i.strip() for i in re.findall('dishonest_base_info_detail">(.*?)</', txt, re.S)]

                for itm in pps:

                    try:

                        name, _, _, addr = itm.split('，')

                        assert addr.endswith('人。')

                        addr = addr.rstrip('人。')

                        addr_dic[name] = addr

                    except:

                        pass

                # 解析出每条失信记录的id

                cid_lis = re.findall('data-id="([\da-z]{32})"', txt)

                tasks = []

                for cid in cid_lis:

                    # 开启协程爬取解析每条记录

                    task = asyncio.create_task(parse_case_data(sem, session, cid))

                    # 回调存入mysql

                    task.add_done_callback(partial(save_data, cursor, addr_dic))

                    tasks.append(task)

                await asyncio.wait(tasks)

                print(f'第{page}页爬取完成')

                if 'tic-icon-arrow-right' not in txt:

                    break

                page += 1

            except:

                print(f'爬取到第{page}页失败')

                break

async def main():

    province = "广东"

    url_data = json.load(open('url.json', 'r', encoding='utf-8'))  # url.json: 存储省份对应的url的json文件

    url_lis = [url_data.get(province)]  # 此处是支持全国所有省份一起爬取的，但是我只爬取广东的

    sem = Semaphore(4)

    conn = pymysql.connect(host='localhost', port=3306, user='user', password='password', charset='utf8', database='db', autocommit=True)

    cursor = conn.cursor()

    async with aiohttp.ClientSession(headers=headers) as session:

        for url in url_lis:

            await parse_province(sem, session, cursor, url)

    cursor.close()

    conn.close()

if __name__ == '__main__':

    asyncio.run(main())

python协程爬取某网站的老赖数据的更多相关文章

Python协程爬取妹子图(内有福利，你懂得~)
项目说明: 1.项目介绍本项目使用Python提供的协程+scrapy中的选择器的使用(相当好用)实现爬取妹子图的(福利图)图片,这个学会了,某榴什么的.pow(2, 10)是吧! 2.用到的知 ...
python之简单爬取一个网站信息
requests库是一个简介且简单的处理HTTP请求的第三方库 get()是获取网页最常用的方式,其基本使用方式如下使用requests库获取HTML页面并将其转换成字符串后,需要进一步解析HTML ...
初次尝试python爬虫，爬取小说网站的小说。
本次是小阿鹏,第一次通过python爬虫去爬一个小说网站的小说. 下面直接上菜. 1.首先我需要导入相应的包,这里我采用了第三方模块的架包,requests.requests是python实现的简单易 ...
04 Python网络爬虫 <<爬取get/post请求的页面数据>>之requests模块
一. urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib ...
python爬虫学习-爬取某个网站上的所有图片
最近简单地看了下python爬虫的视频.便自己尝试写了下爬虫操作,计划的是把某一个网站上的美女图全给爬下来,不过经过计算,查不多有好几百G的样子,还是算了.就首先下载一点点先看看. 本次爬虫使用的是p ...
Python爬虫：爬取某网站关键词对应商品ID，且存入DB2数据库
公司研发不给力,我就自己写了一个,专门爬关键词对应的商品ID. 其中还学会了用Python操作DB2数据库.Python发送邮件.写日志文件.处理浏览器访问限制. #!/usr/bin/python# ...
用python实现多线程爬取影视网站全部视频方法【笔记】
我拿这个站点作为案例:https://91mjw.com/ 其他站点方法都是差不多的. 第一步:获得整站所有的视频连接 html = requests.get("https://91mjw ...
046.Python协程
协程 1 生成器初始化生成器函数返回生成器对象,简称生成器 def gen(): for i in range(10): #yield 返回便能够保留状态 yield i mygen = gen( ...
python爬虫--爬取某网站电影信息并写入mysql数据库
书接上文,前文最后提到将爬取的电影信息写入数据库,以方便查看,今天就具体实现. 首先还是上代码: # -*- coding:utf-8 -*- import requests import re im ...

随机推荐

Java8中执行js脚本
代码中除了callJSFunctionFromFile函数,其他均转载于文章JDK1.8中如何用ScriptEngine动态执行JS import jdk.nashorn.api.scripting. ...
记：create-react-app暴露配置报错
上面主要是说 webpack 版本冲突不是create-react-app本身的问题,需要手动解决. 解决办法: npm run eject // 显示所有的依赖项如果运行出现类似这样的报错 Ar ...
css 10-CSS3选择器详解
10-CSS3选择器详解 #CSS3介绍 CSS3在CSS2基础上,增强或新增了许多特性, 弥补了CSS2的众多不足之处,使得Web开发变得更为高效和便捷. #CSS3的现状浏览器支持程度不够好,有 ...
pandas的学习1-基本介绍
''' Numpy 和 Pandas 有什么不同如果用 python 的列表和字典来作比较, 那么可以说 Numpy 是列表形式的,没有数值标签,而 Pandas 就是字典形式.Pandas是基于N ...
Python 中的运算符重载
本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理一种运算符对于不同类型的对象,有不同的使用方式.例如, + 用于整型对象,表示两个数相加:用于字符串 ...
Python常用内置对象
1.在python中处理的一切都是对象. 2.内置对象可直接使用,如数字.字符串.列表.del等. 3.非内置对象需要导入模块才能使用,如正弦函数sin(x),随机数产生函数random()等.
.net core 和 WPF 开发升讯威在线客服与营销系统：（插曲）一次端口攻击行为的分析与应对
本系列文章详细介绍使用 .net core 和 WPF 开发升讯威在线客服与营销系统的过程.本产品已经成熟稳定并投入商用. 在线演示环境:https://kf.shengxunwei.com 注意 ...
execute，executeQuery，executeUpdate的区别是什么？
a.Statement的execute(String query)方法用来执行任意的SQL查询,如果查询的结果是一个ResultSet,这个方法就返回true.如果结果不是ResultSet,比如in ...
reactor模式前序（二）：NIO WEB服务器设计
前文介绍了传统IO的WEB经典服务器 reactor模式前序:传统IO的WEB服务器设计下面看看JAVA NIO的WEB服务器设计 NIO是基于事件驱动的,对于NIO来说,重要组件是Selector ...
Turtlebot3新手教程：OpenCR软件设置(shell)
*本文针对如何利用脚本来更新固件进行讲解具体步骤如下: burger的固件更新 $ export OPENCR_PORT=/dev/ttyACM0 $ export OPENCR_MODEL=bur ...

python协程爬取某网站的老赖数据

python协程爬取某网站的老赖数据的更多相关文章

随机推荐

热门专题