爬取知乎话题async使用协程

import requests

import json

import time

from pyquery import PyQuery

import pandas as pd

from collections import OrderedDict

import multiprocessing

import asyncio

from functools import partial

# cookies = input('请输入Cookie：')

# url = input('请输入url：')

init_url = 'https://www.zhihu.com/api/v4/topics/19562045/feeds/top_activity?offset=5&limit=10'

headers = {

    'User-Agent': 'Mozilla/5.0 (iPhone; CPU iPhone OS 11_0 like Mac OS X) AppleWebKit/604.1.38 (KHTML, like Gecko) Version/11.0 Mobile/15A372 Safari/604.1',

    'Cookie': '**',

    'Referer': 'https://www.zhihu.com/topic/19606409/hot',

    'Host': 'www.zhihu.com',

    'X-UDID': 'AGDlzA1itw2PTr6aWsPp6OtejkxQ9iF7xgA='

}

def get_all_url(url):

    res = requests.get(url,headers=headers)

    data = json.loads(res.text)

    next_page_url = data['paging']['next']

    url_list.append(next_page_url)

    print(len(url_list))

    end_page = data['paging']['is_end']  # true

    if end_page:

        return url_list

    else:

        get_all_url(next_page_url)

async def get_all_data(url):

    future = loop.run_in_executor(None,partial(requests.get,url,headers=headers))

    #res = requests.get(url,headers=headers)

    res = await future

    data = json.loads(res.text)

    res_data = data['data']

    print(len(data_list))

    for i in res_data:

        final_data = OrderedDict()

        type = i['target']['type']

        if type =='answer':

            final_data['title'] = i['target']['question']['title'] or ''

            try:

                final_data['content'] = PyQuery(i['target']['content']).text()

            except Exception as e:

                final_data['content'] = PyQuery(i['target']['excerpt']).text()

            final_data['comment_count'] = i['target']['comment_count']

            final_data['voteup_count'] = i['target']['voteup_count']

            data_list.append(final_data)

if __name__ == '__main__':

    data_list=[]

    url_list = []

    get_all_url(init_url)

    tasks = [asyncio.ensure_future(get_all_data(url)) for url in url_list]

    loop = asyncio.get_event_loop()

    loop.run_until_complete(asyncio.wait(tasks))

    loop.close()

    df1 =pd.DataFrame(data_list)

    df1.to_excel('保险'+time.strftime("%Y%m%d%H%M%S")+'.xlsx',index=False)

    print('done')

爬取知乎话题async使用协程的更多相关文章

requests爬取知乎话题和子话题
zhihu.py # *_*coding:utf-8 *_* import pymysql import requests from lxml import etree from requests_t ...
教程+资源,python scrapy实战爬取知乎最性感妹子的爆照合集(12G)!
一.出发点: 之前在知乎看到一位大牛(二胖)写的一篇文章:python爬取知乎最受欢迎的妹子(大概题目是这个,具体记不清了),但是这位二胖哥没有给出源码,而我也没用过python,正好顺便学一学,所以 ...
通过scrapy，从模拟登录开始爬取知乎的问答数据
这篇文章将讲解如何爬取知乎上面的问答数据. 首先,我们需要知道,想要爬取知乎上面的数据,第一步肯定是登录,所以我们先介绍一下模拟登录: 先说一下我的思路: 1.首先我们需要控制登录的入口,重写star ...
利用 Scrapy 爬取知乎用户信息
思路:通过获取知乎某个大V的关注列表和被关注列表,查看该大V和其关注用户和被关注用户的详细信息,然后通过层层递归调用,实现获取关注用户和被关注用户的关注列表和被关注列表,最终实现获取大量用户信息. 一 ...
16、爬取知乎大v张佳玮的文章“标题”、“摘要”、“链接”，并存储到本地文件
爬取知乎大v张佳玮的文章“标题”.“摘要”.“链接”,并存储到本地文件 # 爬取知乎大v张佳玮的文章“标题”.“摘要”.“链接”,并存储到本地文件 # URL https://www.zhihu.co ...
python scrapy爬取知乎问题和收藏夹下所有答案的内容和图片
上文介绍了爬取知乎问题信息的整个过程,这里介绍下爬取问题下所有答案的内容和图片,大致过程相同,部分核心代码不同. 爬取一个问题的所有内容流程大致如下: 一个问题url 请求url,获取问题下的答案个数 ...
使用python scrapy爬取知乎提问信息
前文介绍了python的scrapy爬虫框架和登录知乎的方法. 这里介绍如何爬取知乎的问题信息,并保存到mysql数据库中. 首先,看一下我要爬取哪些内容: 如下图所示,我要爬取一个问题的6个信息: ...
爬取知乎热榜标题和连接（python，requests，xpath）
用python爬取知乎的热榜,获取标题和链接. 环境和方法:ubantu16.04.python3.requests.xpath 1.用浏览器打开知乎,并登录 2.获取cookie和User—Agen ...
scrapy 爬取知乎问题、答案，并异步写入数据库（mysql）
python版本 python2.7 爬取知乎流程: 一 .分析在访问知乎首页的时候(https://www.zhihu.com),在没有登录的情况下,会进行重定向到(https://www. ...

随机推荐

在服务器中使用 Entity Framework 的 Migration 更新数据库
在开发环境中,每次我们对要对数据库进行更改,比如增加修改表字段等.改好Entity类后,我们只需在Nuget程序包管理控制台运行 update-database 脚本却可: update-databa ...
Alpha - Postmortem
Alpha - Postmortem NewTeam 2017/11/18 目录设想和目标计划资源变更管理设计/实现测试/发布团队角色.管理.合作总结设想和目标返回目录 1. 软件 ...
udp 局域网群聊
UDP: 无连接协议 udp协议发送数据,用的是数据报包的形式.(64KB以内) 发送端: 1.定义发送的datagramsocket对象,发送端可以不用定义端口 2.定义封装数据包datag ...
【BioCode】将多个蛋白质序列分成单个的txt文档
代码说明: fasta格式的蛋白质序列,一个txt里面有很多蛋白质序列,计算ss.pssm或disorder score时候都需要单条计算,需要分开. 分割前: 分割后: show you the c ...
MongoDb企业应用实战(一) 写在MongoDb应用介绍之前(i)
故事背景: 本人有幸,经老友( 现为x知名快递公司技术总监 ) 推荐进入中国前三大民营快递公司之一工作,在此非常感谢他,在此也非常感谢我在第一家公司帮助我进步的兄弟(我在时的项目经理,现为 x 知名 ...
修改表中的enum字段
alter table 表名 modify 字段名 enum('system','audit','account','secadmin') DEFAULT NULL;
【CF666E】Forensic Examination（后缀自动机，线段树合并）
[CF666E]Forensic Examination(后缀自动机,线段树合并) 题面洛谷 CF 翻译: 给定一个串\(S\)和若干个串\(T_i\) 每次询问\(S[pl..pr]\)在\(T_ ...
bzoj3306: 树（dfs序+倍增+线段树）
比较傻逼的一道题... 显然求子树最小值就是求出dfs序用线段树维护嘛换根的时候树的形态不会改变,所以我们可以根据相对于根的位置分类讨论. 如果询问的x是根就直接输出整棵树的最小值. 如果询问的x是 ...
洛谷 P1924 poj 1038
Description: 给你一个n * m的方格纸,有一些格子无法被覆盖,然后用2*3的格子覆盖这个方格纸,问你最多能放多少个格子神级状压为了弄清楚这道题翻了无数篇解题报告,最后终于搞明白了用 ...
扶苏的bitset浅谈
bitset作为C++一个非常好用的STL,在一些题目中巧妙地使用会产生非常不错的效果.今天扶苏来分享一点bitset的基础语法和应用本文同步发布于个人其他博客,同时作为P3674题解发布. 本文感 ...

爬取知乎话题async使用协程

爬取知乎话题async使用协程的更多相关文章

随机推荐

热门专题