第二个爬虫之爬取知乎用户回答和文章并将所有内容保存到txt文件中

自从这两天开始学爬虫，就一直想做个爬虫爬知乎。于是就开始动手了。

知乎用户动态采取的是动态加载的方式，也就是先加载一部分的动态，要一直滑道底才会加载另一部分的动态。要爬取全部的动态，就得先获取全部的url。

我先找到了第一条url:

https://www.zhihu.com/api/v4/members/***************************/activities?limit=7&session_id=************************&after_id=*************&desktop=True

为了不泄露别人的隐私。涉及到用户信息部分我都用*来代替。

通过几个url的比对，我找到个关键的信息after_id。

这个after_id是一串n位的数字，刚开始我以为每条url之间的after_id都是有规律的，但对比了几条url之后我发现这个数字完全没有规律。那没有规律的话该怎么找出下一个url呢？

情急之下我想到一个办法，我发现after_id前几位是不变的，一直改变的是后六位数字。于是我想到，能不能遍历十万个数，每次after_id加一，这样就能找出所有的url了。

这不太可行。

冷静下来我开始分析url。打开url之后我发现回复的json数据里有一个键值‘next’，里面放的就是下一次请求的url。只要不断提取next的值，就能拿到所有的url。于是我想到了递归的方法。难点解决了，剩下的其实很快就可以完成。下面的源码：

import re

import os

import requests

import urllib

import json

allUrl=[]       #全局数组，用来保存该用户所有的动态的url

def getUrl(url):    #递归获取用户所有的动态url

    nextUrl=urllib.request.urlopen(url)

    nextUrl=json.loads(nextUrl.read())

    key=nextUrl['paging']

    if 'next' in key:   #假如还没到底

        nextUrl=nextUrl['paging']['next']

        allUrl.append(nextUrl)

        #print(nextUrl)

        getUrl(nextUrl)

    else:      #已经到底，停止递归

        print('成功获取所有url！')

        return    

def getArticle():     #获取文章，并将文章存入文本文件中

    a=''

    cnt=0

    for line in allUrl:

        t=urllib.request.urlopen(line)

        t=json.loads(t.read())

        t=t['data']

        try:    #异常处理，由于未知原因，爬取某个url时会出现找不到json数据里的content键，导致报错

            for k in t:    #提取单个url内所有文章

                k1=k['target']['content']

                k1=re.sub('.*?</figure>','\r\n\r\n',k1)

                k1=k1.replace('</p><p>','\r\n    ')

                k1=k1.replace('</p>','\r\n')

                k1=k1.replace('<p>','')

                k1=k1.replace('<br>','')

                cnt=cnt+1

                a=a+k1

                print('第'+str(cnt)+'个动态爬取成功')

        except KeyError:

            print('发生错误，此时的url为'+str(line))    

    file=open('D:/bbb.txt','w',encoding='gb18030',errors='ignore')  #将内容写入文本，字符编码要与浏览器一致，否则会报错。

    file.write(a)

    file.close()        

getUrl(url)     #参数是第一个url

getArticle()

第二个爬虫之爬取知乎用户回答和文章并将所有内容保存到txt文件中的更多相关文章

爬虫-----爬取所有国家的首都、面积，并保存到txt文件中
# -*- coding:utf-8 -*- import urllib2import lxml.htmlfrom lxml import etree def main(): file = open( ...
[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
利用 Scrapy 爬取知乎用户信息
思路:通过获取知乎某个大V的关注列表和被关注列表,查看该大V和其关注用户和被关注用户的详细信息,然后通过层层递归调用,实现获取关注用户和被关注用户的关注列表和被关注列表,最终实现获取大量用户信息. 一 ...
Srapy 爬取知乎用户信息
今天用scrapy框架爬取一下所有知乎用户的信息.道理很简单,找一个知乎大V(就是粉丝和关注量都很多的那种),找到他的粉丝和他关注的人的信息,然后分别再找这些人的粉丝和关注的人的信息,层层递进,这样下 ...
用python+selenium抓取微博24小时热门话题的前15个并保存到txt中
抓取微博24小时热门话题的前15个,抓取的内容请保存至txt文件中,需要抓取排行.话题和阅读数 #coding=utf-8 from selenium import webdriver import ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
Scrapy爬虫笔记 - 爬取知乎
cookie是一种本地存储机制,cookie是存储在本地的 session其实就是将用户信息用户名.密码等)加密成一串字符串,返回给浏览器,以后浏览器每次请求都带着这个sessionId 状态码一般是 ...
爬虫（十六）：scrapy爬取知乎用户信息
一:爬取思路首先我们应该找到一个账号,这个账号被关注的人和关注的人都相对比较多的,就是下图中金字塔顶端的人,然后通过爬取这个账号的信息后,再爬取他关注的人和被关注的人的账号信息,然后爬取被关注人的账 ...
Python 爬取生成中文词云以爬取知乎用户属性为例
代码如下: # -*- coding:utf-8 -*- import requests import pandas as pd import time import matplotlib.pyplo ...

随机推荐

Java开发环境不再需要配置classpath！
前言: 之前发布了关于java开发环境配置的文章,经过与网友的交流,我了解到在jdk1.5以后,java开发环境配置的时候,确实不需要对classpath进行配置,但市面上的书籍,以及一些博客.还是老 ...
nginx+uwsgi02---django部署（不推荐）
1.文件结构 myweb/ ├── manage.py ├── myweb/ │ ├── __init__.py │ ├── settings.py │ ├── urls.py │ └── wsgi. ...
【洛谷】P4883 mzf的考验
[洛谷]P4883 mzf的考验最近忽然放弃治疗开始随机跳题了感觉还行就是必须吸氧感觉有点糟糕... 这题翻转和求和都是平衡树基本操作,那个异或可以通过维护树中\(2\)进制下第\(2^{i}\ ...
手机网站支付如何接入支付宝简易版支付功能PHP版
接入支付宝准备工作:(关于账号可以是个体商户也可以是企业账号但必须有营业执照) 1.登录蚂蚁金服开放平台 2.创建应用,应用分类网页应用和移动应用.应用提交审核审核通过后得到Appid才能调用相应的 ...
selenium (二)
文件上传: 对于通过input标签实现的上传功能,可以将其看作是一个输入框,即通过send_keys()指定本地文件路径的方式实现文件上传创建upfile.html文件,代码如下: <html ...
opencv实现人脸识别（五）运用tkinter进行GUI绘制整合人脸识别模块
因为之前学习过tkinter库,所以在学习了人脸识别模块的编写后, 打算绘制一个简单的GUI来应用人脸识别功能. 主界面如下所示: 签到打开在点开后直接进行人脸识别,如果成功则自动关闭视频窗口. 录入 ...
【转】iis7下站点日志默认位置
本文转自:http://www.cnblogs.com/mincyw/p/3425468.html 在iis6时,通过iis管理器的日志配置可以找到站点日志存储的位置. 但是在iis7下,iis管理器 ...
有趣的后渗透工具 Koadic
koadic是DEFCON黑客大会上分享出来的的一个后渗透工具,虽然和msf有些相似,但是Koadic主要是通过使用Windows ScriptHost(也称为JScript / VBScript)进 ...
Java集合--Hash、Hash冲突
一.Hash 散列表(Hash table,也叫哈希表),是根据键(Key)而直接访问在内存存储位置的数据结构.也就是说,它通过计算一个关于键值的函数,将所需查询的数据映射到表中一个位置来访问记录,这 ...
Cache的一些总结
输出缓存这是最简单的缓存类型,它保存发送到客户端的页面副本,当下一个客户端发送相同的页面请求时,此页面不会重新生成(在缓存有限期内),而是从缓存中获取该页面:当然由于缓存过期或被回收,这时页面会重新 ...

第二个爬虫之爬取知乎用户回答和文章并将所有内容保存到txt文件中

第二个爬虫之爬取知乎用户回答和文章并将所有内容保存到txt文件中的更多相关文章

随机推荐

热门专题