Python爬虫学习笔记之爬取新浪微博

 import requests

 from urllib.parse import urlencode

 from pyquery import PyQuery as pq

 from pymongo import MongoClient

 base_url = 'https://m.weibo.cn/api/container/getIndex?'

 headers = {

     'Host': 'm.weibo.cn',

     'Referer': 'https://m.weibo.cn/u/2803301701',

     'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.75 Safari/537.36',

     'X-Requested-With': 'XMLHttpRequest',

 }

 client = MongoClient()

 db = client['weibo']

 collection = db['weibo']

 max_page = 10

 def get_page(page):

     params = {

         'type': 'uid',

         'value': '',

         'containerid': '',

         'page': page

     }

     url = base_url + urlencode(params)

     try:

         response = requests.get(url, headers=headers)

         if response.status_code == 200:

             return response.json(), page

     except requests.ConnectionError as e:

         print('Error', e.args)

 def parse_page(json, page: int):

     if json:

         items = json.get('data').get('cards')

         for index, item in enumerate(items):

             if page == 1 and index == 1:

                 continue

             else:

                 item = item.get('mblog')

                 weibo = {}

                 weibo['id'] = item.get('id')

                 weibo['text'] = pq(item.get('text')).text()

                 weibo['attitudes'] = item.get('attitudes_count')

                 weibo['comments'] = item.get('comments_count')

                 weibo['reposts'] = item.get('reposts_count')

                 yield weibo

 # def save_to_mongo(result):

     # if collection.insert(result):

         # print('Saved to Mongo')

 if __name__ == '__main__':

     for page in range(1, max_page + 1):

         json = get_page(page)

         results = parse_page(*json)

         for result in results:

             print(result)

             # save_to_mongo(result)

运行结果:

Python爬虫学习笔记之爬取新浪微博的更多相关文章

python爬虫学习01--电子书爬取
python爬虫学习01--电子书爬取 1.获取网页信息 import requests #导入requests库 ''' 获取网页信息 ''' if __name__ == '__main__': ...
Python爬虫学习之正则表达式爬取个人博客
实例需求:运用python语言爬取http://www.eastmountyxz.com/个人博客的基本信息,包括网页标题,网页所有图片的url,网页文章的url.标题以及摘要. 实例环境:pytho ...
Python爬虫学习笔记之抓取猫眼的排行榜
代码: import json import requests from requests.exceptions import RequestException import re import ti ...
Python爬虫学习笔记之爬今日头条的街拍图片
代码: import requests import os from hashlib import md5 from urllib.parse import urlencode from multip ...
python爬虫:了解JS加密爬取网易云音乐
python爬虫:了解JS加密爬取网易云音乐前言大家好,我是"持之以恒_liu",之所以起这个名字,就是希望我自己无论做什么事,只要一开始选择了,那么就要坚持到底,不管结果如何 ...
Python爬虫：为什么你爬取不到网页数据
前言: 之前小编写了一篇关于爬虫为什么爬取不到数据文章(文章链接为:Python爬虫经常爬不到数据,或许你可以看一下小编的这篇文章), 但是当时小编也是胡乱编写的,其实里面有很多问题的,现在小编重新发 ...
Python爬虫实战二之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 前言亲爱的们,教程比较旧了,百度贴吧页面可能改版,可能代码不 ...
Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
转 Python爬虫实战二之爬取百度贴吧帖子
静觅 » Python爬虫实战二之爬取百度贴吧帖子大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标 ...

随机推荐

R语言学习笔记（九）：fivenum（）与quantile（）
fivenum() fivenum(x, na.rm = TRUE) x 为数值型向量,可以包含NA以及Inf,-Inf na.rm = TRUE 默认将NA和NaN去除,但是Inf还保留. five ...
spring boot打包问题
java.lang.IllegalArgumentException: No auto configuration classes found in META-INF/spring.factories ...
4 echo服务器
收到数据,给别人原封不动返回 #4. 将接收到的数据再发送给对方 udpSocket.sendto(recvData[0], recvData[1]) #coding=utf-8 from soc ...
webapi到处excel
最近项目用的webapi前几天做了个导出excel功能,给大家分享下,自己也记录下... 在用的过程中,可以直接请求就可以得到下载的excel文件,在实际的项目中可以通过js打开新页面,encodeU ...
Python 3基础教程18-获取用户键盘输入
有时候,我们需要获取用户的键盘输入的信息,然后得到信息,拿去做一些事情. 请看下面的demo.py # 练习如何通过键盘获取用户输入 x = input('What is your name?') p ...
Python简要标准库（3）
shelve 若只需要一个简单的存储方案,那么shelve模块可以满足你大部分的需要,你所需要的只是为它提供文件名.shelve中唯一有趣的函数是open,在调用的时候他会返回一个Shelf对象注意 ...
JVM 什么时候会触发FGC
1:System.gc(); 2:老年代满了没啥好说的从年轻代去往老年代的 3:JDK7或JDK6中永久区满了得看是否还会有分配,如果没有就不会进行FGC,不过CMS GC下会看到不停地CMS G ...
Python 3 学习笔记之——基础语法
1. a, b = a, a + b 先计算右边表达式,然后再同时赋值给左边. 2. 条件控制和循环语句条件控制 if condition_1: statement_block_1 elif con ...
Codeforces Round #326 Div.1 C.Duff in the Army 树上倍增
题意概述: 给出一棵N个结点的树,然后有M个居民分散在这棵树的结点上(允许某个结点没有居民).现在给出一些询问形如u,v,a,定义k=min(x,a),其中x表示的是u->v路径上的居民数量.将 ...
BFS实现模板
以如下图的无向图G4为例,进行图的深度优先搜索: 假设从顶点v1出发进行搜索,首先访问v1和v1的邻接点v2和v3,然后依次访问v2的邻接点v4和v5及v3的邻接点v6和v7,最后访问v4的邻接点v8 ...

Python爬虫学习笔记之爬取新浪微博

Python爬虫学习笔记之爬取新浪微博的更多相关文章

随机推荐

热门专题