Python爬虫学习笔记之爬取新浪微博

 import requests

 from urllib.parse import urlencode

 from pyquery import PyQuery as pq

 from pymongo import MongoClient

 base_url = 'https://m.weibo.cn/api/container/getIndex?'

 headers = {

     'Host': 'm.weibo.cn',

     'Referer': 'https://m.weibo.cn/u/2803301701',

     'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.75 Safari/537.36',

     'X-Requested-With': 'XMLHttpRequest',

 }

 client = MongoClient()

 db = client['weibo']

 collection = db['weibo']

 max_page = 10

 def get_page(page):

     params = {

         'type': 'uid',

         'value': '',

         'containerid': '',

         'page': page

     }

     url = base_url + urlencode(params)

     try:

         response = requests.get(url, headers=headers)

         if response.status_code == 200:

             return response.json(), page

     except requests.ConnectionError as e:

         print('Error', e.args)

 def parse_page(json, page: int):

     if json:

         items = json.get('data').get('cards')

         for index, item in enumerate(items):

             if page == 1 and index == 1:

                 continue

             else:

                 item = item.get('mblog')

                 weibo = {}

                 weibo['id'] = item.get('id')

                 weibo['text'] = pq(item.get('text')).text()

                 weibo['attitudes'] = item.get('attitudes_count')

                 weibo['comments'] = item.get('comments_count')

                 weibo['reposts'] = item.get('reposts_count')

                 yield weibo

 # def save_to_mongo(result):

     # if collection.insert(result):

         # print('Saved to Mongo')

 if __name__ == '__main__':

     for page in range(1, max_page + 1):

         json = get_page(page)

         results = parse_page(*json)

         for result in results:

             print(result)

             # save_to_mongo(result)

运行结果:

Python爬虫学习笔记之爬取新浪微博的更多相关文章

python爬虫学习01--电子书爬取
python爬虫学习01--电子书爬取 1.获取网页信息 import requests #导入requests库 ''' 获取网页信息 ''' if __name__ == '__main__': ...
Python爬虫学习之正则表达式爬取个人博客
实例需求:运用python语言爬取http://www.eastmountyxz.com/个人博客的基本信息,包括网页标题,网页所有图片的url,网页文章的url.标题以及摘要. 实例环境:pytho ...
Python爬虫学习笔记之抓取猫眼的排行榜
代码: import json import requests from requests.exceptions import RequestException import re import ti ...
Python爬虫学习笔记之爬今日头条的街拍图片
代码: import requests import os from hashlib import md5 from urllib.parse import urlencode from multip ...
python爬虫:了解JS加密爬取网易云音乐
python爬虫:了解JS加密爬取网易云音乐前言大家好,我是"持之以恒_liu",之所以起这个名字,就是希望我自己无论做什么事,只要一开始选择了,那么就要坚持到底,不管结果如何 ...
Python爬虫：为什么你爬取不到网页数据
前言: 之前小编写了一篇关于爬虫为什么爬取不到数据文章(文章链接为:Python爬虫经常爬不到数据,或许你可以看一下小编的这篇文章), 但是当时小编也是胡乱编写的,其实里面有很多问题的,现在小编重新发 ...
Python爬虫实战二之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 前言亲爱的们,教程比较旧了,百度贴吧页面可能改版,可能代码不 ...
Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
转 Python爬虫实战二之爬取百度贴吧帖子
静觅 » Python爬虫实战二之爬取百度贴吧帖子大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标 ...

随机推荐

TCD产品技术参考资料
1.Willis环 https://en.wikipedia.org/wiki/Circle_of_Willis 2.TCD仿真软件 http://www.transcranial.com/index ...
反向代理服务器——nginx
一.概述先来看百度百科的介绍: Nginx是一款轻量级的Web 服务器/反向代理服务器及电子邮件(IMAP/POP3)代理服务器,并在一个BSD-like 协议下发行.其特点是占有内存少,并发能力强 ...
WPF中的ControlTemplate(控件模板)
原文:WPF中的ControlTemplate(控件模板) WPF中的ControlTemplate(控件模板) ...
DDR分析与布线要求
基本知识 Double Data Rate Synchronous Dynamic Random Access Memory 简称 DDR SDRAM 双倍数据率同步动态随机存取内存 DDR SDRA ...
innodb_index_stats
mysql> select * from mysql.innodb_index_stats WHERE database_name='test' and table_name='recordsI ...
qt 编译unresolved external symbol的错误解决
题外问题:.rc文件报错,里面引用的.h文件打不开. 方法:rc文件移除,然后重新添加就可以: unresolved external symbol的原因: 1.没有添加编译生成的moc文件,添加对应 ...
Jmeter学习（三）
Apache JMeter是Apache组织开发的基于Java的压力测试工具.用于对软件做压力测试,它最初被设计用于Web应用测试,但后来扩展到其他测试.(来自百度) jmeter的特点: 开源免费. ...
「日常训练」 Mike and Fun (CFR305D2B)
题意(CodeForces 548B) 每次对01矩阵中的一位取反,问每次操作后,单列中最长连续1的长度. 分析非常非常简单,但是我当时训练的时候WA了四次...无力吐槽了,人间不值得.jpg 代 ...
再见NullPointerException。在Kotlin里null的处理（KAD 19）
作者:Antonio Leiva 时间:Apr 4, 2017 原文链接:https://antonioleiva.com/nullity-kotlin/ 关于Kotlin最重要的部分之一:无效处理, ...
HDFS伪分布式
(一).HDFS shell操作以上已经介绍了如何搭建伪分布式的Hadoop,既然环境已经搭建起来了,那要怎么去操作呢?这就是本节将要介绍的内容: HDFS自带有一些shell命令,通过这些命令我们 ...

Python爬虫学习笔记之爬取新浪微博

Python爬虫学习笔记之爬取新浪微博的更多相关文章

随机推荐

热门专题