Python爬虫__微博某个话题的内容数据

  1 # -*- coding: utf-8 -*-

  2 # @Time : 2020/8/18 15:39

  3 # @Author : Chunfang

  4 # @Email : 3470959534@qq.com

  5 # @File : Weibo_content.py

  6 # @Software: PyCharm

  7

  8 from urllib.parse import urlencode

  9 import requests

 10 from pyquery import PyQuery as pq

 11 import time

 12 import os

 13 import csv

 14 import json

 15

 16 base_url = 'https://m.weibo.cn/api/container/getIndex?'

 17

 18 headers = {

 19     'Host': 'm.weibo.cn',

 20     'Referer': 'https://m.weibo.cn/u/2830678474',

 21     'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',

 22     'X-Requested-With': 'XMLHttpRequest',

 23 }

 24 class SaveCSV(object):

 25

 26     def save(self, keyword_list,path, item):

 27         """

 28         保存csv方法

 29         :param keyword_list: 保存文件的字段或者说是表头

 30         :param path: 保存文件路径和名字

 31         :param item: 要保存的字典对象

 32         :return:

 33         """

 34         try:

 35             # 第一次打开文件时，第一行写入表头

 36             if not os.path.exists(path):

 37                 with open(path, "w", newline='', encoding='utf-8-sig') as csvfile:  # newline='' 去除空白行

 38                     writer = csv.DictWriter(csvfile, fieldnames=keyword_list)  # 写字典的方法

 39                     writer.writeheader()  # 写表头的方法

 40

 41             # 接下来追加写入内容

 42             with open(path, "a", newline='', encoding='utf-8-sig') as csvfile:  # newline='' 一定要写，否则写入数据有空白行

 43                 writer = csv.DictWriter(csvfile, fieldnames=keyword_list)

 44                 writer.writerow(item)  # 按行写入数据

 45                 print("^_^ write success")

 46

 47         except Exception as e:

 48             print("write error==>", e)

 49             # 记录错误数据

 50             with open("error.txt", "w") as f:

 51                 f.write(json.dumps(item) + ",\n")

 52             pass

 53

 54 def get_page(page,title): #得到页面的请求，params是我们要根据网页填的，就是下图中的Query String里的参数

 55     params = {

 56         'containerid': '100103type=1&q='+title,

 57         'page': page,#page是就是当前处于第几页，是我们要实现翻页必须修改的内容。

 58         'type':'all',

 59         'queryVal':title,

 60         'featurecode':'20000320',

 61         'luicode':'10000011',

 62         'lfid':'106003type=1',

 63         'title':title

 64     }

 65     url = base_url + urlencode(params)

 66     print(url)

 67     try:

 68         response = requests.get(url, headers=headers)

 69         if response.status_code == 200:

 70             print(page)

 71             return response.json()

 72     except requests.ConnectionError as e:

 73         print('Error', e.args)

 74

 75 # 解析接口返回的json字符串

 76 def parse_page(json , label):

 77     res = []

 78     if json:

 79         items = json.get('data').get('cards')

 80         for i in items:

 81             if i == None:

 82                 continue

 83             item = i.get('mblog')

 84             if item == None:

 85                 continue

 86             weibo = {}

 87             weibo['id'] = item.get('id')

 88             weibo['label'] = label

 89             weibo['text'] = pq(item.get('text')).text().replace(" ", "").replace("\n" , "")

 90             res.append(weibo)

 91     return res

 92

 93 if __name__ == '__main__':

 94

 95     title = input("请输入搜索关键词：")

 96     path = "article.csv"

 97     item_list = ['id','text', 'label']

 98     s = SaveCSV()

 99     for page in range(10,20):#循环页面

100         try:

101             time.sleep(1)         #设置睡眠时间，防止被封号

102             json = get_page(page , title )

103             results = parse_page(json , title)

104             if requests == None:

105                 continue

106             for result in results:

107                 if result == None:

108                     continue

109                 print(result)

110                 s.save(item_list, path , result)

111         except TypeError:

112             print("完成")

113             continue

Python爬虫__微博某个话题的内容数据的更多相关文章

python爬虫Scrapy(一)-我爬了boss数据
一.概述学习python有一段时间了,最近了解了下Python的入门爬虫框架Scrapy,参考了文章Python爬虫框架Scrapy入门.本篇文章属于初学经验记录,比较简单,适合刚学习爬虫的小伙伴. ...
Python爬虫框架Scrapy实例（三）数据存储到MongoDB
Python爬虫框架Scrapy实例(三)数据存储到MongoDB任务目标:爬取豆瓣电影top250,将数据存储到MongoDB中. items.py文件复制代码# -*- coding: utf-8 ...
Python爬虫入门教程 30-100 高考派大学数据抓取 scrapy
1. 高考派大学数据----写在前面终于写到了scrapy爬虫框架了,这个框架可以说是python爬虫框架里面出镜率最高的一个了,我们接下来重点研究一下它的使用规则. 安装过程自己百度一下,就能找到 ...
【转】Python爬虫：抓取新浪新闻数据
案例一抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
Python爬虫：抓取新浪新闻数据
案例一抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
Python "爬虫"出发前的装备之二数据先行（ Requests 模块）
1. 概念爬虫不是动物,而是一种计算机程序. 这种程序有自己特定的功能,能按照使用者给定的一系列规则自行浏览万维网并获取需要的信息.此类程序被称为网络爬虫(web crawler) 或网络蜘蛛( ...
python爬虫__第一个爬虫程序
前言机缘巧合,最近在学习机器学习实战, 本来要用python来做实验和开发环境得到一个需求,要爬取大众点评中的一些商户信息, 于是开启了我的第一个爬虫的编写,里面有好多心酸,主要是第一次. 我的文 ...
python爬虫-模拟微博登录
微博模拟登录这是本次爬取的网址:https://weibo.com/ 一.请求分析找到登录的位置,填写用户名密码进行登录操作看看这次请求响应的数据是什么这是响应得到的数据,保存下来 exect ...
Python爬虫：微博粉丝列表
前言本来打算做一个关于微博粉丝列表的爬虫,可以统计一下某个微博账号的粉丝里面,僵尸粉(水军)的数量,大V数量. 结果写完爬虫才发现,现在微博只给人看粉丝列表的前5页.......哈哈,好吧.挺无奈的 ...

随机推荐

protocol 协议语言介绍
Protocol Buffer是Google提供的一种数据序列化协议,是一种轻便高效的结构化数据存储格式,可以用于结构化数据序列化,很适合做数据存储或 RPC 数据交换格式.它可用于通讯协议.数据存储 ...
String s = "Hello";s = s + " world!";这两行代码执行后，原始的String对象中的内容到底变了没有？
没有.因为String被设计成不可变(immutable)类,所以它的所有对象都是不可变对象.在这段代码中,s原先指向一个String对象,内容是 "Hello",然后我们对s进行 ...
jpg, jpeg和png区别?
jpg是jpeg的缩写, 二者一致 PNG就是为取代GIF而生的, 无损压缩, 占用内存多 jpg牺牲图片质量, 有损, 占用内存小 PNG格式可编辑.如图片中有字体等,可利用PS再 ...
Scanner几个问题与正则简介
Pre:最近做了头条的在线笔试,对Scanner输入的处理有些特殊,当时是一脸懵逼态,遂由此随笔(/@_@\),java小白,有错难免! 查了下Scanner的源码,没有头绪,但是其中用到了正则的知识 ...
解释内存中的栈(stack)、堆(heap)和方法区(method area)的用法?
通常我们定义一个基本数据类型的变量,一个对象的引用,还有就是函数调用的现场保存都使用JVM中的栈空间:而通过new关键字和构造器创建的对象则放在堆空间,堆是垃圾收集器管理的主要区域,由于现在的垃圾收集 ...
利用contextmenu事件，自定义右键
<!DOCTYPE html> <html xmlns="http://www.w3.org/1999/xhtml"> <head> <m ...
eclipse开发工具之"导入项目"
1.选择菜单栏"file""下的"import" 2.选择Maven 在选中"Existing Maven Projects",然 ...
Numpy求解线性方程组
Numpy求解线性方程组对于Ax=b,已知A和b,怎么算出x? 1. 引入包 2. 求解验证
在 VC 下清空键盘缓冲区的方法
控制台窗口是有输入缓冲区的,当你按键后程序没有来得及处理,系统会将按键缓存,等到程序获取按键的时候,系统会把缓冲区里面之前的按键返回. // 调用控制台 API,清空之前缓冲区内的所有按键. Flus ...
订单突破10000+，仅花1小时，APPx独家深入剖析背后的秘密！
拼多多:成立三年,获客三亿,月订单成交额达到恐怖的400亿,成功上市! 糕妈优选:营销活动推送1小时,订单超过10000+,商品成功刷屏朋友圈! 寻慢:一场活动净增7000+粉丝,付款转化率高达71% ...

Python爬虫__微博某个话题的内容数据

Python爬虫__微博某个话题的内容数据的更多相关文章

随机推荐

热门专题