Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计

要求编写的程序可获取任一贴吧页面中的帖子链接，并爬取贴子中用户发表的图片，在此过程中使用user agent 伪装和轮换，解决爬虫ip被目标网站封禁的问题。熟悉掌握基本的网页和url分析，同时能灵活使用Xmind工具对Python爬虫程序（网络爬虫）流程图进行分析。

一、项目分析

1. 网页分析

贴吧页面简洁，所有内容让人一目了然，使用起来也较其他社区论坛简单，注册简单甚至可以不注册，发帖简单。但栏目创建得参差不齐，内容千奇百怪。

2. url分析

分析贴吧中，贴子链接的拼接构成形态，在程序中将贴子链接重构。

如本例实验，经过多次进入不同贴吧可知，贴吧的链接组成为：fullurl=url+key。其中fullurl表示贴吧总链接

url为贴吧链接的共同体：https://tieba.baidu.com/f?

key为经过urlencode编码的贴吧中文名

使用xpath_helper_2_0_2.crx浏览器插件，可将贴子的链接入口归结为：

“//li/div[@class="t_con cleafix"]/div/div/div/a/@href”，贴子中用户发表的图片链接表达式为：“//img ··[@class="BDE_Image"]/@src”

二、项目工具

Python 3.7.1 、 JetBrains PyCharm 2018.3.2

三、项目过程

（一）使用Xmind工具对Python爬虫程序（网络爬虫）流程图进行分析，绘制如图4-1所示的程序逻辑框架图

图4-1 程序逻辑框架图

（二）爬虫程序调试过程BUG描述（截图）

（三）爬虫运行结果

（四）项目心得

关于本例实验心得可总结如下：

1、当程序运行结果提示错误为：ModuleNotFoundError: No module named 'lxml'，最好的解决方法是：首先排除是否lxml是否安装，再检查lxml是否被导入。本实验中，是由于工程项目为能成功导入lxml，解决方法如图5-1所示，在“Project Interperter”中选择python安装目录，即可。

图5-1 错误解决过程

2、有的时候要模拟浏览器，不然做过反爬虫的网站会知道你是robot

例如针对浏览器的限制我们可以设置User-Agent头部，针对防盗链限制，我们可以设置Referer头部有的网站用了Cookie来限制，主要是涉及到登录和限流，这时候没有什么通用的方法，只能看能否做自动登录或者分析Cookie的问题了。

3、我们第一步可以在主界面的html代码中抽取出这些套图起始的链接地址，这里显然需要用到正则来提取这些不同地址。那么，有了每个套图的起始地址之后，我们进入到子页面，刷新网页，观察它的加载流程。

四、项目源码

tieba-pic.py

from urllib import  request,parse

import ssl

import random

import time

from lxml import  etree

ua_list=[

    'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36',

    'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.1; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; .NET4.0E)',

    'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:45.0) Gecko/20100101 Firefox/45.0'

]

def loadPage(url):

    userAgent=random.choice(ua_list)

    headers={"User-Agent":userAgent}

    req =request.Request(url,headers=headers)

    context=ssl._create_unverified_context()

    response=request.urlopen(req,context=context)

    html=response.read()

    content=etree.HTML(html)

    link_list=content.xpath('//li/div[@class="t_con cleafix"]/div/div/div/a/@href')

    for link in link_list:

        fullurl='http://tieba.baidu.com'+link

        print(fullurl)

        loadImge(fullurl)

def loadImge(url):

    req = request.Request(url)

    context = ssl._create_unverified_context()

    response = request.urlopen(req, context=context)

    html = response.read()

    content = etree.HTML(html)

    link_list = content.xpath('//img[@class="BDE_Image"]/@src')

    for link in link_list:

        print(link)

        writeImge(link)

def writeImge(url):

    req = request.Request(url)

    context = ssl._create_unverified_context()

    response = request.urlopen(req, context=context)

    image = response.read()

    filename=url[-12:]

    f=open(filename,'wb')

    f.write(image)

    f.close()

def tiebaSpider(url,beginPage,endPage):

    for page in range(beginPage,endPage+100):

        pn=(page-1)*50

        fullurl=url+"&pn="+str(pn)

        loadPage(fullurl)

if __name__=="__main__":

    print("测试成功！")

    kw=input("请输入要爬的贴吧名：")

    beginPage=int(input("请输入开始页："))

    endPage = int(input("请输入结束页："))

    url="http://tieba.baidu.com/f?"

    key=parse.urlencode({"kw":kw})

    fullurl=url+key

    tiebaSpider(fullurl,beginPage,endPage)

Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计的更多相关文章

Scrapy项目 - 源码工程 - 实现豆瓣 Top250 电影信息爬取的爬虫设计
一.项目目录结构 spiders文件夹内包含doubanSpider.py文件,对于项目的构建以及结构逻辑,详见环境搭建篇. 二.项目源码 1.doubanSpider.py # -*- coding ...
Scrapy项目 - 数据简析 - 实现豆瓣 Top250 电影信息爬取的爬虫设计
一.数据分析截图(weka数据分析截图 ) 本例实验,使用Weka 3.7对豆瓣电影网页上所罗列的上映电影信息,如:标题.主要信息(年份.国家.类型)和评分等的信息进行数据分析,Weka 3.7数据分 ...
Scrapy项目 - 数据简析 - 实现斗鱼直播网站信息爬取的爬虫设计
一.数据分析截图(weka数据分析截图 2-3个图,作业文字描述) 本次将所爬取的数据信息,如:房间数,直播类别和人气,导入Weka 3.7工具进行数据分析.有关本次的数据分析详情详见下图所示: ...
Scrapy项目 - 实现腾讯网站社会招聘信息爬取的爬虫设计
通过使Scrapy框架,进行数据挖掘和对web站点页面提取结构化数据,掌握如何使用Twisted异步网络框架来处理网络通讯的问题,可以加快我们的下载速度,也可深入接触各种中间件接口,灵活的完成各种需求 ...
Scrapy项目 - 实现豆瓣 Top250 电影信息爬取的爬虫设计
通过使Scrapy框架,掌握如何使用Twisted异步网络框架来处理网络通讯的问题,进行数据挖掘和对web站点页面提取结构化数据,可以加快我们的下载速度,也可深入接触各种中间件接口,灵活的完成各种需求 ...
Scrapy项目 - 实现斗鱼直播网站信息爬取的爬虫设计
要求编写的程序可爬取斗鱼直播网站上的直播信息,如:房间数,直播类别和人气等.熟悉掌握基本的网页和url分析,同时能灵活使用Xmind工具对Python爬虫程序(网络爬虫)流程图进行分析. 一.项目 ...
Scrapy项目 - 数据简析 - 实现腾讯网站社会招聘信息爬取的爬虫设计
一.数据分析截图本例实验,使用Weka 3.7对腾讯招聘官网中网页上所罗列的招聘信息,如:其中的职位名称.链接.职位类别.人数.地点和发布时间等信息进行数据分析,详见如下图: 图1-1 Weka ...
Scrapy项目 - 项目源码 - 实现腾讯网站社会招聘信息爬取的爬虫设计
1.tencentSpider.py # -*- coding: utf-8 -*- import scrapy from Tencent.items import TencentItem #创建爬虫 ...
Python爬虫实例（一）爬取百度贴吧帖子中的图片
程序功能说明:爬取百度贴吧帖子中的图片,用户输入贴吧名称和要爬取的起始和终止页数即可进行爬取. 思路分析: 一.指定贴吧url的获取例如我们进入秦时明月吧,提取并分析其有效url如下 http:// ...

随机推荐

thinkPHP中的文章详情页实现“上一篇下一篇”功能经验分享
前段时间在公司中接触到了用thinkPHP搭建的项目,其中涉及到了文章详情页上一篇下一篇翻页的功能实现效果. 因为刚接触这套框架和PHP,所以整理一下实现该功能的经验方法. 如果有不到位的地方,欢迎指 ...
深度解密Go语言之 scheduler
目录前置知识 os scheduler 线程切换函数调用过程分析 goroutine 是怎么工作的什么是 goroutine goroutine 和 thread 的区别 M:N 模型什么是 ...
effective java 3th item1：考虑静态工厂方法代替构造器
传统的方式获取一个类的实例,是通过提供一个 public 构造器.这里有技巧,每一个程序员应该记住.一个类可以对外提供一个 public 的静态工厂方法 ,该方法只是一个朴素的静态方法,不需要有太多 ...
SpringCloud之Feign
[前面的话]书接上文,本文的某些知识依赖我的第一篇SpringCLoud的文章:SpringCloud之Eureka,如果没有看过可以先移步去看一下.另外在微服务架构中,业务都会被拆分成一个个独立的服 ...
SyntaxError: invalid syntax ： if not 0 <= time_low < 1<<32L:
报错 Traceback (most recent call last): File "D:/PyCharm 5.0.3/WorkSpace/2.NLP/8.高阶实践/1.PipelineQ ...
E-triples II_2019牛客暑期多校训练营（第四场）
求用n个3的倍数的数按位或出数字a的方案数有多少种(0也算3的倍数) 题解若数b的每个二进制位上的1,在a中也为1,则称b为a的子集容易知道任意个a的子集按位或出来的结果还是a的子集若问题改为按 ...
poj 2763 Housewife Wind（树链剖分+单点查询+区间修改）
题目链接:http://poj.org/problem?id=2763 题意:给一个数,边之间有权值,然后两种操作,第一种:求任意两点的权值和,第二,修改树上两点的权值. 题解:简单的树链剖分. #i ...
2014 北京区域赛 dp
Matt has N friends. They are playing a game together. Each of Matt’s friends has a magic number. In ...
poj1037 [CEOI 2002]A decorative fence 题解
---恢复内容开始--- 题意: t组数据,每组数据给出n个木棒,长度由1到n,除了两端的木棒外,每一根木棒,要么比它左右的两根都长,要么比它左右的两根都短.即要求构成的排列为波浪型.对符合要求的排列 ...
vscode代码段设置console.log,转换大小写,目录别名
https://blog.csdn.net/gyz718/article/details/71513075 vscode代码段设置console.log https://blog.csdn.net/u ...

Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计

Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计的更多相关文章

随机推荐

热门专题