Python爬虫爬取贴吧的帖子内容

最近在看一个大神的博客，从他那里学会了很多关于python爬虫的知识，其实python如果想用在实际应用中，你需要了解许多，比如正则表达式、引入库、过滤字段等等，下面不多说，我下面的程序是爬取Ubuntu吧的一个帖子，要是问我为什么选择Ubuntu吧，没为什么，win、mac、linux我都用，但毫无疑问，我最喜欢的系统就是ubuntu linux，这个系统让我学会了很多东西，从基本命令到shell编程等等，这个系统让我深入了解了操作系统，也让我对操作系统的概念有了进一步的学习和了解，ok，下面就是我的代码，作为参考：

#coding=utf-8

# __author__ = 'Abel'

import urllib

import urllib2

import re

#处理页面标签类

class Tool:

    #去除img标签,7位长空格

    removeImg = re.compile('<img.*?>| {7}|')

    #删除超链接标签

    removeAddr = re.compile('<a.*?>|</a>')

    #把换行的标签换为\n

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    #将表格制表<td>替换为\t

    replaceTD= re.compile('<td>')

    #把段落开头换为\n加空两格

    replacePara = re.compile('<p.*?>')

    #将换行符或双换行符替换为\n

    replaceBR = re.compile('<br><br>|<br>')

    #将其余标签剔除

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removeImg,"",x)

        x = re.sub(self.removeAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n    ",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        #strip()将前后多余内容删除

        return x.strip()

#百度贴吧爬虫类

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self,baseUrl,seeLZ,floorTag):

        #base链接地址

        self.baseURL = baseUrl

        #是否只看楼主

        self.seeLZ = '?see_lz='+str(seeLZ)

        #HTML标签剔除工具类对象

        self.tool = Tool()

        #全局file变量，文件写入操作对象

        self.file = None

        #楼层标号，初始为1

        self.floor = 1

        #默认的标题，如果没有成功获取到标题的话则会用这个标题

        self.defaultTitle = u"百度贴吧"

        #是否写入楼分隔符的标记

        self.floorTag = floorTag

    #传入页码，获取该页帖子的代码

    def getPage(self,pageNum):

        try:

            #构建URL

            url = self.baseURL+ self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            #返回UTF-8格式编码内容

            return response.read().decode('utf-8')

        #无法连接，报错

        except urllib2.URLError, e:

            if hasattr(e,"reason"):

                print u"连接百度贴吧失败,错误原因",e.reason

                return None

    #获取帖子标题

    def getTitle(self,page):

        #得到标题的正则表达式

        pattern = re.compile('<h1 class="core_title_txt.*?>(.*?)</h1>',re.S)

        result = re.search(pattern,page)

        if result:

            #如果存在，则返回标题

            return result.group(1).strip()

        else:

            return None

    #获取帖子一共有多少页

    def getPageNum(self,page):

        #获取帖子页数的正则表达式

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>',re.S)

        result = re.search(pattern,page)

        if result:

            return result.group(1).strip()

        else:

            return None

    #获取每一层楼的内容,传入页面内容

    def getContent(self,page):

        #匹配所有楼层的内容

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        contents = []

        for item in items:

            #将文本进行去除标签处理，同时在前后加入换行符

            content = "\n"+self.tool.replace(item)+"\n"

            contents.append(content.encode('utf-8'))

        return contents

    def setFileTitle(self,title):

        #如果标题不是为None，即成功获取到标题

        if title is not None:

            self.file = open(title + ".txt","w+")

        else:

            self.file = open(self.defaultTitle + ".txt","w+")

    def writeData(self,contents):

        #向文件写入每一楼的信息

        for item in contents:

            if self.floorTag == '':

                #楼之间的分隔符

                floorLine = "\n" + str(self.floor) + u"-----------------------------------------------------------------------------------------\n"

                self.file.write(floorLine)

            self.file.write(item)

            self.floor += 1

    def start(self):

        indexPage = self.getPage(1)

        pageNum = self.getPageNum(indexPage)

        title = self.getTitle(indexPage)

        self.setFileTitle(title)

        if pageNum == None:

            print "URL已失效，请重试"

            return

        try:

            print "该帖子共有" + str(pageNum) + "页"

            for i in range(1,int(pageNum)+1):

                print "正在写入第" + str(i) + "页数据"

                page = self.getPage(i)

                contents = self.getContent(page)

                self.writeData(contents)

        #出现写入异常

        except IOError,e:

            print "写入异常，原因" + e.message

        finally:

            print "写入任务完成"

print u"请输入帖子代号"

baseURL = 'http://tieba.baidu.com/p/3560761301' + str(raw_input(u'http://tieba.baidu.com/p/3560761301'))

seeLZ = raw_input("是否只获取楼主发言，是输入1，否输入0\n")

floorTag = raw_input("是否写入楼层信息，是输入1，否输入0\n")

bdtb = BDTB(baseURL,seeLZ,floorTag)

bdtb.start()

程序运行结果：

然后打开工程文件里生成的ubuntu.txt文件，爬取的内容如下:

是不是很神奇，反正我是感觉很神奇:-)

Python爬虫爬取贴吧的帖子内容的更多相关文章

Python爬虫-爬取百度贴吧帖子
这次主要学习了替换各种标签,规范格式的方法.依然参考博主崔庆才的博客. 1.获取url 某一帖子:https://tieba.baidu.com/p/3138733512?see_lz=1&p ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
Python爬虫爬取搜狗搜索到的内容页面
废话不多说,直接上代码 import requests def main(): url='https://www.sogou.com/web' headers={ 'User_Agent':'Mozi ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...

随机推荐

CentOS7安装mongodb
1.下载mongodb的*.tar.gz安装包 2.移到centos7中并解压 tar -xzvf mongodb.tar.gz 3.配置环境变量 vim /etc/profile 添加如下内容: # ...
Sqoop安装与应用过程
1. 参考说明参考文档: http://sqoop.apache.org/ http://sqoop.apache.org/docs/1.99.7/admin/Installation.html ...
ActiveReports 区域报表中的事件介绍
1.仅触发一次的事件以下是在报表的处理过程中仅触发一次的所有事件这些事件在报表的处理周期中仅在最开始和结束前触发一次. ReportStart 该事件在DataInitialize事件触发之前发生. ...
Origin绘制双Y轴图的方法
1.已有数据绘图如下,其中网络流量的单位是M Bytes/s,与另外两组数据的单位(时间)不同,现在要为其添加右侧Y轴. 2.首先选中该图像,找到工具条,点击第三个按钮“Add Right-Y Lay ...
【Python】opencv显示图像
import cv2 img = cv2.imread("lena.jpg") cv2.namedWindow("Image") cv2.imshow(&quo ...
sklearn——数据集调用及应用
忙了许久,总算是又想起这边还没写完呢. 那今天就写写sklearn库的一部分简单内容吧,包括数据集调用,聚类,轮廓系数等等. 自带数据集API 数据集函数中文翻译任务类型数据规模 load_ ...
[Spark Core] 在 Spark 集群上运行程序
0. 说明将 IDEA 下的项目导出为 Jar 包,部署到 Spark 集群上运行. 1. 打包程序 1.0 前提搭建好 Spark 集群,完成代码的编写. 1.1 修改代码 [添加内容,判断参数 ...
Linux nmap命令详解
nmap,也就是Network Mapper,是Linux下的网络扫描和嗅探工具包. nmap是在网络安全渗透测试中经常会用到的强大的扫描器.功能之强大,不言而喻.下面介绍一下它的几种扫描命令.具体的 ...
Linux搭建kafka
一.安装Java 1.查看linux 的系统版本 root@aliyun:~# uname --m x86_64 2.安装java mkdir -p /usr/local/java tar -xf j ...
某某D的手伸的实在太长了,路由器也未能幸免,致被阉割的TP-Link
前段时间整了个服务器架上l2tp.server, TP-Link路由连上去后,全网走l2tp通道,而且不能配置相关的路由表然后研究啊找啊查啊,确定是路由没有这功能找客服问了一下,他一听就懂了, ...

Python爬虫爬取贴吧的帖子内容

Python爬虫爬取贴吧的帖子内容的更多相关文章

随机推荐

热门专题