Python爬虫爬取贴吧的帖子内容

最近在看一个大神的博客，从他那里学会了很多关于python爬虫的知识，其实python如果想用在实际应用中，你需要了解许多，比如正则表达式、引入库、过滤字段等等，下面不多说，我下面的程序是爬取Ubuntu吧的一个帖子，要是问我为什么选择Ubuntu吧，没为什么，win、mac、linux我都用，但毫无疑问，我最喜欢的系统就是ubuntu linux，这个系统让我学会了很多东西，从基本命令到shell编程等等，这个系统让我深入了解了操作系统，也让我对操作系统的概念有了进一步的学习和了解，ok，下面就是我的代码，作为参考：

#coding=utf-8

# __author__ = 'Abel'

import urllib

import urllib2

import re

#处理页面标签类

class Tool:

    #去除img标签,7位长空格

    removeImg = re.compile('<img.*?>| {7}|')

    #删除超链接标签

    removeAddr = re.compile('<a.*?>|</a>')

    #把换行的标签换为\n

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    #将表格制表<td>替换为\t

    replaceTD= re.compile('<td>')

    #把段落开头换为\n加空两格

    replacePara = re.compile('<p.*?>')

    #将换行符或双换行符替换为\n

    replaceBR = re.compile('<br><br>|<br>')

    #将其余标签剔除

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removeImg,"",x)

        x = re.sub(self.removeAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n    ",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        #strip()将前后多余内容删除

        return x.strip()

#百度贴吧爬虫类

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self,baseUrl,seeLZ,floorTag):

        #base链接地址

        self.baseURL = baseUrl

        #是否只看楼主

        self.seeLZ = '?see_lz='+str(seeLZ)

        #HTML标签剔除工具类对象

        self.tool = Tool()

        #全局file变量，文件写入操作对象

        self.file = None

        #楼层标号，初始为1

        self.floor = 1

        #默认的标题，如果没有成功获取到标题的话则会用这个标题

        self.defaultTitle = u"百度贴吧"

        #是否写入楼分隔符的标记

        self.floorTag = floorTag

    #传入页码，获取该页帖子的代码

    def getPage(self,pageNum):

        try:

            #构建URL

            url = self.baseURL+ self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            #返回UTF-8格式编码内容

            return response.read().decode('utf-8')

        #无法连接，报错

        except urllib2.URLError, e:

            if hasattr(e,"reason"):

                print u"连接百度贴吧失败,错误原因",e.reason

                return None

    #获取帖子标题

    def getTitle(self,page):

        #得到标题的正则表达式

        pattern = re.compile('<h1 class="core_title_txt.*?>(.*?)</h1>',re.S)

        result = re.search(pattern,page)

        if result:

            #如果存在，则返回标题

            return result.group(1).strip()

        else:

            return None

    #获取帖子一共有多少页

    def getPageNum(self,page):

        #获取帖子页数的正则表达式

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>',re.S)

        result = re.search(pattern,page)

        if result:

            return result.group(1).strip()

        else:

            return None

    #获取每一层楼的内容,传入页面内容

    def getContent(self,page):

        #匹配所有楼层的内容

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        contents = []

        for item in items:

            #将文本进行去除标签处理，同时在前后加入换行符

            content = "\n"+self.tool.replace(item)+"\n"

            contents.append(content.encode('utf-8'))

        return contents

    def setFileTitle(self,title):

        #如果标题不是为None，即成功获取到标题

        if title is not None:

            self.file = open(title + ".txt","w+")

        else:

            self.file = open(self.defaultTitle + ".txt","w+")

    def writeData(self,contents):

        #向文件写入每一楼的信息

        for item in contents:

            if self.floorTag == '':

                #楼之间的分隔符

                floorLine = "\n" + str(self.floor) + u"-----------------------------------------------------------------------------------------\n"

                self.file.write(floorLine)

            self.file.write(item)

            self.floor += 1

    def start(self):

        indexPage = self.getPage(1)

        pageNum = self.getPageNum(indexPage)

        title = self.getTitle(indexPage)

        self.setFileTitle(title)

        if pageNum == None:

            print "URL已失效，请重试"

            return

        try:

            print "该帖子共有" + str(pageNum) + "页"

            for i in range(1,int(pageNum)+1):

                print "正在写入第" + str(i) + "页数据"

                page = self.getPage(i)

                contents = self.getContent(page)

                self.writeData(contents)

        #出现写入异常

        except IOError,e:

            print "写入异常，原因" + e.message

        finally:

            print "写入任务完成"

print u"请输入帖子代号"

baseURL = 'http://tieba.baidu.com/p/3560761301' + str(raw_input(u'http://tieba.baidu.com/p/3560761301'))

seeLZ = raw_input("是否只获取楼主发言，是输入1，否输入0\n")

floorTag = raw_input("是否写入楼层信息，是输入1，否输入0\n")

bdtb = BDTB(baseURL,seeLZ,floorTag)

bdtb.start()

程序运行结果：

然后打开工程文件里生成的ubuntu.txt文件，爬取的内容如下:

是不是很神奇，反正我是感觉很神奇:-)

Python爬虫爬取贴吧的帖子内容的更多相关文章

Python爬虫-爬取百度贴吧帖子
这次主要学习了替换各种标签,规范格式的方法.依然参考博主崔庆才的博客. 1.获取url 某一帖子:https://tieba.baidu.com/p/3138733512?see_lz=1&p ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
Python爬虫爬取搜狗搜索到的内容页面
废话不多说,直接上代码 import requests def main(): url='https://www.sogou.com/web' headers={ 'User_Agent':'Mozi ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...

随机推荐

Flex 常用布局
1.flex布局 1.1 容器指定为flex布局 .box{display: flex;} 1.2 行元素指定flex布局 .box{display:inline-flex} 2.容器的属性 2.1 ...
高性能JavaScript（DOM编程）
首先什么是DOM?为什么慢? DOM:文档对象模型,是一个独立于语言的,用于操作XML和HTML文档的程序接口(API) 用脚本进行DOM操作的代价很昂贵.那么,怎样才能提高程序的效率? 1.DOM访 ...
纯小白入手 vue3.0 CLI - 2.3 - 组件 home.vue 中学习指令和绑定
vue3.0 CLI 真小白一步一步入手全教程系列:https://www.cnblogs.com/ndos/category/1295752.html 我的 github 地址 - vue3.0St ...
Oracle中SQL语句转化IP地址到数字
CREATE OR REPLACE FUNCTION ip_num(ipaddress IN VARCHAR2) RETURN NUMBER AS ipnum ; pos1 ; pos2 ; BEGI ...
AJAX删除事件与加载数据
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/ ...
【jdk源码1】TreeMap源码学习
这是看过的第一个jdk源码(从立下目标以来):TreeMap.说实话断断续续的看了有好几天了,我觉得我犯了一个错误,就像一开始说的那样,我打算完完全全看懂TreeMap关于红黑树的实现方式,后来我想了 ...
python基础知识回顾之列表
在python 中,主要的常用数据类型有列表,元组,字典,集合,字符串.对于这些基础知识,应该要能够足够熟练掌握. 如何创建列表: # 创建一个空列表:定义一个变量,然后在等号右边放一个中括号,就创建 ...
Web Api跨域访问配置及调用示例
1.Web Api跨域访问配置. 在Web.config中的system.webServer内添加以下代码: <httpProtocol> <customHeaders> &l ...
sysbench 多线程异步io模拟mysql测试的脚本
用于测试的脚本: for size in 100 do cd /mnt/stec sysbench --test=fileio --file-num=1 --file-total-size=${siz ...
50家硅谷IT公司技术博客
分享一下 50 家硅谷优秀 IT 公司技术博客,从中可以了解企业文化,技术特色和设计语言,如果直接列出来很单调,加上点评,算吐槽版吧. 知名大厂 1. Facebook https://www.f ...

Python爬虫爬取贴吧的帖子内容

Python爬虫爬取贴吧的帖子内容的更多相关文章

随机推荐

热门专题