Python爬虫实战（二）：爬百度贴吧

代码：

# _*_ coding:utf-8 _*_

import urllib

import urllib2

import re

class Tool:

    removingImg = re.compile('<img.*?>| {7}|')

    removingAddr = re.compile('<a.*?>|</a>')

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    replaceTD = re.compile('<td>')

    replacePara = re.compile('<p.*?>')

    replaceBR = re.compile('<br><br>|<br>')

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removingImg,"",x)

        x = re.sub(self.removingAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        return x.strip()

class BDTB:

    def __init__(self,baseUrl,seeLZ,floorTag):

        self.baseURL = baseUrl

        self.seeLZ = '?see_lz='+str(seeLZ)

        self.tool = Tool()

        self.file = None

        self.floor = 1

        self.defaultTitle = '百度贴吧'

        self.floorTag = floorTag

    def getPage(self,pageNum):

        try:

            url = self.baseURL + self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            pageCode = response.read().decode('utf-8')

            #print pageCode

            return pageCode

        except urllib2.URLError,e:

            if hasattr(e,"reason"):

                print u"连接百度贴吧失败，错误原因",e.reason

                return None

    def getTitle(self,page):

         pattern = re.compile('<h3 class="core_title_txt.*?>(.*?)</h3>',re.S)

         result = re.search(pattern,page)

         if result:

             #print result.group(1)

             return result.group(1).strip()

         else:

             #print "Not match"

             return None

    def getPageNum(self,page):

         pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>',re.S)

         result = re.search(pattern,page)

         if result:

             #print result.group(1)

             return result.group(1).strip()

         else:

             #print "Not match"

             return None

    def getContent(self,page):

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        contents = []

        for item in items:

            #print floor,u"楼-----------------------------------------\n"

            content = "\n" + self.tool.replace(item) + "\n"

            contents.append(content.encode('utf-8'))

            #floor += 1

        return contents

    def setFileTitle(self,title):

        if title is not None:

            self.file = open(title + ".txt","w+")

        else:

            self.file = open(self.defaultTitle + ".txt","w+")

    def writeData(self,contents):

        for item in contents:

            if self.floorTag == '':

                floorLine = "\n" + str(self.floor) + u"------------------------------------------------------\n"

                self.file.write(floorLine)

            self.file.write(item);

            self.floor += 1

    def start(self):

        indexPage = self.getPage(1)

        pageNum = self.getPageNum(indexPage)

        title = self.getTitle(indexPage)

        self.setFileTitle(title)

        if pageNum == None:

            print "URL已失效，请重试"

            return

        try:

            print "该帖子共有" + str(pageNum) + "页"

            for i in range(1,int(pageNum)+1):

                print "正在写入第" + str(i) + "页数据"

                page = self.getPage(i)

                contents = self.getContent(page)

                self.writeData(contents)

        except IOError,e:

            print "写入异常，原因" + e.message

        finally:

            print "写入任务完成"

print u"请输入帖子代号"

baseURL = "http://tieba.baidu.com/p/" + str(raw_input(u'http://tieba.baidu.com/p/'))

seeLZ = raw_input("是否只获取楼主发言，是输入1，否输入0\n")

floorTag = raw_input("是否写入楼层信息，是输入1，否输入0\n")

bdtb = BDTB(baseURL,seeLZ,floorTag)

bdtb.start()

#baseURL = 'http://tieba.baidu.com/p/3138733512'

#bdtb = BDTB(baseURL,1)

#page = bdtb.getPage(1)

#bdtb.getTitle()

#bdtb.getPageNum()

#bdtb.getContent(page)

Python爬虫实战（二）：爬百度贴吧的更多相关文章

Python爬虫实战二之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 前言亲爱的们,教程比较旧了,百度贴吧页面可能改版,可能代码不 ...
转 Python爬虫实战二之爬取百度贴吧帖子
静觅 » Python爬虫实战二之爬取百度贴吧帖子大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标 ...
Python爬虫实战之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标对百度贴吧的任意帖子进行抓取指定是否只抓取楼主发帖 ...
Python爬虫实战——反爬策略之模拟登录【CSDN】
在<Python爬虫实战-- Request对象之header伪装策略>中,我们就已经讲到:=="在header当中,我们经常会添加两个参数--cookie 和 User-Age ...
Python 爬虫入门(二)——爬取妹子图
Python 爬虫入门听说你写代码没动力?本文就给你动力,爬取妹子图.如果这也没动力那就没救了. GitHub 地址: https://github.com/injetlee/Python/blob ...
Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
Python爬虫实战之爬取糗事百科段子【华为云技术分享】
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
芝麻HTTP:Python爬虫实战之爬取百度贴吧帖子
本篇目标 1.对百度贴吧的任意帖子进行抓取 2.指定是否只抓取楼主发帖内容 3.将抓取到的内容分析并保存到文件 1.URL格式的确定首先,我们先观察一下百度贴吧的任意一个帖子. 比如:http:// ...
Python爬虫实战：爬取腾讯视频的评论
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 易某某 PS:如有需要Python学习资料的小伙伴可以加点击下方链 ...
Python爬虫学习(二) ——————爬取前程无忧招聘信息并写入excel
作为一名Pythoner,相信大家对Python的就业前景或多或少会有一些关注.索性我们就写一个爬虫去获取一些我们需要的信息,今天我们要爬取的是前程无忧!说干就干!进入到前程无忧的官网,输入关键字&q ...

随机推荐

对一个前端使用AngularJS后端使用ASP.NET Web API项目的理解(4)
chsakell分享了一个前端使用AngularJS,后端使用ASP.NET Web API的项目. 源码: https://github.com/chsakell/spa-webapi-angula ...
windows phone 基础
一.安装建议安装Windows 7环境,XP中不能运行模拟器,Vista系统支持,但不解释.系统安装完后,直接去微软网站在线安装即可,非常方便,美中不足的是如果你的网速不快,那可能要折磨你半天,快得 ...
rest api上传和下载文件
rest api上传和下载文件 function FileToString(AFileName: string): string; var LMemoryStream: TMemoryStream; ...
C#编程（七十三）----------浅析C#中内存管理
浅析C#中内存管理前言:个人觉得C#吸收了各种语言的优点,可谓集大成者,但是不知但,这种集所有语言于一身的情况是好是坏.C#编程的一个优点就是程序员不需要关心具体的内存管理,尤其是垃圾收集器会处理所 ...
学习 HTML+CSS 的书籍推荐
1.<CSS那些事儿> 本书专注于CSS技巧实例的讲解,由浅入深地分析了CSS样式在布局时所需要理解的原理.绕开随处可见的基础知识.网络中能随意搜索到的hack技巧,侧重原理分析,拓展读者 ...
利用svn log命令实现的资源版本更新
无论页游或是手游都需要经常进行更新,而每一次更新几乎都是一部血泪吏.这里重点介绍一下前端资源打包的简化操作.目前2D手游主流都采用了cocos2d-x 绑lua的做法,因为lua相当于一种资源可以进行 ...
教你摆脱低级程序猿项目中cocopads的安装使用
小农今天聊聊一款作为iOS开发者必备的第三方管理软件.希望程序猿朋友们看到小农的这篇文章后.可以真正的学会怎样灵活管理你项目中的第三方. (一)CocoaPods是什么? 首先我们来认识一下这款第三方 ...
Android布局分析工具HierarchyView的使用方法
本文是从这里看到的:http://www.2cto.com/kf/201404/296960.html 如果我们想宏观的看看自己的布局,Android SDK中有一个工具HierarchyView.b ...
《ASP.NET Web API 2框架揭秘》
<ASP.NET Web API 2框架揭秘> 基本信息作者: 蒋金楠出版社:电子工业出版社 ISBN:9787121235368 上架时间:2014-7-5 出版日期:2014 年7 ...
3分钟搞定SpringBoot+Mybatis+druid多数据源和分布式事务
文章来自: https://blog.csdn.net/qq_29242877/article/details/79033287 在一些复杂的应用开发中,一个应用可能会涉及到连接多个数据源,所谓多数据 ...

Python爬虫实战（二）：爬百度贴吧

Python爬虫实战（二）：爬百度贴吧的更多相关文章

随机推荐

热门专题