Python爬虫-爬取百度贴吧帖子

这次主要学习了替换各种标签，规范格式的方法。依然参考博主崔庆才的博客。

1.获取url

某一帖子:https://tieba.baidu.com/p/3138733512?see_lz=1&pn=1

其中https://tieba.baidu.com/p/3138733512?为基础部分，剩余的为参数部分。

http:// 代表资源传输使用http协议

tieba.baidu.com 是百度的二级域名，指向百度贴吧的服务器。

/p/3138733512 是服务器某个资源，即这个帖子的地址定位符

see_lz和pn是该URL的两个参数，分别代表了只看楼主和帖子页码，等于1表示该条件为真

    def getPage(self, pagenum):

        try:

            url = self.baseurl + self.seelz + '&pn=' + str(pagenum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            # print response.read()

            # print url

            return response.read().decode('utf-8')

        except urllib2.URLError, e:

            if hasattr(e, 'reason'):

                print 'wrong !',e.reason

                return None

2.获取标题

因为标题由<h3 class="core_title_txt...</h3>包围，所以利用正则表达式很容易获取。

def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_tx.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

3.获取帖子页数

如上图，利用正则表达式如下：

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

4.获取楼主正文内容

    def getContent(self):

        page = self.getPage(1)

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>', re.S)

        items = re.findall(pattern, page)

        for item in items:

            print self.tool.replace(item)

正文主要包括在<div id="post.....></div>，但是明显正文中穿插了各种换行符、链接、图片、段落符等。所以需要将这些符号删除或替换。

替换代码如下：

class Tool:

    removeImg = re.compile('<img.*?>| {7}|')   #去除图像和7位空格

    removeAddr = re.compile('<a.*?>|</a>')     #去除链接

    replaceLine = re.compile('<tr>|<div>|<div></p>')   #换行符替换成\n

    replaceTD = re.compile('<td>')  #制表符换位\t

    replacePara = re.compile('<p.*?>')  #段落符换位\n和两个空格

    replaceBR = re.compile('<br>|<br><br>')  #换行符或双换行符替换为\n

    removeExtraTag = re.compile('<.*?>')  #去掉其他符号

    def replace(self, x):

        x = re.sub(self.removeImg, "", x)

        x = re.sub(self.removeAddr, "", x)

        x = re.sub(self.replaceLine, '\n', x)

        x = re.sub(self.replaceTD, '\t', x)

        x = re.sub(self.replacePara, "\n  ", x)

        x = re.sub(self.replaceBR, '\n', x)

        x = re.sub(self.removeExtraTag, "", x)

        return x.strip()

5.整体代码及结果

# coding:utf-8

import urllib

import urllib2

import re

class Tool:

    removeImg = re.compile('<img.*?>| {7}|')

    removeAddr = re.compile('<a.*?>|</a>')

    replaceLine = re.compile('<tr>|<div>|<div></p>')

    replaceTD = re.compile('<td>')

    replacePara = re.compile('<p.*?>')

    replaceBR = re.compile('<br>|<br><br>')

    removeExtraTag = re.compile('<.*?>')

    def replace(self, x):

        x = re.sub(self.removeImg, "", x)

        x = re.sub(self.removeAddr, "", x)

        x = re.sub(self.replaceLine, '\n', x)

        x = re.sub(self.replaceTD, '\t', x)

        x = re.sub(self.replacePara, "\n  ", x)

        x = re.sub(self.replaceBR, '\n', x)

        x = re.sub(self.removeExtraTag, "", x)

        return x.strip()

class tieba:

    def __init__(self, baseurl, seelz):

        self.baseurl = baseurl

        self.seelz = '?see_lz=' + str(seelz)

        self.tool = Tool()

    def getPage(self, pagenum):

        try:

            url = self.baseurl + self.seelz + '&pn=' + str(pagenum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            # print response.read()

            # print url

            return response.read().decode('utf-8')

        except urllib2.URLError, e:

            if hasattr(e, 'reason'):

                print 'wrong !',e.reason

                return None

    def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_tx.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

    def getContent(self):

        page = self.getPage(1)

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>', re.S)

        items = re.findall(pattern, page)

        for item in items:

            print self.tool.replace(item)

baseURL = 'https://tieba.baidu.com/p/3138733512'

bdtb = tieba(baseURL, 1)

# bdtb.getPage(1)

bdtb.getTitle()

bdtb.getPageNum()

bdtb.getContent()

Python爬虫-爬取百度贴吧帖子的更多相关文章

Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
python爬虫-爬取百度图片
python爬虫-爬取百度图片(转) #!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:16# 文件 :spider ...
写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...
Python爬虫爬取百度贴吧的帖子
同样是参考网上教程,编写爬取贴吧帖子的内容,同时把爬取的帖子保存到本地文档: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urlli ...
Python爬虫爬取贴吧的帖子内容
最近在看一个大神的博客,从他那里学会了很多关于python爬虫的知识,其实python如果想用在实际应用中,你需要了解许多,比如正则表达式.引入库.过滤字段等等,下面不多说,我下面的程序是爬取Ubun ...
python爬虫—爬取百度百科数据
爬虫框架:开发平台 centos6.7 根据慕课网爬虫教程编写代码片区百度百科url,标题,内容分为4个模块:html_downloader.py 下载器 html_outputer.py 爬取数 ...
Python爬虫爬取百度贴吧的图片
根据输入的贴吧地址,爬取想要该贴吧的图片,保存到本地文件夹,仅供参考: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urllib2i ...
Python爬虫爬取百度翻译之数据提取方法json
工具:Python 3.6.5.PyCharm开发工具.Windows 10 操作系统说明:本例为实现输入中文翻译为英文的小程序,适合Python爬虫的初学者一起学习,感兴趣的可以做英文翻译为中文的 ...
python --爬虫--爬取百度翻译
import requestsimport json class baidufanyi: def __init__(self, trans_str): self.lang_detect_url = ' ...

随机推荐

BAI度内部资料！Python_Threads多线程
基本介绍 runable运行sleeping等待dead销毁(run方法执行完成或执行时抛出异常) 类继承threading.Thread线程的状态函数介绍在__init__里调用threadin ...
自学Python2.1-基本数据类型-字符串str(object) 上
自学Python之路自学Python2.1-基本数据类型-字符串str(object) 上字符串是 Python 中最常用的数据类型.我们可以使用引号('或")来创建字符串. 创建字符串 ...
【BZOJ1814】Ural 1519 Formula 1 （插头dp）
[BZOJ1814]Ural 1519 Formula 1 (插头dp) 题面 BZOJ Vjudge 题解戳这里上面那个链接里面写的非常好啦. 然后说几个点吧. 首先是关于为什么只需要考虑三进制 ...
【BZOJ2245】[SDOI2011]工作安排（费用流）
[BZOJ2245][SDOI2011]工作安排(费用流) 题面 BZOJ 洛谷题解裸的费用流吧. 不需要拆点,只需要连边就好了,保证了\(W_j<W_{j+1}\). #include&l ...
前端学习 -- Html&Css -- 条件Hack 和属性Hack
条件Hack 语法:  <keyw ...
Azure Powershell script检测登陆并部署ARM Template
本文简单提供了一个Azure powershell脚本,能实现如下功能 Azure (China)账户是否已经登陆了,如果没登陆,会提示你登陆. 要创建的资源组是否存在,存在的话不再创建,直接部署te ...
Holiday、Vacation、Days off、Leave、Break
http://write.scu.edu.tw/view.php?bd=mistake&no=25 這些字在英文的用法中都有放假.休息的意思,但用法卻不太一樣,接下來就來看看它們的不同吧. 『 ...
A1091. Acute Stroke
One important factor to identify acute stroke (急性脑卒中) is the volume of the stroke core. Given the re ...
Mysq中的流程控制语句的用法
这篇博客主要是总结一下Mysq中的流程控制语句的用法,主要是:CASE,IF,IFNULL,NULLIF 1.case CASE value WHEN [compare-value] THEN res ...
算法入门及其C++实现
https://github.com/yuwei67/Play-with-Algorithms (nlogn)为最优排序算法选择排序整个数组中,先选出最小元素的位置,将该位置与当前的第一位交换:然 ...

Python爬虫-爬取百度贴吧帖子

Python爬虫-爬取百度贴吧帖子的更多相关文章

随机推荐

热门专题