Python爬虫-爬取百度贴吧帖子

这次主要学习了替换各种标签，规范格式的方法。依然参考博主崔庆才的博客。

1.获取url

某一帖子:https://tieba.baidu.com/p/3138733512?see_lz=1&pn=1

其中https://tieba.baidu.com/p/3138733512?为基础部分，剩余的为参数部分。

http:// 代表资源传输使用http协议

tieba.baidu.com 是百度的二级域名，指向百度贴吧的服务器。

/p/3138733512 是服务器某个资源，即这个帖子的地址定位符

see_lz和pn是该URL的两个参数，分别代表了只看楼主和帖子页码，等于1表示该条件为真

    def getPage(self, pagenum):

        try:

            url = self.baseurl + self.seelz + '&pn=' + str(pagenum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            # print response.read()

            # print url

            return response.read().decode('utf-8')

        except urllib2.URLError, e:

            if hasattr(e, 'reason'):

                print 'wrong !',e.reason

                return None

2.获取标题

因为标题由<h3 class="core_title_txt...</h3>包围，所以利用正则表达式很容易获取。

def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_tx.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

3.获取帖子页数

如上图，利用正则表达式如下：

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

4.获取楼主正文内容

    def getContent(self):

        page = self.getPage(1)

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>', re.S)

        items = re.findall(pattern, page)

        for item in items:

            print self.tool.replace(item)

正文主要包括在<div id="post.....></div>，但是明显正文中穿插了各种换行符、链接、图片、段落符等。所以需要将这些符号删除或替换。

替换代码如下：

class Tool:

    removeImg = re.compile('<img.*?>| {7}|')   #去除图像和7位空格

    removeAddr = re.compile('<a.*?>|</a>')     #去除链接

    replaceLine = re.compile('<tr>|<div>|<div></p>')   #换行符替换成\n

    replaceTD = re.compile('<td>')  #制表符换位\t

    replacePara = re.compile('<p.*?>')  #段落符换位\n和两个空格

    replaceBR = re.compile('<br>|<br><br>')  #换行符或双换行符替换为\n

    removeExtraTag = re.compile('<.*?>')  #去掉其他符号

    def replace(self, x):

        x = re.sub(self.removeImg, "", x)

        x = re.sub(self.removeAddr, "", x)

        x = re.sub(self.replaceLine, '\n', x)

        x = re.sub(self.replaceTD, '\t', x)

        x = re.sub(self.replacePara, "\n  ", x)

        x = re.sub(self.replaceBR, '\n', x)

        x = re.sub(self.removeExtraTag, "", x)

        return x.strip()

5.整体代码及结果

# coding:utf-8

import urllib

import urllib2

import re

class Tool:

    removeImg = re.compile('<img.*?>| {7}|')

    removeAddr = re.compile('<a.*?>|</a>')

    replaceLine = re.compile('<tr>|<div>|<div></p>')

    replaceTD = re.compile('<td>')

    replacePara = re.compile('<p.*?>')

    replaceBR = re.compile('<br>|<br><br>')

    removeExtraTag = re.compile('<.*?>')

    def replace(self, x):

        x = re.sub(self.removeImg, "", x)

        x = re.sub(self.removeAddr, "", x)

        x = re.sub(self.replaceLine, '\n', x)

        x = re.sub(self.replaceTD, '\t', x)

        x = re.sub(self.replacePara, "\n  ", x)

        x = re.sub(self.replaceBR, '\n', x)

        x = re.sub(self.removeExtraTag, "", x)

        return x.strip()

class tieba:

    def __init__(self, baseurl, seelz):

        self.baseurl = baseurl

        self.seelz = '?see_lz=' + str(seelz)

        self.tool = Tool()

    def getPage(self, pagenum):

        try:

            url = self.baseurl + self.seelz + '&pn=' + str(pagenum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            # print response.read()

            # print url

            return response.read().decode('utf-8')

        except urllib2.URLError, e:

            if hasattr(e, 'reason'):

                print 'wrong !',e.reason

                return None

    def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_tx.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

        else:

            return None

    def getContent(self):

        page = self.getPage(1)

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>', re.S)

        items = re.findall(pattern, page)

        for item in items:

            print self.tool.replace(item)

baseURL = 'https://tieba.baidu.com/p/3138733512'

bdtb = tieba(baseURL, 1)

# bdtb.getPage(1)

bdtb.getTitle()

bdtb.getPageNum()

bdtb.getContent()

Python爬虫-爬取百度贴吧帖子的更多相关文章

Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
python爬虫-爬取百度图片
python爬虫-爬取百度图片(转) #!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:16# 文件 :spider ...
写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...
Python爬虫爬取百度贴吧的帖子
同样是参考网上教程,编写爬取贴吧帖子的内容,同时把爬取的帖子保存到本地文档: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urlli ...
Python爬虫爬取贴吧的帖子内容
最近在看一个大神的博客,从他那里学会了很多关于python爬虫的知识,其实python如果想用在实际应用中,你需要了解许多,比如正则表达式.引入库.过滤字段等等,下面不多说,我下面的程序是爬取Ubun ...
python爬虫—爬取百度百科数据
爬虫框架:开发平台 centos6.7 根据慕课网爬虫教程编写代码片区百度百科url,标题,内容分为4个模块:html_downloader.py 下载器 html_outputer.py 爬取数 ...
Python爬虫爬取百度贴吧的图片
根据输入的贴吧地址,爬取想要该贴吧的图片,保存到本地文件夹,仅供参考: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urllib2i ...
Python爬虫爬取百度翻译之数据提取方法json
工具:Python 3.6.5.PyCharm开发工具.Windows 10 操作系统说明:本例为实现输入中文翻译为英文的小程序,适合Python爬虫的初学者一起学习,感兴趣的可以做英文翻译为中文的 ...
python --爬虫--爬取百度翻译
import requestsimport json class baidufanyi: def __init__(self, trans_str): self.lang_detect_url = ' ...

随机推荐

[树链剖分]hihocoder1883
描述有一个无向图,有n个点,m1条第一类边和m2条第二类边.第一类边有边权,第二类边无边权.请为第二类的每条边定义一个边权,使得第二类边可能全部出现在该无向图的最小生成树上,同时要求第二类边的边权总 ...
PHP 判断浏览器语言
详情请参看代码作用:判断当前的浏览器语言.接收传入参数.拼接字符串 <?php $lang = substr($_SERVER['HTTP_ACCEPT_LANGUAGE'],0,2); if ...
centos7 安装mysql的正确姿势
1. 添加MySQL Yum源 MySQL官网>DOWNLOADS>MySQL Yum Repository找到合适版本的yum源 $wget https://dev.mysql.com/ ...
JVM复习总结
运行时数据区域图中深色区域为,由所有线程共享的数据区域,其他为线程隔离的数据区. 程序计数器程序计数器可以看作是当前线程执行的字节码的行号指示器. 虚拟机栈虚拟机栈描述的是Java方法执行的内存 ...
1. vim 的安装及配置
简介 vim是什么 vim是一款功能强大.支持各种插件.配置极为灵活的编辑器,且支持多种主流OS(linux.Unix.mac.windows),可用来各种编程预言的coding和文件编辑,用习惯了v ...
poco logging
http://pocoproject.org/slides/110-Logging.pdf
A1016. Phone Bills
A long-distance telephone company charges its customers by the following rules: Making a long-distan ...
java基础题整理（1）
1.使用length属性获取数组长度,使用length()获取字符串的长度: 2.public.private.protected.friendly区别 public表明该数据成员.成员函数是对所有用 ...
NOIP 普及组 2013 表达式求值
传送门 https://www.cnblogs.com/violet-acmer/p/9898636.html 题解: 哇哇哇,又是一发暴力AC. 用字符数组存储表达式. 然后将表达式中的数字与 ...
jQuery层级选择器
<!DOCTYPE html> <html> <head> <meta charset="UTF-8"> <title> ...

Python爬虫-爬取百度贴吧帖子

Python爬虫-爬取百度贴吧帖子的更多相关文章

随机推荐

热门专题