简单的百度贴吧爬虫实现（urllib）

环境：ubuntu 16.04 LTS （X86-64），pycharm

python版本：3.5.1+

#生成的文件默认会保存到代码所在根目录

 1 import urllib.request,urllib.error,re

 class Tool:

     removeImg=re.compile('<img.*?| {7}|')

     removeAddr=re.compile('<a.*?|</a>')

     replaceLine=re.compile('<tr>|<div>|</div>|</p>')

     replaceTD=re.compile('<td>')

     replaceBR=re.compile('<br></br>|br')

     replaceExtra=re.compile('<.*?>')

     def replace(self,x):

         x=re.sub(self.removeImg,"",x)

         x=re.sub(self.removeAddr,"",x)

         x=re.sub(self.replaceLine,"\n",x)

         x=re.sub(self.replaceTD,"\t",x)

         x=re.sub(self.replaceBR,"\n",x)

         x=re.sub(self.replaceExtra,"",x)

         return x.strip()

 class BDTB:

     def __init__(self,baseUrl,see_lz):

         self.tool=Tool()

         self.baseurl=baseUrl+'?see_lz='+str(see_lz)+'&pn='

         self.defaultTitle=u'百度贴吧'

     def getPage(self,pagenum):

         try:

             url=self.baseurl+str(pagenum)

             request=urllib.request.Request(url)

             response=urllib.request.urlopen(request)

             content = response.read().decode('utf-8')

             return content

         except urllib.error.URLError as e:

             if hasattr(e,"reason"):

                 print(u'connect error reason:'+e.reason)

             if hasattr(e,'code'):

                 print(u'connect error,reason:'+e.code)

     def getPns(self,content):

         pattern = re.compile('<li class="l_reply_num".*?<span class="red">(.*?)</span>', re.S)

         pns = int((re.findall(pattern, content))[0])

         return pns

     def getTitle(self,content):

         pattern=re.compile('<h3 class="core_title_txt pull-left text-overflow  ".*?>(.*?)</h3>',re.S)

         return str((re.findall(pattern,content))[0])

     def getContent(self,content):

         pattern=re.compile('<ul class="p_author".*?<li class="d_name".*?target="_blank">(.*?)</a>.*?<div id="post_content_.*?>(.*?)</div>',re.S)

         items=re.findall(pattern,content)

         contents=[]

         for item in items:

             content='Username:   '+item[0]+'   content:   '+self.tool.replace(item[1])+'\n'

             contents.append(content)

         return contents

     def setFileTitle(self,Title):

         if Title is not None:

             self.file=open(Title+'.txt','w+')

         else:

             self.file=open(self.defaultTitle+'.txt','w+')

     def WriteData(self,contents):

         for content in contents:

             self.file.write(content)

     def start(self):

         Pns=self.getPns(self.getPage(1))

         self.setFileTitle(self.getTitle(self.getPage(1)))

         for i in range(Pns):

             print('Page Sum:'+str(Pns)+'\n')

             print('Now is Write page:'+str(i)+'\n')

             self.WriteData(self.getContent(self.getPage(i)))

         self.file.close()

 print('please enter discussion num:')

 url='http://tieba.baidu.com/p/'+str(input())

 see_lz=input('Whether just see lz(enter 0 or 1)')

 bdtb=BDTB(url,see_lz)

 bdtb.start()

运行结果：

简单的百度贴吧爬虫实现（urllib）的更多相关文章

c# WPF——完成一个简单的百度贴吧爬虫客户端
话不多说先上图爬取10页大概500个帖子大概10s,500页2w多个帖子大概2min,由此可见性能并不是特别好,但是也没有很差. 好了话不多说,我们来一步一步实现这么个简易的客户端. 1.创建项目 ...
[Python]网络爬虫（六）：一个简单的百度贴吧的小爬虫
转自:http://blog.csdn.net/pleasecallmewhy/article/details/8927832 # -*- coding: utf-8 -*- #----------- ...
Python之路：爬虫之urllib库的基本使用和高级使用
关于爬虫自己一直在看,所以时间太慢,这才第二更,有等不及的小伙伴可以慢慢的品尝了,在看下面的之前,建议先把上一章看一下.以下是关于python的Urllib的基础和高级用法. 1.如何扒下一个网站,用 ...
实用的开源百度云分享爬虫项目yunshare - 安装篇
今天开源了一个百度云网盘爬虫项目,地址是https://github.com/callmelanmao/yunshare. 百度云分享爬虫项目 github上有好几个这样的开源项目,但是都只提供了爬虫 ...
python 3.x 爬虫基础---Urllib详解
python 3.x 爬虫基础 python 3.x 爬虫基础---http headers详解 python 3.x 爬虫基础---Urllib详解前言爬虫也了解了一段时间了希望在半个月的时间内 ...
Python爬虫之urllib模块2
Python爬虫之urllib模块2 本文来自网友投稿作者:PG-55,一个待毕业待就业的二流大学生. 看了一下上一节的反馈,有些同学认为这个没什么意义,也有的同学觉得太简单,关于Beautiful ...
（爬虫）urllib库
一.爬虫简介什么是爬虫?通俗来讲爬虫就是爬取网页数据的程序. 要了解爬虫,还需要了解HTTP协议和HTTPS协议:HTTP协议是超文本传输协议,是一种发布和接收HTML页面的传输协议:HTTPS协议 ...
C# 学习之路--百度网盘爬虫设计与实现（一）
百度网盘爬虫现在市面上出现了很多网盘搜索引擎,写这系列博文及爬虫程序的初衷: 更方面的查找资源学习C# 学习爬虫的设计与实现记录学习历程自我监督能力有限,如有不妥之处,还请各位看官点评.同在 ...
python爬虫之urllib库（二）
python爬虫之urllib库(二) urllib库超时设置网页长时间无法响应的,系统会判断网页超时,无法打开网页.对于爬虫而言,我们作为网页的访问者,不能一直等着服务器给我们返回错误信息,耗费 ...

随机推荐

C#（数据类型）
刚开始学c#!!!
uTenux——重新整理底层驱动库
重新整理底层驱动库 1. 整理chip.h 在chip.h文件中的07----13的宏定义设置位如下,这样我们就不用在工程配中定义sam3s4c这个宏了,为我们以后通用少了一件麻烦事. //#if d ...
<转>32位移植到64位注意事项
32bit-64bit porting work注意事项 64位服务器逐步普及,各条产品线对64位升级的需求也不断加大.在本文中,主要讨论向64位平台移植现有32位代码时,应注意的一些细小问题. 什么 ...
基础！winForm客户端最常用的几个基本属性
客户端应用程序 - 是需要安装在用户电脑上才可以使用的程序特点:不需要联网也可以打开使用部分功能但是现在的情况是许多功能依然需要互联网的支持代码部分在用户电脑上执行 WinForm常用窗体属性: 布 ...
shell 随机从文件中抽取若干行
shuf -n5 main.txt sort -R main.txt | head -5 awk -vN=5 -vC="`wc -l file`" 'BEGIN{srand();w ...
dup2()函数的使用，
#define STR "xiamanman\n"#define STR_LEN 10#define STDOUT 1 #include <stdio.h>#inclu ...
HDU 5038 Grade（分级）
Description 题目描述 Ted is a employee of Always Cook Mushroom (ACM). His boss Matt gives him a pack of ...
iOS - OC NSFileManager 文件管理
前言 @interface NSFileManager : NSObject @interface NSFileHandle : NSObject <NSSecureCoding> NSF ...
sessionKey
许多人都知道NETSCAPE公司是Internet商业中领先技术的提供者,该公司提供了一种基于RSA和保密密钥的应用于因特网的技术,被称为安全插座层(Secure Sockets Layer,SSL) ...
ABAP 没有地方输入\H 进入DEBUG 怎么办？
把如下代码保存,命名debug.txt ,把这个文件拖拉到要调试的窗口. [FUNCTION]Command=/HTitle=Barry TestType=SystemCommand

简单的百度贴吧爬虫实现（urllib）

简单的百度贴吧爬虫实现（urllib）的更多相关文章

随机推荐

热门专题