Python(五)编程小实例

抓取网页信息,并生成txt文件内容!

Python抓取网页技能——Python抓取网页就是我们常看见的网络爬虫,我们今天所要用到的就是我们Python中自带的模块,用这些模块将网页内容爬取下来,并生成一个txt文件。

(一)实例思路:

我们所需要用到的模块:

urllib2—urllib2是Python的一个获取URLs(Uniform Resource Locators)的组件。他以urlopen函数的形式提供了一个非常简单的接口,这是具有利用不同协议获取URLs的能力,他同样提供了一个比较复杂的接口来处理一般情况,例如:基础验证,cookies,代理和其他。

 import urllib2

 response=urllib2.urlopen('http://tieba.baidu.com/p/4923127538?see_lz=1')

 html = response.read()

re—Python的re模块就是我们开始想知道的大名鼎鼎的正则表达式,正则表达式(可以称为REs,regex,regex pattens)是一个小巧的,高度专业化的编程语言,它内嵌于Python开发语言中,可通过re模块使用。正则表达式的pattern可以被编译成一系列的字节码,然后用C编写的引擎执行。

 import re

 m = re.search ('ab+','asdfabbbbb')

 print m.group()
 Python 2.7.13 (v2.7.13:a06454b1afa1, Dec 17 2016, 20:53:40) [MSC v.1500 64 bit (AMD64)] on win32
Type "copyright", "credits" or "license()" for more information.
>>>
========================= RESTART: H:\Python27\1.py =========================
abbbbb
>>>

re—正则表达式我们本节就不去重点讲了,基础同学们可以去看看正则表达式的详细内容:http://www.runoob.com/python/python-reg-expressions.html。在我的博客中有详细的正则表达式(字符)详解!

那么接下来我们开始我们的小实例——爬取百度贴吧小说!

首先我们要明确一下我们项目的思路:

                # -*- coding: utf-8 -*-
                #模块:urllib2, re。
                #正则表达式:------想要的内容 findall(正则表达式,源码)
                #百度贴吧爬取内容:1.获取源码
                # 2.解析超链接
                # 3.获取标题
                # 4.获取内容
                # 5.发送命令,调用主函数

我们在进行项目时要将整体突出程序化,那么我们开始第一步的实施调取Python中自带的模块:

 # -*- coding: utf-8 -*-

 import urllib2
import re

将我们所需的模块插入后,我们开始项目的实施:

 class BDTB:
baseUrl = 'http://tieba.baidu.com/p/4923127538?see_lz=1'
#获取源代码
def getPage(self,pageNum):
try:
url = self.baseUrl + str(pageNum)
request = urllib2.Request(url)
response = urllib2.urlopen(request).read()
#print response
return response
except Exception,e:
print e

上述代码是我们要获取的网页源码信息,因为我们需要多方面的爬取我们想要的内容,所以我们创建一个类来实现其中所有函数的功能。

 baseUrl = 'http://tieba.baidu.com/p/4923127538?see_lz=1'

baseUrl就是我们想要获取的网址!

  def getPage(self,pageNum):
try:
url = self.baseUrl + str(pageNum)
request = urllib2.Request(url)
response = urllib2.urlopen(request).read()
#print response
return response
except Exception,e:
print e

网址获取到了之后,我们要定义一个函数,来获取我们想要获取的网页信息,在函数中我们定义了两个变量,这两个变量是我们正则匹配时要需要用到的!

我们在其中所用到的:

 try:
语句1
语句2
.
.
语句N
except Exception e:
print e

这样的语句就是判断我们的程序有没有错误,看我们是否获取到我们想要的信息,如果没有获取到就给编译器返回一个e值!

接下来我们要使用我们的正则表达式来获取其中我们想要的内容了!

 def Title(self,pageNum):
html = self.getPage(pageNum)
reg = re.compile(r'title="这(.*?)"')
items = re.findall(reg,html)
print items[0]
for item in items:
f = open('text1.txt','w')
f.write('标题'+'\t'+item)
f.close()
return items

这一段定义的函数是将我们所获取到的网页信息,匹配到我们想要的位置,然后截取下来!并且将网页匹配的信息生成一个text1.txt的文本文件,‘w’就是写入信息!

  reg = re.compile(r'title="这(.*?)"')

这里我们就用到了re模块中的包含一个重要函数是compile(pattern [, flags]) ,该函数根据包含的正则表达式的字符串创建模式对象

参数描述:

pattern匹配的正则表达式string要匹配的字符串。

flags标志位,用于控制正则表达式的匹配方式,如:是否区分大小写,多行匹配等等。

 >>> import re
>>> repp = 'a,b,,,,c d'
>>> reOB = re.compile('[, ]+')
>>> reOB.split(some_text)
['a', 'b', 'c', 'd']

接下来我们再看另一个re模块中的函数python 正则表达式 re findall 方法能够以列表的形式返回能匹配的子串。

re.findall(pattern, string[, flags]):

 items = re.findall(reg,html)

我们来看一下这个函数的实例:

 >>> import re
>>> p = re.compile(r'\d+')
>>> print p.findall('one1two2three3four4')
['', '', '', '']
>>>

将我们我所要查询到的数字以列表的形式输出出来!

 for item in items:
f = open('text1.txt','w')
f.write('标题'+'\t'+item)
f.close()

在这段代码中,我们用到了Python文件写入,这个地方就是生成我们txt文本文件的地方,同学门可以找找详细的资料来研究一下,这里是对于想保存长期看的同学有很大的帮助哦!在这里我就不详细讲解了!

我们继续我们的项目:

 def Text(self,pageNum):
html = self.getPage(pageNum)
reg = re.compile(r'class="d_post_content j_d_post_content "> (.*?)</div><br> ',re.S)
req = re.findall(reg,html)
#print req[0]
for i in req:
removeAddr = re.compile('<a.*?>|</a>')
removeaddr = re.compile('<img.*?>')
removeadd = re.compile('http.*?.html')
i = re.sub(removeAddr,'',i)
i = re.sub(removeaddr,'',i)
i = re.sub(removeadd,'',i)
i = i.replace('<br>','')
print i
f = open('text1.txt','a')
f.write('\n\n'+i)
f.close()

此处的代码就是我们要完成我们真正所需要的内容了,这里是完整的将我们所需要的小说爬取到手的,这里面用的正则匹配就是我们的贪婪匹配模式了!

  def Text(self,pageNum):
html = self.getPage(pageNum)
reg = re.compile(r'class="d_post_content j_d_post_content "> (.*?)</div><br> ',re.S)
req = re.findall(reg,html)

那么这一部分还是我们在上一匹配到的内容中,将class标签中的全部文字内容提取出来,但是其中我们会看到包含了很多img http等很多小标签,所以我们还需要将这些内容利用正则匹配中的sub函数将他们装换为空“ ”!

 for i in req:
removeAddr = re.compile('<a.*?>|</a>')
removeaddr = re.compile('<img.*?>')
removeadd = re.compile('http.*?.html')
i = re.sub(removeAddr,'',i)
i = re.sub(removeaddr,'',i)
i = re.sub(removeadd,'',i)
i = i.replace('<br>','')
print i

这一串代码就是我们想要把其中像re.compile('<a.*?>|</a>')这样的内容获取到,然后再利用我们的sub函数将这些获取到的内容装换为“ ”空白!然后在输出到 i 这个列表中!最后将 i 输出!

我们在结尾处需要做一个程序运行无误的判断,那么我们就需要用到在编译器中给我们返回我们程序运行的开始!文件的生成结果:

 bdtb = BDTB()
print '爬虫正在启动.....'
try:
for i in range(1,4):
print '正在爬取第%s小说' %(i)
bdtb.Title(1)
bdtb.Text(1)
except Exception,e:
print e

在这里我们要调用我们所创建的类,在这一个try中我们看到了一个range的函数,这个函数就是如果你需要一个数值序列,使用内建函数range() 会很方便,它产生等差级数序列。利用这个函数的意思就是我们要获取小说的全部内容!最后我们生成一个text1.txt的文件

最后附上我们实现的整体代码:

 # -*- coding: utf-8 -*-

 import urllib2
import re class BDTB:
baseUrl = 'http://tieba.baidu.com/p/4923127538?see_lz=1'
#获取源代码
def getPage(self,pageNum):
try:
url = self.baseUrl + str(pageNum)
request = urllib2.Request(url)
response = urllib2.urlopen(request).read()
#print response
return response
except Exception,e:
print e
#匹配内容
def Title(self,pageNum):
html = self.getPage(pageNum)
reg = re.compile(r'title="这(.*?)"')
items = re.findall(reg,html)
print items[0]
for item in items:
f = open('text1.txt','w')
f.write('标题'+'\t'+item)
f.close()
return items
def Text(self,pageNum):
html = self.getPage(pageNum)
reg = re.compile(r'class="d_post_content j_d_post_content "> (.*?)</div><br> ',re.S)
req = re.findall(reg,html)
#print req[0]
for i in req:
removeAddr = re.compile('<a.*?>|</a>')
removeaddr = re.compile('<img.*?>')
removeadd = re.compile('http.*?.html')
i = re.sub(removeAddr,'',i)
i = re.sub(removeaddr,'',i)
i = re.sub(removeadd,'',i)
i = i.replace('<br>','')
print i
f = open('text1.txt','a')
f.write('\n\n'+i)
f.close() bdtb = BDTB()
print '爬虫正在启动。。。。'
try:
for i in range(1,4):
print '正在爬取第%s小说' %(i)
bdtb.Title(1)
bdtb.Text(1)
except Exception,e:
print e

运行后,在你的Pyhton文件中会生成一个text1.txt的文本文件,你就可以打开查看你想看的小说了哦!加油吧,同学们!

Python(五)编程小实例的更多相关文章

  1. Python - 面向对象编程 - 小实战(1)

    题目 设计一个类Person,生成若干实例,在终端输出如下信息 小明,10岁,男,上山去砍柴 小明,10岁,男,开车去东北 小明,10岁,男,最爱大保健 老李,90岁,男,上山去砍柴 老李,90岁,男 ...

  2. Python - 面向对象编程 - 小实战(2)

    需求 小明和小美都爱跑步 小明体重 75 公斤 小美体重 45 公斤 每次跑步会减肥 0.5 公斤 每次吃东西体重增加 1 公斤 需求分析 小明.小美都是一个具体的对象,他们都是人,所以应该抽象成人类 ...

  3. python数据库编程小应用

    python DB api 数据库连接对象connection数据库交互对象cursor数据库异常类exceptions 流程:开始创建connection获取cursor执行查询.执行命令.获取数据 ...

  4. python 面向对象编程 - 小游戏

    面向对象写的小游戏 欢迎玩耍 class Omnicience: camp = 'Omniscience' def __init__(self, name, atk=100, hp=1000, mp= ...

  5. Python - 面向对象编程 - 小实战(3)

    需求 房子(House)有户型.总面积.家具名称列表:新房子没有任何的家具 家具(HouseItem)有名字.占地面积 席梦思(bed) 占地 4 平米 衣柜(bed) 占地 2 平米 餐桌(bed) ...

  6. (python)编程小练习

    1.将一串字符串反向输出,如将"abcd"变成“dcba” str1="abcd" print str1[::-1] 2.判断是否为回文——判断用户输入的字符串 ...

  7. Python进度条小实例

    代码理解: 函数view_bar(num,total) num是一个随即数,total是总数( num / total ) * 的int类型可以计算百分比 '\r%d%%%s' % (rate_num ...

  8. python面向对象编程小程序- 选课系统

    选课系统 花了一晚上写的,可能还存在不足 1.程序框架 2.文件夹建立 D:/选课系统 |___api | |___common_api.py |___bil | |___common.py |___ ...

  9. Python做单元测试小实例

    import sys#先定义一个函数,这个函数是计算高*宽,并返回计算结果def test(hight,width):    return hight*width #这是程序启动函数入口,给要测试的函 ...

随机推荐

  1. iOS 环信消息撤回

    这两天在做环信的消息回撤,在网上找了许久没有这种案例,之后官方的一些方法,但是自己做,还是需要花点时间去整理,所以我决定等我把这个做好之后,分享给大家,如果做的不好多多指教,谢谢- 首先要实现消息撤回 ...

  2. Jcompress: 一款基于huffman编码和最小堆的压缩、解压缩小程序

    前言 最近基于huffman编码和最小堆排序算法实现了一个压缩.解压缩的小程序.其源代码已经上传到github上面: Jcompress下载地址 .在本人的github上面有一个叫Utility的re ...

  3. SQL CRUD 简单查询

    identity 自增长 primary key 主键 unique 唯一键 not null 非空 references 外键(引用) 1.删除表 drop table Student 2.修改表 ...

  4. Kafka 0.10 KafkaConsumer流程简述

    ConsumerConfig.scala 储存Consumer的配置 按照我的理解,0.10的Kafka没有专门的SimpleConsumer,仍然是沿用0.8版本的. 1.从poll开始 消费的规则 ...

  5. Java性能优化_转载

    一.避免在循环条件中使用复杂表达式 1.在不做编译优化的情况下,在循环中,循环条件会被反复计算,如果不使用复杂表达式,而使循环条件值不变的话,程序将会运行的更快. 2.不可使用多层循嵌套. 二.集合大 ...

  6. uml系列图(一)——与uml的第一次约会

    uml视频终于开始看了,再看之前先大概了解了一下uml都有啥. 老规矩,有图有真相: 暂时的理解就这么多,等到uml看完的时候总结跟现在这张图比一下,应该是有很大的区别吧. uml是一种可视化的建模语 ...

  7. pch 文件

    PCH的文件的用途:      在实际的项目开发中,如果很多地方都在使用某个类的头文件,很多地方都在使用同一个”宏”的时候:很多地方用到了NSLog()函数, 在app发布的时候,想清除掉时,此时就需 ...

  8. java学习阶段三:运算符和结构学习

    import java.util.Scanner;/* * JAVA中运算符的学习: * 算术运算符:+.-.*./ 和 %,两个整数相除,结果还是整数. * 赋值运算符:=.+=.-=.*=./=. ...

  9. Java生成、解析二维码

    今天遇到需求,使用Java生成二维码图片,网搜之后,大神们早就做过,个人总结一下. 目标:借助Google提供的ZXing Core工具包,使用Java语言实现二维码的生成和解析. 步骤如下: 1.m ...

  10. React库

    一.React概述 React是一个是一个开源的js库,用来为数据渲染视图的,由facebook,Instagram社区维护的.(例如美团.阿里.airbnb都在使用React开发) 为什么会出现Re ...