Python使用xslt提取网页数据

1，引言

在Python网络爬虫内容提取器一文我们详细讲解了核心部件：可插拔的内容提取器类gsExtractor。本文记录了确定gsExtractor的技术路线过程中所做的编程实验。这是第一部分，实验了用xslt方式一次性提取静态网页内容并转换成xml格式。

2，用lxml库实现网页内容提取

lxml是python的一个库，可以迅速、灵活地处理 XML。它支持 XML Path Language (XPath) 和 Extensible Stylesheet Language Transformation (XSLT)，并且实现了常见的 ElementTree API。

这2天测试了在python中通过xslt来提取网页内容，记录如下：

2.1，抓取目标

假设要提取集搜客官网旧版论坛的帖子标题和回复数，如下图，要把整个列表提取出来，存成xml格式

2.2，源代码1：只抓当前页，结果显示在控制台

Python的优势是用很少量代码就能解决一个问题，请注意下面的代码看起来很长，其实python函数调用没有几个，大篇幅被一个xslt脚本占去了，在这段代码中，只是一个好长的字符串而已，至于为什么选择xslt，而不是离散的xpath或者让人挠头的正则表达式，请参看《Python即时网络爬虫项目启动说明》，我们期望通过这个架构，把程序员的时间节省下来一大半。

可以拷贝运行下面的代码(在windows10， python3.2下测试通过)：

from urllib import request

from lxml import etree

url="http://www.sina.com/cn/forum/7"  #由于博客园的限制，如果你要运行该段代码的话请将‘sina’替换成‘gooseeker’

conn=request.urlopen(url)

doc = etree.HTML(conn.read())

xslt_root = etree.XML("""\

<xsl:stylesheet version="1.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform" >

<xsl:template match="/">

<列表>

<xsl:apply-templates select="//*[@id='forum' and count(./table/tbody/tr[position()>=1 and count(.//*[@class='topic']/a/text())>0])>0]" mode="列表"/>

</列表>

</xsl:template>

<xsl:template match="table/tbody/tr[position()>=1]" mode="list">

<item>

<标题>

<xsl:value-of select="*//*[@class='topic']/a/text()"/>

<xsl:value-of select="*[@class='topic']/a/text()"/>

<xsl:if test="@class='topic'">

<xsl:value-of select="a/text()"/>

</xsl:if>

</标题>

<回复数>

<xsl:value-of select="*//*[@class='replies']/text()"/>

<xsl:value-of select="*[@class='replies']/text()"/>

<xsl:if test="@class='replies'">

<xsl:value-of select="text()"/>

</xsl:if>

</回复数>

</item>

</xsl:template>

<xsl:template match="//*[@id='forum' and count(./table/tbody/tr[position()>=1 and count(.//*[@class='topic']/a/text())>0])>0]" mode="列表">

<item>

<list>

<xsl:apply-templates select="table/tbody/tr[position()>=1]" mode="list"/>

</list>

</item>

</xsl:template>

</xsl:stylesheet>""")

transform = etree.XSLT(xslt_root)

result_tree = transform(doc)

print(result_tree)

源代码请通过本文结尾的GitHub源下载。

2.3，抓取结果

得到的抓取结果如下图：

2.4，源代码2：翻页抓取，结果存入文件

我们对2.2的代码再做进一步修改，增加翻页抓取和存结果文件功能，代码如下：

from urllib import request

from lxml import etree

import time

xslt_root = etree.XML("""\

<xsl:stylesheet version="1.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform" >

<xsl:template match="/">

<列表>

<xsl:apply-templates select="//*[@id='forum' and count(./table/tbody/tr[position()>=1 and count(.//*[@class='topic']/a/text())>0])>0]" mode="列表"/>

</列表>

</xsl:template>

<xsl:template match="table/tbody/tr[position()>=1]" mode="list">

<item>

<标题>

<xsl:value-of select="*//*[@class='topic']/a/text()"/>

<xsl:value-of select="*[@class='topic']/a/text()"/>

<xsl:if test="@class='topic'">

<xsl:value-of select="a/text()"/>

</xsl:if>

</标题>

<回复数>

<xsl:value-of select="*//*[@class='replies']/text()"/>

<xsl:value-of select="*[@class='replies']/text()"/>

<xsl:if test="@class='replies'">

<xsl:value-of select="text()"/>

</xsl:if>

</回复数>

</item>

</xsl:template>

<xsl:template match="//*[@id='forum' and count(./table/tbody/tr[position()>=1 and count(.//*[@class='topic']/a/text())>0])>0]" mode="列表">

<item>

<list>

<xsl:apply-templates select="table/tbody/tr[position()>=1]" mode="list"/>

</list>

</item>

</xsl:template>

</xsl:stylesheet>""")

baseurl="http://www.sina.com/cn/forum/7"   #由于博客园的限制，如果你要运行该代码的话，将'sina'替换成'gooseeker‘

basefilebegin="jsk_bbs_"

basefileend=".xml"

count=1

while (count < 12):

        url=baseurl + "?page=" + str(count)

        conn=request.urlopen(url)

        doc = etree.HTML(conn.read())

        transform = etree.XSLT(xslt_root)

        result_tree = transform(doc)

        print(str(result_tree))

        file_obj=open(basefilebegin+str(count)+basefileend,'w',encoding='UTF-8')

        file_obj.write(str(result_tree))

        file_obj.close()

        count+=1

        time.sleep(2)

我们增加了写文件的代码，还增加了一个循环，构造每个翻页的网址，但是，如果翻页过程中网址总是不变怎么办？其实这就是动态网页内容，下面会讨论这个问题。

3，总结

这是开源Python通用爬虫项目的验证过程，在一个爬虫框架里面，其它部分都容易做成通用的，就是网页内容提取和转换成结构化的操作难于通用，我们称之为提取器。但是，借助GooSeeker可视化提取规则生成器MS谋数台，提取器的生成过程将变得很便捷，而且可以标准化插入，从而实现通用爬虫，在后续的文章中会专门讲解MS谋数台与Python配合的具体方法。

4，接下来阅读

本文介绍的方法通常用来抓取静态网页内容，也就是所谓的html文档中的内容，目前很多网站内容是用javascript动态生成的，一开始html是没有这些内容的，通过后加载方式添加进来，那么就需要采用动态技术，请阅读《Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容》

5，集搜客GooSeeker开源代码下载源

1. GooSeeker开源Python网络爬虫GitHub源

6，文档修改历史

2016-05-26：V2.0，增补文字说明；把跟帖的代码补充了进来
2016-05-29：V2.1，增加最后一章源代码下载源

Python使用xslt提取网页数据的更多相关文章

python爬虫-提取网页数据的三种武器
常用的提取网页数据的工具有三种xpath.css选择器.正则表达式 1.xpath 1.1在python中使用xpath必须要下载lxml模块: lxml官方文档 :https://lxml.de/i ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
python笔记之提取网页中的超链接
python笔记之提取网页中的超链接对于提取网页中的超链接,先把网页内容读取出来,然后用beautifulsoup来解析是比较方便的.但是我发现一个问题,如果直接提取a标签的href,就会包含jav ...
Python【BeautifulSoup解析和提取网页数据】
[解析数据] 使用浏览器上网,浏览器会把服务器返回来的HTML源代码翻译为我们能看懂的样子在爬虫中,也要使用能读懂html的工具,才能提取到想要的数据 [提取数据]是指把我们需要的数据从众多数据中挑 ...
API例子：用Python驱动Firefox采集网页数据
1,引言本文讲解怎样用Python驱动Firefox浏览器写一个简易的网页数据采集器.开源Python即时网络爬虫项目将与Scrapy(基于twisted的异步网络框架)集成,所以本例将使用Scra ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
python python 入门学习之网页数据爬虫cnbeta文章保存
需求驱动学习的动力. 因为我们单位上不了外网所以读新闻是那么的痛苦,试着自己抓取网页保存下来,然后离线阅读.今天抓取的是cnbeta科技新闻,抓取地址是http://m.cnbeta.com/wap/ ...
python爬取动态网页数据，详解
原理:动态网页,即用js代码实现动态加载数据,就是可以根据用户的行为,自动访问服务器请求数据,重点就是:请求数据,那么怎么用python获取这个数据了? 浏览器请求数据方式:浏览器向服务器的api(例 ...
Python爬虫之-动态网页数据抓取
什么是AJAX: AJAX(Asynchronouse JavaScript And XML)异步JavaScript和XML.过在后台与服务器进行少量数据交换,Ajax 可以使网页实现异步更新.这意 ...

随机推荐

css之自动换行-设计师零张
自动换行问题,正常字符的换行是比较合理的,而连续的数字和英文字符常常将容器撑大,挺让人头疼,下面介绍的是CSS如何实现换行的方法对于div,p等块级元素正常文字的换行(亚洲文字和非亚洲文字)元素拥 ...
Python-----格式化字符
摘要: Python中 %s . %r Python中也有类似于C中的 printf()格式输出,使用 % 运算符,格式: 格式标记字符串 % 要输出的值组右边的”值组“若有两个及以上的值则需要用小 ...
Jasper_table_resolve get multiple copies of table in detail band issue
resolve method: (1) put table component into the Title band / Page Header band / Summary band, not i ...
Escape character is '^]'. Connection closed by foreign host.
今天在用易汇金的接口回调时候,老是回调不到我的机器上面.我的ip通过公网映射,按说是可以访问到我的ip,思考是什么问题. 1.防火墙关闭,不行 2.防火墙开启,但是把自己的端口号改为可以访问(参考:h ...
PHP中$_GET['name']与$_POST['name']变量直接用变量名$name的php配置
php中,可以直接使用参数名称作为变量来接收get或post的传参,条件是php.ini中register_global设置成On 另外一种方法: if(!ini_get('register_glob ...
The Angles of a Triangle
The Angles of a Triangle You are given the lengths for each side on a triangle. You need to find all ...
【转】Android(4.2) Sensors 学习——G-sensor,Gyroscope驱动移植
原文网址:http://blog.csdn.net/nxh_love/article/details/11804841 本人对驱动可谓是一点不懂,鉴于公司目前高驱动的人手不够,所以我也只能两眼一抹黑硬 ...
CSS3 新特性开放字体格式WOFF
疑问上面这是虾米玩意? \e806 是在自定义字体表中的字体位置. 好嘛现在问题来了 WOFF里面是什么东西呢? 怎么才能看到? 用这个:FontCreatorPortable ...
softlayer virtual machine vhd磁盘镜像导入shell脚本
脚本
计算机视觉库 SimpleCV
SimpleCV首页.文档和下载 - 计算机视觉库 - 开源中国社区计算机视觉库 SimpleCV 编辑/纠错分享到新浪微博腾讯微博已用 +0 收藏 + ...

Python使用xslt提取网页数据

Python使用xslt提取网页数据的更多相关文章

随机推荐

热门专题