python模块之HTMLParser之穆雪峰的案例(理解其用法原理)

# -*- coding: utf-8 -*-

#python 27

#xiaodeng

#python模块之HTMLParser之穆雪峰的案例(理解其用法原理)

#http://www.cnblogs.com/xiaowuyi/archive/2012/10/15/2721658.html

#常见做法：首先，我们需要定义一个新的HTMLParser类，以覆盖handle_starttag()方法，我们将使用这个方法来显示所有标签的HRef属性值。

from HTMLParser import HTMLParser

class MyHTMLParser(HTMLParser):

    def handle_starttag(self, tag, attrs):

        #print('<开始标签:%s>' % tag)

        #print '---------some img--------'

        if tag=='img':

            #print attrs#[('src', 'python-logo.png'), ('alt', 'The Python logo')]

            for k ,v in attrs:

                print k,v

        else:

            pass

    def handle_endtag(self, tag):

        print('<结束标签：/%s>' % tag)

    def handle_startendtag(self, tag, attrs):

        print('<%s/>' % tag)

    def handle_data(self, data):

        print 'data:',data

    def handle_comment(self, data):

        print '<!-- -->',data

    def handle_decl(self, decl):

        print '文档类型声明:',decl

    '''

    def handle_entityref(self, name):#处理一些特殊字符，以&开头的

        print('&%s;' % name)

    def handle_charref(self, name):#处理特殊字符串，就是以&#开头的，一般是内码表示的字符

        print('&#%s;' % name)

    '''

parser = MyHTMLParser()

content=''''<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01//EN"

<html>

    <head>

    </head>

        <body>

            <p>Some

                <a href=\"#\">html</a> tutorial...<br>END

                <!-- i am Notes Content-->

                <img src="python-logo.png" alt="The Python logo">

            </p>

        </body>

</html>

'''

import urllib

html=urllib.urlopen('http://www.163.com').read()

#parser.feed(html)

parser.feed(content)

parser.close()

python模块之HTMLParser之穆雪峰的案例(理解其用法原理)的更多相关文章

python模块介绍- HTMLParser 简单的HTML和XHTML解析器
python模块介绍- HTMLParser 简单的HTML和XHTML解析器 2013-09-11 磁针石 #承接软件自动化实施与培训等gtalk:ouyangchongwu#gmail.comqq ...
python模块之HTMLParser(原理很大程度上就是对类构造的熟练运用)
# -*- coding: utf-8 -*- #python 27 #xiaodeng #python模块之HTMLParser(原理很大程度上就是对类构造的熟练运用) import HTMLPar ...
python模块之HTMLParser抓页面上的所有URL链接
# -*- coding: utf-8 -*- #python 27 #xiaodeng #python模块之HTMLParser抓页面上的所有URL链接 import urllib #MyParse ...
python模块之HTMLParser解析出URL链接
# -*- coding: utf-8 -*- #python 27 #xiaodeng #python模块之HTMLParser解析出URL链接 #http://www.cnblogs.com/mf ...
python模块之HTMLParser
HTMLParser是python用来解析html的模块.它可以分析出html里面的标签.数据等等,是一种处理html的简便途径. HTMLParser采用的是一种事件驱动的模式,当HTMLParse ...
python模块学习---HTMLParser(解析HTML文档元素)
HTMLParser是Python自带的模块,使用简单,能够很容易的实现HTML文件的分析. 本文主要简单讲一下HTMLParser的用法. 使用时需要定义一个从类HTMLParser继承的类,重定义 ...
python模块之HTMLParser简介
html.parser是一个非常简单和实用的库,它的核心是HTMLParser类. 工作的流程是:当你feed给它一个类似HTML格式的字符串时,它会调用goahead方法向前迭代各个标签,并调用对应 ...
python模块使用案例
python模块使用案例一.使用MySQLdb模块代码示例: # 导入 MySQLdb模块 import MySQLdb # 和服务器建立链接,host是服务器ip,我的MySQL数据库搭建在本机, ...
Python模块、包、异常、文件(案例)
Python模块.包.异常.文件(案例) python.py #模块 # Python中的模块(Module),是一个Python文件,以.py文件结尾,包含了Python对象定义和Python语句, ...

随机推荐

Java和C#差异点
语法:----------------------------------------------------------1. Java的byte为-128~127相当于c#的sbyte,c#byte ...
[转]用 jQuery 实现页面滚动（Scroll）效果的完美方法
转自: http://zww.me/archives/25144 很多博主都写过/转载过用 jQuery 实现页面滚动(Scroll)效果的方法,但目前搜来的方法大都在 Opera 下有个小 Bug: ...
JavaScript：Number 对象
ylbtech-JavaScript:Number 对象 1. Number 对象返回顶部 Number 对象 Number 对象是原始数值的包装对象. 创建 Number 对象的语法: var my ...
C/C++log日志库比较
事实上,在C的世界里面没有特别好的日志函数库(就像Java里面的的log4j,或者C++的log4cxx).C程序员都喜欢用自己的轮子.printf就是个挺好的轮子,但没办法通过配置改变日志的格式或者 ...
WinCE程序调试方法【转】
刚刚接触WinCE编程,感觉大部分跟WinForm一样.刚开始的时候,不知道怎么进行断点调试,后来同事告诉我,可以直接连接进行断点调试,一试之下,果然好用,所以拿出来分享一下. 必备工具: Micro ...
BUG的严重级别分类 BUG状态标准
英文参考 BUG的严重级别分类 Severity This field describes the impact of a bug. Blocker Blocks development and/or ...
spring boot整合mybatis+mybatis-plus
Spring boot对于我来说是一个刚接触的新东西,学习过程中,发现这东西还是很容易上手的,Spring boot没配置时会默认使用Spring data jpa,这东西可以说一个极简洁的工具,可是 ...
springboot下配置多数据源
摘自: http://blog.csdn.net/wangqingqi20005/article/details/52613055
php7安装mongoDB扩展
本文我们使用pecl命令来安装首先来到php7的安装目录 $ /usr/local/php7/bin/pecl install mongodb 回车,执行成功后,会输出以下结果: …… Build ...
Mat类具体解释（二）
Mat::~Mat Mat的析构函数. C++: Mat::~Mat() 析构函数调用Mat::release(). Mat::operator = 提供矩阵赋值操作. C++: Mat& M ...

python模块之HTMLParser之穆雪峰的案例(理解其用法原理)

python模块之HTMLParser之穆雪峰的案例(理解其用法原理)的更多相关文章

随机推荐

热门专题