python HTMLparser

1.概述

 如果我们要编写一个搜索引擎，第一步是用爬虫把目标网站的页面抓下来，

 第二步就是解析该HTML页面，看看里面的内容到底是新闻、图片还是视频。

 假设第一步已经完成了，第二步应该如何解析HTML呢？

 HTML本质上是XML的子集，但是HTML的语法没有XML那么严格，所以不能用标准的DOM或SAX来解析HTML。

 也可以用 re正则表达式

 scrapy 框架下的css选择器或者xpath

 仁者见仁智者见智

2.HTMLparser

 # 使用时需要定义一个从类HTMLParser继承的类，重定义函数：

 # handle_starttag( tag, attrs)

 #handle_startendtag( tag, attrs)

 # handle_endtag( tag)

 # 来实现自己需要的功能。

 # tag是的html标签，attrs是 (属性，值)元组(tuple)的列表(list)。

 # HTMLParser自动将tag和attrs都转为小写

 from html.parser import HTMLParser

 class MyHTMLParser(HTMLParser):

     def __init__(self):

         HTMLParser.__init__(self)

         self.links = []

     def handle_starttag(self, tag, attrs):

         #print "Encountered the beginning of a %s tag" % tag

         if tag == "a":

             if len(attrs) == 0:

                 pass

             else:

                 for (variable, value) in attrs:

                     if variable == "href":

                         self.links.append(value)   

 if __name__ == "__main__":

     html_code = """ <a href="www.google.com"> google.com</a> <A Href="www.pythonclub.org"> PythonClub </a> <A HREF = "www.sina.com.cn"> Sina </a> """

     hp = MyHTMLParser()

     hp.feed(html_code)

     hp.close()

     print(hp.links)

 # 运行结果

 # ['www.google.com', 'www.pythonclub.org', 'www.sina.com.cn']

3.总结

个人观点如果是做搜索引擎建议还是用scrapy框架

参照：https://www.cnblogs.com/mfryf/p/3691563.html

python HTMLparser的更多相关文章

Python抓取页面中超链接(URL)的三中方法比较(HTMLParser、pyquery、正则表达式) <转>
Python抓取页面中超链接(URL)的3中方法比较(HTMLParser.pyquery.正则表达式) HTMLParser版: #!/usr/bin/python # -*- coding: UT ...
python中HTMLParser简单理解
找一个网页,例如https://www.python.org/events/python-events/,用浏览器查看源码并复制,然后尝试解析一下HTML,输出Python官网发布的会议时间.名称和地 ...
python模块学习---HTMLParser(解析HTML文档元素)
HTMLParser是Python自带的模块,使用简单,能够很容易的实现HTML文件的分析. 本文主要简单讲一下HTMLParser的用法. 使用时需要定义一个从类HTMLParser继承的类,重定义 ...
python模块介绍- HTMLParser 简单的HTML和XHTML解析器
python模块介绍- HTMLParser 简单的HTML和XHTML解析器 2013-09-11 磁针石 #承接软件自动化实施与培训等gtalk:ouyangchongwu#gmail.comqq ...
python网络爬虫之LXML与HTMLParser
Python lxml包用于解析html和XML文件,个人觉得比beautifulsoup要更灵活些 Lxml中的路径表达式如下: 在下面的表格中,我们已列出了一些路径表达式以及表达式的结果: 路径表 ...
python之HTMLParser解析HTML文档
HTMLParser是Python自带的模块,使用简单,能够很容易的实现HTML文件的分析.本文主要简单讲一下HTMLParser的用法. 使用时需要定义一个从类HTMLParser继承的类,重定义函 ...
Python HTML解析模块HTMLParser(爬虫工具)
简介先简略介绍一下.实际上,HTMLParser是python用来解析HTML的内置模块.它可以分析出HTML里面的标签.数据等等,是一种处理HTML的简便途径.HTMLParser采用的是一种事件 ...
Python HTML操作（HTMLParser）
HTML操作是编程中很重要的一块,下面用Python3.x中的html.parser中的HTMLParser类来进行HTML的解析. HTMLParser类定义及常用方法标准库中的定义 class ...
使用Python中的HTMLParser、cookielib抓取和解析网页、从HTML文档中提取链接、图像、文本、Cookies（二）（转）
对搜索引擎.文件索引.文档转换.数据检索.站点备份或迁移等应用程序来说,经常用到对网页(即HTML文件)的解析处理.事实上,通过 Python语言提供的各种模块,我们无需借助Web服务器或者Web浏览 ...

随机推荐

day 12 函数
函数函数的定义和调用 def 函数名(形参): 函数体 return 返回值调用函数名(实参) 站在形参的角度上: 位置参数, *args, 默认参数(陷阱), 关键字参数, **kwargs ...
Linux centos7 安装 phpMyAdmin
yum install httpd php mariadb-server –y搭建lamp运行环境之后安装phpMyAdmin遇到的一些问题记录一下 1.官网下载phpMyAdmin压缩包 wget ...
java多线程技能-使用多线程-继承Thread类
/* 使用多线程可通过继承Thread类或实现Runnable接口. Thread和Runnable的关系:public class Thread implements Runnable. 使用thr ...
equals和==的使用
1.equals的使用: 引用数据类型的比较:通常情况下比较的是引用数据类型下的栈中的地址,但当你重写了equals方法后就不一定了 User user1=new User("tom&quo ...
C# WPF Bing地图展示
微信公众号:Dotnet9,网站:Dotnet9,问题或建议,请网站留言: 如果您觉得Dotnet9对您有帮助,欢迎赞赏内容目录实现效果业务场景编码实现本文参考源码下载 1.实现效果 Bi ...
Python3 基本语法学习笔记
如何定义python源文件的文件编码如果想要定义文件代码的编码,一个特殊的注释应该放到源文件的第一或第二行,例如: # coding=<encoding name> 或使用一种大多数编 ...
linux查看防火墙状态和对外开放的端口状态
1.查看防火墙状态查看防火墙状态 systemctl status firewalld 开启防火墙 systemctl start firewalld ...
2020.01.19【NOIP提高组】模拟比赛-1.水池,2.数字排序,3.球星,4.钻石交易总结反思
水池比赛时我最讨厌这种数学类题了,我首先想到了这几种情况,设\(jl[][]\)表示两点之间弧的距离,从F到G可以由 F->G F->B->A->G F->A-> ...
AMC Problems and Solutions
AMC Problems and Solutions:https://artofproblemsolving.com/wiki/index.php/AMC_Problems_and_Solutions ...
基于Python接口自动化测试框架(初级篇)附源码
引言很多人都知道,目前市场上很多自动化测试工具,比如:Jmeter,Postman,TestLink等,还有一些自动化测试平台,那为啥还要开发接口自动化测试框架呢?相同之处就不说了,先说一下工具的局 ...

python HTMLparser

python HTMLparser的更多相关文章

随机推荐

热门专题