windows 下安装tidylib

先去https://pypi.python.org/pypi/pytidylib

跑官方提供的测试用例报错

ition 0: unexpected end of data

Traceback (most recent call last):

  File "_ctypes/callbacks.c", line 314, in 'calling callback function'

  File "D:\Python27\lib\site-packages\tidylib\sink.py", line 79, in put_byte

    write_func(byte.decode('utf-8'))

  File "D:\Python27\lib\encodings\utf_8.py", line 16, in decode

    return codecs.utf_8_decode(input, errors, True)

UnicodeDecodeError: 'utf8' codec can't decode byte 0xb7 in position 0: invalid start byte

解决办法：

去http://www.paehl.com/open_source/?HTML_Tidy_for_Windows 下载LIBTIDY DLL

将dll解压到python安装目录下的Scripts文件夹即可

解决xpath提取不规则网页的问题

在数据采集时，处理不规范的HTML页面是件令人头疼的事。因为不规范的HTML页面往往会引起xpath解析失败，造成得不到正确的数据。
这里引入tidylib,实例采用抓取慧聪网为例子,使用示例如下,

from tidylib import tidy_document

import requests

from lxml import etree

url = "https://s.hc360.com/?w=%BF%D5%B5%F7"

s = requests.Session()

# proxies={

#     "https":"https://192.168.43.1:1800"

# }

headers = {

    "Host": "s.hc360.com",

    "user-agent": "Mozilla/5.0 (X11; Linux x86_64) "

                  "AppleWebKit/537.36 (KHTML, like Gecko)"

                  " Chrome/67.0.3396.87 Safari/537.36",

    "cookies": "hcsearchurlport=1; visitid_time=2018-8-27%2011%3A0%3A1; hc360visitid=C81E205C97B000016A91177717E91DA7; hc360first_time=2018-08-27; hcbrowserid=C81E205CA0100001BD5AC09D4D99F260; hckIndex=C81E205CA0A00001613715F0773DE730; topmatchkey=; Hm_lvt_1437b8f613f9fcba581e33d8d178e1f5=1535338807; hccordet=00; hcpreurl=; hclastsearchkeyword=%u7A7A%u8C03; Hm_lvt_e1e386be074a459371b2832363c0d7e7=1535338809; hc360sessionid=C81E205EE6000001B74C508019802980; hc360sessionid=C81E205EE6000001B74C508019802980; hc360firstvisittime=1535338811032; hc360firstvisittime=1535338811032; _ga=GA1.2.1558106052.1535338807; _gid=GA1.2.1254508720.1535338856; hc360analyid=C81E24E7EC600001801D413B1900ED60; hc360analycopyid=C81E24E7EC6000016E7E7D601F0098B0; Hm_lpvt_1437b8f613f9fcba581e33d8d178e1f5=1535345882;"

               " Hm_lpvt_e1e386be074a459371b2832363c0d7e7=1535345884; hc5minbeat=1535346223259"

}

response = s.get(url, headers=headers).text

response, errors = tidy_document(response)

res = etree.HTML(response)

items = res.xpath('//div/ul/li[contains(@class,"grid-list")]')

print(response)

print(len(items))

for item in items:

    d = dict()

    d['name'] = item.xpath('.//div[2]/dl/dd/p/a/text()')

    d['title'] = item.xpath('.//div[@class="NewItem"]/div/a/@title')

    d['price'] = item.xpath('.//div[2]/dl/dt/span/text()')

    d['bcid'] = item.xpath('.//div[@class="NewItem"]/@data-bcid')

    d['username'] =item.xpath('.//div[@class="NewItem"]/@data-username')

    d['tel'] =item.xpath('./@data-telphone')

    d['businid'] =item.xpath('./@data-businid')

    d['sellerproviderid'] =item.xpath('./@data-sellerproviderid')

    d['supcatid'] =item.xpath('./@data-supcatid')

    d['main_product'] =item.xpath('.//div[@class="NewItem"]/@data-obj')

    print(d)

可以匹配导数据

{'businid': [''], 'username': ['yzhh'], 'sellerproviderid': [''], 'bcid': [''], 'tel': [''], 'price': ['2.36万/套'], 'supcatid': [''], 'title': ['HAIER/海尔家用中央空调智尊·MXS系列一拖四套餐/室外机5匹125-4-A'], 'name': ['青岛海尔空调电子'], 'main_product': ['空调,:0']}

{'businid': [''], 'username': ['yhjddmc'], 'sellerproviderid': [''], 'bcid': [''], 'tel': [''], 'price': ['450.00/台'], 'supcatid': [''], 'title': ['安徽优质供应风机盘管|2匹壁挂式远博牌风机盘管|德州远博空调'], 'name': ['德州远博空调有限'], 'main_product': ['风机盘管机组,水源热泵机组,地源热泵机组,恒温恒湿机组 ,风冷冷（热）水机组,水冷冷（热）水机组,卡式风机盘管,卧式明装风机盘管,卧室暗装风机盘管 ,立式明装风机盘管,空气处理机组,组合式空调机组 ,立式暗装风机盘管,风机盘管,嵌入式风机盘管:0']}

{'businid': [''], 'username': ['hisurp'], 'sellerproviderid': [''], 'bcid': [''], 'tel': [''], 'price': ['5000.00/台'], 'supcatid': [''], 'title': ['GLONTER/吉霖特射流机组 车间降温空调 工厂降空调 工业车间空调 高大空间空调'], 'name': ['浙江吉霖特制冷设'], 'main_product': ['精密机房空调,特种定制空调,高温空调,屋顶式空调机组,直膨式空调机组,工业空调,风冷热泵机组,集装箱空调,洁净式空调机组,恒温恒湿机组,全新风空调机组,帐篷空调,组合式空调机组,医用净化风机盘管,电气室专用空调,粮库空调,三联供空调,冷凝热回收排风机组,基站空调,电柜空调:0']}

......

使用tidylib解决不规则网页问题的更多相关文章

解决Chrome网页编码显示乱码的问题
解决Chrome网页编码显示乱码的问题记得在没多久以前,Google Chrome上面出现编码显示问题时,可以手动来调整网页编码问题,可是好像在Chrome 55.0版以后就不再提供手动调整编码,所 ...
解决Jsoup网页抓取过程中需要cookie的问题
最近在做城觅网的信息抓取,发现城觅网上海与北京的url是一样的.那怎样才确定信息的来源呢?折腾了半天,才发现城觅网是使用cookie的,如果你把网站的cookie禁用了,就无法在上海与北京之间切换了. ...
【PHP】解决html网页乱码问题
在自己制作一个网页时,时常会遇到网页乱码的问题. 其实导致网页乱码主要有几个原因,以下给出解决方法. 1.HTML的字符编码问题该问题较常见,也是最明显和最容易解决的. 在网页<head> ...
css3处理sprite背景图压缩来解决H5网页在手机浏览器下图标模糊的问题
近期在负责一个微信H5 App项目,遇到一个郁闷的问题,手机浏览器查看网页时图标都是模糊的,有锯齿,电脑浏览器显示则是正常.大概知道是分辨率适配等类型的问题,后来网上查找了一些办法.大部分的解决方式都 ...
如何解决Angular网页内嵌推特时间线无法正常显示
我最近解决了一个折磨了我好久但是解决方法却只是添加两三行代码的问题.我没有在网上找到合适的解决方案,最后是我根据官方网站和很多的帖子里的部分代码得到的启发,尝试了很久之后得到的解决方法.因为过程实在是 ...
解决Zabbix网页端Get value error: cannot connect to [[192.168.238.139]:10050]: [113] No route to host问题
在安装配置完zabbix_agentd以后,网页端出现 Get value error: cannot connect to [[192.168.238.139]:10050]: [113] No ...
curl_multi_select解决curl_multi网页假死问题
curl_multi可以批处理事务,给网页编程带来很大的方便.不过在使用curl_multi的过程中,我们会遇到一个比较头疼的问题,那就是当并发处理的事务数量过多的时候,就会出现CPU过高,网页假死的 ...
Filter 解决web网页跳转乱码
为什么采用filter实现了字符集的统一编码问题: 为什么会有字符集编码的问题呢?对于Java Web应用,使用Tomcat容器获取和传递的参数(request.getParameter())默认是 ...
解决php网页运行超时问题:Maximum execution time of 30 seconds exceeded
Fatal error: Maximum execution time of 30 seconds exceeded in C:\Inetpub\wwwroot\ry.php on line 11 意 ...

随机推荐

第9章 scrapy-redis分布式爬虫
9-1 分布式爬虫要点 1.分布式的优点充分利用多机器的宽带加速爬取充分利用多机的IP加速爬取速度问:为什么scrapy不支持分布式? 答:在scrapy中scheduler是运行在队列的,而队 ...
微信WeUI入门2
引入需要的样式文件最重要的css文件为 weui.min.css 基本的框架如下: <!DOCTYPE html> <html lang="zh-CN"> ...
ssh 远程拷贝文件到本地
scp userA@192.168.0.205:/home/xinshang-toolkit/wwwroot/macheng/tianxiaohuanew-mc.dsceshi.cn/public/ ...
git pull和git pull --rebase的使用
使用下面的关系区别这两个操作: git pull = git fetch + git merge git pull --rebase = git fetch + git rebase 现在来看看git ...
Eclipse 反编译之 JadClipse
一:下载对应的 net.sf.jadclipse_x.x.x.jar ,把该jar包放入到Eclipse中的 plugins 目录下,下载地址:https://sourceforge.net/proj ...
Spring学习笔记：spring整合web之spring-web架包的引用（WebApplicationContextUtils注入容器）
WebApplicationContextUtils 一.Spring整合web之前案例:给部门列表添加新部门 import org.apache.log4j.Logger; import org. ...
TCP/IP Socket通信demo
一个实例通过client端和server端通讯客户端发送:“我是客户端,请多关照” 服务端回复:“收到来自于"+s.getInetAddress().getHostName()+" ...
java map常用的4种遍历方法
public static void main(String[] args) { Map<String, String> map = new HashMap<String, Stri ...
Golang把所有包括底层类库，输出到stderr的内容，重新定向到一个日志文件里面？
不论应用是如何部署的,我们都期望能扑捉到应用的错误日志, 解决思路: 自己写代码处理异常拦截,甚至直接在main函数中写异常拦截. stderr重定向到某个文件里使用 syscall.Dup2 第一 ...
sql中,In和where的区别
SQL 语句中In 和 Where 的含义不同.应用解释如下: 1.如需有条件地从表中选取.删除.更新数据时,使用Where:2.In只作为Where条件子句下的一个运算符,除了In之外还有Betwe ...

使用tidylib解决不规则网页问题

解决xpath提取不规则网页的问题

使用tidylib解决不规则网页问题的更多相关文章

随机推荐

热门专题