前言

cheerio是一款非常实用的nodejs第三方包,适用于服务端(nodejs端)处理html。它有着与jquery及其相似(几乎是一致)的api,速度飞快,使用灵活,而且不仅能够处理html,同样也能处理xml。

本文主要的参考文档就是cheerio的官方文档,基本上就是它的翻译。

APIs

cheerio文档的api我将其分为以下几个方面,包括

  • 加载(loading)
  • 选择器(selectors)
  • 属性操作(attributes)
  • 结构推导(traversing)
  • 结构操作(manipulation)
  • 实用方法(Miscellaneous & Utilities)

在具体讲述各个api之前,我们给出一份html代码,这份html代码将会是我们下面所有api操作的示例代码。

1
2
3
4
5
<ul id="fruits">
<li class="apple">Apple</li>
<li class="orange">Orange</li>
<li class="pear">Pear</li>
</ul>

加载(loading)

在使用cheerio进行各种操作之前,我们需要首先加载一份html得到一个cherrio对象。比如

1
2
var cheerio = require('cheerio');
var $ = cheerio.load('<ul>...</ul>');

因为cheerio与jquery有着极其相似的语法,所以我们一般将得到的cheerio对象命名为$,装作它就是jquery对象,反正基本上用法都一样。

除了.load()方法之外,我们还可以使用$( selector, [context], [root] )这个api来获得部分html节点作为cheerio对象。比如

1
2
3
var $ = require('cheerio');
var t1 = $('ul', '<ul id = "fruits">...</ul>');
var t2 = $('li', 'ul', '<ul id = "fruits">...</ul>');

其中第一个参数就是我们获取的目标参数。所以t1得到是ul标签封装的cheerio对象,t2得到是3个li标签封装的cheerio对象的集合。

此外,我们在加载html时还可以设置一些配置参数,比如

1
2
3
4
$ = cheerio.load('<ul id = "fruits">...</ul>', {
ignoreWhitespace: true,
xmlMode: true
});

关于cheerio的配置,一般我们用的较少,它默认的配置如下,

1
2
3
4
5
{
ignoreWhitespace: false, // 是否忽略空白符
xmlMode: false, // 是否是解析xml文档
lowerCaseTags: false // 是否采用xml模式处理。这将会影响部分tag的处理。
}

关于cheerio配置的更多内容,请参考这里这里

选择器(selectors)

cheerio的选择器基本上跟jquery拥有一致的用法。如果你熟悉jquery,那你将会倍感亲切。

1
$(selector, [context], [root])

其中selector是目标选择器,context是目标选择器的上下文,root是上下文context的上下文。selectorcontext可以是字符串表达式、dom元素、dom元素集合、cheerio对象,而root一般都是html文档字符串。

一般地,我们通过cheerio操作html,都是以上面的这个api得到目标元素的cheerio对象开始,然后再进行各种操作。比如

1
2
3
4
5
$('.apple', '#fruits').text(); //=> Apple

$('ul .pear').attr('class'); //=> pear

$('li[class=orange]').html(); //=> <li class="orange">Orange</li>

属性操作(attributes)

cheerio提供了操作元素属性的一系列方法。

.attr(name[, value])

这个方法很简单,第二个参数是可选的。当只有第一个参数时表示获取属性的值,当有带有第二个参数时,表示设置属性的值。

1
2
3
4
$('ul').attr('id'); //=> fruits

$('.apple').attr('id', 'favorite').html();
//=> <li class="apple" id="favorite">Apple</li>

.removeAttr(name)

通过name移除某一个属性,同时返回被移除的这个元素。

1
2
$('.pear').removeAttr('class').html();
//=> <li>Pear</li>

.hasClass(className)

判断某元素的class中是否包含className

1
2
3
4
5
$('.pear').hasClass('pear'); //=> true

$('apple').hasClass('fruit'); //=> false

$('li').hasClass('pear'); //=> true

.addClass(className)

给某元素添加一个名为className的样式名。

1
2
3
4
5
$('.pear').addClass('fruit').html();
//=> <li class = "pear fruit">Pear</li> $('.apple').addClass('fruit red').html();
//=> <li class = "apple fruit red">Apple</li>

.removeClass(className)

将某元素上名为className的样式名移除。如果不存在className,则移除所有的样式名。

1
2
3
4
5
$('.pear').removeClass('pear').html();
//=> <li class="">Pear</li> $('.apple').addClass('red').removeClass().html();
//=> <li class="">Apple</li>

结构推导(traversing)

可以像使用jquery那样使用cheerio,通过某一个元素来获取它的父元素、子元素、兄弟元素等等。

.find(selector)

在某元素下查询满足选择条件的元素。

1
$('#fruits').find('li').length; //=> 3

.parent()

获取某元素的父元素。

1
$('.pear').parent().attr('id'); //=> fruits

.next()

获取某元素的下一个兄弟元素。

1
$('.apple').next().hasClass('orange'); //=> true

.perv()

获取某元素的上一个兄弟元素。

1
$('.orange').prev().hasClass('apple'); //=> true

.siblings()

获取某元素的所有同级元素。(当然除了它自己)

1
$('.pear').siblings().length; //=> 2

.children([selector])

获取某元素的孩子节点。可以传入参数在所有的孩子节点中进行筛选。

1
2
3
$('#fruits').children().length; //=> 3

$('#fruits').children('.pear').text(); //=> Pear

.each(function(index, element){...})

和jquery类似的each迭代器,对每一个元素进行处理。

1
2
3
4
5
6
7
var fruits = [];

$('li').each(function(i, elem) {
fruits[i] = $(this).text();
}); fruits.join(', '); //=> Apple, Orange, Pear

.map(function(index, element){...})

和jquery类似的each迭代器,对每一个元素进行处理并返回一个值。

1
2
3
4
$('li').map(function(i, el) {
// this === el
return $(this).attr('class');
}).get().join(', '); //=> apple, orange, pear

.filter(selector) & .filter(function(index))

在cheerio对象集合中进行条件筛选。

1
2
3
4
5
6
$('li').filter('.orange').attr('class'); //=> orange

$('li').filter(function(i, el) {
// this === el
return $(this).attr('class') === 'orange';
}).attr('class') //=> orange

.first()

获取cheerio集合中的第一个cheerio对象。

1
$('#fruits').children().first().text(); //=> Apple

.last()

获取cheerio集合中的最后一个cheerio对象。

1
$('#fruits').children().last().text(); //=> Pear

.eq(i)

根据索引获取cheerio集合中的某一个对象。参数可以使负数,表示从尾部开始索引。

1
2
3
$('li').eq(0).text(); //=> Apple

$('li').eq(-1).text(); //=> Pear

结构操作(manipulation)

cheerio提供一系列修改dom结构的方法。

.append(content, [content, ...])

content插入到某元素中作为该元素的最后一个子元素。

1
2
3
4
5
6
7
8
$('ul').append('<li class = "plum">Plum</li>');
$.html();
// <ul id = "fruits">
// <li class = "apple">Apple</li>
// <li class = "orange">Orange</li>
// <li class = "pear">Pear</li>
// <li class = "plum">Plum</li>
// </ul>

.prepend(content, [content, ...])

content插入到某元素中作为该元素的第一个子元素。

1
2
3
4
5
6
7
8
$('ul').prepend('<li class = "plum">Plum</li>');
$.html();
// <ul id = "fruits">
// <li class = "plum">Plum</li>
// <li class = "apple">Apple</li>
// <li class = "orange">Orange</li>
// <li class = "pear">Pear</li>
// </ul>

.after(content, [content, ...])

content插入到某元素的后面,并作为其后面第一个兄弟节点。

1
2
3
4
5
6
7
8
$('.apple').after('<li class = "plum">Plum</li>');
$.html();
// <ul id = "fruits">
// <li class = "apple">Apple</li>
// <li class = "plum">Plum</li>
// <li class = "orange">Orange</li>
// <li class = "pear">Pear</li>
// </ul>

.before(content, [content, ...])

content插入到某元素的前面,并作为其前面的第一个兄弟节点。

1
2
3
4
5
6
7
8
$('.apple').before('<li class = "plum">Plum</li>');
$.html();
// <ul id = "fruits">
// <li class = "plum">Plum</li>
// <li class = "apple">Apple</li>
// <li class = "orange">Orange</li>
// <li class = "pear">Pear</li>
// </ul>

.remove([selector])

移除某一个节点以及他们的孩子节点。

1
2
3
4
5
6
$('.pear').remove();
$.html();
// <ul id = "fruits">
// <li class = "apple">Apple</li>
// <li class = "orange">Orange</li>
// </ul>

.replaceWith(content)

替换匹配的节点。

1
2
3
4
5
6
7
8
var plum = $('<li class = "plum">Plum</li>');
$('.pear').replaceWith(plum);
$.html();
// <ul id = "fruits">
// <li class = "apple">Apple</li>
// <li class = "orange">Orange</li>
// <li class = "plum">Plum</li>
// </ul>

.empty()

清空一个节点,移除其所有的孩子节点。

1
2
3
$('ul').empty();
$.html();
// <ul id = "fruits"></ul>

.html([htmlString])

获取某节点的html字符串。如果传入参数,则设置该元素的html结构。

1
2
3
4
$('.orange').html(); //=> Orange

$('#fruits').html('<li class = "mango">Mango</li>').html();
//=> <li class="mango">Mango</li>

.text([textString])

获取某节点的纯文本。

1
2
3
4
5
6
7
$('.orange').text();
//=> Orange $('ul').text();
//=> Apple
// Orange
// Pear

实用方法(Miscellaneous & Utilities)

.toArray()

将cheerio对象集合转换成真正的数据结构。

1
2
$('li').toArray();
//=> [ {...}, {...}, {...} ]

.clone()

克隆一个节点。

1
var moreFruit = $('#fruits').clone();

$.root

对某一cheerio对象的根节点进行相关操作。

1
2
$.root().append('<ul id="vegetables"></ul>').html();
//=> <ul id="fruits">...</ul><ul id="vegetables"></ul>

$.contains(container, contained)

检查container中是否是否包含contained元素。

1
$.contains('#fruits', '.pear'); // => true

End! All rights reserved @gejiawen.

通读Cheerio文档的更多相关文章

  1. 通读cheerio API ——NodeJs中的jquery

    通读cheerio API ——NodeJs中的jquery 所谓工欲善其事,必先利其器,所以通读了cheerio的API,顺便翻译了一遍,有些地方因为知道的比较少,不知道什么意思,保留了英文,希望各 ...

  2. IO流-ZIP文档

    java中通常使用ZipInputStream来读ZIP文档 ZIP文档(通常)以压缩格式存储了一个或多个文件,每个ZIP文档都有一个包含诸如文件 名字和所使用的压缩方法等信息的头.在Java中,可以 ...

  3. [转]支付宝接口程序、文档及解读(ASP.NET)

    本文转自:http://www.cnblogs.com/blodfox777/archive/2009/11/03/1595223.html 最近需要为网站加入支付宝的充值接口,而目前关于支付宝接口开 ...

  4. [ Laravel 5.5 文档 ] 快速入门 —— 目录结构篇

    简介 Laravel 默认的目录结构试图为不管是大型应用还是小型应用提供一个良好的起点.当然,你也可以按照自己的喜好重新组织应用的目录结构,因为 Laravel 对于指定类在何处被加载没有任何限制 — ...

  5. 20165234 [第二届构建之法论坛] 预培训文档(Java版) 学习总结

    [第二届构建之法论坛] 预培训文档(Java版) 学习总结 我通读并学习了此文档,并且动手实践了一遍.以下是我学习过程的记录~ Part1.配置环境 配置JDK 原文中提到了2个容易被混淆的概念 JD ...

  6. 通读cheerio API

    所谓工欲善其事,必先利其器,所以通读了cheerio的API,顺便翻译了一遍,有些地方因为知道的比较少,不知道什么意思,保留了英文,希望各位不吝告诉我,然后一起把这个翻译完成. ###cheerio ...

  7. 通读cheerio API-网络爬虫

    所谓工欲善其事,必先利其器,所以通读了cheerio的API,顺便翻译了一遍,有些地方因为知道的比较少,不知道什么意思,保留了英文,希望各位不吝告诉我,然后一起把这个翻译完成. ###cheerio ...

  8. 9、perldoc文档阅读器

    转载:http://www.cnblogs.com/nkwy2012/p/6016320.html 一般来说,将文档的名称作为参数传递给perldoc命令,即可查阅该文档.比如下面,给定文档名称per ...

  9. 支付宝接口程序、文档及解读(ASP.NET)

    最近需要为网站加入支付宝的充值接口,而目前关于支付宝接口开发的资料比较杂乱,这里就我此次开发所用到的资料进行汇总整理,希望能够帮助需要的朋友. 开发步骤: 1. 确定签约类型 支付宝的接口有多种类型, ...

随机推荐

  1. cefsharp wpf 中文输入问题解决方法

    摘要 最近在搞一个客户端的项目,考虑使用wpf,内嵌webView的方式,访问h5页面.所以使用了CefSharp组件,但发现一个问题,就是在输入中文的时候,无法输入. 解决办法 去官方github的 ...

  2. MySQL主从复制的原理及配置方法(比较详细)

    MySQL 的数据库的高可用性的架构大概有以下几种:集群,读写分离,主备.而后面两种都是通过复制来实现的.下面将简单介绍复制的原理及配置,以及一些常见的问题 一.复制的原理 MySQL 复制基于主服务 ...

  3. 玩一下C#的语音识别

    在.NET4.0中,我可以借助System.Speech组件让电脑来识别我们的声音. 以上,当我说"name",显示"Darren",我说"age&q ...

  4. i386、i586、i686、noarch、x86_64

    xxxxxxxxx.rpm   <== RPM的格式,已经经过编译且包装完成的rpm文件. xxxxxx.src.rpm   <== SRPM的格式,包含未编译的源代码信息. 例如rp-p ...

  5. Java Jackson - Json Polymorphism

    from://http://www.studytrails.com/java/json/java-jackson-Serialization-polymorphism.jsp Jackson prov ...

  6. SharePoint 2016 工作流报错“没有适用于此应用程序的地址”

    前言 最近为SharePoint 2016配置工作流,创建工作流的过程中遇到这样一个错误,记录分享下来,希望能够为有需要的人带来帮助. 错误截图 创建完毕工作流,发布的时候报错,保存没有问题. 错误信 ...

  7. Swift - 多个mask的动画效果

    Swift - 多个mask的动画效果 效果 源码 https://github.com/YouXianMing/Swift-Animations // // TranformFadeView.swi ...

  8. 重载hash与isEqual:方法

    重载hash与isEqual:方法 前言 NSObject 自带了hash与isEqual:方法,服务于具有hash表结构的数据结构.NSObject自带的hash函数相当于hash表中的f(key) ...

  9. 将hta包装为exe发布

    hta在打开的时候,有时候会被杀毒软件拦截而不给执行,更重要的一点是通常都可以右击查看源代码,里面如果涉及到域名或者其它的一些细节就很容易被其它人了解. 网络上有一些hta转exe的,类似的软件基本上 ...

  10. [Android Security] jar文件转smali文件

    cp : https://blog.csdn.net/fengmm521/article/details/78446486 jar转smali文件一共要走两步,先将jar文件转为.dex文件 (dx工 ...