[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [二] 基本使用

[DotnetSpider 系列目录]

使用环境

Visual Studio 2017
.NET 4.5 or later or .NET Core

概述

在上一篇也讲到过，实现一个完整的爬虫需要4大模块：下载器（已有实现），URL调度（已有实现），数据抽取（需要自己实现），数据存储（需要自己实现），因此，只需要实现数据抽取、数据存储这两个模块就可以完成一个爬虫了。

新建一个Console 项目

右键项目的Manage NuGet Packages(管理NuGet包)

搜索DotnetSpider2, 从结果列表中选中DotnetSpider2.Core并安装到控制台项目中

定义数据对象

public class YoukuVideo

{

    public string Name { get; set; }

}

定义数据抽取（实现 IPageProcessor 接口）

        public class YoukuPageProcessor : BasePageProcessor

        {

            protected override void Handle(Page page)

            {

                // 利用 Selectable 查询并构造自己想要的数据对象

                var totalVideoElements = page.Selectable.SelectList(Selectors.XPath("//div[@class='yk-pack pack-film']")).Nodes();

                List<YoukuVideo> results = new List<YoukuVideo>();

                foreach (var videoElement in totalVideoElements)

                {

                    var video = new YoukuVideo();

                    video.Name = videoElement.Select(Selectors.XPath(".//img[@class='quic']/@alt")).GetValue();

                    results.Add(video);

                }

                // Save data object by key. 以自定义KEY存入page对象中供Pipeline调用

                page.AddResultItem("VideoResult", results);

            }

        }

需要注意的是

Page 对象中Selectable属性是由下载的HTML构造的选择器容器，调用Seletable的接口就可以进行Xpath，Css， JsonPath，Regex的查询
Selectable的GetValue传入true时会把结果去HTML标签化
把组装好的对象，如上面的 YoukuVideo List, 保存到page的ResultItem中，并指定一个唯一的Key

定义数据管道（继承BasePipeline这个抽象类）

数据管道可以通过在PageProcessor中指定的唯一Key，取出需要处理的数据存入想要的数据库或文件中

    public class YoukuPipeline : BasePipeline

    {

        private static long count = ;

        public override void Process(ResultItems resultItems)

        {

            StringBuilder builder = new StringBuilder();

            foreach (YoukuVideo entry in resultItems.Results["VideoResult"])

            {

                count++;

                builder.Append($" [YoukuVideo {count}] {entry.Name}");

            }

            Console.WriteLine(builder);

            // Other actions like save data to DB. 可以自由实现插入数据库或保存到文件

        }

    }

初始化起始链接并运行

通过AddStartUrl可以添加爬虫的起始链接后，调用Run方法运行爬虫

            // Config encoding, header, cookie, proxy etc... 定义采集的 Site 对象, 设置 Header、Cookie、代理等

            var site = new Site { EncodingName = "UTF-8", RemoveOutboundLinks = true };

            for (int i = ; i < ; ++i)

            {

                // Add start/feed urls. 添加初始采集链接

                site.AddStartUrl($"http://list.youku.com/category/show/c_96_s_1_d_1_p_{i}.html");

            }

            Spider spider = Spider.Create(site,

                // use memoery queue scheduler. 使用内存调度

                new QueueDuplicateRemovedScheduler(),

                // use custmize processor for youku 为优酷自定义的 Processor

                new YoukuPageProcessor())

                // use custmize pipeline for youku 为优酷自定义的 Pipeline

                .AddPipeline(new YoukuPipeline());

            spider.Downloader = new HttpClientDownloader();

            spider.ThreadNum = ;

            spider.EmptySleepTime = ;

            // Start crawler 启动爬虫

            spider.Run();

运行结果

设置目标页抽取

以上只是采集了初始的一个链接，如何达到翻页(遍历)效果继续采集直的最后一页呢？只需要在PageProccessor中解析出符合规则的目标页，并加入到Page对象的TargetRequests这个List中即可。我们做如下改动：

        public class YoukuPageProcessor : BasePageProcessor

        {

            protected override void Handle(Page page)

            {

                // 利用 Selectable 查询并构造自己想要的数据对象

                var totalVideoElements = page.Selectable.SelectList(Selectors.XPath("//div[@class='yk-pack pack-film']")).Nodes();

                List<YoukuVideo> results = new List<YoukuVideo>();

                foreach (var videoElement in totalVideoElements)

                {

                    var video = new YoukuVideo();

                    video.Name = videoElement.Select(Selectors.XPath(".//img[@class='quic']/@alt")).GetValue();

                    results.Add(video);

                }

                // Save data object by key. 以自定义KEY存入page对象中供Pipeline调用

                page.AddResultItem("VideoResult", results);

                // Add target requests to scheduler. 解析需要采集的URL

                foreach (var url in page.Selectable.SelectList(Selectors.XPath("//ul[@class='yk-pages']")).Links().Nodes())

                {

                    page.AddTargetRequest(new Request(url.GetValue(), null));

                }

            }

        }

重新运行爬虫后，可以看到已经实现的翻页

代码地址

https://github.com/zlzforever/DotnetSpider 望各位大佬加星

参与开发或有疑问

博文写得比较早, 框架修改有时会来不及更新博文中的代码, 请查看DotnetSpider.Sample项目中的样例爬虫

QQ群: 477731655

邮箱: zlzforever@163.com

[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [二] 基本使用的更多相关文章

[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [一] 初衷与架构设计
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统五.如何做全站采集为什么要造轮子同学们可以去各大招聘网站查看一下爬虫工程师 ...
[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [五] 如何做全站采集?
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统五.如何做全站采集如何做全站采集? 很多同学加群都在问, 如何使用Dotne ...
[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [四] JSON数据解析
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统五.如何做全站采集场景模拟接上一篇, JD SKU对应的店铺信息是异步加载 ...
[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] [三] 配置式爬虫
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统五.如何做全站采集上一篇介绍的基本的使用方式,自由度很高,但是编写的代码相对 ...
[开源 .NET 跨平台 Crawler 数据采集爬虫框架: DotnetSpider] 学习
http://www.cnblogs.com/jjg0519/p/6707513.html
[开源 .NET 跨平台数据采集爬虫框架: DotnetSpider] [二] 基本使用
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统使用环境 Visual Studio 2015 or later .NET 4 ...
[开源 .NET 跨平台数据采集爬虫框架: DotnetSpider] [一] 初衷与架构设计
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统为什么要造轮子同学们可以去各大招聘网站查看一下爬虫工程师的要求,大多是招JA ...
[开源 .NET 跨平台数据采集爬虫框架: DotnetSpider] [三] 配置式爬虫
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统上一篇介绍的基本的使用方式,虽然自由度很高,但是编写的代码相对还是挺多.于是框 ...
[开源 .NET 跨平台数据采集爬虫框架: DotnetSpider] [四] JSON数据解析
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统场景模拟假设由于漏存JD SKU对应的店铺信息.这时我们需要重新完全采集所有 ...

随机推荐

[20171225]变态的windows批处理4.txt
[20171225]变态的windows批处理4.txt --//昨天学习windows 批处理的echo &.使用它可以实现类似回车换行的功能.例子: 1.echo &.R:\> ...
SQL Server 2005详细安装过程及配置
说明:个人感觉SQL Server 2005是目前所有的SQL Server版本当中最好用的一个版本了,原因就是这个版本比起其它版本来说要安装简单,操作简便,只可惜这个版本只能在Windows7或者低 ...
Error: spawn Unknown system errno 203
在用node写代码的时候发现这个错误,google之无解,现在解决,发于此. 事件起因为一个全局模块通过子进程(chind_process)调用另一个全局模块的命令,这个错误就是在命令行通过全局命令调 ...
编写一个BAT脚本协助运维人员遇到问题时候调测数据库是否有效连接成功的操作攻略
简单摘要: 1.内网系统出现故障需要排查 2.运维人员不熟悉数据库操作,没法通过连接数据库和执行SQL语句的方式排查数据库及数据是否正常 3.解决方案:编写一个bat脚本,运维人员双击运行即可. ...
使用pymysql(使用一)
创建数据表 import pymysql db = pymysql.connect("localhost","root",""," ...
Js 不支持函数的重载
Js 不支持函数的重载,可以用相同的名字在同一作用区域,定义两个函数,而不会引起错误,但真正使用的是最后一个. Js 不会验证传递给函数的参数个数是否和函数定义的参数的个数相同,开发人员定义的函数都可 ...
Note 387206.1 ORA-15041: ASM diskgroup with unlike disks sizes
Applies to: Oracle Server - Enterprise Edition - Version: 10.1.0.2 to 10.2.0.1 - Release: 10.1 to 10 ...
win7下面搭建angularjs开发环境
每天学习一点点编程PDF电子书免费下载: http://www.shitanlife.com/code 1.安装git,添加环境变量2.github上有一个比较好的纯净AngularJs app的种 ...
PCB （2）创建新工程原理图
1创建一个新项目 2创建一个新的原理图图纸 3将原理图图纸添加到项目 4设置原理图选项修改单位设置图纸大小图纸附加说明 5绘制原理图打开库之后连续放置的器件会在此基础上+1 名字描述 6 ...
wallet.metamask.io 网页版钱包 connecting unknown network导致页面卡住
之前在还不是十分懂用的时候想要用其连接本地的打开的ganache,所以就像使用本地插件的metamask一样,点击custom rpc,然后输入http://localhost:7545,然后页面就一 ...

[开源 .NET 跨平台 Crawler 数据采集 爬虫框架: DotnetSpider] [二] 基本使用