Html Agility Pack 解析Html

Hello 好久不见哈哈，今天给大家分享一个解析Html的类库 Html Agility Pack。这个适用于想获取某网页里面的部分内容。今天就拿我的Csdn的博客列表来举例。

打开页面用Firebug 找到文章列表的内容区域

如上面图片我们已经找到了想要的内容在Html 中的位置

那么接下来第一步就是获取Html 然后用Html Agility Pack 找出我们想要的东西

1. 获网页的Html

  #region 获取文章列表 +GetHtml(string url)

         /// <summary>

         /// 获取文章列表 Add shuaibi 2015-03-08

         /// </summary>

         /// <param name="url">页面地址</param>

         /// <returns>文章列表</returns>

         public List<Model> GetHtml(string url)

         {

             var myWebClient = new WebClient();

             var myStream = myWebClient.OpenRead(url);

             var list = GetMessage(myStream); //这里调用的是下面的方法

             if (myStream != null) myStream.Close();

             return list;

         }

         #endregion

2. 用Html Agility Pack 找出我们想要的东西

#region 处理文章信息 +GetMessage(Stream myStream)

        /// <summary>

        /// 处理文章信息 Add shuaibi 2015-03-08

        /// </summary>

        /// <param name="myStream">网页的数据流</param>

        /// <returns></returns>

        private static List<Model> GetMessage(Stream myStream)

        {

            var document = new HtmlDocument();

            document.Load(myStream, Encoding.UTF8);

            var rootNode = document.DocumentNode;

            var messageNodeList = rootNode.SelectNodes(MessageListXPath);

            return messageNodeList.Select(messageNode => HtmlNode.CreateNode(messageNode.OuterHtml)).Select(temp => new Model

            {

                Title = temp.SelectSingleNode(MessageNameXPath).InnerText,

                Href = "http://blog.csdn.net" + temp.SelectSingleNode(MessageNameXPath).Attributes["href"].Value,

                Content = temp.SelectSingleNode(MessageContxtXPath).InnerText,

                Time = Convert.ToDateTime(temp.SelectSingleNode(MessageTimeXPath).InnerText),

                ComeFrom = "csdn"

            }).ToList();

        }

        #endregion

看完上面说完了方法和步骤细心的你是不是发现的什么问题。哈哈，说一半天了都没说这类库怎么用，还有第二个方法里面那几个变量是啥。

现在来说怎么获取 Html Agility Pack 下载地址http://htmlagilitypack.codeplex.com/下载后解压压缩包就会发现HtmlAgilityPack.dll 在项目中右键添加引用就可以了

然后就是几个变量的问题了

1.下面这句话是获取全部 class为list_item article_item开始的div

/// <summary>

        /// 获取文章列表

        /// </summary>

        private const string MessageListXPath = "//div[starts-with(@class,'list_item article_item')]";

2.下面这句话是获取上面获取出来的集合里面每一项的标题

/// <summary>

        /// 获取标题 解释: 第一个div,下的第一个div,下的第一个h1,下的第一个span,下的第一个a标签

        /// </summary>

        private const string MessageNameXPath = "/div[1]/div[1]/h1[1]/span[1]/a[1]";

3.和上面一样这个是获取内容

/// <summary>

        /// 获取内容 解释： 第一个div,下的第二个div

        /// </summary>

        private const string MessageContxtXPath = "/div[1]/div[2]";

4.这个是获取发布时间

/// <summary>

        /// 获取时间 这个就是 获取 第一个div,下的第3个div,下的span

        /// </summary>

        private const string MessageTimeXPath = "/div[1]/div[3]/span";

上面这些代码都是根据第一张图片来的。

第二次发，说的不好请见谅。希望和大家成为盆友共同进步嘿嘿

最后附上实体内的代码

using System;

namespace MessageHelper

{

   public class Model

    {

       public string Title { get; set; } //标题

       public string Content { get; set; } //内容

       public string Href { get; set; } //文章链接

       public string ComeFrom { get; set; } //来源

       public DateTime Time { get; set; } //发布时间

    }

}

Html Agility Pack 解析Html的更多相关文章

Html Agility Pack解析HTML页
文章来源:Html Agility Pack解析HTML页现在,在不少应用场合中都希望做到数据抓取,特别是基于网页部分的抓取.其实网页抓取的过程实际上是通过编程的方法,去抓取不同网站网页后,再进行分 ...
[c#] Html Agility Pack 解析HTML
摘要在开发过程中,很有可能会遇到这样的情况,服务端返回的是html的内容,但需要在客户端显示纯文本内容,这时候就需要解析这些html,拿到里面的纯文本.达到这样的目的可以有很多途径,比如自己写正则表 ...
Html Agility Pack解析Html(C#爬虫利器)
有个需求要写网络爬虫,以前接触过一个叫Html Agility Pack这个解析html的库,这次又要用到,然而发现以前咋用的已经不记得了,现在从头开始记录一下使用过程. Html Agility P ...
C# 网络爬虫利器之Html Agility Pack如何快速实现解析Html
简介现在越来越多的场景需要我们使用网络爬虫,抓取相关数据便于我们使用,今天我们要讲的主角Html Agility Pack是在爬取的过程当中,能够高效的解析我们抓取到的html数据. 优势在.NE ...
Html Agility Pack基础类介绍及运用
第一篇只对Html Agility Pack做了一个大概的介绍,在接下来的章节会比较深入的介绍Html Agility Pack. Html Agility Pack 源码中的类大概有28个左右,其实 ...
开源项目Html Agility Pack实现快速解析Html
这是个很好的的东西,以前做Html解析都是在用htmlparser,用的虽然顺手,但解析速度较慢,碰巧今天找到了这个,就拿过来试,一切出乎意料,非常爽,推荐给各位使用. 下面是一些简单的使用技巧,希望 ...
C#解析HTML利器-Html Agility Pack
今天刚开始做毕设....好吧,的确有点晚.我的毕设设计需要爬取豆瓣的电影推荐,于是就需要解析爬取下来的html,之前用Python玩过解析,但目前我使用的是C#,我觉得C#不比python差,有微软大 ...
强大而灵活的的Html解析器——Html Agility Pack
一.概述 Html Agility Pack 简称HAP,是一个强大而灵活的解析Html DOM的.Net类库. 二.官方链接官网:http://html-agility-pack.net/ NuG ...
使用Html Agility Pack快速解析Html内容
Html Agility Pack 是一个开源的.NET 方案HTML解析器. 开源地址:https://github.com/zzzprojects/html-agility-pack 用法:vs上 ...

随机推荐

在 C# 里使用 F# 的 option 变量
在使用 C# 与 F# 混合编程的时候(通常是使用 C# 实现 GUI,F#负责数据处理),经常会遇到要判断一个 option 是 None 还是 Some.虽然 Option module 里有 i ...
OpenGL超级宝典笔记----框架搭建
自从工作后,总是或多或少的会接触到客户端3d图形渲染,正好自己对于3d图形的渲染也很感兴趣,所以最近打算从学习OpenGL的图形API出发,进而了解3d图形的渲染技术.到网上查了一些资料,OpenGL ...
AFNetworking 3.0 源码解读（十）之 UIActivityIndicatorView/UIRefreshControl/UIImageView + AFNetworking
我们应该看到过很多类似这样的例子:某个控件拥有加载网络图片的能力.但这究竟是怎么做到的呢?看完这篇文章就明白了. 前言这篇我们会介绍 AFNetworking 中的3个UIKit中的分类.UIAct ...
Java定时任务的常用实现
Java的定时任务有以下几种常用的实现方式: 1)Timer 2)ScheduledThreadPoolExecutor 3)Spring中集成Cron Quartz 接下来依次介绍这几类具体实现的方 ...
enote笔记法使用范例（2）——指针（1）智能指针
要知道什么是智能指针,首先了解什么称为 “资源分配即初始化” what RAII:RAII—Resource Acquisition Is Initialization,即“资源分配即初始化” 在&l ...
css3制作旋转动画
现在的css3真是强大,之前很多动画都是用jq来实现,但是css3制作的动画要比jq实现起来简单很多,今天呢,我自己也写了一个css旋转动画和大家分享.效果如下面的图片思路:1.制作之前呢,我们先来 ...
BZOJ 1597: [Usaco2008 Mar]土地购买 [斜率优化DP]
1597: [Usaco2008 Mar]土地购买 Time Limit: 10 Sec Memory Limit: 162 MBSubmit: 4026 Solved: 1473[Submit] ...
Centos、Ubuntu 安装 Mono、Jexus
Mono是.NET的跨平台实现在众多关于语言的争论中,.NET一直被以不能跨平台而诟病,Mono改变了这一现状. 有人当心Mono会涉及版权啥的问题.高深的偶不懂,不过我觉得Unity3D都能用,为 ...
使用Metrics.NET 构建 ASP.NET MVC 应用程序的性能指标
通常我们需要监测ASP.NET MVC 或 Web API 的应用程序的性能时,通常采用的是自定义性能计数器,性能计数器会引发无休止的运维问题(损坏的计数器.权限问题等).这篇文章向你介绍一个新的替代 ...
IOCP Internals
Buffer Type Buffer I/O 针对Buffer I/O的请求,系统会为其分配一个非换页内存作为缓存区,其大小等同于I/O请求的缓存区大小.对于写操作,I/O管理器在创建IRP时,将请求 ...

Html Agility Pack 解析Html

Html Agility Pack 解析Html的更多相关文章

随机推荐

热门专题