C# 爬虫小程序

设计思路

主要基于Http Get请求网页数据，进行分析。涉及递归调用，多线程提高效率，守护线程等。

项目结构

AbsChain

职责链抽象类，负责定义HTML处理方法，定义递归处理方法等

AbsThreadManager

线程管理抽象类，负责定义守望线程，管理多线程

UrlQueue

URL队列对象，管理URL队列

Crawl

爬虫对象，负责结合URL队列与职责链，运行爬取功能

HttpGet

HTTP GET请求类，负责获取HTML文本

ThreadEntity

爬虫线程，实体对象

简单爬虫示例

以下示例为一个简单的获取HTML页面文本示例，可以做到下载文本，并进行分析，可以说是最简单的爬虫

            WebClient wc = new WebClient();

            byte[] response = wc.DownloadData("http://www.weather.com.cn/weather/101120501.shtml");

            string ss = Encoding.UTF8.GetString(response);

项目代码调用示例

创建继承类，继承职责链，负责具体爬虫方法

    public class NodeChain : AbsChain

    {

        #region 去除头部的'与"

        /// <summary>

        /// 去除头部的'与"

        /// </summary>

        /// <param name="url"></param>

        /// <returns></returns>

        private string RemoveQuotation(string url)

        {

            if ((url.IndexOf("'") == 0) || (url.IndexOf("\"") == 0))

            {

                url = url.Remove(0, 1);

                if (url.IndexOf("'") != -1)

                {

                    url = url.Remove(url.IndexOf("'"), 1);

                }

                if (url.IndexOf("\"") != -1)

                {

                    url = url.Remove(url.IndexOf("\""), 1);

                }

            }

            if (url.IndexOf(" ") != -1)

            {

                url = url.Remove(url.IndexOf(" "));

            }

            return url;

        }

        #endregion

        #region 处理网页

        /// <summary>

        /// 处理网页

        /// </summary>

        /// <param name="html"></param>

        protected override void Process(string html)

        {

            try

            {

                Regex re = new Regex(@"href=(?<web_url>[\s\S]*?)>|href=""(?<web_url>[\s\S]*?)""|href='(?<web_url>[\s\S]*?)'");

                MatchCollection mc = re.Matches(html);

                foreach (Match m in mc)

                {

                    string url = m.Groups["web_url"].ToString();

                    url = this.RemoveQuotation(url);

                    if (url.IndexOf("http://") != -1)

                    {

                        UrlQueue.GetInstance().Enqueue(url);

                    }

                }

                string title = string.Empty;

                re = new Regex(@"<title[\s\S]*?>(?<title>[\s\S]*?)</title>");

                Match temp = re.Match(html.ToLower());

                title = temp.Groups["title"].ToString();

                if (!string.IsNullOrEmpty(title))

                {

                    Console.WriteLine(string.Format("网页标题：{0}",title));

                    Console.WriteLine(string.Format("网页URL：{0}", this.Url));

                }

            }

            catch

            {

            }

        }

        #endregion

    }

创建线程管理继承类，负责重写新建职责链对象

    public class ThreadManager:AbsThreadManager

    {

        protected override AbsChain GetChainHeader()

        {

            return new NodeChain();

        }

    }

设置URL入口，运行爬虫

            try

            {

                Console.Title = System.Configuration.ConfigurationManager.AppSettings["Title"].ToString();

                Console.WriteLine("Process is running！");

                string url = System.Configuration.ConfigurationManager.AppSettings["URL"].ToString();

                UrlQueue.GetInstance().Enqueue(url);

                ThreadManager thread = new ThreadManager();

                thread.Start();

            }

            catch (Exception ex)

            {

            }

GitHub

.NET-App/NetSpider/

C# 爬虫小程序的更多相关文章

一个python爬虫小程序
起因深夜忽然想下载一点电子书来扩充一下kindle,就想起来python学得太浅,什么“装饰器”啊.“多线程”啊都没有学到. 想到廖雪峰大神的python教程很经典.很著名.就想找找有木有pdf版的 ...
nodeJs爬虫小程序练习
//爬虫小程序 var express = require('express'); //superagent是一个http的库,可以发起get和post请求 var superagent = requ ...
适合新手的Python爬虫小程序
介绍:此程序是使用python做的一个爬虫小程序爬取了python百度百科中的部分内容,因为这个demo是根据网站中的静态结构爬取的,所以如果百度百科词条的html结构发生变化需要修改部分内容. ...
福利贴——爬取美女图片的Java爬虫小程序代码
自己做的一个Java爬虫小程序废话不多说.先上图. 目录命名是用标签缩写,假设大家看得不顺眼能够等完成下载后手动改一下,比方像有强迫症的我一样... 这是挂了一个晚上下载的总大小,只是还有非常多由于 ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 import requests from lxml import etree from multiprocessing imp ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
java实现一个简单的爬虫小程序
前言前些天无意间在百度搜索了一下以前写过的博客我啥时候在这么多不知名的网站上发表博客了???点进去一看, 内容一模一样,作者却不是我... 然后又去搜了其他篇博客,果然,基本上每篇都在别的网站上有 ...

随机推荐

POJ1127 Jack Straws
给你一些线段,求出哪些线段是相连的,哪些是不相连的.相连包括间接相连,即这两条线段本身不直接相连,而是通过其它线段的连接而间接相连. 线段相交+并查集这里主要说如何判断线段相交:快速排斥试验+跨立试 ...
异常处理简单例子--python
捕获所有异常 #!/usr/bin/pythona = 10b = 0try: c = a/b print c print 'nothing happen...'#todo: catch all ex ...
URL最大长度
今天在测试Email Ticket的时候发现在进行Mark as Read/Unread操作时,请求是通过GET方式进行的.URL中列出了所有参与该操作的Ticket Id.于是,我想起GET请求是有 ...
.NET Core中向已存在文件的特定位置写入数据
本例使用.NET Core向一个文本文件中的特定位置写入数据,来模拟文件上传中的断点续传是如何在服务器端实现的. 新建一个.NET Core控制台项目FileContinueToWrite,其Prog ...
Net Core 使用外部登陆提供程序登陆的流程，以及身份认证的流程
在Asp.Net Core 中使用外部登陆(google.微博...) 原文出自Rui Figueiredo的博文<External Login Providers in ASP.NET C ...
5213 Exp3 免杀原理与实践
5213 Exp3 免杀原理与实践任务一:正确使用msf编码器,msfvenom生成如jar之类的其他文件,veil-evasion,自己利用shellcode编程等免杀工具或技巧使用msf编码器 ...
# 20155337《网络对抗》Exp6 信息搜集与漏洞扫描
20155337<网络对抗>Exp6 信息搜集与漏洞扫描实践目标 (1)各种搜索技巧的应用 (2)DNS IP注册信息的查询 (3)基本的扫描技术:主机发现.端口扫描.OS及服务版本探测 ...
Vue 项目集合
饿了么安全应急响应中心饿了么招聘饿了么前端 · GitHub 稀土掘金异乡好居明星垂搜广州建管基于Vue.js的数据统计系统(一) 基于Vue.js的数据统计系统(二) 基于Vue.js的 ...
Python的进制等转换
To 十进制二进制: >>> int('110', 2) -> 6 八进制: >>> int('10', 8) -> 8 十六进制: >> ...
Kubernetes学习之路（二十）之K8S组件运行原理详解总结
目录一.看图说K8S 二.K8S的概念和术语三.K8S集群组件 1.Master组件 2.Node组件 3.核心附件四.K8S的网络模型五.Kubernetes的核心对象详解 1.Pod资源对 ...

C# 爬虫小程序

设计思路

相关技术

项目结构

简单爬虫示例

项目代码调用示例

GitHub

C# 爬虫小程序的更多相关文章

随机推荐

热门专题