爬虫技术 -- 进阶学习（七）简单爬虫抓取示例（附c#代码）

这是我的第一个爬虫代码。。。算是一份测试版的代码。大牛大神别喷。。。

通过给定一个初始的地址startPiont然后对网页进行捕捉，然后通过正则表达式对网址进行匹配。

List<string> todo ：进行抓取的网址的集合

List<string> visited ：已经访问过的网址的集合

下面实现的是，给定一个初始地址，然后进行爬虫，输出正在访问的网址和已经访问的网页的个数。

需要注意的是，下面代码实现的链接匹配页面的内容如图一、图二所示：

图一：

图二：

简单代码示范如下：（测试版）

using System;

using System.Collections.Generic;

using System.ComponentModel;

using System.Data;

using System.Drawing;

using System.Linq;

using System.Text;

using System.Windows.Forms;

using System.Web.Security;

using System.IO;

using System.Net;

using System.Text.RegularExpressions;

using System.Web;

namespace Demo1

{

    public partial class Form1 : Form

    {

        public Form1()

        {

            InitializeComponent();

         }

        private void button1_Click(object sender, EventArgs e)

        {

            Test1 a = new Test1();

            a.getCurrentURL();

        }

        public class Test1

        {

            List<string> todo = new List<string>();

            List<string> visited = new List<string>();

            string startPoint = "http://www.cnblogs.com/lmei/";

            
            public void getCurrentURL()

            {

                RequestSite(startPoint);

                while (todo.Count > ) 
                {

                    string currentURL = todo[];

                    RequestSite(currentURL);

                    if (visited.Contains(currentURL))  //注释1

                    {

                        Console.WriteLine("已经访问过了" + currentURL);

                        todo.Remove((currentURL));

                    }

                    else

                    {

                        Console.WriteLine("现在正在访问：===>   " + currentURL);

                        visited.Add(currentURL);

                        Console.WriteLine("目前已经访问了：===>   " + visited.Count + "个网页" );

                        todo.Remove((currentURL));

                    }

                }

            }

            public void RequestSite(string url)

            {

                WebRequest req = WebRequest.Create(url);

                HttpWebResponse res;

                try{

                      res = (HttpWebResponse)(req.GetResponse());

                }

                catch (WebException ex) { res = (HttpWebResponse)ex.Response; }

                Stream st = res.GetResponseStream();

                StreamReader rdr = new StreamReader(st);

                string s = rdr.ReadToEnd();

                todo.AddRange(GetLink(s));

            }

            List<string> GetLink(string htmlPage)

            {

                Regex regx =

                    new Regex("http://www\\.cnblogs\\.com\\/lmei\\/p\\/[0-9a-zA-Z]+\\.html*" ,RegexOptions.IgnoreCase);

                MatchCollection matches = regx.Matches(htmlPage);

                List<string> results = new List<string>();

                foreach (Match match in matches)

                {

                    if (!visited.Contains(match.Value)) //注释2

                    {

                        results.Add(match.Value);

                    }

                }

                return results;

            }

        }

    }

}

注释1 ：是将已经访问过的网址排除。

注释2 ：是将已经访问过的网址排除，但是可能由于同个网页中包含的两个（或两个以上）相同的链接，而且都没被访问过的，这样使得todo队列中会有相同的网址，所以需要注释1那部分进行再次过滤排除。其实也可以将注释2那部分删去，直接让注释1过滤就行。

接下来会进一步补充爬虫抓取的内容。。。

爬虫技术 -- 进阶学习（七）简单爬虫抓取示例（附c#代码）的更多相关文章

爬虫技术 -- 进阶学习（十）网易新闻页面信息抓取（htmlagilitypack搭配scrapysharp）
最近在弄网页爬虫这方面的,上网看到关于htmlagilitypack搭配scrapysharp的文章,于是决定试一试~ 于是到https://www.nuget.org/packages/Scrapy ...
爬虫技术（四）-- 简单爬虫抓取示例（附c#代码）
这是我的第一个爬虫代码...算是一份测试版的代码.大牛大神别喷... 通过给定一个初始的地址startPiont然后对网页进行捕捉,然后通过正则表达式对网址进行匹配. List<string&g ...
爬虫技术 -- 进阶学习（九）使用HtmlAgilityPack获取页面链接（附c#代码及插件下载）
菜鸟HtmlAgilityPack初体验...弱弱的代码... Html Agility Pack是一个开源项目,为网页提供了标准的DOM API和XPath导航.使用WebBrowser和HttpW ...
爬虫技术 -- 进阶学习（十一）【补充】获取html中meta标签中的content的内容
上一篇网易新闻页面信息抓取 -- htmlagilitypack搭配scrapysharp中提及了很多如何快速抓取html中的文本的语句, 但是meta标签中的content内容的抓取,没有提及到! ...
爬虫技术 -- 进阶学习（八）模拟简单浏览器（附c#代码）
由于最近在做毕业设计,需要用到一些简单的浏览器功能,于是学习了一下,顺便写篇博客~~大牛请勿喷,菜鸟练练手~ 实现界面如下:(简单朴素版@_@||) button_go实现如下: private vo ...
爬虫技术 -- 基础学习（一）HTML规范化（附特殊字符编码表）
最近在做网页信息提取这方面的,由于没接触过这系列的知识点,所以逛博客,看文档~~看着finallyly大神的博文和文档,边看边学习边总结~~ 对网站页面进行信息提取,需要进行页面解析,解析的方法有以下 ...
爬虫学习一系列：urllib2抓取网页内容
爬虫学习一系列:urllib2抓取网页内容所谓网页抓取,就是把URL地址中指定的网络资源从网络中读取出来,保存到本地.我们平时在浏览器中通过网址浏览网页,只不过我们看到的是解析过的页面效果,而通过程 ...
python3爬虫再探之豆瓣影评数据抓取
一个关于豆瓣影评的爬虫,涉及:模拟登陆,翻页抓取.直接上代码: import re import time import requests import xlsxwriter from bs4 imp ...
[python应用]python简单图片抓取
前言 emmmm python简单图片抓取 1 import requests 2 import threading 3 import queue 4 from subprocess import P ...

随机推荐

诚聘Android开发工程师
职位要求1.有1年以上Android应用项目经验或相关经验: 2.熟悉Android操作系统和Android SDK,GUI编程及GDI的使用:熟练掌握Android 的 UI 系统控件及常用布局.动 ...
nginx的反向代理和负载均衡的区别
反向代理,是把一些静态资源存储在服务器上,当用户有请求的时候,就直接返回反向代理服务器上的资源给用户,而如果反向代理服务器上没有的资源,就转发给后面的负载均衡服务器,负载均衡服务器再将请求分发给后端的 ...
STM32 CANBus RAM Layout
F8 FF FF FF //F0R0 F0R1 F8 FF FF FF //F1R0 F1R1 F8 FF FF FF F8 FF FF FF F8 FF FF FF F8 FF FF FF F8 F ...
PHP多次调用Mysql存储过程报错解决办法
PHP多次调用Mysql数据库的存储过程会出现问题,主要问题为存储过程中执行多次SQL语句不能一一释放导致的,网上找了一些解决办法,比如使用 multi_query 然后一个一个释放,但是发现根本不适 ...
ReactiveCocoa与Functional Reactive Programming
转自 http://blog.leezhong.com/ios/2013/06/19/frp-reactivecocoa.html Functional Reactive Programming(以下 ...
【linux】文件隐藏属性
这些隐藏的属性确实对于系统有很大的帮助的- 尤其是在系统安全 (Security) 上面,重要的紧呢!不过要先强调的是,底下的chattr指令只能在Ext2/Ext3的文件系统上面生效, 其他 ...
Android 在xml中配置 float 和 integer 值
一.float的配置方法 andriod 默认不支持float型的设置,在values 下的新建floats.xml 文件,在内部添加如下代码: <resources> <item ...
JAVA中类、实例与Class对象
已同步更新至个人blog:http://dxjia.cn/2015/08/java-class-object/ 类类是面向对象编程语言的一个重要概念,它是对一项事物的抽象概括,可以包含该事物的一些属 ...
前端开发者进阶之函数反柯里化unCurrying
函数柯里化,是固定部分参数,返回一个接受剩余参数的函数,也称为部分计算函数,目的是为了缩小适用范围,创建一个针对性更强的函数. 那么反柯里化函数,从字面讲,意义和用法跟函数柯里化相比正好相反,扩大适用 ...
lintcode: k Sum 解题报告
K SUM My Submissions http://www.lintcode.com/en/problem/k-sum/ 题目来自九章算法 13% Accepted Given n distinc ...

爬虫技术 -- 进阶学习（七）简单爬虫抓取示例（附c#代码）

爬虫技术 -- 进阶学习（七）简单爬虫抓取示例（附c#代码）的更多相关文章

随机推荐

热门专题