c# & Fizzler to crawl web page in a certain website domain

使用fizzler [HtmlAgilityPackExtension]和c#进行网页数据提取；fizzler是HtmlAgilityPack的一个扩展，支持jQuery Selector；

提取数据一般都是有规律url拼凑，然后挨个儿发request得到response进行解析：

1.假如一个website下的所有xxx.sample.com/contactus.html里边存在邮箱字段(准备提取的数据)

　　a)当有子域名的时候，比如：a.sample.com, aadr.sample.com, 135dj.sample.com，随机性比较强；

　　　解决方法：bing search engine中使用 site:b2b.sample.com搜索得到的result页面可以提取所有子域名，然后拼凑成xxx.sample.com/contactus.html，继而发送请求到这个url，得　　　　　　　　到response进行解析；

　　　NOTE：关于site:b2b.sample.com的搜索url拼凑如下，

　　　　　　　http://www.bing.com/search?q=site%3A{b2b.sample.com}&go=Submit&qs=n&form=QBRE&pq=site%3A{b2b.sample.com}&sc=1-19&sp=-1&sk=&cvid=6165a189f5354b1982fb8cd6933abb6f&first={pageIndex}&FORM=PERE

2.像www.sample.com/1456.html的页面可以直接平凑1456.html/1457.html/1458.html etc.此处不列举；

Fizzler使用方法：

1.从nuget上安装Fizzler；

2.使用方法参考code.google.com；

3.使用bing提取website下的所有子域：

private static List<string> GetSubdomains(string websiteDomain, int startPageIndex = , int pageCount = , int pageSize = )

        {

            var list = new List<string>();

            //using bind to search subdomains in a certain website

            var bingSearchUrlFormat = "http://www.bing.com/search?q=site%3a{0}&go=Submit&qs=n&pq=site%3a{0}&sc=1-100&sp=-1&sk=&cvid=a9b36439006f4b05b09f9202c5b784bd&first={1}&FORM=PQRE";

            WebClient client = new WebClient();

            client.Encoding = Encoding.UTF8;

            var doc = new HtmlDocument();

            var first = (startPageIndex / ) *  + ;

            var stopIndex = first + pageCount*pageSize;

            var currentPageIndex = startPageIndex;

            for (var startItemSquenceNumber = first; startItemSquenceNumber < stopIndex; startItemSquenceNumber = startItemSquenceNumber + pageSize)

            {

                var response = client.DownloadString(string.Format(bingSearchUrlFormat, websiteDomain, startItemSquenceNumber));

                HtmlDocumentExtensions.LoadHtml2(doc, response);

                var docNode = doc.DocumentNode;

                var subDomains = docNode.QuerySelectorAll(".sb_meta cite");foreach (var subDomain in subDomains)

                {

                    list.Add(subDomain.InnerText);

                }

            }return list;

        }

4.获取网页节点：

        private static List<HtmlNode> GetWebPageNodes(string url, string elementSelector, string attributeNameContained, string attributeNameContainedValueLike)

        {

            var client = new WebClient();

            client.Encoding = Encoding.UTF8;

            var response = client.DownloadString(url);

            var doc = new HtmlDocument();

            HtmlDocumentExtensions.LoadHtml2(doc, response);

            var docNode = doc.DocumentNode;

            var emailNode = docNode.QuerySelectorAll(elementSelector).Where(node => node.Attributes.Where(attr => attr.Name == attributeNameContained).FirstOrDefault().Value.Contains(attributeNameContainedValueLike)).FirstOrDefault();

            var nodes = (from node in docNode.QuerySelectorAll(elementSelector)

                         where node.HasAttributes && node.GetAttributeValue(attributeNameContained, string.Empty).Contains(attributeNameContainedValueLike)

                         select node).ToList();

            return nodes;

        }

5.获取某个网页中邮箱的方法：

var subdomains = GetSubdomains("b2b.sample.com", stopPageIndex, );

var urlFormat = "http://{0}/contactus.html";

GetWebPageNodes(string.Format(urlFormat, item), "body table a", "href", "mailto").FirstOrDefault();

最后的问题：当通过bing搜索子域时会有限制，发送100~150个请求后获取到的response就不是我想要的页面，而是要求输入验证码防止攻击的html；此问题暂时未解决，望大神指点！

c# & Fizzler to crawl web page in a certain website domain的更多相关文章

How To Crawl A Web Page with Scrapy and Python 3
sklearn实战-乳腺癌细胞数据挖掘(博主亲自录制视频) https://study.163.com/course/introduction.htm?courseId=1005269003& ...
解读Web Page Diagnostics网页细分图
解读Web Page Diagnostics网页细分图 http://blog.sina.com.cn/s/blog_62b8fc330100red5.html Web Page Diagnostic ...
网页细分图结果分析（Web Page Diagnostics）
Discuz开源论坛网页细分图结果分析(Web Page Diagnostics) 续LR实战之Discuz开源论坛项目,之前一直是创建虚拟用户脚本(Virtual User Generator)和场 ...
Atitit.web三大编程模型 Web Page Web Forms 和 MVC
Atitit.web三大编程模型 Web Page Web Forms 和 MVC 1. 编程模型是 Web Forms 和 MVC (Model, View, Controller). 2. ...
[转]Calling Web Service Functions Asynchronously from a Web Page 异步调用WebServices
本文转自:http://www.codeproject.com/Articles/70441/Calling-Web-Service-Functions-Asynchronously-from Ove ...
Tutorial: Importing and analyzing data from a Web Page using Power BI Desktop
In this tutorial, you will learn how to import a table of data from a Web page and create a report t ...
Android WebView常见问题的解决方案总结----例如Web page not available
之前android虚拟机一直都可以直接联网,今天写了一个WebView之后,突然报出了Web page not available的错误,但是查看虚拟机自带的浏览器,是可以上网的,所以检查还是代码的问 ...
LR实战之Discuz开源论坛——网页细分图结果分析（Web Page Diagnostics）
续LR实战之Discuz开源论坛项目,之前一直是创建虚拟用户脚本(Virtual User Generator)和场景(Controller),现在,终于到了LoadRunner性能测试结果分析(An ...
Home | eMine: Web Page Transcoding Based on Eye Tracking Project Page
Home | eMine: Web Page Transcoding Based on Eye Tracking Project Page The World Wide Web (web) has m ...

随机推荐

Equal
package com; public class StringEquals { public static void main(String[] args) { String s1=new Stri ...
HTTP协议详解--转载http://blog.csdn.net/gueter/article/details/1524447
引言 HTTP是一个属于应用层的面向对象的协议,由于其简捷.快速的方式,适用于分布式超媒体信息系统.它于1990年提出,经过几年的使用与发展,得到不断地完善和扩展.目前在WWW中使用的是HTTP/1. ...
《C与指针》第十章练习
本章问题 1.成员和数组元素有什么区别? answer:Structure members can be all different types;they are accessed by name;a ...
hiho一下120周后缀数组一·重复旋律
后缀数组一·重复旋律时间限制:5000ms 单点时限:1000ms 内存限制:256MB 描述小Hi平时的一大兴趣爱好就是演奏钢琴.我们知道一个音乐旋律被表示为长度为 N 的数构成的数列. 小Hi ...
C语言编程心得
记录这些是为了日后自己想查阅以前经验的方便,同时若能给其他网友带来一些帮助,就更好了~ C语言,自己经常遇到的问题: 1.段错误段错误一般是由于访问了不存在的地址造成的,具体的原因有文件路径不存在, ...
Mac下Nginx环境配置
环境信息: Mac OS X 10.11.1 Homebrew 0.9.5 正文一.安装 Nginx 终端执行: brew search nginx brew install nginx 当前版本 ...
EF学习笔记——通用增删改查方案
http://blog.csdn.net/leftfist/article/details/25005307 我刚接触EF未久,还不知道它有什么强大之处,但看上去,EF提供了一般的增删改查功能.以往用 ...
卫星地图下载软件WebImageDowns
卫星地图下载软件WebImageDowns一款基于网络服务器的多线程卫星地图下载软件.支持多种网络地图.软件可以高速下载您所指定的任意经纬度范围的卫星地图,并可将所下载的卫星地图进行无缝拼接,使您可以 ...
[系统开发] Django Admin上传图片简单校验
我的 models里有个ImageField字段,用来保存用户头像,希望通过Django Admin上传时校验头像大小,如果太大就报错,并且不保存. 网上有不少方法,有的通过第三方软件实现,有的通过自 ...
php_sapi_name详解
php_sapi_name : — 返回 web 服务器和 PHP 之间的接口类型. 返回描述 PHP 所使用的接口类型(the Server API, SAPI)的小写字符串. 例如,CLI 的 P ...

c# & Fizzler to crawl web page in a certain website domain

c# & Fizzler to crawl web page in a certain website domain的更多相关文章

随机推荐

热门专题