asp.net 网页抓取内容

网页抓取代码

using System;

using System.Collections.Generic;

using System.Linq;

using System.Web;

//

using System.Net;

using System.IO;

using System.Text.RegularExpressions;

using System.Text;

namespace WSYL.Web.Common

{

    public static class GetSteamShipInfo

    {

        public static string GetWebSite(string steamshipname,int itype)

        {

            if (steamshipname == null || steamshipname.Trim() == "")

                return null;

            //step1: get html from url

            string urlToCrawl = @"网址";

            //generate http request

            HttpWebRequest req = (HttpWebRequest)WebRequest.Create(urlToCrawl);

            //use GET method to get url's html

            req.Method = "GET";

            //use request to get response

            HttpWebResponse resp = (HttpWebResponse)req.GetResponse();

            // 二〇一五年八月十二日 18:14:45 需要增加判断网页解析超时问题 防止网页假死

            // string htmlCharset = "UTF-8";

            string htmlCharset = "utf-8";

            //use songtaste's html's charset GB2312 to decode html

            //otherwise will return messy code

            Encoding htmlEncoding = Encoding.GetEncoding(htmlCharset);

            StreamReader sr = new StreamReader(resp.GetResponseStream(), htmlEncoding);

            //read out the returned html

            string respHtml = sr.ReadToEnd();

            //第三种获取内容

            //Match TitleMatch = Regex.Match(rtbExtractedHtml.Text.ToString(), "<td width=\"30%\">([^<]*)</td>", RegexOptions.IgnoreCase | RegexOptions.Multiline);
//需要获取的代码开始和结尾内容

            Match TitleMatch2 = Regex.Match(respHtml.ToString(), "<td align=\"left\" bgcolor=\"#EEEEEE\">([^<]*)</td>", RegexOptions.IgnoreCase | RegexOptions.Multiline);

            // txbExtractedInfo.Text = TitleMatch2.Groups[1].Value+"/"+ TitleMatch2.Groups[2].Value;

            if (TitleMatch2.Groups[1].Value.Length == 0 || TitleMatch2.Groups[1].Value=="")

               return respHtml = "";

            if(itype==0)

            {

                respHtml = TitleMatch2.Groups[1].Value.ToString();

            }

             if(itype==1)

            {

                respHtml = StripHtml(TitleMatch2.NextMatch().Value.ToString());

            }

             if (itype == 2)

             {

                 respHtml = TitleMatch2.Groups[1].Value + "/" + StripHtml(TitleMatch2.NextMatch().Value.ToString());

             }

            return  respHtml;

        }

        /// <summary>

        /// 去除html标签和空格有些例外会使得去除不干净，所以建议连续两次转化。这样将Html标签转化为了空格。太多连续的空格会影响之后对字符串的操作

        /// </summary>

        /// <param name="strHtml">标签内容</param>

        /// <returns></returns>

        private static string StripHtml(string strHtml)

        {

            Regex objRegExp = new Regex("<(.|\n)+?>");

            string strOutput = objRegExp.Replace(strHtml, "");

            strOutput = strOutput.Replace("<", "&lt;");

            strOutput = strOutput.Replace(">", "&gt;");

            //把所有空格变为一个空格

            Regex r = new Regex(@"\s+");

            strOutput = r.Replace(strOutput, " ");

            return strOutput.Trim();

        }

    }

}

asp.net 网页抓取内容的更多相关文章

ASP.NET网页抓取数据
我的数据通过一个TextBox输入,这些代码是写在一个button的点击事件里的. 网页数据抓取大概分为两步,第一步是获取网页源代码: 具体注释如下: var currentUrl = TextBox ...
分享一个c#t的网页抓取类
using System; using System.Collections.Generic; using System.Web; using System.Text; using System.Ne ...
java网页抓取
网页抓取就是,我们想要从别人的网站上得到我们想要的,也算是窃取了,有的网站就对这个网页抓取就做了限制,比如百度直接进入正题 //要抓取的网页地址 String urlStr = "http ...
网页抓取：PHP实现网页爬虫方式小结
来源:http://www.ido321.com/1158.html 抓取某一个网页中的内容,需要对DOM树进行解析,找到指定节点后,再抓取我们需要的内容,过程有点繁琐.LZ总结了几种常用的.易于实现 ...
Asp.Net 之抓取网页内容
一.获取网页内容——html ASP.NET 中抓取网页内容是非常方便的,而其中更是解决了 ASP 中困扰我们的编码问题. 需要三个类:WebRequest.WebResponse.StreamRea ...
基于Casperjs的网页抓取技术【抓取豆瓣信息网络爬虫实战示例】
CasperJS is a navigation scripting & testing utility for the PhantomJS (WebKit) and SlimerJS (Ge ...
Python开发爬虫之动态网页抓取篇：爬取博客评论数据——通过Selenium模拟浏览器抓取
区别于上篇动态网页抓取,这里介绍另一种方法,即使用浏览器渲染引擎.直接用浏览器在显示网页时解析 HTML.应用 CSS 样式并执行 JavaScript 的语句. 这个方法在爬虫过程中会打开一个浏览器 ...
php爬虫入门 - 登录抓取内容
PHP 写爬虫说实话我也想用Python的,毕竟人家招牌.无奈我Python还停留在看语法的阶段,实在太惭愧,鞭笞一下自己加油学习.这里用php的CURL库进行页面抓取. 同事使用的系统需要先登录, ...
Python实现简单的网页抓取
现在开源的网页抓取程序有很多,各种语言应有尽有. 这里分享一下Python从零开始的网页抓取过程第一步:安装Python 点击下载适合的版本https://www.python.org/ 我这里选择 ...

随机推荐

NVelocity-0.4.2.8580 的修改记录[发个vs2008能用的版本] -- "It appears that no class was specified as the ResourceManager..." bug 修正等
因为另有开发记录工具最新没怎么在 cnblog 写开发备忘.不过我觉得这个是个比较严重的问题,觉得有必要让更多的人知道处理方法,所以在 cnblog 也放上一篇希望广为传播. 因为现在网络上vs200 ...
JavaScript跨域方法
一.什么是跨域 JavaScript出于安全方面的考虑,不允许跨域调用其他页面的对象.但在安全限制的同时也给注入iframe或是ajax应用上带来了不少麻烦.这里把涉及到跨域的一些问题简单地整理一下: ...
Rxlifecycle（一）：使用
Rxlifecycle使用非常方便简单,如下: 1.集成 build.gradle添加 //Rxlifecycle compile 'com.trello:rxlifecycle:0.3.1' com ...
Ajax学习笔记(二)
二.prototype库具体解释 1.prototype库的使用 //导入下载好的prototype.js文件 <script type="text/javascript" ...
UE4在Android调用Project Tango
Project Tango应该说是Google一试水AR的设备,其中Project Tango主要二个功能,一个是获取深度信息,如MS的Kinect,有相当多的设备都有这个功能,二是第一人称相对定位, ...
WeifenLuo组件中如何设置停靠窗体的宽度
在项目中使用了WeifenLuo.WinFormsUI.Docking组件,窗体停靠效果非常棒. 现在项目出现了这样的需求,希望可以控制停靠窗体的宽度,因为默认的宽度往往会造成停靠窗体的内容显示不完全 ...
BeginInvoke与Invoke的区别
简单的讲就是 BeginInvoke不需要等待方法运行完毕,就会继续执行下面的代码 Invoke则必须等待Invoke中的代码运行完毕,才会继续执行下面的代码. 可以通过下面的项目测试上面所描述的观点 ...
JavaScript封装Ajax（类JQuery中$.ajax()方法）
ajax.js (function(exports, document, undefined){ "use strict"; function Ajax(){ if(!(this ...
IL速查
名称说明 Add 将两个值相加并将结果推送到计算堆栈上. Add.Ovf 将两个整数相加,执行溢出检查,并且将结果推送到计算堆栈上. Add.Ovf.Un 将两个无符号整数值相加,执行溢出检查,并且 ...
用Razor語法寫範本-RazorEngine組件介紹【转——非常好，可以用它来代替NVelocity】
RazorEngine 官網網址:http://razorengine.codeplex.com 在找到RazorEngine之前曾經想過其他的方案,如T4與V8 Engine載jquery.temp ...

asp.net 网页抓取内容

asp.net 网页抓取内容的更多相关文章

随机推荐

热门专题