C#获取网页内容，并且处理正确编码

控制台调用
static void Main(string[] args)

        {

            string code = GetEncodings("http://www.cnblogs.com");

            Encoding pp = Encoding.GetEncoding(code);

            string pl = GetHtml("http://www.cnblogs.com", pp);

        }

下面的代码不重要，只是可以获取标题或其它内容

// 获取网页的HTML内容，根据网页的charset自动判断Encoding

        static string GetHtml(string url)

        {

            return GetHtmls(url, null);

        }

        // 获取网页的HTML内容，指定Encoding

        static string GetHtmls(string url, Encoding encoding)

        {

            byte[] buf = new WebClient().DownloadData(url);

            if (encoding != null) return encoding.GetString(buf);

            string html = Encoding.UTF8.GetString(buf);

            encoding = GetEncoding(html);

            if (encoding == null || encoding == Encoding.UTF8) return html;

            return encoding.GetString(buf);

        }

        // 根据网页的HTML内容提取网页的Encoding

        static Encoding GetEncoding(string html)

        {

            string pattern = @"(?i)\bcharset=(? <charset>[-a-zA-Z_0-9]+)";

            string charset = Regex.Match(html, pattern).Groups["charset"].Value;

            try { return Encoding.GetEncoding(charset); }

            catch (ArgumentException) { return null; }

        }

        // 根据网页的HTML内容提取网页的Title

        static string GetTitle(string html)

        {

            string pattern = @"(?si) <title(?:\s+(?:""[^""]*""|'[^']*'|[^""'>])*)?>(? <title>.*?) </title>";

            return Regex.Match(html, pattern).Groups["title"].Value.Trim();

        }

        // 打印网页的Encoding和Title

        static void PrintEncodingAndTitle(string url)

        {

            string html = GetHtml(url);

            Console.WriteLine("[{0}] [{1}]", GetEncoding(html), GetTitle(html));

        }

里面的代码不重要，只是获取其它的内容

/// <summary>

        /// 获取源代码

        /// </summary>

        /// <param name="url"></param>

        /// <returns></returns>

        public static string GetHtml(string url, Encoding encoding)

        {

            HttpWebRequest request = null;

            HttpWebResponse response = null;

            StreamReader reader = null;

            try

            {

                request = (HttpWebRequest)WebRequest.Create(url);

                request.Timeout = ;

                request.AllowAutoRedirect = false;

                response = (HttpWebResponse)request.GetResponse();

                if (response.StatusCode == HttpStatusCode.OK && response.ContentLength <  * )

                {

                    if (response.ContentEncoding != null && response.ContentEncoding.Equals("gzip", StringComparison.InvariantCultureIgnoreCase))

                        reader = new StreamReader(new GZipStream(response.GetResponseStream(), CompressionMode.Decompress), encoding);

                    else

                        reader = new StreamReader(response.GetResponseStream(), encoding);

                    string html = reader.ReadToEnd();

                    return html;

                }

            }

            catch

            {

            }

            finally

            {

                if (response != null)

                {

                    response.Close();

                    response = null;

                }

                if (reader != null)

                    reader.Close();

                if (request != null)

                    request = null;

            }

            return string.Empty;

        }

        public static string GetEncodings(string url)

        {

            HttpWebRequest request = null;

            HttpWebResponse response = null;

            StreamReader reader = null;

            try

            {

                request = (HttpWebRequest)WebRequest.Create(url);

                request.Timeout = ;

                request.AllowAutoRedirect = false;

                response = (HttpWebResponse)request.GetResponse();

                if (response.StatusCode == HttpStatusCode.OK && response.ContentLength <  * )

                {

                    if (response.ContentEncoding != null && response.ContentEncoding.Equals("gzip", StringComparison.InvariantCultureIgnoreCase))

                        reader = new StreamReader(new GZipStream(response.GetResponseStream(), CompressionMode.Decompress));

                    else

                        reader = new StreamReader(response.GetResponseStream(), Encoding.ASCII);

                    string html = reader.ReadToEnd();

                    string pp = html.Substring(html.IndexOf("charset"),);

                    int p2 = pp.IndexOf(">");

                    pp=pp.Substring(,p2);

                    pp = pp.Replace("\\", "").Replace("\"", "").Replace("charset=","").Replace(">","")..Replace("/","").Replace(" ","");;

                    string p3 = pp;

                    return p3;

                    //Regex reg_charset = new Regex(@"charset\b\s*=\s*(?<charset>[^""]*)");

                    //if (reg_charset.IsMatch(html))

                    //{

                    //    return reg_charset.Match(html).Groups["charset"].Value;

                    //}

                    //else if (response.CharacterSet != string.Empty)

                    //{

                    //    return response.CharacterSet;

                    //}

                    //else

                    //    return Encoding.Default.BodyName;

                    ////XmlDocument xml = new XmlDocument();

                    ////xml.LoadXml(html);

                }

                return null; 

            }

            catch

            {

                return null;

            }

            finally

            {

                if (response != null)

                {

                    response.Close();

                    response = null;

                }

                if (reader != null)

                    reader.Close();

                if (request != null)

                    request = null;

            }

        }

这里才是真正的代码，这里一个是获取正确的编码，一个是根据编码解析源码

C#获取网页内容，并且处理正确编码的更多相关文章

C#获取网页内容 (WebClient、WebBrowser和HttpWebRequest/HttpWebResponse)
获取网页数据有很多种方式.在这里主要讲述通过WebClient.WebBrowser和HttpWebRequest/HttpWebResponse三种方式获取网页内容. 这里获取的是包括网页的所有信息 ...
C#获取网页内容的三种方式
C#通常有三种方法获取网页内容,使用WebClient.WebBrowser或者HttpWebRequest/HttpWebResponse... 方法一:使用WebClient (引用自:http: ...
基于apache —HttpClient的小爬虫获取网页内容
今天(17-03-31)忙了一下午研究webmagic,发现自己还太年轻,对于这样难度的框架(类库) 还是难以接受,还是从基础开始吧,因为相对基础的东西教程相多一些,于是乎我找了apache其下的 H ...
C#获取网页内容的三种方式(转)
搜索网络,发现C#通常有三种方法获取网页内容,使用WebClient.WebBrowser或者HttpWebRequest/HttpWebResponse... 方法一:使用WebClient (引用 ...
【C#】获取网页内容及HTML解析器HtmlAgilityPack的使用
最近经常需要下载一些东西,而这个下载地址又会经过层层跳转,每个页面上都有很多广告,烦不胜烦,所以做了一个一键获得最终下载地址的小工具.使用C#,来获取网页内容,然后通过HtmlAgilityPack获 ...
JS获取url参数及url编码、解码
完整的URL由这几个部分构成:scheme://host:port/path?query#fragment ,各部分的取法如下: window.location.href:获取完整url的方法:,即s ...
定义一个方法get_page(url),url参数是需要获取网页内容的网址，返回网页的内容。提示（可以了解python的urllib模块）
定义一个方法get_page(url),url参数是需要获取网页内容的网址,返回网页的内容.提示(可以了解python的urllib模块) import urllib.request def get_ ...
使用Jsoup获取网页内容超时设置
使用Jsoup获取网页内容超时设置最近使用Jsoup来抓取网页,并对网页进行解析,发现很好用.在抓取过程中遇到一个问题,有些页面总是报Timeout异常,开始想是不是被抓取网站对IP进行了限制,后来 ...
使用selenium和phantomJS浏览器获取网页内容的小演示
# 使用selenium和phantomJS浏览器获取网页内容的小演示 # 导入包 from selenium import webdriver # 使用selenium库里的webdriver方法调 ...
[PHP学习教程 - 网络]002.获取网页内容(URL Content)
引言:获取网页内容是我们实现网页操作的基本之基本,今天这一讲,我们和大家讲一下基本请求网页内容的几种方法. 我们似乎每天都要做这样一件事情,打开一个浏览器,输入网址,回车,一个空白的页面顿时有了东西, ...

随机推荐

使用ngx_lua构建高并发应用
http://blog.csdn.net/chosen0ne/article/details/7304192
9-4 Unidirectional TSP uva116 （DP）
题意:给一个n行m列矩阵从第一列任意一个位置出发每次往右右上右下三个方向走一格直到最后一列输出所类和的最小值和路径!! 最小值相同则输出字典序最小路径很像一开始介绍的三角形dp ...
百道CTF刷题记录(一)
简介最近在刷CTF题,主攻Web,兼职Misc Shiyanbar 0x01 简单的登陆题简单概括: 考点: %00截断正则 CBC字节翻转攻击难度: 难 WP:https://blog.csd ...
使用IDEA运行Eclipse编辑jetty运行的J2EE项目的惨痛教训
公司的项目原本是使用Eclipse,使用自带的jetty运行, 用IDEA通过git clone后,使用Tomcat运行,可以运行,却无法访问页面,总是报错404 后来使用IDEA Jetty运行,经 ...
Linux-UDP-Socket编程
接收CAN总线上的数据并将其发送出去创建客户端: /******************************************************************** * co ...
C#剪切板
C#剪切板 Clipboard类我们现在先来看一下官方文档的介绍位于:System.Windows.Forms 命名空间下 Provides methods to place data on an ...
Xamarin 2017.11.1更新
Xamarin 2017.11.1更新本次更新主要解决了一些bug.Visual Studio 2017升级到15.4.2获得新功能.Visual Studio 2015需要工具-选项-Xamar ...
vsftp 虚拟用户+MySQL认证独立家目录
centos7 系统安装包 yum -y install mariadb vsftpd openssl-devel mysql-devel pam-devel yum -y groupinsta ...
python opencv3 轮廓检测
git:https://github.com/linyi0604/Computer-Vision # coding:utf8 import cv2 import numpy as np # 创建一个2 ...
GITC简单感触
GITC短暂的2天,去参加主要是想参与其中,了解其他家的技术,技术使用, 那些大牛,及大牛公司,大牛团队的一些事. 早上的主会场主要是介绍和宣传.半小时后就出去逛逛外面的分会场: 参与听了下智能硬件 ...

C#获取网页内容，并且处理正确编码

C#获取网页内容，并且处理正确编码的更多相关文章

随机推荐

热门专题