C# 爬取网页上的数据

最近工作中需求定时爬取不同城市每天的温度。其实就是通过编程的方法去抓取不同网站网页进行分析筛选的过程。.NET提供了很多类去访问并获得远程网页的数据，比如WebClient类和HttpWebRequest类。这些类对于利用HTTP去访问远端的网页并且下载下来是很有用的，但在对于所下载下来的HTML的解析能力方面，则显得功能很弱了。推荐一个开源的组件HTML Agility Pack(http://htmlagilitypack.codeplex.com/),它的设计目标是尽可能简化对HTML文档的读和写。这个包本身是利用了DOM文档对象模型去解析HTML的。在此顺便记录一下最近收集的爬取历史和当前天气的网站备用：

支持历史天气查询的中文网站：http://lishi.tianqi.com/
类似网站：http://tianqi.2345.com/wea_history/59287.htm （最近2-3年数据）
网站：http://www.wunderground.com/history/ （最近18年数据）
这个网站支持的时间更长： http://www.tutiempo.net/en/Climate/
中国天气网：http://www.weather.com.cn/,

中国天气网(Weather.com.cn)

该网提供有如下三个Json格式的查询接口，以北京为例：
http://www.weather.com.cn/data/sk/101010100.html
http://www.weather.com.cn/data/cityinfo/101010100.html
http://m.weather.com.cn/data/101010100.html
ID是一个9位的数字，按照长度可以分为如下四部分：101（国家代号） 01（省） 01（二级地区） 00（三级地区）
要获取所有的地区代号，通过如下方式：https://wqbot.blob.core.windows.net/botdemo/CityCode.xml

示例Demo

编程使用示例如下：我们要获取如下网页中的天气信息：

下载HTML Agility Pack组件，新建控制台程序，在你的工程中引用相应framework版本对应的组件，示例代码如下：

            string url = @"http://lishi.tianqi.com/beijing/201701.html";

            var webGet = new HtmlWeb();

            var document = webGet.Load(url);

            var div = document.DocumentNode.SelectNodes("//div[@class='tqtongji2']/ul");

            foreach (HtmlNode node in div)

            {

                var tmpNode = node.SelectNodes("li");

                Console.WriteLine(string.Format("{0}-----------{1}---------{2}----------{3}",

                    tmpNode[].InnerText,

                    tmpNode[].InnerText,

                    tmpNode[].InnerText,

                    tmpNode[].InnerText));

            }

            Console.ReadKey();

程序运行效果：中文存在乱码，如下图

通过分析HTML Agility Pack源码，在HtmlWeb类的Get(Uri uri, string method, string path, HtmlDocument doc)方法中，局部变量 resp是http请求的response。设置断点发现resp.ContentEncoding为空。因此通过HttpWebRequest来下载数据，示例代码如下：

            string url = @"http://lishi.tianqi.com/beijing/201701.html";

            HttpWebRequest req = WebRequest.Create(new Uri(url)) as HttpWebRequest;

            req.Method = "GET";

            WebResponse rs = req.GetResponse();

            Stream rss = rs.GetResponseStream();

            HtmlDocument doc = new HtmlDocument();

            doc.Load(rss);

            var div = doc.DocumentNode.SelectNodes("//div[@class='tqtongji2']/ul");

            foreach (HtmlNode node in div)

            {

                var tmpNode = node.SelectNodes("li");

                Console.WriteLine(string.Format("{0}-----------{1}---------{2}----------{3}",

                    tmpNode[].InnerText,

                    tmpNode[].InnerText,

                    tmpNode[].InnerText,

                    tmpNode[].InnerText));

            }

            Console.ReadKey();

代码运行效果如下：

that's ok!!!

C# 爬取网页上的数据的更多相关文章

Python爬取网站上面的数据很简单，但是如何爬取APP上面的数据呢
python3下scrapy爬虫(第八卷:循环爬取网页多页数据）
之前我们做的数据爬取都是单页的现在我们来讲讲多页的一般方式有两种目标URL循环抓取另一种在主页连接上找规律,现在我用的案例网址就是通过点击下一页的方式获取多页资源话不多说全在代码里(因为刚才写 ...
简单又强大的pandas爬虫利用pandas库的read_html()方法爬取网页表格型数据
文章目录一.简介二.原理三.爬取实战实例1 实例2 一.简介一般的爬虫套路无非是发送请求.获取响应.解析网页.提取数据.保存数据等步骤.构造请求主要用到requests库,定位提取数据用的比 ...
PHP 爬取网页中表格数据
public function spider_j($page) { $url="http://aaa/bbb".$page."_0/"; $fcontents= ...
Python3.5：爬取网站上电影数据
首先我们导入几个pyhton3的库: from urllib import requestimport urllibfrom html.parser import HTMLParser 在Python ...
[原创]python爬虫之BeautifulSoup,爬取网页上所有图片标题并存储到本地文件
from bs4 import BeautifulSoup import requests import re import os r = requests.get("https://re. ...
爬虫入门（三）——动态网页爬取：爬取pexel上的图片
Pexel上有大量精美的图片,没事总想看看有什么好看的自己保存到电脑里可能会很有用但是一个一个保存当然太麻烦了所以不如我们写个爬虫吧(๑•̀ㅂ•́)و✧ 一开始学习爬虫的时候希望爬取pexel上的 ...
使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...

随机推荐

【转】移除HTML5 input在type="number"时的上下小箭头
在chrome下: input::-webkit-outer-spin-button, input::-webkit-inner-spin-button{ -webkit-appearance ...
Unity5.2如何使用VS调试
今天不想使用Mono了,想用VS调试Unity,上百度搜了很久无果,VPN又连不上,结果搞两个小时没搞定.11点终于可以上谷歌了,十分钟搞定.由此可见,百度真的很坑爹...废话不多说下面上正文. 误区 ...
MS14-021： Internet Explorer 安全更新： 2014 年 5 月 1 日
微软推送全平台IE零日漏洞补丁 2014.05.2 3 Comments 207 views今天,微软正式发布IE安全补丁,修复4月底曝光的零日漏洞.用户可通过Windows Update自动更新服务 ...
windowns 下备份mysql数据库
@echo off & setlocal ENABLEEXTENSIONS :: ---------- 配置项 ---------- :: 备份放置的路径,加 \ set BACKUP_PAT ...
myeclipse10 破解版安装
安装包请看百度云: step1 step2 step3 step4 step5 step6 安装 svn,可以参考: http://www.cnblogs.com/OnlyCT/p/6061134.h ...
DevExpress Add ASPxGridView template columns at runtime
<%@ Assembly Name="$SharePoint.Project.AssemblyFullName$" %> <%@ Import Namespace ...
Mac 活动监视器闪退 pro发热耗电过快问题解决，亲测可用解决
该解决办法转载 Mac 活动监视器闪退 pro发热耗电过快问题解决这个月新买了mac,升级了系统,出现CPU发热,高负荷运转问题,始终找不到问题解决办法, ,这个过程太痛苦了,也不知道是什么原因. ...
批量解帧视频文件cpp
前言将多个视频文件进行解帧. 实现过程 1.批量获取文件路径: 2.对某个视频文件进行解帧: 代码 /************************************************ ...
ubuntu16.04 中文输入法
https://blog.csdn.net/qq_21792169/article/details/53152700 在主文件夹目录即home目录,按快捷键Ctrl+H(显示隐藏文件),看到的.bas ...
xgboost 简单测试
#coding=utf8 import pandas as pd from sklearn.model_selection import train_test_split from sklearn.f ...

C# 爬取网页上的数据

C# 爬取网页上的数据的更多相关文章

随机推荐

热门专题