使用jsoup进行网页内容抓取

对网页内容的抓取比较的感兴趣，于是就简单的学习了一下，如果不使用任何的框架去抓取网页的内容，感觉有点难度，我就简单点来吧，这里所使用的jsoup框架，抓取网页的内容与使用jquery选择网页的内容差不多，上手很快。下面就简单的介绍一下吧！

首先是获取网络资源的方法：

    /**

     * 获取网络中的超链接

     *

     * @param urlStr

     *            传入网络地址

     * @return 返回网页中的所有的超链接信息

     */

    public String getInternet(String urlStr, String encoding) {

        URL url = null;

        URLConnection conn = null;

        String nextLine = null;

        StringBuffer sb = new StringBuffer();

        // 设置系统的代理信息

        Properties props = System.getProperties();

        props.put("proxySet", "true");

        props.put("proxyHost", "10.27.16.212");

        props.put("proxyPort", "3128");

        System.setProperties(props);

        try {

            // 获取网络资源

            url = new URL(urlStr);

            // 获取资源连接

            conn = url.openConnection();

            conn.setReadTimeout(30000);//设置30秒后超时

            conn.connect();

            BufferedReader reader = new BufferedReader(new InputStreamReader(

                    conn.getInputStream(), encoding));

            // 开始读取网页信息获取网页中的超链接信息

            while ((nextLine = reader.readLine()) != null) {

                sb.append(nextLine);

            }

        } catch (Exception e) {

            e.printStackTrace();

        }

        return sb.toString();

    }

我们在获取了网络资源之后，我们就可以根据自己的需求筛选出对自己有用的资源了，下面开始抓取资源：

public static void main(String[] args) {

        MavenTest test = new MavenTest();

        try {

            String html = test.getInternet(    "http://www.weather.com.cn/html/weather/101020100.shtml#7d","UTF-8");

            //将html文档转换为Document文档

            Document doc = Jsoup.parse(html);

            //获取class为.weatherYubaoBox的div的元素

            Elements tableElements = doc.select("div.weatherYubaoBox");

//            System.out.println(tableElements.html());

            //获取所有的th元素

            Elements thElements = tableElements.select("th");

            //打印出日期的标题信息

            for (int i = 0; i < thElements.size(); i++) {

                System.out.print("                "+thElements.get(i).text() + "\t");

            }

            // 输出标题之后进行换行

            System.out.println();

            //获取表格的tbody

            Elements tbodyElements = tableElements.select("tbody");

            for (int j = 1; j < tbodyElements.size(); j++) {

                //获取tr中的信息

                Elements trElements = tbodyElements.get(j).select("tr");

                for (int k = 0; k < trElements.size(); k++) {

                    //获取单元格中的信息

                    Elements tdElements = trElements.get(k).select("td");

                    //根据元素的多少判断出白天和夜晚的

                    if (tdElements.size() > 6) {

                        for (int m = 0; m < tdElements.size(); m++) {

                            System.out.print(tdElements.get(m).text() + "\t");

                        }

                        // 白天的数据打印完成后进行换行

                        System.out.println();

                    }else{

                        for(int n =0; n < tdElements.size(); n++){

                            System.out.print("\t"+tdElements.get(n).text());

                        }

                        //打印完成夜间的天气信息进行换行处理

                        System.out.println();

                    }

                }

            }

        } catch (Exception e) {

            e.printStackTrace();

        }

    }

运行的结果如下：

最后附上框架的地址：http://www.open-open.com/jsoup/selector-syntax.htm

使用jsoup进行网页内容抓取的更多相关文章

Java+Jsoup实现网页内容抓取
不知不觉毕业快一年了,工作逐渐趋于平淡,从一个对编程了解得很少甚至完全一窍不通的小小菜,终于成为了一枚小菜,总而言之,算是入了IT这一行.这大半年马马虎虎做了三个项目,有安卓项目,有Java Web项 ...
使用Jsoup函数包抓取网页内容
之前写过一篇用Java抓取网页内容的文章,当时是用url.openStream()函数创建一个流,然后用BufferedReader把这个inputstream读取进来.抓取的结果是一整个字符串.如果 ...
Java下HttpUnit和Jsoup的Http抓取
简单记录下:搜集信息-分析问题-解决问题关于html文档的操作现成库有: HttpUnit 很老了,不更了 http://www.httpunit.org/ 20 May 2008 HttpUni ...
网络爬虫WebCrawler（1）-Http网页内容抓取
在windows在下面C++由Http协议抓取网页的内容: 首先介绍了两个重要的包(平时linux在开源包,在windows下一个被称为动态链接库dll):curl包和pthreads_dll,其中c ...
C# asp.net 抓取需要登录的网页内容抓取asp.net登录验证的网站
private void btnASPNET_Click(object sender, EventArgs e) { Dictionary<string, s ...
php 网页内容抓取
最近抓的2个网站内容的代码列表页抓取:第一种使用phpquery插件,可以快速获取,第二种它是api,所以直接获取 load_third("phpQuery.php"); /** ...
Python 实现腾讯新闻抓取
原文地址:http://www.cnblogs.com/rails3/archive/2012/08/14/2636780.htm 思路: 1.抓取腾讯新闻列表页面: http://news.qq.c ...
jsoup抓取网页内容
java项目有时候我们需要别人网页上的数据,怎么办?我们可以借助第三方架包jsou来实现,jsoup的中文文档,那怎么具体的实现呢?那就跟我一步一步来吧最先肯定是要准备好这个第三方架包啦,下载地址, ...
HTTPCLIENT抓取网页内容
通过httpclient抓取网页信息. public class SnippetHtml{ /** * 通过url获取网站html * @param url 网站url */ public Strin ...

随机推荐

js date string parse
function dateParse(dStr){ //var dStr = '2016-1-26 0:7:14'; var d = dStr.split(' ')[0].split('-'); va ...
GC: 垃圾回收算法
标记-清除算法标记-清除(Mark-Sweep)算法是最基础的算法,就如它的名字一样,算法分为“标记”和“清除”两个阶段:首先标记出所有需要回收的对象,在标记完成后统一回收掉所有被标记的对象.之所以说 ...
A - Oulipo
A - Oulipo Time Limit:1000MS Memory Limit:65536KB 64bit IO Format:%I64d & %I64u Submit S ...
HNC-全局联想脉络
全局联想脉络—语义块和句类一个语义块包含核心部分和说明部分. 语义块分为: 主语义块:有 4 种:特征E.作用者A.对象B.内容C 辅语义块:有 7 种:条件.手段.工具.途径.参照.因.果. ...
iOS单例宏定义
#define singleton_interface(className) \ + (className *)shared##className; // @implementation #defin ...
oracle 空值与 null
Oracle中的空字符串基本上是被当成空NULL来处理的,我们可以从下面的得到印证. select nvl('','NULL') from dual 返回 'NULL' select ...
使用VS2013调试FluorineFx程序
VS2013,建立 FluorineFx Web 项目方法: 先新建.项目.Web.选择.NET 3.5 ASP.NET 窗体程序来新建一个项目.复制 log.Templates.WEB-INF 文件 ...
JPBM4.4基础及数据库说明
JPBM4.4基础及数据库说明对jBPM4.4数据库的几张表简单介绍: A.资源库和运行时表结构 JBPM4_DEPLOYMENT 流程定义表 ...
[读书笔记]SQL约束
目的:通过在列级或表级设置约束,确保数据符合某种数据完整性规则实现:数据库主动地检查维护数据的完整性手段:约束,数据类型,触发器 --------------------------------- ...
本地存储（cookie&sessionStorage&localStorage）
好文章,最全面.就查它吧:https://segmentfault.com/a/1190000004556040 1.DOM存储:https://developer.mozilla.org/zh-CN ...

使用jsoup进行网页内容抓取

使用jsoup进行网页内容抓取的更多相关文章

随机推荐

热门专题