java实现网络爬虫

import java.io.IOException;  

import java.util.HashSet;  

import java.util.Set;  

import java.util.regex.Matcher;  

import java.util.regex.Pattern;  

import org.jsoup.Jsoup;  

import org.jsoup.nodes.Document;  

import org.jsoup.nodes.Element;  

import org.jsoup.select.Elements;  

 

public class TestClass {  

    private static Set<String> urlSet = new HashSet<String>();  

    private static Pattern p = Pattern  

            .compile(  

                    "^(((http|https)://" +  

                    "(www.|([1-9]|[1-9]\\d|1\\d{2}|2[0-1]\\d|25[0-5])" +  

                    "(\\.(\\d|[1-9]\\d|1\\d{2}|2[0-4]\\d|25[0-5])){3}:[0-9]+/)?)" +  

                    "{1}.+){1}quot;,  

                    Pattern.CASE_INSENSITIVE);  

 

    public static void main(String[] args) {  

        String baseUrl = "http://www.sina.com";  

        spiderInternet(baseUrl, "");  

    }  

 

    private static void spiderInternet(String baseUrl, String exUrl) {  

        if (baseUrl.endsWith("/") && exUrl.startsWith("/")) {  

            baseUrl = baseUrl.substring(0, baseUrl.length() - 1);  

        }  

        String new_url = baseUrl + exUrl;  

        if (urlSet.contains(new_url)) {  

            return;  

        }  

        System.out.println(new_url);  

        try {  

            Document doc = Jsoup.connect(new_url).get();  

            urlSet.add(new_url);  

            Elements links = doc.select("a[href]");  

            for (Element link : links) {  

                String linkHref = link.attr("href");  

                if (linkHref.equals("#")) {  

                    return;  

                }  

                Matcher matcher = p.matcher(linkHref);  

                if (matcher.matches()) {  

                    spiderInternet(linkHref, "");  

                } else {  

                    spiderInternet(baseUrl, linkHref);  

                }  

            }  

        } catch (IOException e) {  

            e.printStackTrace();  

        }  

    }  

}

java实现网络爬虫的更多相关文章

Java之网络爬虫WebCollector2.1.2+selenium2.44+phantomjs2.1.1
Java之网络爬虫WebCollector2.1.2+selenium2.44+phantomjs2.1.1 一.简介版本匹配: WebCollector2.12 + selenium2.44.0 ...
java之网络爬虫介绍
文章大纲一.网络爬虫基本介绍二.java常见爬虫框架介绍三.WebCollector实战四.项目源码下载五.参考文章一.网络爬虫基本介绍 1. 什么是网络爬虫网络爬虫(又被称为网页蜘蛛, ...
使用Java实现网络爬虫
网络爬虫网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本. 另外一些不常使用的名字还有蚂蚁.自动索引.模 ...
基于java的网络爬虫框架(实现京东数据的爬取，并将插入数据库)
原文地址http://blog.csdn.net/qy20115549/article/details/52203722 本文为原创博客,仅供技术学习使用.未经允许,禁止将其复制下来上传到百度文库等平 ...
Jsoup-基于Java实现网络爬虫-爬取笔趣阁小说
注意!仅供学习交流使用,请勿用在歪门邪道的地方!技术只是工具!关键在于用途! 今天接触了一款有意思的框架,作用是网络爬虫,他可以像操作JS一样对网页内容进行提取初体验Jsoup <!-- Ma ...
Java版网络爬虫基础（转）
网络爬虫不仅仅可以爬取网站的网页,图片,甚至可以实现抢票功能,网上抢购,机票查询等.这几天看了点基础,记录下来. 网页的关系可以看做是一张很大的图,图的遍历可以分为深度优先和广度优先.网络爬虫采取的广 ...
Java版网络爬虫基础
网络爬虫不仅仅可以爬取网站的网页,图片,甚至可以实现抢票功能,网上抢购,机票查询等.这几天看了点基础,记录下来. 网页的关系可以看做是一张很大的图,图的遍历可以分为深度优先和广度优先.网络爬虫采取的广 ...
用Java实现网络爬虫
myCrawler.java package WebCrawler; import java.io.File; import java.util.ArrayList; import java.util ...
JAVA平台上的网络爬虫脚本语言 CrawlScript
JAVA平台上的网络爬虫脚本语言 CrawlScript 网络爬虫即自动获取网页信息的一种程序,有很多JAVA.C++的网络爬虫类库,但是在这些类库的基础上开发十分繁琐,需要大量的代码才可以完成一个 ...

随机推荐

R语言包下载（转载）
http://blog.csdn.net/hongjinlongno1/article/details/53130893 包含几乎所有包,很方便
Apache shiro的简单介绍与使用(与spring整合使用）
apache shiro框架简介 Apache Shiro是一个强大而灵活的开源安全框架,它能够干净利落地处理身份认证,授权,企业会话管理和加密.现在,使用Apache Shiro的人越来越多,因为它 ...
Fitnesse - Slim Tables
Fitnesse - Slim Tables 2017-09-28 目录1 什么是Wiki Word?2 Query Table 2.1 Query Table的格式 2.2 源代码3 Scri ...
Python实战之列表list的详细简单练习2
name_list = ['zhangsan','lisi','wangermazi','xiaotaoqi'] print(name_list) # name_list.append("w ...
javascript Dom 编程
javascript Dom 编程知识概要: (1)Dom是什么? (2)Dom结构模型 (3)XML DOM和 HTML DOM (4)NODE接口的特性和方法 (5)DOM结点的常用属性 ...
Java继承--覆盖
java中支持单继承.不直接支持多继承,但对C++中的多继承机制进行改良. 单继承:一个子类只能有一个直接父类. 多继承:一个子类可以有多个直接父类(java中不允许,进行改良).不直接支持,因为多个 ...
基于HTML5的WebGL实现json和echarts图表展现在同一个界面
突然有个想法,如果能把一些用到不同的知识点放到同一个界面上,并且放到一个盒子里,这样我如果要看什么东西就可以很直接显示出来,而且这个盒子一定要能打开.我用HT实现了我的想法,代码一百多行,这么少的代码 ...
LeetCode 118. Pascal's Triangle （杨辉三角）
Given numRows, generate the first numRows of Pascal's triangle. For example, given numRows = 5,Retur ...
Windows搭建golang开发平台
Golang是谷歌开发的一款开源性语言,暂时比较方便的IDE有Inteillj Idea.LiteIDE.Eclipse(Golipse)等,使用起来比较方便的IDE:LiteIDE和Inteillj ...
HTTP Error 500.19 - Internal Server Error
1.使用svn对项目进行管理 2.之前都是平安无事,忽然有一天报错:HTTP Error 500.19 - Internal Server Error,如图: 3.经过各种挣扎和求证,最后发现是项目. ...

java实现网络爬虫

java实现网络爬虫的更多相关文章

随机推荐

热门专题