简单的网络爬虫程序（Web Crawlers）

程序比较简单，但是能体现基本原理。

package com.wxisme.webcrawlers;

import java.io.*;

import java.net.*;

/**

 * Web Crawlers * @author wxisme

 *

 */

public class WebCrawlers {

    public static void main(String[] args) {

        URL url = null;

        try {

            url = new URL("http://www.baidu.com");

        } catch (MalformedURLException e) {

            System.out.println("域名不合法！");

            e.printStackTrace();

        }

        InputStream is = null;

        try {

            is = url.openStream();

        } catch (IOException e) {

            e.printStackTrace();

        }

        FileOutputStream fos = null;

        try {

            fos = new FileOutputStream("E:\\baidu.txt");

        } catch (FileNotFoundException e) {

            System.out.println("文件创建失败！");

            e.printStackTrace();

        }

        //使用转换流设置字符集

        BufferedReader br = null;

        try {

            br = new  BufferedReader(new InputStreamReader(

                    is,"utf-8"));

        } catch (UnsupportedEncodingException e) {

            System.out.println("字符集设置失败！");

            e.printStackTrace();

        }

        BufferedWriter bw = new BufferedWriter(new OutputStreamWriter(

                fos));

        String msg = null;

        try {

            while((msg = br.readLine()) != null) {

                bw.write(msg);

                bw.newLine();

            }

        } catch (IOException e) {

            System.out.println("文件操作失败！");

            e.printStackTrace();

        } finally {

            try {

                bw.flush();

            } catch (IOException e) {

                e.printStackTrace();

            }

            closeAll(is, fos, br, bw);

        }

    }

    public static void closeAll(Closeable ... io) {

        for(Closeable temp : io) {

            if(temp != null) {

                try {

                    temp.close();

                } catch (IOException e) {

                    System.out.println("文件关闭失败!");

                    e.printStackTrace();

                }

            }

        }

    }

}

简单的网络爬虫程序（Web Crawlers）的更多相关文章

一个简单的python爬虫程序
python|网络爬虫概述这是一个简单的python爬虫程序,仅用作技术学习与交流,主要是通过一个简单的实际案例来对网络爬虫有个基础的认识. 什么是网络爬虫简单的讲,网络爬虫就是模拟人访问web ...
Android网络爬虫程序（基于Jsoup）
摘要:基于 Jsoup 实现一个 Android 的网络爬虫程序,抓取网页的内容并显示出来.写这个程序的主要目的是抓取海投网的宣讲会信息(公司.时间.地点)并在移动端显示,这样就可以随时随地的浏览在学 ...
网络爬虫与web之间的访问授权协议——Robots
网站的管理者们通常会有这样一种心态:一方面期待百度.Google这样的搜索引擎来抓取网站的内容,另一方面又很厌恶其他来路不明的网络爬虫抓取自己的信息.正是因为这样,才有“好爬虫”.“坏爬虫”这样的说法 ...
一个简单的C#爬虫程序
这篇这篇文章主要是展示了一个C#语言如何抓取网站中的图片.实现原理就是基于http请求.C#给我们提供了HttpWebRequest和WebClient两个对象,方便发送请求获取数据,下面看如何实 1 ...
Python:requests库、BeautifulSoup4库的基本使用（实现简单的网络爬虫）
Python:requests库.BeautifulSoup4库的基本使用(实现简单的网络爬虫) 一.requests库的基本使用 requests是python语言编写的简单易用的HTTP库,使用起 ...
Java实现一个简单的网络爬虫
Java实现一个简单的网络爬虫 import java.io.BufferedReader; import java.io.BufferedWriter; import java.io.FileWri ...
hello/hi的简单的网络聊天程序
hello/hi的简单的网络聊天程序 0 Linux Socket API Berkeley套接字接口,一个应用程序接口(API),使用一个Internet套接字的概念,使主机间或者一台计算机上的进程 ...
以您熟悉的编程语言为例完成一个hello/hi的简单的网络聊天程序
Socket通常也称作"套接字",用于描述IP地址和端口,是一个通信链的句柄,可以用来实现不同虚拟机或不同计算机之间的通信,应用程序通常通过"套接字"向网络发出 ...
为编写网络爬虫程序安装Python3.5
1. 下载Python3.5.1安装包1.1 进入python官网,点击menu->downloads,网址:https://www.python.org/downloads/ 1.2 根据系统 ...

随机推荐

深入理解Java虚拟机 -- 读书笔记（1）：JVM运行时数据区域
深入理解Java虚拟机 -- 读书笔记:JVM运行时数据区域本文转载:http://blog.csdn.net/jubincn/article/details/8607790 本系列为<深入理 ...
R语言中的数据处理包dplyr、tidyr笔记
R语言中的数据处理包dplyr.tidyr笔记 dplyr包是Hadley Wickham的新作,主要用于数据清洗和整理,该包专注dataframe数据格式,从而大幅提高了数据处理速度,并且提供了 ...
expect模块的使用,主要没装包折腾一晚上
第一步首先下载expect 模块,yum list |grep expect ,安装下面的模块. expect.x86_64 5.44.1. ...
ansible result.stdout.find('running') != -1 判断状态
[root@m01 ansible-playbook]# cat test_1103.yml ---- hosts: webserver tasks: - file: path=/tmp/{{ ...
Web API（三）：创建Web API项目
在本篇文章中将讲解如何使用Visual Studio创建一个新的ASP.NET Web API项目. 在Visual Studio中有两种方式用于创建Web API项目: 1.创建带MVC的Web A ...
HTTP API 设计指南（响应部分）
前言这篇指南介绍描述了 HTTP+JSON API 的一种设计模式,最初摘录整理自 Heroku 平台的 API 设计指引 Heroku 平台 API 指引. 这篇指南除了详细介绍现有的 API 外 ...
重要：C/C++变量的自动初始化
对于内置变量的自动初始化代码1: #include<stdio.h> #define CONST 100 int *p1; ]; int b; static int c; main() ...
ThinkPHP U函数生成URL伪静态
ThinkPHP支持伪静态URL设置,可以通过设置URL_HTML_SUFFIX参数随意在URL的最后增加你想要的静态后缀,而不会影响当前操作的正常执行.例如,我们设置 'URL_HTML_SUFFI ...
struts 标签牛逼之处
<s:hidden>标签的value属性的类型是String类型,所以把<s:property value="#session.LOGIN_USER"/>当 ...
64位程序，long*转long 出错
原因: long*在64位程序中占8个字节,long占4个字节.强转会出错. 解决方法: 把long用long long替换,long long 占8个字节

简单的网络爬虫程序（Web Crawlers）

简单的网络爬虫程序（Web Crawlers）的更多相关文章

随机推荐

热门专题