这个java获取网络资源以前也写过不少

最近用到又重新写了一个,apache.commons.io中的例子就非常好,但是无法对请求进行详细设置

于是大部分照搬,局部替换以设置请求头

如需更加复杂的设置,可以考虑使用同为apche的httpComponents


**
```java
package boot.example;

import org.apache.commons.io.FileUtils;

import org.apache.commons.io.IOUtils;

import java.io.*;

import java.net.HttpURLConnection;

import java.net.URL;

/**

  • Created by wq on 2017/6/6.

    */

    public class Download {

    public static void main(String[] args) {

    Download download = new Download();

    String url = "http://img1.3lian.com/2015/w7/85/d/21.jpg";

    String path1 = "E:\1.jpg";

    String path2 = "E:\2.jpg";

    String path3 = "E:\3.jpg";

    String url2="http://www.baidu.com";

    try {

    download.apacheCommonsIoDownload(url, path1);

    } catch (Exception e) {

    e.printStackTrace();

    }

    try {

    download.pureJavaNetDownload(url, path2);

    } catch (Exception e) {

    e.printStackTrace();

    }

    try {

    download.mixedDownload(url, path3);

    } catch (Exception e) {

    e.printStackTrace();

    }

    try{

    download.getContentAsString(url2);

    }catch (Exception e){

    e.printStackTrace();

    }

    }

    private void apacheCommonsIoDownload(String urlstr, String path) throws Exception {

    apacheCommonsIoDownload(urlstr, new File(path));

    }

    private void apacheCommonsIoDownload(String urlstr, File file) throws Exception {

    FileUtils.copyURLToFile(new URL(urlstr), file);

    }

    private void pureJavaNetDownload(String urlstr, String path) throws Exception {

    pureJavaNetDownload(urlstr, new File(path));

    }

    //无需依赖

    private void pureJavaNetDownload(String urlstr, File file) throws Exception {

    URL url = new URL(urlstr);

    HttpURLConnection httpURLConnection = (HttpURLConnection) url.openConnection();

    httpURLConnection.setRequestMethod("GET");

    //有的网站屏蔽程序抓取 添加User-Agent头信息以避免403

    httpURLConnection.setRequestProperty("User-Agent", "Mozilla/4.0");

    httpURLConnection.setConnectTimeout(10000);

    httpURLConnection.setReadTimeout(10000);

    // httpURLConnection.set...更多请求设置

    httpURLConnection.connect();

    InputStream is = httpURLConnection.getInputStream();

    // 不需要设置可以直接下面 也就是org.apache.commons.io.FileUtils中copyURLToFile(URL source, File destination)的写法

    // InputStream is=url.openStream();

    try {

    FileOutputStream fos = new FileOutputStream(file);

    try {

    // 照搬org.apache.commons.io.IOUtils

    // IOUtils.copy(InputStream input, OutputStream output) 开始

    byte[] buffer = new byte[1024 * 4];

    int n;

    while (-1 != (n = is.read(buffer))) {

    fos.write(buffer, 0, n);

    }

    // IOUtils.copy(InputStream input, OutputStream output) 结束

    } finally {

    try {

    if (is != null) {

    fos.close();

    }

    } catch (IOException ioe) {

    // ignore

    }

    }

    } finally {

    try {

    if (is != null) {

    is.close();

    }

    } catch (IOException ioe) {

    // ignore

    }

    }

    }

    private void mixedDownload(String urlstr, String path) throws Exception {

    mixedDownload(urlstr, new File(path));

    }

    //使用IOUtils减少代码量 弃用FileUtils以对请求进行详细设置 推荐

    private void mixedDownload(String urlstr, File file) throws Exception {

    URL url = new URL(urlstr);

    HttpURLConnection httpURLConnection = (HttpURLConnection) url.openConnection();

    httpURLConnection.setRequestMethod("GET");

    httpURLConnection.setRequestProperty("User-Agent", "Mozilla/4.0");

    httpURLConnection.setConnectTimeout(10000);

    httpURLConnection.setReadTimeout(10000);

    httpURLConnection.connect();

    InputStream is = httpURLConnection.getInputStream();

    try {

    FileOutputStream output = FileUtils.openOutputStream(file);

    try {

    IOUtils.copy(is, output);

    } finally {

    IOUtils.closeQuietly(output);

    }

    } finally {

    IOUtils.closeQuietly(is);

    }

    }

    private void getContentAsString(String urlstr) throws Exception {

    URL url = new URL(urlstr);

    InputStream is=url.openStream();

    ByteArrayOutputStream bos=new ByteArrayOutputStream();

    IOUtils.copy(is, bos);

    System.out.println(bos.toString());

    }

    }

旧瓶新酒-获取网络资源即爬取下载页面内容(图片、html、css、js等)的更多相关文章

  1. java实现多线程使用多个代理ip的方式爬取网页页面内容

    项目的目录结构 核心源码: package cn.edu.zyt.spider; import java.io.BufferedInputStream; import java.io.FileInpu ...

  2. scrapy(四): 爬取二级页面的内容

    scrapy爬取二级页面的内容 1.定义数据结构item.py文件 # -*- coding: utf-8 -*- ''' field: item.py ''' # Define here the m ...

  3. Scrapy爬取静态页面

    Scrapy爬取静态页面 安装Scrapy框架: Scrapy是python下一个非常有用的一个爬虫框架 Pycharm下: 搜索Scrapy库添加进项目即可 终端下: #python2 sudo p ...

  4. UI自动化之特殊处理四(获取元素属性\爬取页面源码\常用断言)

    获取元素属性\爬取页面源码\常用断言,最终目的都是为了验证我们实际结果是否等于预期结果 目录 1.获取元素属性 2.爬取页面源码 3.常用断言 1.获取元素属性 获取title:driver.titl ...

  5. scrapy模拟浏览器爬取验证码页面

    使用selenium模块爬取验证码页面,selenium模块需要另外安装这里不讲环境的配置,我有一篇博客有专门讲ubuntn下安装和配置模拟浏览器的开发 spider的代码 # -*- coding: ...

  6. [Python_scrapy图片爬取下载]

    welcome to myblog Dome地址 爬取某个车站的图片 item.py 中 1.申明item 的fields class PhotoItem(scrapy.Item): # define ...

  7. 爬取百度页面代码写入到文件+web请求过程解析

    一.爬取百度页面代码写入到文件 代码示例: from urllib.request import urlopen #导入urlopen包 url="http://www.baidu.com& ...

  8. 使用BeautifulSoup自动爬取微信公众号图片

    爬取微信分享的图片,根据不同的页面自行修改,使用BeautifulSoup爬取,自行格局HTML修改要爬取图片的位置 import re import time import requests imp ...

  9. Python爬取 | 唯美女生图片

    这里只是代码展示,且复制后不能直接运行,需要配置一些设置才行,具体请查看下方链接介绍: Python爬取 | 唯美女生图片 from selenium import webdriver from fa ...

随机推荐

  1. 基于队列queue实现的线程池

    本文通过文章同步功能推送至博客园,显示排版可能会有所错误,请见谅! 写在前文:在Python中给多进程提供了进程池类,对于线程,Python2并没有直接提供线程池类(Python3中提供了线程池功能) ...

  2. .NetCore技术研究-ConfigurationManager在单元测试下的坑

    最近在将原有代码迁移.NET Core, 代码的迁移基本很快,当然也遇到了不少坑,重构了不少,后续逐步总结分享给大家.今天总结分享一下ConfigurationManager遇到的一个问题. 先说一下 ...

  3. 第 15 篇:优化博客功能的细节,提升使用体验—— HelloDjango 系列教程

    作者:HelloGitHub-追梦人物 文中涉及的示例代码,已同步更新到 HelloGitHub-Team 仓库 在之前的系列教程中,我们已经实现了:文章的发布.展示.评论等功能,可能认真的小伙伴已经 ...

  4. sql 删除完全表中完全重复的数据保留一条

    1.删除完全重复数据 原始数据: 期望数据: delete result from (select ROW_NUMBER () over(partition by id order by id) r, ...

  5. FreeSql (二十二)Dto 映射查询

    适合喜欢使用 dto 的朋友,很多时候 entity 与 dto 属性名相同,属性数据又不完全一致. 有的人先查回所有字段数据,再使用 AutoMapper 映射. 我们的功能是先映射,再只查询映射好 ...

  6. kubernetes部署jenkins(Docker in Docker)及认证

    引言 Jenkins是一款开源 CI&CD 软件,用于自动化各种任务,包括构建.测试和部署软件. 本文将Jenkins的master与slave置于Pod中,部署在namespace:jenk ...

  7. Set集合、List集合

    集合体系:Collection.Map接口 存储数量不等的多个对象,不能存储基本数据类型,如存储基本数据类型会自动装箱 ======================================== ...

  8. C#基础知识总结(三)--反射

    如何在C#.NET开发中使用反射. 首先,我新建一个普通的类库项目.在该项目的测试类中,定义好 属性.静态方法.实例方法.无参方法等... 代码如下: using System; using Syst ...

  9. Android四大组件之服务的两种启动方式详解

    Service简单概述 Service(服务):是一个没有用户界面.可以在后台长期运行且可以执行操作的应用组件.服务可由其他应用组件启动(如:Activity.另一个service).此外,组件可以绑 ...

  10. Spring Cloud 系列之 Spring Cloud Stream

    Spring Cloud Stream 是消息中间件组件,它集成了 kafka 和 rabbitmq .本篇文章以 Rabbit MQ 为消息中间件系统为基础,介绍 Spring Cloud Stre ...