Java爬虫

作为一位Java爬虫的初学者，分享一下自己的心得。
所用到的jar包

org.codehaus.jettison.jar

jsoup-1.7.3.jar

个人认为爬虫的实现机制：
获取Docume对象—>获取节点—>输出或者持久化

获取页面的图片地址

获取Docume对象—>获取Img元素—>输出地址

 package com.cn.basic;

 import java.io.IOException;

 import org.jsoup.Jsoup;

 import org.jsoup.nodes.Document;

 import org.jsoup.nodes.Element;

 import org.jsoup.select.Elements;

 public class ImageDemo1 {

     public static void Get_Url(String htmlUrl, String path) {

         try {

             Document doc = Jsoup.connect(htmlUrl).get();

             Element body = doc.body();

             Elements elements = body.select("img");

             String src = "";

             for (Element element : elements) {

                 src = element.attr("src");

                 System.out.println(path + src);

             }

             System.out.println("elements-size: " + elements.size());

         } catch (IOException e) {

             e.printStackTrace();

         }

     }

     public static void main(String[] args) {

         String url = "http://pic.netbian.com/4kkatongdongman/index_2.html";

         String path = "http://pic.netbian.com";

         Get_Url(url, path);

     }

 }

将图片写入本地

获取Docume对象—>获取Img元素—>将图片保存本地

 package com.cn.basic;

 import java.io.ByteArrayOutputStream;

 import java.io.File;

 import java.io.FileOutputStream;

 import java.io.IOException;

 import java.io.InputStream;

 import java.net.HttpURLConnection;

 import java.net.URL;

 import java.util.Date;

 import org.jsoup.Jsoup;

 import org.jsoup.nodes.Document;

 import org.jsoup.nodes.Element;

 import org.jsoup.select.Elements;

 public class ImageDemo2 {

     public static void saveImage(String htmlUrl, String path) {

         try {

             Document doc = Jsoup.connect(htmlUrl).get();

             Element body = doc.body();

             Elements elements = body.select("img");

             String outputFilePath="E:/pythonTest/javaPython/imgs/";

             String src = "";

             HttpURLConnection conn = null;

             InputStream inStream = null;

             byte[] data = null;

             String filePath = null;

             FileOutputStream outStream = null;

             Long startTime=new Date().getTime();

             for (Element element : elements) {

                 src = element.attr("src");

                 System.out.println(path + src);

                 // new一个URL对象

                 if (!src.contains(".jpg")) {

                     continue;

                 }

                 URL url = new URL(path + src);

                 // 打开链接

                 conn = (HttpURLConnection) url.openConnection();

                 // 设置请求方式为"GET"

                 conn.setRequestMethod("GET");

                 // 超时响应时间为5秒

                 conn.setConnectTimeout(5 * 1000);

                 // 通过输入流获取图片数据

                 inStream = conn.getInputStream();

                 // 得到图片的二进制数据，以二进制封装得到数据，具有通用性

                 data = readInputStream(inStream);

                 // new一个文件对象用来保存图片，默认保存当前工程根目录

                 filePath = outputFilePath + System.currentTimeMillis() + ".jpg";

                 // 创建输出流

                 outStream = new FileOutputStream(new File(filePath));

                 // 写入数据

                 outStream.write(data);

                 // 关闭输出流

                 outStream.close();

             }

             System.out.println(elements.size());

             System.out.println("读写速度："+(new Date().getTime()-startTime)+"毫秒");

         } catch (IOException e) {

             e.printStackTrace();

         } catch (Exception e) {

             e.printStackTrace();

         }

     }

     public static byte[] readInputStream(InputStream inStream) throws Exception {

         ByteArrayOutputStream outStream = new ByteArrayOutputStream();

         // 创建一个Buffer字符串

         byte[] buffer = new byte[1024];

         // 每次读取的字符串长度，如果为-1，代表全部读取完毕

         int len = 0;

         // 使用一个输入流从buffer里把数据读取出来

         while ((len = inStream.read(buffer)) != -1) {

             // 用输出流往buffer里写入数据，中间参数代表从哪个位置开始读，len代表读取的长度

             outStream.write(buffer, 0, len);

         }

         // 关闭输入流

         inStream.close();

         // 把outStream里的数据写入内存

         return outStream.toByteArray();

     }

     public static void main(String[] args) {

         String url = "http://pic.netbian.com/4kkatongdongman/index_2.html";

         String path = "http://pic.netbian.com";

         saveImage(url, path);

     }

 }

Java爬虫的更多相关文章

webmagic的设计机制及原理-如何开发一个Java爬虫
之前就有网友在博客里留言,觉得webmagic的实现比较有意思,想要借此研究一下爬虫.最近终于集中精力,花了三天时间,终于写完了这篇文章.之前垂直爬虫写了一年多,webmagic框架写了一个多月,这方 ...
JAVA爬虫挖取CSDN博客文章
开门见山,看看这个教程的主要任务,就去csdn博客,挖取技术文章,我以<第一行代码–安卓>的作者为例,将他在csdn发表的额博客信息都挖取出来.因为郭神是我在大学期间比较崇拜的对象之一.他 ...
爬虫6：多页面增量Java爬虫-sina主页
之前写过很多单页面python爬虫,感觉python还是很好用的,这里用java总结一个多页面的爬虫,迭代爬取种子页面的所有链接的页面,全部保存在tmp路径下. 1 序言实现这个爬虫需要两个数据结构 ...
推荐几个优秀的java爬虫项目
java爬虫项目大型的: Nutch apache/nutch · GitHub 适合做搜索引擎,分布式爬虫是其中一个功能. Heritrix internetarchive/heritrix3 ...
Java爬虫搜索原理实现
permike 原文 Java爬虫搜索原理实现没事做,又研究了一下爬虫搜索,两三天时间总算是把原理闹的差不多了,基本实现了爬虫搜索的原理,本次实现还是俩程序,分别是按广度优先和深度优先完成的,广度优 ...
JAVA爬虫 WebCollector
JAVA爬虫 WebCollector 爬虫简介: WebCollector是一个无须配置.便于二次开发的JAVA爬虫框架(内核),它提供精简的的API,只需少量代码即可实现一个功能强大的爬虫. 爬虫 ...
爬虫入门手写一个Java爬虫
本文内容涞源于罗刚老师的书籍 << 自己动手写网络爬虫一书 >> ; 本文将介绍 1: 网络爬虫的是做什么的? 2: 手动写一个简单的网络爬虫; 1: 网络爬虫是做 ...
JAVA爬虫实践（实践三：爬虫框架webMagic和csdnBlog爬虫）
WebMagic WebMagic是一个简单灵活的Java爬虫框架.基于WebMagic,你可以快速开发出一个高效.易维护的爬虫. 采用HttpClient可以实现定向的爬虫,也可以自己编写算法逻辑来 ...
MinerUtil.java 爬虫工具类
MinerUtil.java 爬虫工具类 package com.iteye.injavawetrust.miner; import java.io.File; import java.io.File ...

随机推荐

Windows10 VS2015下分别编译libevent 32位和64位库
Libevnt 在Windows10 VS2015下分别编译32位和64位库直接上王道 libevent代码地址: https://github.com/libevent/libevent git ...
团队作业2--需求分析&原型设计
一.需求分析 1.用户采访 a.采访对象: 分别对本学院同学.其他专业同学.部分老师等总计15人进行了采访调研: b.采访截图: c.采访总结: (1).功能需求能够将所提供的四个数进 ...
蓝桥杯PREV-11：横向打印二叉树
嗯,没错我还报了蓝桥杯. 这是题目问题描述二叉树可以用于排序.其原理很简单:对于一个排序二叉树添加新节点时,先与根节点比较,若小则交给左子树继续处理,否则交给右子树. 当遇到空子树时,则把该节点放 ...
201521123085 《Java程序设计》第7周学习总结
1. 本周学习总结以你喜欢的方式(思维导图或其他)归纳总结集合相关内容. 参考资料: 2. 书面作业 1.ArrayList代码分析 1.1 解释ArrayList的contains源代码代码: ...
201521123100 《Java程序设计》第2周学习总结
一. 本章学习总结 1.本周学习了Java语言中各种数据类型以及运算符,其中大部分还是和c语言差不多,发现了各种语言的相通性 2.进一步学习了eclipse的功能和使用方法,学会了如何将其与码云连接更 ...
python之socket编程------粘包
一.粘包什么是粘包只有TCP只有粘包现象,UDP永远不会粘包所谓粘包问题主要还是因为接收方不知道之间的界限,不知道一次性提取多少字节的数据所造成的两种情况发生粘包: 1.发送端需要等缓冲区满才 ...
Spring02-AOP
1,动态代理,指的是通过一个代理对象创建需要的业务对象,然后在这个代理对象中统一进行各种操作. 步骤: 1)写一个类实现InvocationHandler接口: 2)创建要代理的对象 2,创建一个简单 ...
jmeter测试HTTP请求
HTTP超文本传输协议(HyperText Transfer Protocol)是互联网上应用最为广泛的一种网络协议.所有的WWW文件都必须遵守这个标准.(详情参考看一下百科) HTTP发送请求有GE ...
Eclipse dynamic web project 插件
下载了Eclipse Oxygen 发现没有Dynamic web Project 首先我们先了解下Dynamic Web Project If you want to create a c ...
String和StringBuffer分别作为参数传递注意项
public staticvoid main(){ String s1 = "abc"; StringBuffer sb = new StringBuffer(); sb.appe ...

Java爬虫

Java爬虫的更多相关文章

随机推荐

热门专题