转载请注明来源：http://blog.csdn.net/loongshawn/article/details/51542309

相关文章：

1、介绍

Apache PDFbox是一个开源的、基于Java的、支持PDF文档生成的工具库，它可以用于创建新的PDF文档，修改现有的PDF文档，还可以从PDF文档中提取所需的内容。Apache PDFBox还包含了数个命令行工具。
Apache PDFbox于2016年4月26日发布了最新的2.0.1版。

备注：本文代码均是基于2.0及以上版本编写。

官网地址：https://pdfbox.apache.org/index.html

PDFBox 2.0.1 API在线文档：https://pdfbox.apache.org/docs/2.0.1/javadocs/

2、特征

Apache PDFBox主要有以下特征：
PDF读取、创建、打印、转换、验证、合并分割等特征。

3、开发实战

3.1、场景说明

1、读取PDF文本内容，样例中为读取体检报告文本内容。
2、提取PDF文档中的图片。这里仅仅实现将PDF中的图片另存为一个单独的PDF，至于需要直接输出图片文件（暂时没有实现），大家可以参考我的代码加以拓展，主要就是处理PDImageXObject对象。

3.2、所需jar包

pdfbox-2.0.1.jar下载地址

fontbox-2.0.1.jar下载地址

将上述两jar包添加到工程库中，如下：

3.3、文本内容提取

3.3.1、文本内容提取

创建PdfReader类，编写下述功能函数。

package com.loongshaw;

import java.io.File;

import java.io.FileInputStream;

import java.io.InputStream;

import org.apache.pdfbox.io.RandomAccessBuffer;

import org.apache.pdfbox.pdfparser.PDFParser;

import org.apache.pdfbox.pdmodel.PDDocument;

import org.apache.pdfbox.text.PDFTextStripper;

public class PdfReader {

    public static void main(String[] args){

        File pdfFile = new File("/Users/dddd/Downloads/0571888890423433356rrrr_182-93201510313223336-2.pdf");

        PDDocument document = null;

        try

        {

            // 方式一：

            /**

            InputStream input = null;

            input = new FileInputStream( pdfFile );

            //加载 pdf 文档

            PDFParser parser = new PDFParser(new RandomAccessBuffer(input));

            parser.parse();

            document = parser.getPDDocument();

            **/

            // 方式二：

            document=PDDocument.load(pdfFile);

            // 获取页码

            int pages = document.getNumberOfPages();

            // 读文本内容

            PDFTextStripper stripper=new PDFTextStripper();

            // 设置按顺序输出

            stripper.setSortByPosition(true);

            stripper.setStartPage(1);

            stripper.setEndPage(pages);

            String content = stripper.getText(document);

            System.out.println(content);

        }

        catch(Exception e)

        {

            System.out.println(e);

        }

    }

}

3.3.2、过程说明

PDF文件加载有两种方式，无明显差异，方式二代码较简洁：

// 方式一：

        InputStream input = null;

        input = new FileInputStream( pdfFile );

        //加载 pdf 文档

        PDFParser parser = new PDFParser(new RandomAccessBuffer(input));

        parser.parse();

        document = parser.getPDDocument();

 // 方式二：

        document=PDDocument.load(pdfFile);

3.3.3、执行结果

3.4、图片提取（2016-12-02添加）

3.3.1、图片提取

public static void readImage(){

        // 待解析PDF

        File pdfFile = new File("/Users/xiaolong/Downloads/test.pdf");

        // 空白PDF

        File pdfFile_out = new File("/Users/xiaolong/Downloads/testout.pdf");

        PDDocument document = null;

        PDDocument document_out = null;

        try {

            document = PDDocument.load(pdfFile);

            document_out = PDDocument.load(pdfFile_out);

        } catch (IOException e) {

            e.printStackTrace();

        }  

        int pages_size = document.getNumberOfPages();

        System.out.println("getAllPages==============="+pages_size);

        int j=0;

        for(int i=0;i<pages_size;i++) {

            PDPage page = document.getPage(i);

            PDPage page1 = document_out.getPage(0);

            PDResources resources = page.getResources();

            Iterable xobjects = resources.getXObjectNames();

            if (xobjects != null) {

                Iterator imageIter = xobjects.iterator();

                while (imageIter.hasNext()) {

                    COSName key = (COSName) imageIter.next();

                    if(resources.isImageXObject(key)){

                        try {

                            PDImageXObject image = (PDImageXObject) resources.getXObject(key);

                            // 方式一：将PDF文档中的图片 分别存到一个空白PDF中。

                            PDPageContentStream contentStream = new PDPageContentStream(document_out,page1,AppendMode.APPEND,true);

                            float scale = 1f;

                            contentStream.drawImage(image, 20,20,image.getWidth()*scale,image.getHeight()*scale);

                            contentStream.close();

                            document_out.save("/Users/xiaolong/Downloads/123"+j+".pdf");

                            System.out.println(image.getSuffix() + ","+image.getHeight() +"," + image.getWidth());

                            /**

                            // 方式二：将PDF文档中的图片 分别另存为图片。

                            File file = new File("/Users/xiaolong/Downloads/123"+j+".png");

                            FileOutputStream out = new FileOutputStream(file);

                            InputStream input = image.createInputStream();                   

                            int byteCount = 0;

                            byte[] bytes = new byte[1024];

                            while ((byteCount = input.read(bytes)) > 0)

                            {

                                out.write(bytes,0,byteCount);

                            }

                            out.close();

                            input.close();

                            **/

                        } catch (IOException e) {

                            // TODO Auto-generated catch block

                            e.printStackTrace();

                        }

                        //image count

                        j++;

                    }

                }

            }

        } 

        System.out.println(j);

    }

3.4.2、过程说明

此方法可以取出源PDF中图片对象PDImageXObject，然后可以对该对象进行相关处理，本代码实现了将提取出来的每一个图片对象，插入到一个空白的PDF文档中。

有一点需要说明，以上代码注释部分本意是想直接生成图片文件，但尝试后发现文件异常。因此大家在这个代码基础上有新的想法可以继续尝试。

3.4.3、执行结果

源PDF文件中包含19张图片

分别生成19个仅包含单独图片的PDF

4、小结

本文仅介绍了利用Apache PDFbox相关开发包读取PDF文本，其他复杂功能暂未涉及，需要大家自己线下探索、尝试。

Apache PDFbox开发指南之PDF文档读取的更多相关文章

Quartz 2D编程指南－ PDF文档的创建、显示及转换
PDF文档存储依赖于分辨率的向量图形.文本和位图,并用于程序的一系列指令中.一个PDF文档可以包含多页的图形和文本.PDF可用于创建跨平台.只读的文档,也可用于绘制依赖于分辨率的图形. ...
pdf.js实现在HTML下直接浏览pdf文档，无需插件即可实现
近期,有一个朋友做B端,服务器存了大量的金融类数据,很多都是pdf文档,他现在的做法是,先将pdf文档转换成flash,再放到浏览器上给用户浏览,但是他告诉我,这种体验太差了,而且很好资源,空间已经快 ...
常用PDF文档开发库
C++库: 1,PDF类库 PoDoFo http://podofo.sourceforge.net/ PoDoFo 是一个用来操作 PDF 文件格式的 C++ 类库.它还包含一些小工具用来解析 ...
【Win10 开发】读取PDF文档
关于用来读取PDF文档的内容的API,其实在Win8.1的时候就有,不过没关系,既咱们讨论的是10的UAP,连同8.1的内容也包括进去,所以老周无数次强调:把以前的内容学好了,就可以在不学习任何新知识 ...
一起学微软Power BI系列-官方文档-入门指南(7)发布与共享-终结篇+完整PDF文档
接触Power BI的时间也只有几个月,虽然花的时间不多,但通过各种渠道了解收集,谈不上精通,但对一些重要概念和细节还是有所了解.在整理官方文档的过程中,也熟悉和了解了很多概念.所以从前到后把微软官方 ...
操作PDF文档功能的相关开源项目探索——iTextSharp 和PDFBox
原文操作PDF文档功能的相关开源项目探索——iTextSharp 和PDFBox 很久没自己写写心得日志与大家分享了,一方面是自己有点忙,一方面是自己有点懒,没有及时总结.因为实践是经验的来源,总结 ...
icepdf和pdfbox转pdf文档为图片
icepdf转pdf文档为图片首先导入icepdf jar包或maven pdfPath为pdf文件路径.pdfimgpsth为图片保存的路径 public static void icePdfIm ...
[开发笔记]-C#获取pdf文档的页数
[操作pdf文档]之C#判断pdf文档的页数: /// <summary> /// 获取pdf文档的页数 /// </summary> /// <param name=& ...
[.NET开发] C# 如何在PDF文档中创建表格
表格能够直观的传达数据信息,使信息显得条理化,便于阅读同时也利于管理.那在PDF类型的文档中如何来添加表格并且对表格进行格式化操作呢?使用常规方法直接在PDF中添加表格行不通,那我们可以在借助第三方组 ...

随机推荐

十五、读写锁ReentrantReadWriteLock
一.简介有时候我们对资源的修改操作非常地少,但是读取的频率却很高.如果采用一般的互斥锁,那么大量的读取操作也需要做等待.基于读写分离的思想,我们可以使用JDK的读写锁来处理这种情况. 1)读读不互斥 ...
MongoTemplate基本操作
本文基于spring boot项目,快速构建项目请参考:https://www.cnblogs.com/lay2017/p/8836273.html 添加mongo依赖 <dependency& ...
CentOS添加SSH登录提示
前言使用阿里云服务器的应该都注意到每次ssh登录后都能看见类似下面这样的欢迎语: Last login:xxxxxxxxxxxxx Welcome to Alibaba Cloud Elastic ...
html全局属性(收藏)
HTML 属性赋予元素意义和语境. 下面的全局属性可用于任何 HTML 元素. 参考链接:http://www.w3school.com.cn/tags/html_ref_standardattrib ...
基于 java 【Web安全】文件上传漏洞及目录遍历攻击
前言:web安全之文件上传漏洞,顺带讲一下目录遍历攻击.本文基于 java 写了一个示例. 原理在上网的过程中,我们经常会将一些如图片.压缩包之类的文件上传到远端服务器进行保存.文件上传攻击指的是恶 ...
eclipse中实现文本换行
Eclipse 使用系统内置的“ Text Editor ”做为文本编辑器,这个文本编辑器有一个问题,就是文本无法换行. 扩展插件 WordWrap 可以实现文本换行安装方法: ...
python中字典，没键加键，有键操作其键对应的值，的思想
cars = ['鲁A32444', '鲁B12333', '京B8989M', '黑C49678', '黑C46555', '沪B25041', '黑C34567'] locations = {'沪 ...
【vue】混合模式
因为工作的分配,写财务的对账部分,因为3个页面的设计和功能基本相同,都是查询筛选表格,所以用混合模式优化了部分代码.用混合把一些共用的东西抽离了出来. 具体使用方法参照文档. https://cn.v ...
给大家分享下坐标转换的代码的JS和Python两个版本的源码【转】
/** * Created by Wandergis on 2015/7/8. * 提供了百度坐标(BD09).国测局坐标(火星坐标,GCJ02).和WGS84坐标系之间的转换 */ /** * 百度 ...
android studio 3.0 以上查看sharedpreference
android studio 3.0 以上查看sharedpreference 点击android studio 右侧的device file explore,找到data / data 目录: 找 ...

Apache PDFbox开发指南之PDF文档读取