java 获取pdf内容

1. 说明

将pdf中的文字读取处理还有一些限制：1. 文档的安全属性不能过于严格 2. 不能存在图片。

2. 直接贴相关的源码

有两种读取方式，maven对应的pom文件

<dependencies>

  	<dependency>

	    <groupId>org.apache.pdfbox</groupId>

	    <artifactId>pdfbox</artifactId>

	    <version>1.8.8</version>

	</dependency>

	<dependency>

	    <groupId>com.itextpdf</groupId>

	    <artifactId>itextpdf</artifactId>

	    <version>5.0.6</version>

	</dependency>

  </dependencies>

2.1 pdfbox

/**

 * PdfboxUtil.java

 */

package com.hsm.pdfTest;

import java.io.BufferedWriter;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileWriter;

import java.io.InputStream;

import org.apache.pdfbox.pdfparser.PDFParser;

import org.apache.pdfbox.pdmodel.PDDocument;

import org.apache.pdfbox.util.PDFTextStripper;

/**

 * @author hsm

 */

public class PdfboxUtil {

	private static String PDFPATH = "D:/Maven权威指南中文版.pdf";

	private static String FILEPATH = "D:/Maven权威指南中文版.doc";

	public static void main(String[] args) throws Exception {

		String content=getPdfContent(PDFPATH);

		toFile(content,FILEPATH);

	}

	/**

	 * 获取pdf的内容<br/>

	 * @param pdfPath

	 * @return

	 * @throws Exception

	 */

	private static String getPdfContent(String pdfPath) throws Exception {

	    boolean sort = false;// 是否排序

	    int startPage = 1;// 开始提取页数

	    int endPage = Integer.MAX_VALUE;   // 结束提取页数

	    String content = null;//暂时存放pdf内容

	    InputStream input = null;

	    File pdfFile = new File(pdfPath);

	    PDDocument document = null;

	    try {

	    	input = new FileInputStream(pdfFile);

	    	// 加载 pdf 文档

	    	PDFParser parser = new PDFParser(input);

	    	parser.parse();

	    	document = parser.getPDDocument();

	    	// 获取内容信息

	    	PDFTextStripper pts = new PDFTextStripper();

	    	pts.setSortByPosition(sort);

	    	endPage = document.getNumberOfPages();

	    	System.out.println("Total Page: " + endPage);

	    	pts.setStartPage(startPage);

	    	pts.setEndPage(endPage);

	    	try {

	    		content = pts.getText(document);

	    	}catch(Exception e) {

	    		throw e;

	    	}

	    	System.out.println("Get PDF Content ...");

      }catch(Exception e){

         throw e;

      } finally {

         if (null != input)

            input.close();

         if (null != document)

            document.close();

      }

      return content;

	}

	private static void toFile(String content,String filePath) {

		 try {

	         File f = new File(filePath);

	         if (!f.exists()) {

	            f.createNewFile();

	         }

	         System.out.println("Write PDF Content to txt file ...");

	         BufferedWriter output = new BufferedWriter(new FileWriter(f));

	         output.write(content);

	         output.close();

	      } catch (Exception e) {

	         e.printStackTrace();

	      }

	}

}

2.2 itext

package com.hsm.pdfTest;

import java.io.FileOutputStream;

import java.io.IOException;

import java.io.PrintWriter;

import com.itextpdf.text.pdf.PdfReader;

import com.itextpdf.text.pdf.parser.PdfReaderContentParser;

import com.itextpdf.text.pdf.parser.PdfTextExtractor;

import com.itextpdf.text.pdf.parser.SimpleTextExtractionStrategy;

import com.itextpdf.text.pdf.parser.TextExtractionStrategy;

/**

 * @author hsm

 */

public class ItextpdfUtil {

	private static String PDFPATH = "D:/Maven权威指南中文版.pdf";

	private static String FILEPATH = "D:/Maven权威指南中文版.doc";

	public static void main(String[] args)  {

		String content=getPdfContent(PDFPATH);

		System.out.println(content);

		toFile(PDFPATH,FILEPATH);

	}

	/**

	 * 获取pdf的内容

	 * @param pdfPath

	 * @return

	 */

	private static String getPdfContent(String pdfPath) {

		PdfReader reader = null;

	    StringBuffer buff = new StringBuffer();

	    try {

			reader = new PdfReader(pdfPath);

			PdfReaderContentParser parser = new PdfReaderContentParser(reader);

			int num = reader.getNumberOfPages();// 获得页数

			TextExtractionStrategy strategy;

			for (int i = 1; i <= num; i++) {

			   strategy = parser.processContent(i,

			          new SimpleTextExtractionStrategy());

			   buff.append(strategy.getResultantText());

			}

	     } catch (IOException e) {

	        e.printStackTrace();

	     }

	   return buff.toString();

	}

	/**

	 * 将对应的pdf文件读到指定的文件中

	 * @param pdfPath

	 * @param filePath

	 */

	private static void toFile(String pdfPath, String filePath) {

		PrintWriter writer = null;

		PdfReader reader = null;

		try {

			writer = new PrintWriter(new FileOutputStream(filePath));

			reader = new PdfReader(pdfPath);

			int num = reader.getNumberOfPages();// 获得页数

			System.out.println("Total Page: " + num);

			StringBuffer content = new StringBuffer(""); // 存放读取出的文档内容

			for (int i = 1; i <= num; i++) {

				// 读取第i页的文档内容

				content.append(PdfTextExtractor.getTextFromPage(reader, i));

			}

			writer.write(content.toString());// 写入文件内容

			writer.flush();

			writer.close();

		} catch (IOException e) {

			e.printStackTrace();

		}

	}

}

java 获取pdf内容的更多相关文章

Java从URL获取PDF内容
Java直接URL获取PDF内容题外话网上很多Java通过pdf转 HTML,转文本的,可是通过URL直接获取PDF内容,缺没有,浪费时间,本人最近工作中刚好用到,花了时间整理下,分享出来,防止浪 ...
Java 获取PDF数字签名证书信息
PDF文档中可添加数字签名,在添加签名前,需要准备可信任签名证书.对文档中已有的签名,可验证书签是否有效.也可通过一定方法来获取数字签名或者签名证书信息.下面以Java代码示例展示如何读取签名的证书信 ...
java根据URL获取HTML内容
之前我写脚本,是想获取HTML内容的. 但是呢...一方面编码困扰着我,于是我写了这个: java根据URL获取网页编码然后呢,每个网站是不是GZIP还得判断,贼麻烦... 但是没办法啊,麻烦也得写 ...
Java：获取文件内容
文章来源:https://www.cnblogs.com/hello-tl/p/9139353.html import java.io.*; public class FileBasicOperati ...
关于java 获取 html select标签下拉框 option 文本内容隐藏域
在HTML中从多选下拉框中提取已选中选项的文本内容到后台,被这个问题难倒了. demo.jsp文件 <select id="selecttype" name"typ ...
java通过URL获取文本内容
原文地址https://www.cnblogs.com/myadmin/p/7634262.html public static String readFileByUrl(String urlStr) ...
通过http路径获取文本内容（Java）
public static String readFileByUrl(String urlStr) { String res = null; try { URL url = new URL(urlSt ...
【apache tika】apache tika获取文件内容(与FileUtils的对比)
Tika支持多种功能: 文档类型检测内容提取元数据提取语言检测重要特点: 统一解析器接口:Tika封装在一个单一的解析器接口的第三方解析器库.由于这个特征,用户逸出从选择合适的解析器库的负担, ...
Java三方---->pdf框架之IText的使用
在企业的信息系统中,报表处理一直占比较重要的作用t.通过在服务器端使用Jsp或JavaBean生成PDF报表,客户端采用超链接显示或下载得到生成的报表,这样就很好的解决了B/S系统的报表处理问题.今天 ...

随机推荐

Nginx访问日志和错误日志的拆分（Logstash）
>> from zhuhaiqing.info input { file { type =>> "nginx-access" path =>> ...
OpenGL/GLSL数据传递小记(3.x)(转)
OpenGL/GLSL规范在不断演进着,我们渐渐走进可编程管道的时代的同时,崭新的功能接口也让我们有点缭乱的感觉.本文再次从OpenGL和GLSL之间数据的传递这一点,记录和介绍基于OpenGL3.x ...
springboot 中使用AOP
网上关于AOP的例子好多,各种名词解释也一大堆,反正名词各种晦涩,自己写个最最最简单的例子入门mark一下,以后再深入学习. maven依赖 <dependency> <groupI ...
刨根问底 HTTP 和 WebSocket 协议（下）
上篇介绍了HTTP1.1协议的基本内容,这篇文章将继续分析WebSocket协议,然后对这两个进行简单的比较. WebSocket WebSocket协议还很年轻,RFC文档相比HTTP的发布时间也很 ...
yum 无法安装mysql
昨晚帮盆友搭建服务器时,一直出现yum mysql 无法安装.报错信息如下: Transaction Check Error: file /etc/my.cnf from install of my ...
android requestLayout()重新请求布局
在应用中有时会遇到,例如你listView 的设置的高度为warp_content 自适应,listView下方有个TextView但如果你删了一个listView的item 我们希望下面的TextV ...
SVN分支与主干
我的理解:在svn版本库中创建两个目录,一个主干如truck,一个分支目录如branch(注:分支可以创建多个),分别在客户端中检出代码,在分支中进行bug的修复以及新模块的开发,开发完后再merge ...
jquery 通过属性选择器获取input不为disabled的对象
$("input[id^='input_001']:not(:disabled)").each(function(){ console.log(this); });
HYSBZ - 1799 self 同类分布
self 同类分布 HYSBZ - 1799 给出a,b,求出[a,b]中各位数字之和能整除原数的数的个数.Sample Input 10 19 Sample Output 3 Hint [约束条件] ...
【BZOJ2790】[Poi2012]Distance 筛素数+调和级数
[BZOJ2790][Poi2012]Distance Description 对于两个正整数a.b,这样定义函数d(a,b):每次操作可以选择一个质数p,将a变成a*p或a/p, 如果选择变成a/p ...

java 获取pdf内容

1. 说明

2. 直接贴相关的源码

2.1 pdfbox

2.2 itext

java 获取pdf内容的更多相关文章

随机推荐

热门专题