利用pdfbox和poi抽取pdf、doc以及docx格式的内容

使用pdfbox1.5.0抽取pdf格式文档内容，使用poi3.7抽取doc及docx文档内容：

 /**

  * Created by yan.shi on 2017/9/25.

  */

 import org.apache.pdfbox.pdfparser.PDFParser;

 import org.apache.pdfbox.pdmodel.PDDocument;

 import org.apache.pdfbox.util.PDFTextStripper;

 import org.apache.poi.POIXMLDocument;

 import org.apache.poi.POIXMLTextExtractor;

 import org.apache.poi.hwpf.extractor.WordExtractor;

 import org.apache.poi.openxml4j.exceptions.OpenXML4JException;

 import org.apache.poi.openxml4j.opc.OPCPackage;

 import org.apache.poi.xwpf.extractor.XWPFWordExtractor;

 import org.apache.xmlbeans.XmlException;

 import java.io.File;

 import java.io.FileInputStream;

 import java.io.IOException;

 /**

  * 这里使用pdfbox解析pdf类型文档

  * 使用poi解析doc与docx类型文档

  */

 public class ExtractText {

     public static void main(String[] args) {

         ExtractText text=new ExtractText();

         String filePath="文件";

         String content=text.getText(filePath);

         if(null!=content)

             System.out.println("content: "+content);

     }

     public ExtractText(){

     }

     public ExtractText(String filePath){

     }

     /**

      * 根据不同的文档类型读取，这里只使用pdf、doc、docs类型

      * @param filePath

      * @return

      */

     public String getText(String filePath){

         File file = new File(filePath);

         String fileName=file.getName();

         String postfix=fileName.substring(fileName.lastIndexOf(".")+1);

         String content=null;

         if(postfix.equalsIgnoreCase("pdf")){

             content=getPDFText(file);

         }else if(postfix.equalsIgnoreCase("doc")){

             content=getDocText(file);

         }else if(postfix.equalsIgnoreCase("docx")){

             content=getDocxText(filePath);

         }else {

             System.out.println("输入的文件格式不支持！");

             return null;

         }

         if(null!=content && !"".equals(content))

             return content;

         else

             return null;

     }

     /**

      * 利用pdfbox解析pdf内容

      * @param file

      * @return

      */

     private String getPDFText(File file){

         FileInputStream fileinput=null;

         String text=null;

         try {

             fileinput=new FileInputStream(file);

             PDFParser parser=new PDFParser(fileinput);//pdf解析器

             parser.parse();//解析

             PDDocument pdfdocument=parser.getPDDocument();//pdf文档

             PDFTextStripper stripper=new PDFTextStripper();//文本剥离

             //List allPages=pdfdocument.getDocumentCatalog().getAllPages();

             text=stripper.getText(pdfdocument);//从pdf文档剥离文本

         } catch (IOException e) {

             e.printStackTrace();

         }finally {

             if(fileinput!=null){

                 try {

                     fileinput.close();

                 } catch (IOException e) {

                     e.printStackTrace();

                 }

             }

         }

         return text;

     }

     /**

      * 读取doc文档类型

      * @param file

      * @return

      */

     private String getDocText(File file){

         FileInputStream fileinput=null;

         String text=null;

         try {

             fileinput=new FileInputStream(file);

             WordExtractor we=new WordExtractor(fileinput);

             //text=we.getText();

             String s[]=we.getParagraphText();

             for(String str:s){

                 str=str.trim();

                 if(str.equals("") || str==null)

                     continue;

                 //System.out.println(str);

             }

         } catch (IOException e) {

             e.printStackTrace();

         }finally {

             if(fileinput!=null){

                 try {

                     fileinput.close();

                 } catch (IOException e) {

                     e.printStackTrace();

                 }

             }

         }

         return text;

     }

     /**

      * 读取docx文档类型

      * @param file

      * @return

      */

     private String getDocxText(String file){

         String text=null;

         try {

             OPCPackage opcPackage=POIXMLDocument.openPackage(file);

             POIXMLTextExtractor extractor=new XWPFWordExtractor(opcPackage);

             text=extractor.getText();

            //InputStream is=new FileInputStream(file);

             //XWPFWordExtractor doc=new XWPFWordExtractor(OPCPackage.open(is));

             //List<XWPFParagraph> paras=doc.get

             //System.out.println(text);

         } catch (IOException e) {

             e.printStackTrace();

         } catch (XmlException e) {

             e.printStackTrace();

         } catch (OpenXML4JException e) {

             e.printStackTrace();

         }

         return text;

     }

 }

利用pdfbox和poi抽取pdf、doc以及docx格式的内容的更多相关文章

基于java 合并.doc和docx格式的Word文件
注:摘录自 https://www.cnblogs.com/shenzhouyh/articles/7243805.html 之前用过jacob 合并.doc,但是是有jacob有弊端: 服务器必须是 ...
完美解决doc、docx格式word转换为Html
http://blog.csdn.net/renzhehongyi/article/details/48767597
word文档转pdf，支持.doc和.docx，另附抽取pdf指定页数的方法
公司有个需求,需要将word转成pdf并且抽取首页用以展示,word文档有需要兼容.doc和.docx两种文档格式.其中.docx通过poi直接就可以将word转成pdf,.doc则无法这样实现,上网 ...
利用POI抽取word中的图片并保存在文件中
利用POI抽取word中的图片并保存在文件中 poi.apache.org/hwpf/quick-guide.html 1.抽取word doc中的图片 package parse; import j ...
使用Lucene对doc、docx、pdf、txt文档进行全文检索功能的实现
转载请注明出处:http://blog.csdn.net/dongdong9223/article/details/76273859 本文出自[我是干勾鱼的博客] 这里讲一下使用Lucene对doc. ...
[ASP.NET]利用itextsharp将GridView汇出PDF档
原文 [ASP.NET]利用itextsharp将GridView汇出PDF档最近在讨论区看到有人说itextsharp可以把网页变成PDF 小弟就去抓一下itextsharp来玩玩,先教大家最实用 ...
c#抽取pdf文档标题（2）
public class IETitle { public static List<WordInfo> WordsInfo = new List<WordInfo>(); pr ...
文件在线预览doc，docx转换pdf（一）
文件在线预览doc,docx转换pdf(一) 1. 前言文档转换是一个是一块硬骨头,但是也是必不可少的,我们正好做的知识库产品中,也面临着同样的问题,文档转换,精准的全文搜索,知识的转换率,是知识库 ...
使用POI转换word doc文件
目录 1 转换为Html文件 2 转换为Xml文件 3 转换为Text文件在POI中还存在有针对于word doc文件进行格式转换的功能.我们可以将word的内容 ...

随机推荐

ES6简单初识
ES常用命令介绍函数的Rest参数和扩展 Promise使用 Module.exports和ES6 import/export的使用 promise使用 promise 为了解决callback嵌套 ...
hdfs基本文件操作
编程实现下列要求: 1.创建一个自己姓名首字母的文件夹 2.在文件夹下创建一个hdfstext1.txt文件,项文件内输入“班级学号姓名HDFS课堂测试”的文字内容: 3.在文件夹下在创建一个好的fs ...
jupyter 配置远程登陆
官方地址: https://jupyter-notebook.readthedocs.io/en/latest/public_server.html#notebook-server-security ...
SQL数据库字段数据类型详细说明
这里先总结数据类型.MySQL中的数据类型大的方面来分,可以分为:日期和时间.数值,以及字符串.下面就分开来进行总结. 日期和时间数据类型 MySQL数据类型含义 date 3字节,日期,格式:20 ...
[转载]MySQL之char、varchar和text的设计
[转载]MySQL之char.varchar和text的设计来源:https://www.cnblogs.com/billyxp/p/3548540.html 首先我们先普及一下常识: 1.char ...
04 Python网络爬虫 <<爬取get/post请求的页面数据>>之requests模块
一. urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib ...
js之运算符其它运算符（三元运算符,逗号运算符,void运算符,typeof,delete运算符）
Javascript支持很多其它的运算符,具体如下: 一.条件运算符(?:) 条件运算符是Javascript中唯一的三个操作数的三元运算符,有时会直接称做是“三元运算符”. 基本格式:conditi ...
LRU算法介绍和在JAVA的实现及源码分析
一.写随笔的原因:最近准备去朋友公司面试,他说让我看一下LRU算法,就此整理一下,方便以后的复习. 二.具体的内容: 1.简介: LRU是Least Recently Used的缩写,即最近最少使用. ...
Delphi MainMenu组件
deep_learning_Function_tensorflow_transpose()
tf.transpose()的用法一.tensorflow官方文档内容 transpose( a, perm=None, name='transpose' ) Defined ...

利用pdfbox和poi抽取pdf、doc以及docx格式的内容

利用pdfbox和poi抽取pdf、doc以及docx格式的内容的更多相关文章

随机推荐

热门专题