tesseract-ocr 识别中文扫描图片

原文链接：http://www.cnblogs.com/alex-blog/articles/2714984.html

项目主页地址：http://code.google.com/p/tesseract-ocr/

相关资源下载地址：http://code.google.com/p/tesseract-ocr/downloads/list

需要下载的资源有：

1、tesseract-ocr-setup-3.01-1.exe

因我本地为windows系统，所以用这个

2、chi_sim.traineddata.gz

中文识别时需要的。

安装tesseract-ocr

自定义安装语言包

在Tesseract-OCR安装目录下找到 tessdata目录，其是用来存放语言包，可把 chi_sim.traineddata.gz 解压缩之后的chi_sim.traineddata文件复制到该目录下即可。

本文使用参考blog中的例子

如下：

package org.img;

import java.awt.image.BufferedImage;

import java.io.File;

import java.io.IOException;

import java.util.Iterator;

import java.util.Locale;

import javax.imageio.IIOImage;

import javax.imageio.ImageIO;

import javax.imageio.ImageReader;

import javax.imageio.ImageWriteParam;

import javax.imageio.ImageWriter;

import javax.imageio.metadata.IIOMetadata;

import javax.imageio.stream.ImageInputStream;

import javax.imageio.stream.ImageOutputStream;

import com.sun.media.imageio.plugins.tiff.TIFFImageWriteParam;

public class ImageIOHelper {

    /**

     * 图片文件转换为tif格式

     * @param imageFile 文件路径

     * @param imageFormat 文件扩展名

     * @return

     */

    public static File createImage(File imageFile, String imageFormat) {

        File tempFile = null;

        try {

            Iterator<ImageReader> readers = ImageIO.getImageReadersByFormatName(imageFormat);

            ImageReader reader = readers.next();

            ImageInputStream iis = ImageIO.createImageInputStream(imageFile);

            reader.setInput(iis);

            //Read the stream metadata

            IIOMetadata streamMetadata = reader.getStreamMetadata();

            //Set up the writeParam

            TIFFImageWriteParam tiffWriteParam = new TIFFImageWriteParam(Locale.CHINESE);

            tiffWriteParam.setCompressionMode(ImageWriteParam.MODE_DISABLED);

            //Get tif writer and set output to file

            Iterator<ImageWriter> writers = ImageIO.getImageWritersByFormatName("tiff");

            ImageWriter writer = writers.next();

            BufferedImage bi = reader.read(0);

            IIOImage image = new IIOImage(bi,null,reader.getImageMetadata(0));

            tempFile = tempImageFile(imageFile);

            ImageOutputStream ios = ImageIO.createImageOutputStream(tempFile);

            writer.setOutput(ios);

            writer.write(streamMetadata, image, tiffWriteParam);

            ios.close();

            writer.dispose();

            reader.dispose();

        } catch (IOException e) {

            e.printStackTrace();

        }

        return tempFile;

    }

    private static File tempImageFile(File imageFile) {

        String path = imageFile.getPath();

        StringBuffer strB = new StringBuffer(path);

        strB.insert(path.lastIndexOf('.'),0);

        return new File(strB.toString().replaceFirst("(?<=//.)(//w+)$", "tif"));

    }

}

package org.img;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.InputStreamReader;

import java.util.ArrayList;

import java.util.List;

import org.jdesktop.swingx.util.OS;

public class OCR {

    private final String LANG_OPTION = "-l";  //英文字母小写l，并非数字1

    private final String EOL = System.getProperty("line.separator");

    private String tessPath = "C://Program Files//Tesseract-OCR"; //

注意这个路径，为安装的tesseract-OCR的路径

    //private String tessPath = new File("tesseract").getAbsolutePath();

    public String recognizeText(File imageFile,String imageFormat)throws Exception{

        File tempImage = ImageIOHelper.createImage(imageFile,imageFormat);

        File outputFile = new File(imageFile.getParentFile(),"output");

        StringBuffer strB = new StringBuffer();

        List<String> cmd = new ArrayList<String>();

        if(OS.isWindowsXP()){

            cmd.add(tessPath+"//tesseract");

        }else if(OS.isLinux()){

            cmd.add("tesseract");

        }else{

            cmd.add(tessPath+"//tesseract");

        }

        cmd.add("");

        cmd.add(outputFile.getName());

        cmd.add(LANG_OPTION);

        cmd.add("chi_sim");

        //cmd.add("eng");

        ProcessBuilder pb = new ProcessBuilder();

        pb.directory(imageFile.getParentFile());

        cmd.set(1, tempImage.getName());

        pb.command(cmd);

        pb.redirectErrorStream(true);

        Process process = pb.start();

        //tesseract.exe 1.jpg 1 -l chi_sim

        int w = process.waitFor();

        //删除临时正在工作文件

        tempImage.delete();

        if(w==0){

            BufferedReader in = new BufferedReader(new InputStreamReader(new FileInputStream(outputFile.getAbsolutePath()+".txt"),"UTF-8"));

            String str;

            while((str = in.readLine())!=null){

                strB.append(str).append(EOL);

            }

            in.close();

        }else{

            String msg;

            switch(w){

                case 1:

                    msg = "Errors accessing files.There may be spaces in your image's filename.";

                    break;

                case 29:

                    msg = "Cannot recongnize the image or its selected region.";

                    break;

                case 31:

                    msg = "Unsupported image format.";

                    break;

                default:

                    msg = "Errors occurred.";

            }

            tempImage.delete();

            throw new RuntimeException(msg);

        }

        new File(outputFile.getAbsolutePath()+".txt").delete();

        return strB.toString();

    }

}

package org.img;

import java.io.File;

import java.io.IOException;

public class TestOCR {

    /**

     * @param args

     */

    public static void main(String[] args) {

        String path = "D:\\temp\\img\\untitled8.png";

        try {

            String valCode = new OCR().recognizeText(new File(path), "png");

            //6905_1294109277pAj9.jpg

            System.out.println(valCode);

        } catch (IOException e) {

            e.printStackTrace();

        } catch (Exception e) {

            e.printStackTrace();

        }

    }

}

对于报错，请检查tessPath 这个参数是否设置正确

本文参考以下两位的blog：

http://blog.csdn.net/foamflower/article/details/6110211

http://blog.csdn.net/zhoushuyan/article/details/5948289

tesseract-ocr 识别中文扫描图片的更多相关文章

tesseract-ocr识别中文扫描图片实例讲解
当我浏览http://code.google.com/p/tesseract-ocr并下载了几个文件下来之后顿时感到一头雾水,不知该如何下手.网上看到有人在linux操作系统下的实现, 如: 利用开源 ...
使用Tesseract OCR识别验证码
1.下载Tessrac OCR,默认安装 2.把验证码code.jpg图片放在D盘 3.打开cmd,进入D盘,输入:tesseract code.jpg result 4.进入D盘,生成了resul ...
身份证扫描识别/身份证OCR识别的正确姿势，你get到了吗？
自从国家规定电信实名制之后,实名制已经推广到各个领域:办理通信业务需要实名制.银行开户需要实名制.移动支付需要实名制,就连注册个自媒体账户都需要实名制. 而实名制的背后,就是身份证信息的采集和录入验证 ...
Python 进行 OCR识别 -- pytesseract库
pip install pytesseract 报错:tesseract is not installed or it's not in your path 下载安装 Tesseract-OCR ht ...
tesseract-ocr识别英文和中文图片文字以及扫描图片实例讲解
本文来源:http://blog.csdn.net/wanghui2008123/article/details/37694307 本文参考http://blog.sina.com.cn/s/blog ...
开源图片文字识别引擎——Tesseract OCR
Tessseract为一款开源.免费的OCR引擎,能够支持中文十分难得.虽然其识别效果不是很理想,但是对于要求不高的中小型项目来说,已经足够用了. 文字识别可应用于许多领域,如阅读.翻译.文献资料的检 ...
深入学习OpenCV文档扫描及OCR识别（文档扫描，图像矫正，透视变换，OCR识别）
如果需要处理的原图及代码,请移步小编的GitHub地址传送门:请点击我如果点击有误:https://github.com/LeBron-Jian/ComputerVisionPractice 下面 ...
【图片识别】java 图片文字识别 ocr （转）
http://www.cnblogs.com/inkflower/p/6642264.html 最近在开发的时候需要识别图片中的一些文字,网上找了相关资料之后,发现google有一个离线的工具,以下为 ...
图片文字OCR识别-tesseract-ocr
帮助文件:https://github.com/tesseract-ocr/tesseract/blob/master/doc/tesseract.1.asc 下载地址:https://github. ...

随机推荐

机器学习（三）--- scala学习笔记
Scala是一门多范式的编程语言,一种类似Java的编程语言,设计初衷是实现可伸缩的语言.并集成面向对象编程和函数式编程的各种特性. Spark是UC Berkeley AMP lab所开源的类Had ...
Logview_pro破解版
logViewer Pro 是一款log文件查看器,它可以在短短数秒内打开上G的LOG文件,支持高亮某行文字(例如警告,错误),支持Unicode名字,支持查看的编码:ANSI, OEM, Unico ...
Log4net_配置
Log4net 有三个主要组件:loggers,appenders 和 layouts.这三个组件一起工作使得开发者能够根据信息类型和等级(Level)记录信息,以及在运行时控制信息的格式化和信息的写 ...
Nginx code 常用状态码学习小结
最近了解下Nginx的Code状态码,在此简单总结下.一个http请求处理流程: 一个普通的http请求处理流程,如上图所示:A -> client端发起请求给nginxB -> ngin ...
Visual studio2015 编译时提示“GenerateResource”任务意外失败。
今天弄了一个winfrom程序,狗血,一直报错,在另一台电脑上就不报错. 错误如下图其实这样也能运行,但就是代码改之后,没有办法调试.搜了很久,发现了一种解决办法,完美解决. 最终成功了.
C_数据结构_递归自己调用自己
# include <stdio.h> void f(int n) { ) printf("哈哈\n"); else f(n-i); } int main(void) ...
'config.h' file not found 解决过程
最近将ReactNative业务集成进现有APP项目中,出现了几个具有代表性的问题,下面记录一下问题1. [!] CocoaPods could not find compatible versio ...
@Scheduled 定时
此文章记录在spring boot项目中的使用 1,在项目的启动类中加注解@EnableScheduling,表示此项目可以进行定时 @SpringBootApplication @EnableSch ...
Beta版本发布报告
项目名称学霸系统写手机客户端项目版本 Beta版本负责人北京航空航天大学计算机学院 hots团队联系方式 http://www.cnblogs.com/hotsbuaa/ 要求发布日期 20 ...
VIM编辑器常用命令（转）
转自:https://www.cnblogs.com/Nice-Boy/p/6124177.html

tesseract-ocr 识别中文扫描图片

tesseract-ocr 识别中文扫描图片的更多相关文章

随机推荐

热门专题