记 iTextSharp 提取中文的问题

Shayne Chow 2024-10-20 00:43:56 原文

问题

下面的代码中 currentText 能提取到大部分汉字

但是字体为 Non-Embedded Font: AdobeSongStd-Light(Horizontal) 的汉字提取不到

PdfReader pdfReader = new PdfReader(@"E:\Desktop\file.pdf");

var currentText = string.Empty;

for (int i = 0; i < pdfReader.NumberOfPages; i++)

{

    currentText += PdfTextExtractor.GetTextFromPage(pdfReader, i + 1, new LocationTextExtractionStrategy());

}

解决办法

增加 iTextSharp 的中文，韩文，日文字体包

//1. 我使用的iTextSharp 5.5.13.2

//2. 引用 iTextAsian.dll 2.1 版本和iTextAsianCmaps.dll 1.0 版本

//3. 读取pdf前加载字体包

StreamUtil.AddToResourceSearch(System.Reflection.Assembly.Load("iTextAsian"));

StreamUtil.AddToResourceSearch(System.Reflection.Assembly.Load("iTextAsianCmaps"));

读取某个文本域的值

RenderFilter[] filter = { new RegionTextRenderFilter(new System.util.RectangleJ(393, 676,1, 1)) };//即使选取了一个很小的1*1区域，只要这个区域在这个文本域内，也能读取到整个文本内容

ITextExtractionStrategy strategy =

    new FilteredTextRenderListener(

        new LocationTextExtractionStrategy(), filter);

currentText += PdfTextExtractor.GetTextFromPage(pdfReader, pageNum, strategy);

附件

iTextAsianCmaps.dll

Tags

iTextSharp pdf

iTextAsian.dll 2.1

iTextAsian-all-2.1.zip

Chinese 汉字中文日文韩文

记 iTextSharp 提取中文的问题的更多相关文章

使用Python提取中文字符
#功能:国际化测试,用于提取应用设计包中的中文字符,并输出report#解压---筛选---整理路径---提取中文---输出报告 ################################### ...
js正则提取数字小数,提取中文,提取英文
var value="污染物:PM2.5"; //提取中文 console.log(value.replace(/[^\u4E00-\u9FA5]/g,'')); //提取英文 c ...
SQL Server 从字符串中提取中文、英文、数字
--[提取中文] IF OBJECT_ID('dbo.fun_getCN') IS NOT NULL DROP FUNCTION dbo.fun_getCN GO create function db ...
iTextSharp 提取签名图像
原文本文使用 iTextSharp 5.5.13.2,记录使用 iTextSharp 提取图片时,获得的知识点. pdf 中的签名并不是单纯的一张图片,它是由一张基础的底色图和一张蒙版图片组成.需要 ...
利用sfntly的sfnttool.jar提取中文字体
雨忆博客中提到了sfntly(具体介绍可以看:https://code.google.com/p/sfntly/),利用其中sfnttool.jar就可以提取只包含指定字符的字体,如果想在页面中通过@ ...
unity插件，从一段文字中提取中文并去重
using System.Collections.Generic; using System.Text.RegularExpressions; using UnityEditor; using Uni ...
python re 正则提取中文
需求: 提取文本中的中文和数字字母(大小写都要),即相当于删除所有标点符号. 其中new是原字符串 news = re.findall(r'[\u4e00-\u9fa5a-zA-Z0-9]',new)
iTextSharp带中文转换出来的PDF文档显示乱码
刚才有写一个小练习<Html代码保存为Pdf文件>http://www.cnblogs.com/insus/p/4323224.html.马上有网友说,当截取块有中文时,保存的pdf文件将 ...
记 iTextSharp 剪裁 PDF 指定区域的方法
原文引用 itextsharp 5.5.13.2 itextsharp.xtra 5.5.13.2 方法 /// <summary> /// 截取pdf文件,例如把A4截出指定的A6区域 ...

随机推荐

carsim2016 与 MATLAB2018 联合仿真send to simulink后编译不成功解决方法
之前使用CarSim8.1和Matlab17b联合仿真时遇到的问题和现在换用Carsim2017之后遇到了不一样的问题.carsim2017界面选择send to simulink 按钮之后,点击运行 ...
聊聊 DisplayObject 的x/y/regX/regY/rotation/scale/skew 属性
首先要指出的是:DisplayObject 实例的属性<x, y> 与 graphics.draw*(x, y, ...) 的参数<x, y>没有关系. 在原生的 Canvas ...
移动端的vw px rem之间换算
一.vw px rem em是什么 1.vw:就是相对视口宽度(Viewport Width).1vw = 1% * 视口宽度.也就是说,一个视口就是100vw. 2.px:px应该是在css中使用最 ...
Mybatis 多表实现多对多查询、添加操作
Mybatis 多表实现多对多查询.添加操作学习内容: 1. 多对多之添加操作 1.1.需求 1.2.数据库表(多对多数据库设计需要设计中间表) 1.3.类设计 1.4.Mapper 接口和 Map ...
微信小程序和公众号和H5之间相互跳转
参考链接:https://www.imooc.com/article/22900 一.小程序和公众号答案是:可以相互关联. 在微信公众号里可以添加小程序. 可关联已有的小程序或快速创建小程序.已关联 ...
【Unity原神AR开发实战 2022】下载原神模型，PMX转FBX，导入到Unity，AR设置，测试应用程序，生成应用程序
文章目录一.前言二.模型下载 1.官网下载 2.模之屋官方下载 3.第三方链接三.pmx转fbx 1.Blender插件CATS的下载与安装 2.pmx模型的导入四.Unity开发部分 1.V ...
计算机网络 TCP 四次挥手过程和状态变迁
客户端打算关闭连接,此时会发送一个 TCP 首部 FIN 标志位被置为 1 的报文,也即 FIN 报文,之后客户端进入 FIN_WAIT_1 状态. 服务端收到该报文后,就向客户端发送 ACK 应答报 ...
Dart语言基础
文章目录前言:dart语言简介一.变量 1.1.类型推导 1.2.默认值 1.3.Final 和 const修饰符二.内建类型 2.1.数据类型 2.2.集合的相关操作三.函数 3.1.函数的 ...
Py点亮
Markdown练习
这是一级标题这是二级标题这是三级标题这是无序列表1 这是无序列表2 有序1 有序2 重点计网 1. 第一章第一部分 1.概念.组成.功能和分类 1. 概念计算机网络是互连的.自治的计算机的 ...