Python3.x：pdf2htmlEX（解析pdf）安装和使用

简介

pdf2htmlEX是一款优秀的pdf转换成html的工具；

下载

windows下载地址：http://soft.rubypdf.com/software/pdf2htmlex-windows-version

安装

下载pdf2htmlEX-win32-0.14.6-with-poppler-data.zip后，直接解压，即可用；

测试

在dos窗口中切换到解压目录：

cd /d D:\pdf2htmlEX-win32-0.14.6

输入测试命令：

pdf2htmlex -v

结果如下图，表示安装成功；

pdf2html命令用法

用法: pdf2htmlEX [options] <input.pdf> [<output.html>]

  -f,--first-page <int>         需要转换的起始页 (默认: 1)

  -l,--last-page <int>          需要转换的最后一页 (默认: 2147483647)

  --zoom <fp>                   缩放比例

  --fit-width <fp>              适合宽度 <fp> 像素

  --fit-height <fp>             适合高度 <fp> 像素

  --use-cropbox <int>           使用剪切框 (default: 1)

  --hdpi <fp>                   图像水平分辨率 (default: 144)

  --vdpi <fp>                   图像垂直分辨率 (default: 144)

  --embed <string>              指定哪些元素应该被嵌入到输出

  --embed-css <int>             将CSS文件嵌入到输出中 (default: 1)

  --embed-font <int>            将字体文件嵌入到输出中 (default: 1)

  --embed-image <int>           将图片文件嵌入到输出中 (default: 1)

  --embed-javascript <int>      将javascript文件嵌入到输出中 (default: 1)

  --embed-outline <int>         将链接嵌入到输出中 (default: 1)

  --split-pages <int>           将页面分割为单独的文件 (default: 0)

  --dest-dir <string>           指定目标目录 (default: ".")

  --css-filename <string>       生成的css文件的文件名 (default: "")

  --page-filename <string>      分割的网页名称  (default:"")

  --outline-filename <string>   生成的链接文件名称 (default:"")

  --process-nontext <int>       渲染图行，文字除外 (default: 1)

  --process-outline <int>       在html中显示链接 (default: 1)

  --printing <int>              支持打印 (default: 1)

  --fallback <int>              在备用模式下输出 (default: 0)

  --embed-external-font <int>   嵌入局部匹配的外部字体 (default: 1)

  --font-format <string>        嵌入的字体文件后缀 (ttf,otf,woff,svg) (default: "woff")

  --decompose-ligature <int>    分解连字-> fi (default:0)

  --auto-hint <int>             使用fontforge的autohint上的字体时不提示 (default: 0)

  --external-hint-tool <string> 字体外部提示工具 (overrides --auto-hint) (default: "")

  --stretch-narrow-glyph <int>  伸展狭窄的字形，而不是填充 (default: 0)

  --squeeze-wide-glyph <int>    收缩较宽的字形，而不是截断 (default: 1)

  --override-fstype <int>       clear the fstype bits in TTF/OTF fonts (default:0)

  --process-type3 <int>         convert Type 3 fonts for web (experimental) (default: 0)

  --heps <fp>                   合并文本的水平临界值，单位：像素(default: 1)

  --veps <fp>                   vertical threshold for merging text, in pixels (default: 1)

  --space-threshold <fp>        断字临界值 (临界值 * em) (default:0.125)

  --font-size-multiplier <fp>   一个大于1的值增加渲染精度 (default: 4)

  --space-as-offset <int>       把空格字符作为偏移量 (default: 0)

  --tounicode <int>             如何处理ToUnicode的CMap (0=auto, 1=force,-1=ignore) (default: 0)

  --optimize-text <int>         尽量减少用于文本的HTML元素的数目 (default: 0)

  --bg-format <string>          指定背景图像格式 (default: "png")

  -o,--owner-password <string>  所有者密码 (为了加密文件)

  -u,--user-password <string>   用户密码 (为了加密文件)

  --no-drm <int>                覆盖文档的 DRM 设置 (default: 0)

  --clean-tmp <int>             转换后删除临时文件 (default: 1)

  --data-dir <string>           指定的数据目录 (default: ".\share\pdf2htmlEX")

  --debug <int>                 打印调试信息 (default: 0)

  -v,--version                  打印版权和版本信息

  -h,--help                     打印使用帮助信息

python3中调用pdf2htmlex示例

Python3.x：pdf2htmlEX（解析pdf）安装和使用的更多相关文章

python3使用pdfminer3k解析pdf文件
安装pdfminer模块 pip3 install pdfminer3k 代码如下 #!/usr/bin/env python # coding:utf8 # author:Z time:2018/7 ...
Python3.x：PDFMiner3k在线、本地解析pdf
Python3.x:PDFMiner3k在线.本地解析pdf 安装 pip install pdfminer3k 示例一:在线解析pdf ''' Demo:pdf2htmlex解析pdf Dateti ...
Python解析PDF三法
span{line-height:2em} --> 最近做调研想知道一些NZ当地的旅游信息,于是在NZ留学的友人自高奋勇地帮我去各个加油站拿了一堆旅游小册子,扫描了发给我. 但是他扫描出的高清图 ...
Python使用PDFMiner解析PDF
近期在做爬虫时有时会遇到网站只提供pdf的情况,这样就不能使用scrapy直接抓取页面内容了,只能通过解析PDF的方式处理,目前的解决方案大致只有pyPDF和PDFMiner.因为据说PDFMiner ...
PHP通过PDFParser解析PDF文件
之前一直找到的资料都是教你怎么生成pdf文档,比如:TCPDF.FPDF.wkhtmltopdf.而我碰到的项目里需要验证从远程获取的pdf文件是否受损.文件内容是否一致这些问题,这些都不能直接提供给 ...
Python3 常用爬虫库的安装
Python3 常用爬虫库的安装 1 简介 Windows下安装Python3常用的爬虫库:requests.selenium.beautifulsoup4.pyquery.pymysql.pymon ...
WPF解析PDF为图片
偶遇需要解析PDF文件为单张图,此做, http://git.oschina.net/jiailiuyan/OfficeDecoder using System; using System.Colle ...
Apache-Tika解析PDF文档
通常在使用爬虫时,爬取到网上的文章都是各式各样的格式处理起来比较麻烦,这里我们使用Apache-Tika来处理PDF格式的文章,如下: package com.mengyao.tika.app; im ...
LIMS系统仪器数据采集-使用xpdf解析pdf内容
不同语言解析PDF内容都有各自的库,比如Java的pdfbox,.net的itextsharp. c#解析PDF文本,关键代码可参考: http://www.cnblogs.com/mahongbia ...

随机推荐

json DateTime转换
前台: function ChangeDateFormat(jsondate) { jsondate = jsondate.replace("/Date(", "&quo ...
WebApi接口传参不再困惑：传参详解
http://www.cnblogs.com/landeanfen/p/5337072.html
Bower和Gulp集成前端资源
在我们开始前先介绍下流程: 安装node.js. 安装npm. 全局安装bower. 根目录创建 .bowerrc (可选) 在项目中安装bower 并创建 bower.json 文件,运行 bowe ...
Redis 连接失败redis Can't init enough connections amount!
Can't init enough connections amount! Only 0 from 10 were initialized. Server: IP:6379 无法初始化足够的连接数量! ...
C++ 分割字符串两种方法
原文地址:http://blog.csdn.net/xjw532881071/article/details/49154911 字符串切割的使用频率还是挺高的,string本身没有提供切割的方法,但可 ...
《转》最受欢迎的ASP.NET的CMS下载
1. Umbraco 项目地址 | 下载 Umbraco是一个开放源码的CMS内容管理系统,基于asp.net建立,使用mssql进行存储数据. 使用Umbraco ,设计师能创造出有效的XHTML标 ...
plotplayer声道设置原声
1.打开plotplayer.根据按键F5,选择声音——>语言/同步/其他-流选择 2.重启plotplayer
mysql_表内容_操作
1.增语法:insert into 表 (列名,列名...) values (值,值...) # 插入单条数据 insert into 表 (列名,列名...) values (值,值...) # ...
安装 oracle 11g 发行版出现错误：由于以下错误，Enterprise Manager配置失败，启动Database Control时出错
解决方案如下进入dos(1)查看dbconsole状态:emctl status dbconsole 显示:Environment variable ORACLE_SID not defined. P ...
table width 决定 td width
w td width 有无在chrome edge ff 均未影响td实际宽度,td接近等比分配table width. <!doctype html> <html lang=&qu ...

Python3.x：pdf2htmlEX（解析pdf）安装和使用

Python3.x：pdf2htmlEX（解析pdf）安装和使用

简介

下载

安装

测试

pdf2html命令用法

python3中调用pdf2htmlex示例

Python3.x：pdf2htmlEX（解析pdf）安装和使用的更多相关文章

随机推荐

热门专题