第一节：python提取PDF文档中的图片

由于项目需要将PDF文档当中的图片转换成图片，所以参考了这篇文章https://blog.csdn.net/qq_15969343/article/details/81673302后项目得以解决。

1、安装第三方类库pymupdf：pip install pymupdf

2、安装完成后直接上代码，代码如下：

import fitz

import time

import re

import os

def pdf2pic(path, pic_path):

    t0 = time.clock()                          # 生成图片初始时间

    checkXO = r"/Type(?= */XObject)"           # 使用正则表达式来查找图片

    checkIM = r"/Subtype(?= */Image)"

    doc = fitz.open(path)                      # 打开pdf文件

    imgcount = 0                               # 图片计数

    lenXREF = doc._getXrefLength()             # 获取对象数量长度

    # 打印PDF的信息

    print("文件名:{}, 页数: {}, 对象: {}".format(path, len(doc), lenXREF - 1))

    # 遍历每一个对象

    for i in range(1, lenXREF):

        text = doc._getXrefString(i)            # 定义对象字符串

        isXObject = re.search(checkXO, text)    # 使用正则表达式查看是否是对象

        isImage = re.search(checkIM, text)      # 使用正则表达式查看是否是图片

        if not isXObject or not isImage:        # 如果不是对象也不是图片，则continue

            continue

        imgcount += 1

        pix = fitz.Pixmap(doc, i)               # 生成图像对象

        new_name = "图片{}.png".format(imgcount) # 生成图片的名称

        if pix.n < 5:                           # 如果pix.n<5,可以直接存为PNG

            pix.writePNG(os.path.join(pic_path, new_name))

        else:                                   # 否则先转换CMYK

            pix0 = fitz.Pixmap(fitz.csRGB, pix)

            pix0.writePNG(os.path.join(pic_path, new_name))

            pix0 = None

        pix = None                              # 释放资源

        t1 = time.clock()                       # 图片完成时间

        print("运行时间:{}s".format(t1 - t0))

        print("提取了{}张图片".format(imgcount))

if __name__=='__main__':

    path = r"C:\Users\lenovo\Desktop\数据.pdf"

    pic_path = r'C:\Users\lenovo\Desktop\图片'

    # 创建保存图片的文件夹

    if os.path.exists(pic_path):

        print("文件夹已存在，不必重新创建！")

        pass

    else:

        os.mkdir(pic_path)

    pdf2pic(path, pic_path)

3、运行结果

文件名:C:\Users\lenovo\Desktop\数据.pdf, 页数: 51, 对象: 156

运行时间:1.0037559488187855s

提取了1张图片

运行时间:1.9240614402553362s

提取了2张图片

运行时间:2.8580821293209087s

提取了3张图片

运行时间:3.59311390384999s

提取了4张图片

运行时间:4.055301359322903s

提取了5张图片

运行时间:4.861761705280556s

第一节：python提取PDF文档中的图片的更多相关文章

C# 提取Word文档中的图片
C# 提取Word文档中的图片图片和文字是word文档中两种最常见的对象,在微软word中,如果我们想要提取出一个文档内的图片,只需要右击图片选择另存为然后命名保存就可以了,今天这篇文章主要是实现使 ...
Aspose.Words提取word文档中的图片文件
/// <summary> /// 提取word中的图片 /// </summary> /// <param name="filePath">w ...
如何使用免费PDF控件从PDF文档中提取文本和图片
如何使用免费PDF控件从PDF文档中提取文本和图片概要现在手头的项目有一个需求是从PDF文档中提取文本和图片,我以前也使用过像iTextSharp, PDFBox 这些免费的PD ...
python 操作pdf文档
简介在实际项目中,我们有可能需要提取当中的部分内容并导出,给PDF文件添加水印,合并多份PDF文件等等,而本文会着重用到PyPDF2模块来玩转PDF文档,以及tabula模块来对PDF文档中的表格数 ...
使用Java POI来选择提取Word文档中的表格信息
通过使用Java POI来提取Word(1992)文档中的表格信息,其中POI支持不同的ms文档类型,在具体操作中需要注意.本文主要是通过POI来提取微软2003文档中的表格信息,具体code如下(事 ...
Java 在PDF文档中绘制图形
本篇文档将介绍通过Java编程在PDF文档中绘制图形的方法.包括绘制矩形.椭圆形.不规则多边形.线条.弧线.曲线.扇形等等.针对方法中提供的思路,也可以自行变换图形设计思路,如菱形.梯形或者组合图形等 ...
python实用小技能分享，教你如何使用 Python 将 pdf 文档进行加密解密
上次说了怎么将word转换为pdf格式及实现批量将word转换为pdf格式(点击这里),这次我又get到一个新技能–使用 Python 将 pdf 文档进行加密解密,哈哈哈希望帮到更多人! ...
如何突出显示PDF文档中的一些重要文本信息
PDF文档中如果存在着太多的文字时,阅读者会容易遗漏很多重要的信息.但如果,文档中存在着一些特殊标记的文字时,比如标黄.标红文本时,很多人都会给予特别关注. 因此,当大家在使用pdfFactory专业 ...
C# 在PDF文档中应用多种不同字体
在PDF文档中,可绘制不同字体样式.不同语言的文字,可通过使用Standard字体.TrueType字体.CJK字体或者自定义(私有)等字体类型.下面通过C#程序代码来展示如何实现使用以上类型的字体来 ...

随机推荐

【POJ - 1661】Help Jimmy （动态规划）
Help Jimmy Descriptions: "Help Jimmy" 是在下图所示的场景上完成的游戏. 场景中包括多个长度和高度各不相同的平台.地面是最低的平台,高度为零,长 ...
我的周记6——"不破楼兰誓不还“
周6 2019-06-13 天气:雨这张照片是我那天中午回家的时候拍的,下着中雨.这是谁的孩子,又是谁的妈妈.看到这样的场景心里还是蛮有触动的, 因为我现在是离家千里的孩子,思念着故乡也想念着亲人 ...
用jdbc连接数据库并简单执行SQL语句
一:版本一.这种存在一个问题就是每执行一次操作都会创建一次Connection链接和且释放一次链接 1:创建pojo对象(OR映射,一个pojo类对应一张数据库表) package com.yin ...
typedef struct和struct 的区别用途
刚刚想到的,我们在用结构体的时候会遇到'->'和'.',这是什么情况呢? 不能混用的(c和c++不同语言对它们没有影响) 我说的不能混用的意思是'.'用于结构体指针的指向......而'-& ...
centos安装PHP扩展（bcmath）
Centos下搭完Mysql+Apache+PHP后,发现有些网页打开是空白的.将php.ini里面的参数 error_reporting = E_ALL,display_errors = On,di ...
Hibernate配置(通过注解配置)
本文主要讲通过注解配置来替换Hibernate的映射文件 1.多对一配置 package com.jazz7.entity; import java.util.Date; import javax.p ...
LN : leetcode 712 Minimum ASCII Delete Sum for Two Strings
lc 712 Minimum ASCII Delete Sum for Two Strings 712 Minimum ASCII Delete Sum for Two Strings Given t ...
poj2991 Crane
思路: 线段树每个节点维护第一条线段起点指向最后一条线段终点的向量,于是每一个操作都是一次区间更新.使用成段更新的线段树即可.实现: #include <cstdio> #include ...
[BZOJ1016][JSOI2008]最小生成树计数最小生成树搜索
题目链接:http://www.lydsy.com/JudgeOnline/problem.php?id=1016 做这道题之前需要知道一些结论,同一个图的最小生成树中相同权值的边的个数是不会变的,如 ...
rest_framework基于generics.CreateAPIView创建用户
最近在写新版的devops3.0,被generics.CreateAPIView创建用户密码序列化的问题折磨的欲仙欲死.反复看源码测试,得出下面的流程,这也是做generics.CreateAPIVi ...

第一节：python提取PDF文档中的图片

第一节：python提取PDF文档中的图片的更多相关文章

随机推荐

热门专题