python对不同类型文件（doc,txt,pdf）的字符查找

python对不同类型文件的字符查找

TXT文件:

    def txt_handler(self, f_name, find_str):

        """

         处理txt文件

        :param file_name:

        :return:

        """

        line_count = 1;

        file_str_dict = {}

        if os.path.exists(f_name):

            f = open(f_name, 'r', encoding='utf-8')

            for line in f :

                if find_str in line:

                    file_str_dict['file_name'] = f_name

                    file_str_dict['line_count'] = line_count

                    break

                else:

                    line_count += 1

        return file_str_dict

docx文件

需要用到docx包

pip install python-docx

参考https://python-docx.readthedocs.io/en/latest/

from docx import Document

def docx_handler(self, f_name, find_str):

        """

         处理word docx文件

        :param file_name:

        :return:

        """

        # line_count = 1;

        file_str_dict = {}

        if os.path.exists(f_name):

            document = Document(f_name)  # 打开文件x.docx

            for paragraph in document.paragraphs:  # 每个获取段落

                # print(paragraph.text)

                if find_str in paragraph.text:

                    file_str_dict['file_name'] = f_name

                    # file_str_dict['line_count'] = line_count

                    break

        return file_str_dict

doc文件:

python没有专门处理doc文件的包，需要把doc转换成docx，再用docx文件类型方式进行处理

from win32com import client as wc

def doc_to_docx(self, fileName):

        # 将doc转换成docx

        word = wc.Dispatch("Word.Application")

        doc = word.Documents.Open(fileName)

        # 使用参数16表示将doc转换成docx，保存成docx后才能 读文件

        FileNameDocx = fileName[:-4] + '.docx'

        doc.SaveAs(FileNameDocx, 16)

        doc.Close()

        word.Quit()

        return FileNameDocx

pdf文件：

这里使用PDFMiner包

python3安装

python -m pip install pdfminer.six

参考文章

https://dzone.com/articles/exporting-data-from-pdfs-with-python

import io

from pdfminer.converter import TextConverter

from pdfminer.pdfinterp import PDFPageInterpreter

from pdfminer.pdfinterp import PDFResourceManager

from pdfminer.pdfpage import PDFPage   

def pdf_handler(self, f_name, find_str):

        """

         处理pdf文件

        :param file_name:

        :return:

        """

        # line_count = 1;

        file_str_dict = {}

        if os.path.exists(f_name):

            # pdf = pdfplumber.open(f_name)  # 打开文件x.pdf

            for page in self.extract_text_by_page(f_name):

                # 获取当前页面的全部文本信息，包括表格中的文字

                if find_str in page:

                    file_str_dict['file_name'] = f_name

                    # file_str_dict['line_count'] = line_count

                    break

        return file_str_dict

    @staticmethod

    def extract_text_by_page(pdf_path):

        """

        按页读取PDF

        生成器函数按页生成（yield）了文本

        :param pdf_path:

        :return:

        """

        with open(pdf_path, 'rb') as fh:

            for page in PDFPage.get_pages(fh,

                                          caching=True,

                                          check_extractable=True):

                resource_manager = PDFResourceManager()

                fake_file_handle = io.StringIO()

                converter = TextConverter(resource_manager, fake_file_handle)

                page_interpreter = PDFPageInterpreter(resource_manager, converter)

                page_interpreter.process_page(page)

                text = fake_file_handle.getvalue()

                yield text  # 使用生成器

                # close open handles

                converter.close()

                fake_file_handle.close()

python对不同类型文件（doc,txt,pdf）的字符查找的更多相关文章

doc或docx(word)或image类型文件批量转PDF脚本
doc或docx(word)或image类型文件批量转PDF脚本 1.实际生产环境中遇到文件展示只能适配PDF版本的文件,奈何一万个文件有七千个都是word或者image类型的,由此搞个脚本批量转换下 ...
python反编译chm文件并生成pdf文件
# -*- coding: utf-8 -*- import os import os.path import logging import pdfkit original_chm = r'C:\Us ...
python基础——python解析yaml类型文件
一.yaml介绍 yaml全称Yet Another Markup Language(另一种标记语言).采用yaml作为配置文件,文件看起来直观.简洁.方便理解.yaml文件可以解析字典.列表和一些基 ...
【python】实例-创建文件并通过键盘输入字符
import os lnend=os.linesep ##windows行结束符号是“\r\n” FileName=raw_input("please input filename:&quo ...
python数据处理（三）之处理pdf文件
代码以及资料 https://github.com/jackiekazil/data-wrangling 1.前言尽可能地寻找可以替代pdf格式的数据 2.解析pdf的编程方法安装slate pi ...
python基础——元组、文件及其它
Python核心数据类型--元组元组对象(tuple)是序列,它具有不可改变性,和字符串类似.从语法上讲,它们便在圆括号中,它们支持任意类型.任意嵌套及常见的序列操作. 任意对象的有序集合:与字符串 ...
solr6.6 导入 pdf/doc/txt/json/csv/xml文件
文本主要介绍通过solr界面dataimport工具导入文件,包括pdf.doc.txt .json.csv.xml等文件,看索引结果有什么不同.其实关键是managed-schema.solrcon ...
python第六篇文件处理类型
阅读目录一文件操作二打开文件的模式三操作文件的方法四文件内光标移动五文件的修改文件处理 ...
[大数据]-Fscrawler导入文件（txt,html,pdf,worf...）到Elasticsearch5.3.1并配置同义词过滤
fscrawler是ES的一个文件导入插件,只需要简单的配置就可以实现将本地文件系统的文件导入到ES中进行检索,同时支持丰富的文件格式(txt.pdf,html,word...)等等.下面详细介绍下f ...

随机推荐

爬取前程无忧网站上python的招聘信息。
本文获取的字段有为职位名称,公司名称,公司地点,薪资,发布时间创建爬虫项目 scrapy startproject qianchengwuyou cd qianchengwuyou scrapy g ...
cmake 编译windows程序
cmake 编译windows程序 cmake 编译windows程序 cmake 编译windows程序尽量使用尽量使用尽量使用 https://www.cnblogs.com/liujia ...
使用adb/Linux获取网关ip
ip route list table
Ruby for
#!/usr/bin/ruby -w# -*- coding: UTF-8 -*-for i in 1..5 print i," "endprint "\n"f ...
ESA2GJK1DH1K微信小程序篇: 安装Nginx,配置反向代理
前言一,为什么需要反向代理小程序访问的是 443端口,咱需要把443端口的数据传给MQTT 这节为了避免大家配置出错,以下源码已经配置. 如果大家想自己配置,请参考 https://www.cnb ...
状压dp专题复习
状压dp专题复习 (有些题过于水,我直接跳了) 技巧总结 : 1.矩阵状压上一行的选择情况 \(n * 2^n\) D [BZOJ2734][HNOI2012]集合选数蒻得不行的我觉得这是一道比较难 ...
性能测试-cpu负载和cpu利用率
概述做压力测试的时候,我们经常会关注两个指标,CPU利用率和CPU负载 Linux中,进程分为三种状态: 阻塞的进程blocked process 可运行的进程runnable process 正在 ...
SSM 实现支付宝支付功能（图文详解+完整代码）
阅读本文大概需要 4 分钟. 前言本教程详细介绍了如何使用ssm框架实现支付宝支付功能.本文章分为两大部分,分别是「支付宝测试环境代码测试」和「将支付宝支付整合到ssm框架」,详细的代码和图文解释, ...
记一次MyBatisPlus问题(如果表名是数据库关键字怎么办)
问题信息:如果表名是数据库关键字怎么办? 正常来说,如果是我们自己写sql的话,给表名加反引号即可解决问题. 但是由于我们使用MyBatisPlus,相关的sql基本上都是封装并自动生成的.如果是这种 ...
unity序列化
什么是序列化 unity的序列化在unity的开发中起着举重足轻的地位,许多核心的功能都是基于序列化和反序列化来实现的.序列化简单来讲就是就是将我们所要保存的数据进行二进制存储,然后当我们需要的时候, ...

python对不同类型文件（doc,txt,pdf）的字符查找

python对不同类型文件的字符查找

TXT文件:

docx文件

doc文件:

pdf文件：

python对不同类型文件（doc,txt,pdf）的字符查找的更多相关文章

随机推荐

热门专题