21.10 Python 使用CRC32校验文件

CRC文件校验是一种用于验证文件完整性的方法，通过计算文件的CRC值并与预先计算的CRC校验值进行比较，来判断文件是否发生变化，此类功能可以用于验证一个目录中是否有文件发生变化，如果发生变化则我们可以将变化打印输出，该功能可用于实现对特定目录的验证。

首先实现文件与目录的遍历功能，递归输出文件或目录，在Python中有两种实现方式，我们可以通过自带的os.walk函数实现，也可以使用os.listdir实现，这里笔者依次封装两个函数，函数ordinary_all_file使用第一种方式，函数recursion_all_file使用第二种，这两种方式都返回_file列表，读者可使用列表接收输出数据集。

import os,hashlib,time,datetime

from zlib import crc32

import argparse

# 递归版遍历所有文件和目录

def recursion_all_file(rootdir):

    _file = []

    root = os.listdir(rootdir)

    for item in range(0,len(root)):

           path = os.path.join(rootdir,root[item])

           if os.path.isdir(path):

              _file.extend(recursion_all_file(path))

           if os.path.isfile(path):

              _file.append(path)

    for item in range(0,len(_file)):

        _file[item] = _file[item].replace("\\","/")

    return _file

# 通过自带OS库中的函数实现的目录遍历

def ordinary_all_file(rootdir):

    _file = []

    for root, dirs, files in os.walk(rootdir, topdown=False):

        for name in files:

            _file.append(os.path.join(root, name))

        for name in dirs:

            _file.append(os.path.join(root, name))

        for item in range(0,len(_file)):

            _file[item] = _file[item].replace("\\","/")

    return _file

针对计算方法此处也提供两种，第一种Calculation_md5sum使用hashlib模块内的md5()方法计算特定文件的MD5特征，第二种Calculation_crc32则使用zlib库中的crc32方法计算特定文件的CRC32值，如下所示。

# 通过hashlib模块读取文件并计算MD5值

def Calculation_md5sum(filename):

    try:

        fp = open(filename, 'rb')

        md5 = hashlib.md5()

        while True:

            temp = fp.read(8096)

            if not temp:

                break

            md5.update(temp)

        fp.close()

        return (md5.hexdigest())

    except Exception:

        return 0

# 计算目标CRC32

def Calculation_crc32(filename):

    try:

        with open(filename,"rb") as fp:

            crc = crc32(fp.read())

            while True:

                temp = fp.read(8196)

                if not temp:

                    break

            return crc

    except Exception:

        return 0

    return 0

在主函数中，我们通过argparse解析库传入参数，并分别实现三个功能，其中使用dump功能可以保存特定目录内文件的hash值到dump.json文件中，其次check功能可用于根据dump.json中的内容检查文件是否被改动过，最后的set则可用于批量设置文件的时间戳，这三类功能都属于较为常用的。

if __name__ == "__main__":

    parser = argparse.ArgumentParser()

    parser.add_argument("--mode",dest="mode",help="指定需要使用的方法名称,(set/dump/check)")

    parser.add_argument("-d","--dir",dest="dir",help="指定一个需要遍历的文件目录(非文件)")

    parser.add_argument("-f","--files",dest="files",help="指定一个本地快照文件,或转储的文件名称")

    parser.add_argument("-t","--time",dest="time",help="指定需要统一修改的文件时间")

    args = parser.parse_args()

    # 保存快照: main.py --mode=dump -d "D:/lyshark" -f dump.json

    if args.mode == "dump" and args.dir and args.files:

        file = recursion_all_file(args.dir)

        fp = open(args.files,"w+")

        for item in file:

            Single = []

            Single.append(Calculation_crc32(item))

            Single.append(item)

            fp.write(str(Single) + "\n")

            print("[+] CRC: {} ---> 路径: {}".format(Single[0],Single[1]))

        fp.close()

    # 检查文件完整性: main.py --mode=check -d "D:/lyshark" -f dump.json

    elif args.mode == "check" and args.dir and args.files:

        fp = open(args.files,"r")

        for item in fp.readlines():

            _list = eval(item)

            # 取出json文件里的目录进行MD5计算

            _md5 = Calculation_crc32(_list[1])

            # 如果该文件的md5与数据库中的记录不一致,说明被修改了

            if _list[0] != _md5 and _md5 != 0:

                print("[-] 异常文件: {}".format(_list[1]))

            elif _md5 == 0:

                print("[x] 文件丢失: {}".format(_list[1]))

    # 设置文件修改时间: main.py --mode=set -d "D:/lyshark" -t "2019-01-01 11:22:30"

    elif args.mode == "set" and args.dir and args.time:

        _list = ordinary_all_file(args.dir)

        _time = int(time.mktime(time.strptime(args.time,"%Y-%m-%d %H:%M:%S")))

        for item in _list:

            os.utime(item,(_time, _time))

            print("[+] 时间戳: {} ---> 路径: {}".format(str(_time),item))

    else:

        parser.print_help()

指定mode模式为dump用于实现将特定文件计算CRC特征，并将该特征保存至dump.json文件内，如下图所示；

指定mode模式为check并指定转存之前的dump.json文件，则可用于验证当前目录下是否存在异常文件，如果文件特征值发生了变化则会提示异常文件，而如果文件被删除或被重命名则会输出文件丢失，如下图所示；

指定mode模式为set则可实现对特定目录内特定文件修改时间参数，例如将d://lyshark目录内的文件全部重置时间戳为2019-01-01 11:22:30则可执行如下命令，执行后读者可自行观察文件时间变化，如下图所示；

文件与目录遍历功能，不仅可以用于对文件的特征扫描，还可以与fopen等函数实现对特定文件内特定内容的扫描，如下是一段实现对文件内特定目录的关键字扫描，运行后读者通过传入需要扫描的路径，扫描的关键字，以及需要扫描文件类型即可。

import os,re

import argparse

def spider(script_path,script_type):

    final_files = []

    for root, dirs, files in os.walk(script_path, topdown=False):

            for fi in files:

                dfile = os.path.join(root, fi)

                if dfile.endswith(script_type):

                    final_files.append(dfile.replace("\\","/"))

    print("[+] 共找到了 {} 个 {} 文件".format(len(final_files),script_type))

    return final_files

def scanner(files_list,func):

    for item in files_list:

        fp = open(item, "r",encoding="utf-8")

        data = fp.readlines()

        for line in data:

            Code_line = data.index(line) + 1

            Now_code = line.strip("\n")

            #for unsafe in ["system", "insert", "include", "eval","select \*"]:

            for unsafe in [func]:

                flag = re.findall(unsafe, Now_code)

                if len(flag) != 0:

                    print("函数: {} ---> 函数所在行: {} ---> 路径: {} " .\

                          format(flag,Code_line,item))

if __name__ == "__main__":

    # 使用方式: main.py -p "D://lyshark" -w eval -t .php

    parser = argparse.ArgumentParser()

    parser.add_argument("-p","--path",dest="path",help="设置扫描路径")

    parser.add_argument("-w","--word",dest="func",help="设置检索的关键字")

    parser.add_argument("-t","--type",dest="type",default=".php",help="设置扫描文件类型,默认php")

    args = parser.parse_args()

    if args.path and args.func:

        ret = spider(args.path, args.type)

        scanner(ret, args.func)

    else:

        parser.print_help()

如下图所示，我们通过传入d://lyshark以及关键字gumbo_normalized_tagname并设置扫描后缀类型*.c当程序运行后，即可输出该目录下所有符合条件的文件，并输出函数所在行，这有利于我们快速跳转并分析数据。

21.10 Python 使用CRC32校验文件的更多相关文章

第三章：Python基础の函数和文件操作实战
本課主題 Set 集合和操作实战函数介紹和操作实战参数的深入介绍和操作实战 format 函数操作实战 lambda 表达式介绍文件操作函数介紹和操作实战本周作业 Set 集合和操作实战 Se ...
Python之IO编程——文件读写、StringIO/BytesIO、操作文件和目录、序列化
IO编程 IO在计算机中指Input/Output,也就是输入和输出.由于程序和运行时数据是在内存中驻留,由CPU这个超快的计算核心来执行,涉及到数据交换的地方,通常是磁盘.网络等,就需要IO接口.从 ...
[Spark][Python]spark 从 avro 文件获取 Dataframe 的例子
[Spark][Python]spark 从 avro 文件获取 Dataframe 的例子从如下地址获取文件: https://github.com/databricks/spark-avro/r ...
Python探索记(18)——文件File
# @Time : 2017/7/8 21:10 # @Author : 原创作者:谷哥的小弟 # @Site : 博客地址:http://blog.csdn.net/lfdfhl # @DESC : ...
Python 通过 .cube LUT 文件对图像加滤镜
Python 通过 .cube LUT 文件对图像加滤镜一个好用的python给图片加滤镜的代码: https://github.com/CKboss/PyApplyLUT 这个是对C++代码的封装 ...
Python 操作 MS Excel 文件
利用 Python 对 Excel 文件进行操作需要使用第三方库: openpyxl,可执行 pip install openpyxl 进行安装 1. 导入 openpyxl 模块导入 openpy ...
[python]自动化将markdown文件转成html文件
*:first-child { margin-top: 0 !important; } body>*:last-child { margin-bottom: 0 !important; } /* ...
Windows校验文件哈希hash的两种常用方式
大家经常都到哪儿去下载软件和应用程序呢?有没想过下载回来的软件.应用程序或资源是否安全呢?在 Windows 10 和 Office 2016 发布当初,很多没权限的朋友都使用第三方网站去下载安装映像 ...
CRC32校验的用法
CRC32校验数据的完整性这里的数据包括字符串.文件,还有哪些? 文件校验相当于下载大型软件,有md5加密结果.这里的用途是什么?
使用 boost 进行 CRC32 校验
使用 boost 进行 CRC32 校验 - firebird321的专栏 - 博客频道 - CSDN.NET 使用 boost 进行 CRC32 校验分类: 文件操作 2008-06-06 18: ...

随机推荐

python 正则表达式简单使用
定义: 正则表达式,又称规则表达式,通常被用来检索.替换那些符合某个模式(规则)的文本. 正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符.及这些特定字符的组合,组成一个&quo ...
【python爬虫】 request模块介绍 http协议版本区别双token认证携带cookie的两种方式 requests.session的使用 post请求携带数据编码格式 request.text编码问题下载图片，视频
目录上节回顾今日内容 1 爬虫介绍 2 request模块介绍 3 request发送get请求 4 request携带参数 5 url编码解码 6 携带请求头 http协议版本之间的区别 7 发 ...
【Docker】基础原理
基础原理基础流程 Docker镜像讲解 Docker容器讲解创建容器的两种方式容器创建命令详解
POJ 1742 Coins（多重背包的可行性问题）
Description People in Silverland use coins.They have coins of value A1,A2,A3...An Silverland dollar. ...
第九届蓝桥杯（2018）C/C++大学A组省赛题解
第一题:分数 1/1 + 1/2 + 1/4 + 1/8 + 1/16 + - 每项是前一项的一半,如果一共有20项, 求这个和是多少,结果用分数表示出来. 类似:3/2 当然,这只是加了前2项而已. ...
C# 加解密
1. Md5 /// <summary> /// 不可逆加密 /// 1 防止被篡改 /// 2 防止明文存储 /// 3 防止抵赖,数字签名 /// </summary> ...
wxpython窗体之间传递参数
如何界面存在frame1与frame2,通过frame1打开页面frame2,并将frame2的值传递给frame1 可以使用回调函数传值参考具体代码如下: # -*- coding: utf-8 - ...
Liunx常用操作(十)-VI编辑器-命令模式命令
vI编辑器三种模式分别为命令模式.输入模式.末行模式.
SD Host控制器的系统集成
控制器集成需求 SD Host可以从外部读取数据存储到SRAM和eFlash或者可以从内部读取数据输出到外部存储 AHB Bus slave接口用于配置 master接口作为主设备,DMA可以控制总线 ...
【C++】类概念及使用
类定义中不允许对数据成员初始化类外只能访问公有部分类成员必须指定访问属性类的成员函数是实现对封装的数据成员进行操作的唯一途径类定义中不允许定义本类对象,因无法预知大小类与结构形式相同,唯一区 ...

21.10 Python 使用CRC32校验文件

21.10 Python 使用CRC32校验文件的更多相关文章

随机推荐

热门专题