python里如何计算大文件的md5

在python3中，有了一个hashlib，可以用来计算md5，这里先给出一个简单的例子：

import hashlib

sstr="i love hanyu"

print(hashlib.md5(sstr).hexdigest())

很遗憾的，出错了，错误信息是：

C:\Python35\python.exe C:/pylearn/bottlelearn/3.py

Traceback (most recent call last):

  File "C:/pylearn/bottlelearn/3.py", line 4, in <module>

    print(hashlib.md5(sstr).hexdigest())

TypeError: Unicode-objects must be encoded before hashing

Process finished with exit code 1

这里主要是考虑到传入的编码不同，会导致md5出问题，所以，要求传入前进行统一的编码，修改如下：

 import hashlib

 hashlib.sha256(str(random.getrandbits(256)).encode('utf-8')).hexdigest()

import hashlib

with open(hash_file) as file:

    control_hash = file.readline().rstrip("\n")

wordlistfile = open(wordlist, "rb")

# ...

for line in wordlistfile:

    if hashlib.md5(line.rstrip(b'\n\r')).hexdigest() == control_hash:

下面，来看看如何计算大文件的md5，如果只是简单的把文件都入到内存中，大文件会导致出现大问题，编码如下：

import hashlib

def hash_bytestr_iter(bytesiter, hasher, ashexstr=False):

    for block in bytesiter:

        hasher.update(block)

    return (hasher.hexdigest() if ashexstr else hasher.digest())

def file_as_blockiter(afile, blocksize=65536):

    with afile:

        block = afile.read(blocksize)

        while len(block) > 0:

            yield block

            block = afile.read(blocksize)

[(fname, hash_bytestr_iter(file_as_blockiter(open(fname, 'rb')), hashlib.md5()))

    for fname in fnamelst]

python里如何计算大文件的md5的更多相关文章

使用python求字符串或文件的MD5
使用python求字符串或文件的MD5 五月 21st, 2008 #以下可在python3000运行. #字符串md5,用你的字符串代替'字符串'中的内容. import hashlib md5=h ...
Python逐块读取大文件行数的代码 - 为程序员服务
Python逐块读取大文件行数的代码 - 为程序员服务 python数文件行数最简单的方法是使用enumerate方法,但是如果文件很大的话,这个方法就有点慢了,我们可以逐块的读取文件的内容,然后按块 ...
删除Git记录里的大文件
删除Git记录里的大文件仓库自身的增长大多数版本控制系统存储的是一组初始文件,以及每个文件随着时间的演进而逐步积累起来的差异:而 Git 则会把文件的每一个差异化版本都记录在案.这意味着,即使你只 ...
Python花式读取大文件(10g/50g/1t)遇到的性能问题（面试向）
原文转载自「刘悦的技术博客」https://v3u.cn/a_id_97 最近无论是面试还是笔试,有一个高频问题始终阴魂不散,那就是给一个大文件,至少超过10g,在内存有限的情况下(低于2g),该以什 ...
python 小程序大文件的拆分合并
1. 将大文件拆分为小文件 I 通过二进制的方式将大文件读取出来,将其拆分存,以不同的文件方式存放在一个目录下面 II 提供两种操作方式交互式和命令行模式 #! usr/bin/python # -* ...
python处理分隔大文件
4个.sql格式的文件,2G大小,直接插入mysql数据中,文件太大了,导入不进去. 太大的文件用python处理也很麻烦,处理不了,只能先分隔成小文件处理. 文件中数据格式:其中values里面的数 ...
Vue.js实现大文件分片md5断点续传
背景根据部门的业务需求,需要在网络状态不良的情况下上传很大的文件(1G+).其中会遇到的问题:1,文件过大,超出服务端的请求大小限制:2,请求时间过长,请求超时:3,传输中断,必须重新上传导致前功尽 ...
python 如何读取大文件
一般的读取文件的方法: with open(file_path, "r") as f: print f.read() 或者 with open(file_path,"r& ...
python实现将大文件夹分割成多个子文件夹
楼主用的linux,一旦数据达到几万,文件夹打开就会变卡,同时也方便同时分工协作,便于git管理,写了个将大文件夹分割成多个小文件夹的脚本如操作文件夹:img,脚本不破坏img的数据,创建img_1 ...

随机推荐

2，Python常用库之二：Pandas
Pandas是用于数据操纵和分析,建立在Numpy之上的.Pandas为Python带来了两种新的数据结构:Pandas Series和Pandas DataFrame,借助这两种数据结构,我们能够轻 ...
Kafka消费分组和分区分配策略
Kafka消费分组,消息消费原理同一个消费组里的消费者不能消费同一个分区,不同消费组的消费组可以消费同一个分区 Kafka分区分配策略在 Kafka 内部存在两种默认的分区分配策略:Range 和 ...
Eclipse 创建 Java 接口---Eclipse教程第11课
打开新建 Java 接口向导新建 Java 接口向导可以创建新的 Java 接口.打开向导的方式有: 点击 File 菜单并选择 New > Interface 在 Package Explo ...
Java - 收藏集 -
Java - 收藏集 - Java 基础思维导图,让 Java 不再难懂 - 工具资源 - 掘金思维导图的好处最近看了一些文章的思维导图,发现思维导图真是个强大的工具.了解了思维导图的作用之后, ...
HTML5技巧
HTML5技巧 HTML5 技巧一:当今科技发展的速度真惊人,稍不留神,就可能无法跟上它的步伐.新一代的HTML-HTML5的发展也不停的带给我们新的惊喜,我们将通过这篇文章向大家介绍一些HTML ...
.net 下word 中的图片与文字分离
最近在做一个项目要求word 中的图片与文字分离 ,找了好久终于找到一个完美的方法 c#实现word中的图文分离 part 1: class define Code highlighting pr ...
c语言字符串内存分配小记
一.疑问有这样一道题: #include "stdio.h" int main() { ]; ]; scanf("%s", word1); scanf(&qu ...
Pythontutor:可视化代码在内存的执行过程
http://www.pythontutor.com/visualize.html今天去问开发一个Python浅拷贝的问题,开发给了一个神器,可以可视化代码在内存的执行过程,一看即懂,太NB了!~真是 ...
开源api文档
蒲公英——API文档 https://www.pgyer.com/doc/api
Canvas 图形组合方式
/** * 图形组合 */ function initDemo5() { var canvas = document.getElementById("demo5"); if (!c ...

python里如何计算大文件的md5

python里如何计算大文件的md5的更多相关文章

随机推荐

热门专题