如何清理误提交到git的历史大文件?
前言
哈喽!好久不见~
最近在思考转型的事情,好久没有更新文章了
不过看到我之前开发的视频剪辑工具 Clipify 收获了不少 star ,让我想起之前画的饼似乎才实现了一点点,所以利用了周末的空闲时间给 Clipify 项目重构了一下界面以及开发一些新功能。
中途意识到现在使用的 WinForms + Blazor 技术栈,就像马拉火车,有种蒸汽朋克的复古感,虽然使用前端技术开发的界面很好看,但 WinForms 不能跨平台终究不是长久之计。
于是我便着手尝试迁移到 MAUI,虽然还不能支持 Linux,至少 Mac 还是可以的,也算是跨平台了吧…
然而我还没把项目跑起来呢,一不小心把一堆静态资源给提交进去了
就是下面这些文件
Clipify.Maui/wwwroot/lib/
Clipify.Maui/wwwroot/css/*.min.css
Clipify.Maui/wwwroot/temp/
这下 git push
超级慢,而且会占用大量空间
还好最终在大模型爷爷的帮助下解决了这个问题
不过我想总不能老是去打扰大模型爷爷啊,问题解决了还是得记录一下,以后遇到类似的情况也好处理。
使用git原生命令
这个问题其实老生常谈了
网上能查到的很多文章都会告诉你可以用以下命令解决
git rm -r --cached Clipify.Maui/wwwroot/lib
git rm --cached Clipify.Maui/wwwroot/css/*.min.css
git rm -r --cached Clipify.Maui/wwwroot/temp
这些命令会移除已提交的文件,但不会删除本地文件
但我这样做了之后还是不行,git push 的时候还是很慢
分析原因
那么问题来了,为什么 git rm --cached
没用呢?
原因是 git rm --cached
只会从当前 commit(工作区)中移除指定文件的 Git 跟踪,它不会修改过去的提交记录
它解决的是「现在开始不要再跟踪」的问题, 但历史上它已经跟踪过的文件,Git 还会一直保留在对象数据库(.git/objects
)里
我在前面几个 commit 已经把 Clipify.Maui/wwwroot/lib 这类文件夹提交进去了
所以这个命令对于这个场景来说是没用的
简单来说,Git 是个版本管理工具,它不会忘记你历史上做过的提交,哪怕现在 git rm --cached
移除了 lib/
文件夹
Git 仍然记得之前在第 N 次 commit 时曾经加入过它,所以 .git
目录依然保存了那些 大 blob 文件,push
时照样要传。
解决方法
那么如何解决呢?
以前看到的方法是编写脚本,循环从每个 commit 里删除已提交的文件
现在不用这么麻烦了,有了 git-filter-repo 工具,这是一个 python 写的可以用来重写 git 历史记录的工具
https://github.com/newren/git-filter-repo
感谢 scoop ,让我在 Windows 上也能获得类似 Linux/MacOS 类似的软件安装体验
# 安装 Git Filter Repo
brew install git-filter-repo # macOS
scoop install git-filter-repo # Windows
# 或者用 Python 安装
pip install git-filter-repo
使用方法
git filter-repo --path Clipify.Maui/wwwroot/lib/ --invert-paths --force
这个命令会彻底删除历史中所有与该路径相关的文件和提交记录
重写整个 Git 提交历史之后,仓库大小会明显减小,git push
更快,历史提交中指定文件将完全移除。可能需要使用 --force
强制推送代码。
经过这一通操作之后,我再使用 git push 提交明显快了很多。
拓展:如何分析git提交历史里的大文件
用 [git rev-list
+ git verify-pack
] 可以找出 Git 提交历史中的大对象(大文件)
不过 git 原生的命令比较复杂
我还是选择借助工具的力量,这次是 git-sizer 工具
git-sizer是 GitHub 官方出的工具,用于分析 Git 仓库大小、提交体积等问题。
brew install git-sizer
# or
scoop install git-sizer
# or
cargo install git-sizer
PS:再次感谢 scoop !
直接在项目根目录下执行 git-sizer
即可
这个工具会输出以下信息:
- 最大的提交
- 最大的 blob(文件内容)
- 最大的目录
- 含大文件的分支
- 是否存在历史中隐藏的肥胖对象(hidden bloats)
我使用这个工具生成的结果是这样
Processing blobs: 2448
Processing trees: 218
Processing commits: 42
Matching commits to trees: 42
Processing annotated tags: 0
Processing references: 3
| Name | Value | Level of concern |
| ---------------------------- | --------- | ------------------------------ |
| Biggest objects | | |
| * Trees | | |
| * Maximum entries [1] | 1.40 k | * |
[1] 77b7ff2aa0456193bee83eebe9dfb76ebd4f35ac (2d9cc135f1aff0863ce2ef8ceff3cbf6984ee499:Clipify.Maui/wwwroot/lib/font-awesome/svgs/solid)
这样就能很方便定位到最大的文件,给 git 仓库瘦身~
如何清理误提交到git的历史大文件?的更多相关文章
- git 仓库中删除历史大文件
git 仓库中删除历史大文件 在git中增加了一个很大的文件,而且被保存在历史提交记录中,每次拉取代码都很大,速度很慢.而且用删除 提交历史记录的方式不是很实际. 以下分几个步骤介绍如何减小.git文 ...
- Git仓库删除大文件
Git仓库删除大文件 背景 当用Git久了,难免会手误或临时添加一些大文件到仓库中,即使以后添加进了.gitignore,甚至做了git rm,但是Git为了保证版本可回退,history pack里 ...
- 永久清理git中的历史大文件
原文发布于:https://www.chenxublog.com/2019/05/26/remove-git-big-files.html 有写老的git仓库,因为当年的无知,不会用.gitignor ...
- Git版本控制:Git查阅、撤销文件修改和撤销文件追踪
http://blog.csdn.net/pipisorry/article/details/47867097 查看文件的修改历史 git log --pretty=oneline 文件名 # 显示修 ...
- 记一次使用commit提交大文件无法推送到远程库解决问题过程及git rebase使用
记一次使用commit提交大文件无法推送到远程库解决问题过程及git rebase使用 目录 大文件无法push到远程仓库 问题 commit的大文件无法push到远程库解决办法 git filter ...
- Git 删除大文件的方法
git 仓库中删除历史大文件 git 仓库中删除历史大文件 在git中增加了一个很大的文件,而且被保存在历史提交记录中,每次拉取代码都很大,速度很慢.而且用删除 提交历史记录的方式不是很实际. 以 ...
- mac里git项目删除.DS_Store文件
用mac开发项目,每次提交文件时都生成修改文件的.DS_Store文件,提交时会不会觉得比较烦?别急,下面给出解决方案.我们需要用到.gitignore文件去配置Git目录中需要忽略的文件. .git ...
- 使用BFG清除git仓库中的隐私文件或大文件
使用git时间不长,在调机械臂项目的时候,由于对TwinCAT3和vs的机制不太了解,没有添加很好的忽略文件(.gitignore).造成git仓库包含了很多没有用的文件,例如vs的sdf文件,Twi ...
- Git Compare with base,比较大文件时,长时间等待,无法加载
问题 当使用Git比较一个大文件(几十兆数量级)版本见差异时,会一直等待加载,且内存消耗很大,导致其他进程很难执行.任务管理器中,可以看到此时的TortoiseGitMerge吃掉3G左右的内存. 原 ...
- git上传超过100m大文件
1.git出错如下错误时 执行如下可解决错误: git rm --cache '大文件路径' git commit --amend -CHEAD git push 2.当必须上传大文件时.需借助git ...
随机推荐
- 5. 想在代码中验证sql的正确性?
1. 简介 我们在平时的开发中可能会遇到需要验证一下sql是否正确,也就是需要check一下sql. 判断sql是否正确一般包含一下几点: 1. sql中使用的列是否存在 2. sql语法是否正确 3 ...
- Linux - 禁ping & 开放访问端口
适用于Linux操作系统 禁ping 1.编辑 /etc/sysctl.conf 文件,文件末尾增加如下内容后,保存退出. net.ipv4.icmp_echo_ignore_all = 1 2.在命 ...
- mysql 登录提示 “is not allowed to connect to this mysql server”
解决方法一 执行 mysql -u root -p 然后输入密码登陆mysql GRANT ALL PRIVILEGES ON . TO 'myuser'@'%' IDENTIFIED BY 'myp ...
- 质疑了ChatGPT,结果他居然...
小编其实是想挑战下ChatGPT,指出目前像他这种AI,通过如此高维向量的方式代表一个事物特征,是算力上的巨大浪费. 质疑这种方式可能不是最优解,冥冥之中应该有更好的方式. 结果发现他居然大方承认,而 ...
- C# 一般处理程序ashx用于验证码
1.用VS2019建立一个web应用程序,选mvc模板 2.选中项目邮件新建文件夹Webservice,然后添加一般处理程序Verify.ashx然后右键打开改写如下 1 public class V ...
- 葡萄城 AI 搜索升级:DeepSeek 加持,客户体验更智能
葡萄城 AI 搜索接入 DeepSeek 在软件开发的广阔领域中,信息获取的效率直接影响开发进程的快慢.葡萄城始终致力于为开发者打造高效.智能的开发环境.自去年12月上线以来,AI 搜索功能已在帮助开 ...
- 北京大学DeepSeek系列教程:《DeepSeek与AIGC应用》
前言 今天大姚分享一个由北京大学推出的DeepSeek系列学习教程<DeepSeek与AIGC应用>,该文档全面介绍了DeepSeek-R1模型的技术特性.应用场景及其在AIGC领域的重要 ...
- xxe学习笔记
什么是xxe XXE(XML External Entity Injection)全称为XML外部实体注入,由于程序在解析输入的XML数据时,解析了攻击者伪造的外部实体而产生的.例如PHP中的simp ...
- python ImportError: libGL.so.1: cannot open shared object file: No such file or directory
前言 python 报错python ImportError: libGL.so.1: cannot open shared object file: No such file or director ...
- 昨晚接收的俄罗斯Meteor-M2气象卫星云图,接收质量还可以!
接收设备: 天馈:自制四臂螺旋天线 硬件:SDRsharp 跟踪:Orbitron.SDRSharpDriverDDE 频率:137.1MHZ 解码:SDRSharp.QPSK.M2_LRPT_Dec ...