Lora训练的参数和性能

主要为了测试模型增加Lora模块后，参数量和训练速度的变化情况。
结论：正常情况下，增加Lora模块是会增加参数量的，因此前向传播和反向传播的时间也会增加。
但是，在大语言模型训练的情况下，因为基础模型本身参数量非常大，Lora模块增加的参数量相对非常小。并且，基础模型不参与梯度更新，可以做模型量化，实际上是能减少模型训练时间和显存使用量的。
以下是实验脚本和运行结果：

#部分参考https://zhuanlan.zhihu.com/p/666000885
import time

import torch

from torch import nn

from peft import LoraConfig, get_peft_model, PeftModel

from torchsummary import summary

x_train = torch.randn((1000, 10))

y_train = torch.randn((1000, 1))

net = nn.Sequential(

    nn.Linear(10,20),

    nn.Sigmoid(),

    nn.Linear(20,30),

    nn.Sigmoid(),

    nn.Linear(30,1)

)

summary(net, (1,10))

config = LoraConfig(target_modules=["0"], r=2)

model = get_peft_model(net, config)

criterion = torch.nn.MSELoss(reduction='mean')            # 定义损失函数，采用均方误差

optimizer = torch.optim.Adam(model.parameters(), lr=0.3)  # 定义优化器，采用Adam

summary(model, (1,10))

# base 前向计算时间

start = time.time()

for i in range(100000):

    y_pre = net(x_train)            # 前向传播

print("base 前向计算时间: ", time.time() - start)

# lora 前向计算时间

start = time.time()

for i in range(100000):

    y_pre = model(x_train)            # 前向传播

print("lora 前向计算时间", time.time() - start)

# base 反向传播时间

start = time.time()

for i in range(1000):

    y_pre = net(x_train)            # 前向传播

    loss = criterion(y_pre, y_train)  # 计算损失

    optimizer.zero_grad()             # 梯度清零

    loss.backward()                   # 反向传播

    optimizer.step()                  # 使用优化器更新梯度

print("base loss after training: ", loss.item())

print("base 反向计算时间", time.time() - start)

# lora 反向传播时间

start = time.time()

for i in range(1000):

    y_pre = model(x_train)            # 前向传播

    loss = criterion(y_pre, y_train)  # 计算损失

    optimizer.zero_grad()             # 梯度清零

    loss.backward()                   # 反向传播

    optimizer.step()                  # 使用优化器更新梯度

print("lora loss after training: ", loss.item())

print("lora 反向计算时间", time.time() - start)

　　运行代码输出：

----------------------------------------------------------------

        Layer (type)               Output Shape         Param #

================================================================

            Linear-1                [-1, 1, 20]             220

           Sigmoid-2                [-1, 1, 20]               0

            Linear-3                [-1, 1, 30]             630

           Sigmoid-4                [-1, 1, 30]               0

            Linear-5                 [-1, 1, 1]              31

================================================================

Total params: 881

Trainable params: 881

Non-trainable params: 0

----------------------------------------------------------------

Input size (MB): 0.00

Forward/backward pass size (MB): 0.00

Params size (MB): 0.00

Estimated Total Size (MB): 0.00

----------------------------------------------------------------

----------------------------------------------------------------

        Layer (type)               Output Shape         Param #

================================================================

            Linear-1                [-1, 1, 20]             220

          Identity-2                [-1, 1, 10]               0

            Linear-3                 [-1, 1, 2]              20

            Linear-4                [-1, 1, 20]              40

            Linear-5                [-1, 1, 20]             220

           Sigmoid-6                [-1, 1, 20]               0

            Linear-7                [-1, 1, 30]             630

           Sigmoid-8                [-1, 1, 30]               0

            Linear-9                 [-1, 1, 1]              31

================================================================

Total params: 1,161

Trainable params: 60

Non-trainable params: 1,101

----------------------------------------------------------------

Input size (MB): 0.00

Forward/backward pass size (MB): 0.00

Params size (MB): 0.00

Estimated Total Size (MB): 0.01

----------------------------------------------------------------

base loss after training:  1.0724023580551147

base 反向计算时间 2.9570980072021484

lora loss after training:  1.0643658638000488

lora 反向计算时间 3.053032159805298

Lora训练的参数和性能的更多相关文章

训练超参数，出现 Cannot use GPU in CPU-only Caffe 错误？
当我们用MNIST手写体数字数据库和LeNet CNN 模型训练超参数,运行 examples/mnist/train_lenet.sh是出现Cannot use GPU in CPU-only Ca ...
05：Sysbench压测-innodb_deadlock_detect参数对性能的影响
目录 sysbench压测-innodb_deadlock_detect参数对性能的影响一.OLTP测试前准备二.进行OLTP测试三.测试结果解读: 四.关于测试后的结论: 五.关于测试后的性能 ...
04：Sysbench压测-innodb_flush_log_at_trx_commit,sync_binlog参数对性能的影响
目录 sysbench压测-innodb_flush_log_at_trx_commit,sync_binlog参数对性能的影响一.OLTP测试前准备二.MySQL 数据落盘的过程三.参数说明 ...
[转帖]PostgreSQL 参数调整(性能优化)
PostgreSQL 参数调整(性能优化) https://www.cnblogs.com/VicLiu/p/11854730.html 知道一个 shared_pool 文章写的挺好的还没仔细看 ...
Tomcat学习四步走：内核、集群、参数及性能
主题简介: 内核实现原理分布式集群生产部署关键参数性能监控和分析一.内核实现原理 HTTP Web服务器与浏览器之间以HTTP协议通信,浏览器要访问服务器即向服务器发送HTTP请求报文. 如图 ...
pytorch和tensorflow的爱恨情仇之定义可训练的参数
pytorch和tensorflow的爱恨情仇之基本数据类型 pytorch和tensorflow的爱恨情仇之张量 pytorch版本:1.6.0 tensorflow版本:1.15.0 之前我们就已 ...
C# 中的 in 参数和性能分析
in 修饰符也是从 C# 7.2 开始引入的,它与我们上一篇中讨论的 <C# 中的只读结构体(readonly struct)>[1] 是紧密相关的. in 修饰符 in 修饰符通过引用传 ...
IO模式设置网络编程常见问题总结—IO模式设置，阻塞与非阻塞的比较，recv参数对性能的影响—O_NONBLOCK(open使用)、IPC_NOWAIT(msgrcv)、MSG_DONTWAIT(re
非阻塞IO 和阻塞IO: 在网络编程中对于一个网络句柄会遇到阻塞IO 和非阻塞IO 的概念, 这里对于这两种socket 先做一下说明: 基本概念: 阻塞IO:: socket 的阻塞模式 ...
Linux内存管理-内核的shmall和shmmax参数（性能调优）（转）
内核的shmall和shmmax参数 SHMMAX=配置了最大的内存segment的大小:这个设置的比SGA_MAX_SIZE大比较好. SHMMIN=最小的内存segment的大小 SHMMNI=整 ...
PostgreSQL 参数调整(性能优化)
昨天分别在外网和无外网环境下安装PostgreSQL,有外网环境下安装的相当顺利.但是在无外网环境下就是两个不同的概念了,可谓十有八折.感兴趣的同学可以搭建一下. PostgreSQL安装完成后第一件 ...

随机推荐

archlinux xfce 修改用户主目录名称
操作有风险,修改用户主目录名称后一些链接了旧主目录的的链接可能仍未修改.导致链接用不了,需要手动指定链接 1.删除指定用户保存的会话,未删除应该会导致修改用户主目录名称后进不去会话 2.切换到其它用户 ...
Scala 传名参数和传值参数
1 package com.atguigu.chapter04 2 3 object ControlAbstraction { 4 def main(args: Array[String]): Uni ...
C++设计模式 - 解析器模式（Interpreter）
领域规则模式在特定领域中,某些变化虽然频繁,但可以抽象为某种规则.这时候,结合特定领域,将问题抽象为语法规则,从而给出在该领域下的一般性解决方案. 典型模式 Interpreter Interpre ...
System.gc 之后到底发生了什么？
本文基于 OpenJDK17 进行讨论在 JDK NIO 针对堆外内存的分配场景中,我们经常会看到 System.gc 的身影,比如当我们通过 FileChannel#map 对文件进行内存映射的时 ...
#KD-Tree，替罪羊树#洛谷 6224 [BJWC2014]数据
题目平面上有 \(N\) 个点.需要实现以下三种操作: 在点集里添加一个点: 给出一个点,查询它到点集里所有点的曼哈顿距离的最小值: 给出一个点,查询它到点集里所有点的曼哈顿距离的最大值. 分析用 ...
Matplotlib绘图设置---颜色条设置
设置颜色条对于图形中由彩色的点.线.面构成的连续标签,用颜色条来表示的效果比较好,在Matplotlib中,颜色条是一个独立的坐标轴. 可视图形的颜色选择可参考matplotlib配色方案. Cho ...
Stable diffusion 初学者指南
1. Stable diffusion 初学者指南想掌握Stable Diffusion AI技术吗? 这份初学者指南专为完全没接触过Stable Diffusion或任何AI图像生成器的新手设计. ...
TeamViewer 9发布－在Linux下安装运行
TeamViewer 9发布-在Linux下安装运行来源:Linux中国作者:未知关注我们: 这篇指南介绍了怎么样在 RedHat. CentOS. Fedora 和 Debian. U ...
c# semaphoreSlim限制线程数
前言我们在使用线程的时候,如果多个线程数去访问一个资源的时候,那么是非常影响程序的运行的,因为如果有写的操作,那么需要写锁,那么线程都会堵在同一个地方,那么我们可以限制一下访问一个资源的线程数. 正 ...
搞定了 6 种分布式ID，分库分表哪个适合做主键？
大家好,我是小富- 本文是<ShardingSphere5.x分库分表原理与实战>系列的第七篇,目前系列的前几篇制作成了PDF,需要的可以在文末获取下载方式,持续更新中.今天咱们继续一起来 ...

Lora训练的参数和性能

Lora训练的参数和性能的更多相关文章

随机推荐

热门专题