聊聊GLM-4-9B开源模型的微调loss计算

概述

Github官方地址：GLM-4

网上已经有很多关于微调的文章，介绍各种方式下的使用，这里不会赘述。我个人比较关心的是微调时的loss计算逻辑，这点在很多的文章都不会有相关的描述，因为大多数人都是关心如何使用之类的应用层，而不是其具体的底层逻辑，当然咱也说不清太底层的计算。

可了解其它loss计算的文章：

再聊多轮对话微调训练格式与长序列训练

 聊聊ChatGLM2与ChatGLM3微调多轮对话的设计逻辑及源码分析

 聊聊大模型多轮对话的训练及优化

微调

微调格式：

[

  {

    "messages": [

      {

        "role": "system",

        "content": "<system prompt text>",

        "tools": [

          {

            "name": "<tool name>",

            "args": {

              "<arg name>": "<arg value>"

            }

          }

        ]

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      },

      {

        "role": "observation",

        "content": "<observation prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response observation>"

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      }

    ]

  }

]

微调源码地址：finetune.py

Loss计算代码：

def process_batch(

        batch: Mapping[str, Sequence],

        tokenizer: PreTrainedTokenizer,

        max_input_length: int,

        max_output_length: int,

) -> dict[str, list]:

    batched_conv = batch['messages']

    batched_input_ids = []

    batched_labels = []

    # batched_conv 是一个数组

    # conv 是数组内的单个 message

    for conv in batched_conv:

        input_ids = [151331, 151333]

        loss_masks = [False, False]

        # conv 是数组内的单个 message

        # message 是 单个role json对象

        for message in conv:

            message = process_message(message)

            # 设置 mask 掩码，只有system,user,observation不参与mask计算，其余的角色参与计算

            loss_mask_val = False if message['role'] in ('system', 'user', 'observation') else True

            # 获取 input 文本的数字表示(ids)

            new_input_ids = tokenizer.apply_chat_template([message], tokenize=True, return_dict=False)[0][2:]

            # 计算整句的 mask

            new_loss_masks = [loss_mask_val] * len(new_input_ids)

            # 拼接message中的每段json

            input_ids += new_input_ids

            # 拼接message中每段json对应的mask

            loss_masks += new_loss_masks

        # 追加结尾的 token id

        input_ids.append(tokenizer.eos_token_id)

        loss_masks = [False, *loss_masks]

        labels = []

        for input_id, mask in zip(input_ids, loss_masks):

            if mask:

                # 添加到label,计算loss

                labels.append(input_id)

            else:

                # -100 不处理，即ignore_index

                labels.append(-100)

        max_length = max_input_length + max_output_length + 1

        # 截断

        batched_input_ids.append(input_ids[:max_length])

        batched_labels.append(labels[:max_length])

    return {'input_ids': batched_input_ids, 'labels': batched_labels}

注释在代码中已经写明。process_batch方法用于将输入转换为ids，并计算mask（用于Loss计算）。而该方法的调用是在数据集的遍历处理中，即如下所示：

tokenizer, model = load_tokenizer_and_model(model_dir, peft_config=ft_config.peft_config)

data_manager = DataManager(data_dir, ft_config.data_config)

# 数据集拆分遍历

train_dataset = data_manager.get_dataset(

    Split.TRAIN,

    functools.partial(

        process_batch,

        tokenizer=tokenizer,

        max_input_length=ft_config.max_input_length,

        max_output_length=ft_config.max_output_length,

    ),

    batched=True,

)

print('train_dataset:', train_dataset)

Loss计算如下图所示：

总结

相比较于之前的ChatGLM版本，GLM4开源版本的多轮对话loss计算更恰当且效率也会更高；在其它的开源模型/微调框架中早已支持该种loss计算，如InternLM、XTuner、Firefly等。对于loss格式的类别，可参考XTuner的官方文档说明：dataset_format.md。

更多大模型相关的文章，请上个人公众号查阅：

聊聊GLM-4-9B开源模型的微调loss计算的更多相关文章

GoogLeNet模型的微调
我从零开始训练了GoogLeNet模型. 但它没有给我带来希望的结果. 作为替代,我想对我的数据集中的GoogLeNet模型进行微调. 有谁知道我应该遵循什么步骤? 采纳答案: 假设你正在尝试做图像分 ...
R语言广义线性模型(GLM)、全子集回归模型选择、检验分析全国风向气候数据|附代码数据
全文链接:http://tecdat.cn/?p=30914 最近我们被客户要求撰写关于广义线性模型(GLM)的研究报告,包括一些图形和统计输出. 我们正和一位朋友讨论如何在R软件中用GLM模型处理全 ...
从开源模型、框架到自研，声网 Web 端虚拟背景算法正式发布
根据研究发现,在平均 38 分钟的视频会议里面,大概会有 13 分钟左右的时间用于处理和干扰相关的事情.同时研究也表明在参加在线会议的时候,人们更加倾向于语音会议,其中一个关键原因就是大家不希望个人隐 ...
[深度学习] 经典深度学习模型及其微调（Caffe）总结
目录经典模型 Caffe预训练模型经典模型 LeNet https://blog.csdn.net/kaido0/article/details/53161684 AlexNet https:// ...
LSF-SCNN：一种基于 CNN 的短文本表达模型及相似度计算的全新优化模型
欢迎大家前往腾讯云社区,获取更多腾讯海量技术实践干货哦~ 本篇文章是我在读期间,对自然语言处理中的文本相似度问题研究取得的一点小成果.如果你对自然语言处理 (natural language proc ...
[Pytorch]深度模型的显存计算以及优化
原文链接:https://oldpan.me/archives/how-to-calculate-gpu-memory 前言亲,显存炸了,你的显卡快冒烟了! torch.FatalError: cu ...
聊聊GIS中的坐标系|再版详细定义、计算及高程系统
本篇讲坐标系统的详细定义,有关坐标系的变换公式,以及简单说说高程坐标系统. 本文约6000字,阅读时间建议45分钟.硬内容比较多,如有疏漏错误请指出,建议有兴趣的朋友进一步阅读. 作者:博客园/B站/ ...
css盒模型宽高混合计算calc
例如: .element{ width:calc(expression); } 兼容性:在IE9+.FF4.0+.Chrome19+.Safari6+都得到了较好支持,但是在移动端的支持不是很好. 其 ...
DL开源框架Caffe | 模型微调（finetune）的场景、问题、技巧以及解决方案
转自:http://blog.csdn.net/u010402786/article/details/70141261 前言什么是模型的微调? 使用别人训练好的网络模型进行训练,前提是必须和别人 ...
聊聊同步、异步、阻塞、非阻塞以及IO模型
前言在使用Netty改造手写RPC框架的时候,需要给大家介绍一些相关的知识,这样很多东西大家就可以看明白了,手写RPC是一个支线任务,后续重点仍然是Kubernetes相关内容. 阻塞与非阻塞同步 ...

随机推荐

首次公开！阿里云开源PolarDB总体架构和企业级特性
简介:在3月2日的阿里云开源 PolarDB 企业级架构发布会上,阿里云 PolarDB 内核技术专家北侠带来了主题为<PolarDB 总体架构设计和企业级特性>的精彩演讲. 在3月2日 ...
【全观测系列】Elasticsearch应用性能监控最佳实践
简介:本文介绍了应用性能监控的应用价值以及解决方案等. 1.什么是全观测? 要了解全观测,我们先看看传统运维存在哪些问题. 数据孤岛,分散在不同部门,分析排查故障困难: 多个厂商的多种工具,无法自动 ...
LlamaIndex 起步教程（本地模型）
提示:确保您已先按照自定义安装步骤操作. 这是一个著名的"五行代码"起步示例,使用本地 LLM(大语言模型)和嵌入模型.我们将使用 BAAI/bge-small-en-v1.5 作 ...
[FE] Quasar BEX 所有位置类型 types
科普:[FE] Quasar BEX 预览版指南 New Tab Quasar BEX 的默认类型是 New Tab,在新 tab 栏里打开内容. Dev Tools 也就是在开发者栏里面的内容. O ...
[Py] Python 的 shape、reshape 含义与用法
shape 方法用于查看数据是几行几列的. reshape 方法用于不更改数据的情况下,重新把数据进行规划成指定的行数和列数. .reshape(-1, 1) -1 表示自动,1 表示整理成 1 列 ...
2018-8-10-C＃-字符串首字符大写
title author date CreateTime categories C# 字符串首字符大写 lindexi 2018-08-10 19:16:52 +0800 2018-2-13 17:2 ...
数据表删除DROP TRUNCATE DELETE区别
总的来说,DROP 用于删除整个数据库对象(表结构和数据全部删除),DELETE 用于删除表中的数据,而 TRUNCATE 也是删除表中的数据,但比 DELETE 更快,且无法指定条件删除.根据需求, ...
sendmail发送慢的问题
1.使用python的脚本,发送邮件.代码如下: 点击查看代码 [root@ZabbixServerMasterNode ~]# cd /etc/zabbix/alertscripts/ [root@ ...
postgresql的insert语句中进行判断，数据已有则更新，数据没有则插入
INSERT 操作 INSERT INTO table_name (column1, column2, ...) VALUES (value1, value2, ...); 下面是一个示例: INSE ...
openssl 生成多域名多IP 的数字证书
openssl.cnf 文件内容: [req] default_bits = 2048 distinguished_name = req_distinguished_name copy_extensi ...

聊聊GLM-4-9B开源模型的微调loss计算

概述

微调

总结

聊聊GLM-4-9B开源模型的微调loss计算的更多相关文章

随机推荐

热门专题