float16与float32转换

// based on https://gist.github.com/martin-kallman/5049614

// float32

// Martin Kallman

//

// Fast half-precision to single-precision floating point conversion

//  - Supports signed zero and denormals-as-zero (DAZ)

//  - Does not support infinities or NaN

//  - Few, partially pipelinable, non-branching instructions,

//  - Core opreations ~6 clock cycles on modern x86-64

void float32(float *__restrict out, const uint16_t in) {

    uint32_t t1;

    uint32_t t2;

    uint32_t t3;

    t1 = in & 0x7fffu;                       // Non-sign bits

    t2 = in & 0x8000u;                       // Sign bit

    t3 = in & 0x7c00u;                       // Exponent

    t1 <<= 13u;                              // Align mantissa on MSB

    t2 <<= 16u;                              // Shift sign bit into position

    t1 += 0x38000000;                       // Adjust bias

    t1 = (t3 == 0 ? 0 : t1);                // Denormals-as-zero

    t1 |= t2;                               // Re-insert sign bit

    *((uint32_t *) out) = t1;

};

// float16

// Martin Kallman

//

// Fast single-precision to half-precision floating point conversion

//  - Supports signed zero, denormals-as-zero (DAZ), flush-to-zero (FTZ),

//    clamp-to-max

//  - Does not support infinities or NaN

//  - Few, partially pipelinable, non-branching instructions,

//  - Core opreations ~10 clock cycles on modern x86-64

void float16(uint16_t *__restrict out, const float in) {

    uint32_t inu = *((uint32_t * ) & in);

    uint32_t t1;

    uint32_t t2;

    uint32_t t3;

    t1 = inu & 0x7fffffffu;                 // Non-sign bits

    t2 = inu & 0x80000000u;                 // Sign bit

    t3 = inu & 0x7f800000u;                 // Exponent

    t1 >>= 13u;                             // Align mantissa on MSB

    t2 >>= 16u;                             // Shift sign bit into position

    t1 -= 0x1c000;                         // Adjust bias

    t1 = (t3 < 0x38800000u) ? 0 : t1;       // Flush-to-zero

    t1 = (t3 > 0x8e000000u) ? 0x7bff : t1;  // Clamp-to-max

    t1 = (t3 == 0 ? 0 : t1);               // Denormals-as-zero

    t1 |= t2;                              // Re-insert sign bit

    *((uint16_t *) out) = t1;

};

#define ABS(A) ((A) >= 0 ? (A) : -(A))

int main() {

    float original = -42.42f;

    uint16_t small = 0;

    float16(&small, original);

    float quantized = 0.0f;

    float32(&quantized, small);

    float diff = ABS(original - quantized);

    printf("orig %f quantized %f absdiff %f\n", original, quantized, diff);

    assert(diff < 0.1f);

}

引用

float16 to float32

float16与float32转换的更多相关文章

OpenCL中的half与float的转换
在kernel中使用half类型可以在牺牲一定精度的代价下来提升运算速度. 在kernel中, 可以比较方便的对half数据进行计算, 但在host上的, 对half的使用就没那么方便了. 查看cl_ ...
[TF] Architecture - Computational Graphs
阅读笔记: 仅希望对底层有一定必要的感性认识,包括一些基本核心概念. Here只关注Graph相关,因为对编程有益. TF – Kernels模块部分参见:https://mp.weixin.qq.c ...
tenaorflow函数（1）
TensorFlow 将图形定义转换成分布式执行的操作, 以充分利用可用的计算资源(如 CPU 或 GPU.一般你不需要显式指定使用 CPU 还是 GPU, TensorFlow 能自动检测.如果检测 ...
Tensorflow的基本概念与常用函数
Tensorflow一些常用基本概念与函数(一) 1.tensorflow的基本运作为了快速的熟悉TensorFlow编程,下面从一段简单的代码开始: import tensorflow as tf ...
tensorflow和python操作中的笔记
前一段时间做了一些项目,把一些笔记放在了txt中,现分享出来,自己也能够时长预习. 1) 读取文件时,将固定的文件地址,采用数组或者字符串的形式,提前表示出来,后期使用时候采用拼接操作 2) # 得到 ...
Tensorflow一些常用基本概念与函数（二）
1.tensorflow的基本运作为了快速的熟悉TensorFlow编程,下面从一段简单的代码开始: import tensorflow as tf #定义‘符号’变量,也称为占位符 a = tf. ...
Numpy的ndarry：一种多维数组对象
Numpy的ndarry:一种多维数组对象 Numpy最重要的一个特点就是其N维数组对象(即ndarry),该对象是一个快速而灵活的大数据集容器.你可以利用这种数组对整块数据执行一些数学运算,其语法跟 ...
Numpy的ndarry
Numpy的ndarry:一种多维数组对象 Numpy最重要的一个特点就是其N维数组对象(即ndarry),该对象是一个快速而灵活的大数据集容器.你可以利用这种数组对整块数据执行一些数学运算,其语法跟 ...
利用Python进行数据分析_Numpy_基础_2
Numpy数据类型包括: int8.uint8.int16.uint16.int32.uint32.int64.uint64.float16.float32.float64.float128.co ...
实操 | 内存占用减少高达90%，还不用升级硬件？没错，这篇文章教你妙用Pandas轻松处理大规模数据
注:Pandas(Python Data Analysis Library) 是基于 NumPy 的一种工具,该工具是为了解决数据分析任务而创建的.此外,Pandas 纳入了大量库和一些标准的数据模型 ...

随机推荐

Linux_etc-shadow文件总结
shadow 文件权限 $ll shadow ---------- 1 root root 1131 Aug 6 12:04 shadow 可以看出只有root可以操作它,普通用户执行passwd,内 ...
LFS（Linux From Scratch）构建过程全记录（六）：交叉编译临时工具
写在前面本章将展示如何使用刚刚构建的跨工具链来交叉编译基本实用程序. M4安装和前文一样,先进行解压,然后cd进入注意:不需要构建build文件夹,直接输入以下配置文件 ./configure ...
华南理工大学 Python第7章课后小测-2
1.(单选)以下选项中使Python脚本程序转变为可执行程序的第三方库的是(本题分数:3)A) NetworkxB) pyinstallC) RequestsD) PyPDF2您的答案:B 正确率: ...
Pytest fixture及conftest详解
前言 fixture是在测试函数运行前后,由pytest执行的外壳函数.fixture中的代码可以定制,满足多变的测试需求,包括定义传入测试中的数据集.配置测试前系统的初始状态.为批量测试提供数据源等 ...
Netty内存池的整体架构
一.为什么要实现内存管理? Netty 作为底层网络通信框架,网络IO读写必定是非常频繁的操作,考虑到更高效的网络传输性能,堆外内存DirectByteBuffer必然是最合适的选择.堆外内存在 JV ...
【学习笔记】第05章 pandas入门
前言上一篇学习中学成的随笔是我的第一篇随笔,撰写中有颇多不足,比如事无巨细的写入学习过程反而像是在抄书,失去了很多可读性也不利于自己反过头来复习,本章节学习需要多加注意,尽量写下较为关键的内容,犯下 ...
视频结构化 AI 推理流程
「视频结构化」是一种 AI 落地的工程化实现,目的是把 AI 模型推理流程能够一般化.它输入视频,输出结构化数据,将结果给到业务系统去形成某些行业的解决方案. 换个角度,如果你想用摄像头来实现某些智能 ...
第六章：Django 综合篇
前面五章,已经将Django最主要的五大系统介绍完毕,除了这些主要章节,还有很多比较重要的内容,比如开发流程相关.安全.本地化与国际化.常见工具和一些框架核心功能.这些内容的篇幅都不大,但整合起来也是 ...
动态存储管理实战：GlusterFS
文件转载自:https://www.orchome.com/1284 本节以GlusterFS为例,从定义StorageClass.创建GlusterFS和Heketi服务.用户申请PVC到创建Pod ...
Python离线安装Flask
受限于内网,无法使用pip install Flask直接安装. 以Flask-0.12.2为例安装Flask需要以下的依赖性,在安装Flask离线版时可以看到依赖性要求. 离线安装文件地址: ht ...

float16与float32转换

float16与float32转换的更多相关文章

随机推荐

热门专题