本文记录官方note中比较新颖和有价值的观点(从反向传播开始) 一 反向传播 1 “反向传播是一个优美的局部过程.在整个计算线路图中,每个门单元都会得到一些输入并立即计算两个东西:1. 这个门的输出值,和2.其输出值关于输入值的局部梯度.门单元完成这两件事是完全独立的,它不需要知道计算线路中的其他细节.” 2 反向传播的编程中要学会分段计算,即在前向传播过程中把有用的中间变量缓存下来. 3 输入的大小对梯度有巨大影响,因此数据预处理很重要.例如乘法门会将大梯度分给小输入,小梯度分给大输入,因此当…