简单的算法示例

数据

x = np.random.uniform(-3,3,100)

X = x.reshape(-1,1)

y = x * 2 + 5 + np.random.normal(0, 1, 100)

BGD

批量梯度下降法的简单实现：

def gradient_descent(X_b, y, initial_theta, eta, n_iters=1e4, epsilon=1e-8):

    def J(theta):

        return np.mean((X_b.dot(theta) - y) ** 2)

    def dj(theta):

        return X_b.T.dot((X_b.dot(theta) - y)) * (2 / len(y))

    theta = initial_theta

    for i in range(1, int(n_iters)):

        gradient = dj(theta)                   # 获得梯度

        last_theta = theta

        theta = theta - eta * gradient    # 迭代梯度

        if np.absolute(J(theta) - J(last_theta)) < epsilon:

            break                         # 满足条件就跳出

    return theta

结果是：

X_b = np.hstack([np.ones((len(y), 1)), X])

initial_theta = np.ones(X_b.shape[1])

eta = 0.1

%time s_gradient_descent(X_b, y, initial_theta, eta, n_iters=1)

## array([4.72619109, 3.08239321])

SGD

这里n_iters表示将所有数据迭代的轮数。

def s_gradient_descent(X_b, y, initial_theta, eta, batch_size=10, n_iters=10, epsilon=1e-8):

    def J(theta):

        return np.mean((X_b.dot(theta) - y) ** 2)

    # 这是随机梯度下降的，随机一个样本的梯度

    def dj_sgd(X_b_i, y_i, theta):

        # return X_b.T.dot((X_b.dot(theta) - y)) * (2 / len(y))

        return 2 * X_b_i.T.dot(X_b_i.dot(theta) - y_i)

    theta = initial_theta

    for i in range(0, int(n_iters)):

        for j in range(batch_size, len(y), batch_size):

            gradient = dj_sgd(X_b[j,:], y[j], theta)

            last_theta = theta

            theta = theta - eta * gradient         # 迭代梯度

            if np.absolute(J(theta) - J(last_theta)) < epsilon:

                break                              # 满足条件就跳出

    return theta

结果是：

X_b = np.hstack([np.ones((len(y), 1)), X])

initial_theta = np.ones(X_b.shape[1])

eta = 0.1

%time s_gradient_descent(X_b, y, initial_theta, eta, n_iters=1)

## array([4.72619109, 3.08239321])

MBGD

在随机梯度下降的基础上，对dj做了一点点修改，batch_size指定批量的大小，dj每次计算batch_size个样本的梯度并取平均值。

不得不说，同样是迭代一轮数据，小批量梯度下降法的准确度要比随机梯度下降法高多了。

def b_gradient_descent(X_b, y, initial_theta, eta, batch_size=10, n_iters=10, epsilon=1e-8):

    def J(theta):

        return np.mean((X_b.dot(theta) - y) ** 2)

    # 这是小批量梯度下降的，随机一个样本的梯度

    def dj_bgd(X_b_b, y_b, theta):

        # return X_b.T.dot((X_b.dot(theta) - y)) * (2 / len(y))

        return X_b_b.T.dot(X_b_b.dot(theta) - y_b) * (2 / len(y_b))

    theta = initial_theta

    for i in range(0, int(n_iters)):

        for j in range(batch_size, len(y), batch_size):

            gradient = dj_bgd(X_b[j-batch_size:j,:], y[j-batch_size:j], theta)

            last_theta = theta

            theta = theta - eta * gradient         # 迭代梯度

            if np.absolute(J(theta) - J(last_theta)) < epsilon:

                break                              # 满足条件就跳出

    return theta

结果是：

X_b = np.hstack([np.ones((len(y), 1)), X])

initial_theta = np.ones(X_b.shape[1])

eta = 0.1

%time b_gradient_descent(X_b, y, initial_theta, eta, n_iters=1)

array([4.4649369 , 2.27164876])

三种梯度下降法的对比(BGD & SGD & MBGD)的更多相关文章

三种梯度下降算法的区别(BGD, SGD, MBGD)
前言我们在训练网络的时候经常会设置 batch_size,这个 batch_size 究竟是做什么用的,一万张图的数据集,应该设置为多大呢,设置为 1.10.100 或者是 10000 究竟有什么区 ...
各种优化器对比--BGD/SGD/MBGD/MSGD/NAG/Adagrad/Adam
指数加权平均 (exponentially weighted averges) 先说一下指数加权平均, 公式如下: \[v_{t}=\beta v_{t-1}+(1-\beta) \theta_{t} ...
python笔记-20 django进阶（model与form、modelform对比，三种ajax方式的对比，随机验证码，kindeditor）
一.model深入 1.model的功能 1.1 创建数据库表 1.2 操作数据库表 1.3 数据库的增删改查操作 2.创建数据库表的单表操作 2.1 定义表对象 class xxx(models.M ...
iOS- NSThread/NSOperation/GCD 三种多线程技术的对比及实现
1.iOS的三种多线程技术 1.NSThread 每个NSThread对象对应一个线程,量级较轻(真正的多线程) 2.以下两点是苹果专门开发的“并发”技术,使得程序员可以不再去关心线程的具体使用问题 ...
iOS- NSThread/NSOperation/GCD 三种多线程技术的对比及实现 -- 转
1.iOS的三种多线程技术 1.NSThread 每个NSThread对象对应一个线程,量级较轻(真正的多线程) 2.以下两点是苹果专门开发的“并发”技术,使得程序员可以不再去关心线程的具体使用问题 ...
几种梯度下降方法对比（Batch gradient descent、Mini-batch gradient descent 和 stochastic gradient descent）
https://blog.csdn.net/u012328159/article/details/80252012 我们在训练神经网络模型时,最常用的就是梯度下降,这篇博客主要介绍下几种梯度下降的变种 ...
Dynamics CRM2016 查询数据的三种方式的性能对比
之前写过一个博客,对非声明验证方式下连接组织服务的两种方式的性能进行了对比,但当时只是对比了实例化组织服务的时间,并没有对查询数据的时间进行对比,那有朋友也在我的博客中留言了反映了查询的时间问题,一直 ...
两个Map的对比，三种方法，将对比结果写入文件。
三种方法的思维都是遍历一个map的Key,然后2个Map分别取这2个Key值所得到的Value. #第一种用entry private void compareMap(Map<String, S ...
java对象头信息和三种锁的性能对比
java头的信息分析首先为什么我要去研究java的对象头呢? 这里截取一张hotspot的源码当中的注释这张图换成可读的表格如下 |-------------------------------- ...

随机推荐

python金牌班第七周周末总结
python金牌班第七周周末总结面向对象前戏 1.我们在学习面相对像之前有一个推导过程如何将我们之前写的东西,从一串代码转向给对象服务. 2.实例我们首先模拟了两个物种进行战斗的场景,然后我们发现 ...
ASP.NET Core 6框架揭秘实例演示[34]：缓存整个响应内容
我们利用ASP.NET开发的大部分API都是为了对外提供资源,对于不易变化的资源内容,针对某个维度对其实施缓存可以很好地提供应用的性能.<内存缓存与分布式缓存的使用>介绍的两种缓存框架(本 ...
kubeadm部署k8s v1.19.4版本集群
1. 准备2台2c4g虚机配置地址192.168.198.144,192.168.198.146,一台作为master,一台作为node 2. 部署环境准备,每一台虚机都需要操作 # 关闭防火墙sy ...
7个自定义定时任务并发送消息至邮箱或企业微信案例（crontab和at）
前言更好熟悉掌握at.crontab定时自定义任务用法. 实验at.crontab定时自定义任务运用场景案例. 作业.笔记需要. 定时计划任务相关命令及配置文件简要说明 at 工具由包 at 提供 ...
Html飞机大战(二):面向对象绘制背景
好家伙, 我们为了后续工作的顺利进行,我试着把每一个模块封装为对象但冻手之前还是要构思一下我们把天空封装成一个类: 1.来搞一手简单的对象分析: 属性方面的都好理解来说明一下方法: (1) p ...
MySQL Workbench生成E-R图
因为做毕业设计文档,需要写ER图,故记录此篇第一步选择添加选择数据库一直next选择要生成的表再一直下一步就ok了
【读书笔记】C#高级编程第十三章异步编程
(一)异步编程的重要性使用异步编程,方法调用是在后台运行(通常在线程或任务的帮助下),并不会阻塞调用线程.有3中不同的异步编程模式:异步模式.基于事件的异步模式和新增加的基于任务的异步模式(TAP, ...
[python]-random模块-手动随机数
random模块通常用来生成随机数,结合time模块生成随机数的代码: import time import random random.seed(time.time()) x = random.ra ...
（数据科学学习手札142）dill：Python中增强版的pickle
本文示例代码已上传至我的Github仓库https://github.com/CNFeffery/DataScienceStudyNotes 1 简介大家好我是费老师,相信不少读者朋友们都在Pyth ...
VLAN的配置
1 vlan的概念和作用虚拟局域网(VLAN)是一组逻辑上的设备和用户,这些设备和用户并不受物理位置的限制,可以根据功能.部门等因素将它们组织起来.相互之间的通信就好像它们在同一个网段中一样. 虚拟 ...

三种梯度下降法的对比(BGD & SGD & MBGD)

简单的算法示例

数据

BGD

SGD

MBGD

三种梯度下降法的对比(BGD & SGD & MBGD)的更多相关文章

随机推荐

热门专题