掌握Spark机器学习库(课程目录)
第1章 初识机器学习
在本章中将带领大家概要了解什么是机器学习、机器学习在当前有哪些典型应用、机器学习的核心思想、常用的框架有哪些,该如何进行选型等相关问题。
- 1-1 导学
- 1-2 机器学习概述
- 1-3 机器学习核心思想
- 1-4 机器学习的框架与选型..
第2章 初识MLlib
本章中,将介绍Spark的机器学习库,对比Spark当前两种机器学习库(MLLib/ML)的区别,同时介绍Spark机器学习库的应用场景以及行业应用优势。
- 2-1 MLlib概述
- 2-2 MLlib的数据结构
- 2-3 MLlib与ml
- 2-4 MLlib的应用场景
第3章 实战环境搭建
本章中,将介绍如何进行实战环境搭建。包括如何完成Spark环境安装配置、如何通过Spark Shell进行编程,并通过 Wordcount 入门程序,完成部署和测试。
- 3-1 Spark环境安装
- 3-2 Spark配置若干要点
- 3-3 学习Spark shell
- 3-4 实战Wordcount
第4章 数据可视化
本章中,将对数据可视化进行介绍,告诉大家什么是数据可视化,我们通过数据可视化能对大数据系统起到怎样的作用,并结合 Echars 介绍了如何实现常见的数据可视化图表(折线图、柱状图、散点图)。
- 4-1 数据可视化的作用及常用方法
- 4-2 初识Echarts
- 4-3 通过Echarts实现图表化数据展示
第5章 Spark的矩阵与向量
本章中,将讲解矩阵与向量的一些基本运算,并介绍Spark的矩阵与向量的操作,帮助数据基础薄弱的同学补齐短板。
- 5-1 矩阵与向量介绍
- 5-2 Spark中实践向量的使用
- 5-3 Spark中实践矩阵的使用
第6章 Spark基础统计模块
本章中,将概要介绍Spark的基础统计模块、简单的统计学知识、相关系数以及假设检验的知识,拓展大家的技术视野。
- 6-1 基础统计模块及常用统计学知识介绍
- 6-2 实战统计汇总
- 6-3 学习相关系数
- 6-4 学习假设检验
第7章 Spark实现回归算法
本章中,将讲解几种常见的回归算法,并以预测房价模型为例,教大家如何使用回归算法来实现简单的预测。
- 7-1 回归分析概述
- 7-2 线性回归算法概述
- 7-3 线性回归算法原理
- 7-4 最小二乘法
- 7-5 随机梯度下降
- 7-6 实战Spark预测房价---项目展示及代码概览
- 7-7 实战Spark预测房价---数据加载及转换
- 7-8 实战Spark预测房价--训练与预测
- 7-9 逻辑回归算法及原理概述
- 7-10 正则化原理
- 7-11 实战Spark逻辑回归
- 7-12 保序回归算法概述
- 7-13 保序回归算法原理
- 7-14 实战一个保序回归数据分析
第8章 Spark实现分类算法
本章中,将几种常见的分类算法,并结合鸢尾花数据集为例,讲解分类算法在Spark上的实践。同时,比较各种分类算法的区别,使大家能够合理选择应该使用的算法。
- 8-1 朴素贝叶斯算法及原理概述
- 8-2 实战朴素贝叶斯的分类
- 8-3 支持向量机概述
- 8-4 实战基于SVM的分类
- 8-5 决策树算法及原理概述
- 8-6 实战基于决策树的分类--案例1
- 8-7 实战基于决策树的分类--案例2
- 8-8 本章小结
- 8-9 关于数据归一化的介绍
第9章 Spark实现聚类算法
本章中,将介绍聚类算法,并通过比较聚类算法与分类算法的区别,帮助大家了解聚类算法的内在含义。此处,仍然使用鸢尾花数据集应用聚类算法进行分析,便于大家对比发现聚类算法与分类算法的区别与联系,以便于后期灵活运用。...
- 9-1 Kmeans算法概述
- 9-2 Kmeans算法原理
- 9-3 Kmeans算法实战
- 9-4 LDA算法概述
- 9-5 LDA算法原理
- 9-6 LDA算法实践
- 9-7 本章小结
第10章 Spark实现降维
本章中,将通过讲解PCA算法的原理,使大家明白降维算法的大致原理,以及能够实现怎么样的功能。结合应用降维算法在分类算法使用之前进行预处理的实践,帮助大家体会算法的作用。
- 10-1 PCA算法及原理概述
- 10-2 实战PCA算法实现降维
- 10-3 本章小结
第11章 Spark实践文本情感分类
本章中,将结合前述知识进行综合实战,以达到所学即所用。文本情感分类这个项目会将分类算法、文本特征提取算法等进行关联,使大家能够对Spark的具体应用有一个整体的感知与了解。
- 11-1 项目总体概况
- 11-2 数据集概述
- 11-3 数据预处理
- 11-4 文本特征提取
- 11-5 训练分类模型
- 11-6 本章小结
第12章 Spark实践推荐系统
本章中,将结合前述知识进行综合实战,以达到所学即所用。在推荐系统项目中,讲解了推荐系统基本原理以及实现推荐系统的架构思路,有其他相关研发经验基础的同学可以结合以往的经验,实现自己的推荐系统。
掌握Spark机器学习库(课程目录)的更多相关文章
- Spark机器学习库(MLlib)官方指南手册中文版
中文https://blog.csdn.net/liulingyuan6/article/details/53582300 https://yq.aliyun.com/articles/608083 ...
- 掌握Spark机器学习库-07.6-线性回归实现房价预测
数据集 house.csv 数据概览 代码 package org.apache.spark.examples.examplesforml import org.apache.spark.ml.fea ...
- 掌握Spark机器学习库-09.6-LDA算法
数据集 iris.data 数据集概览 代码 package org.apache.spark.examples.examplesforml import org.apache.spark.ml.cl ...
- 掌握Spark机器学习库-09.3-kmeans算法实现分类
数据集 iris.data 数据集概览 代码 package org.apache.spark.examples.hust.hml.examplesforml import org.apache.s ...
- 掌握Spark机器学习库-08.7-决策树算法实现分类
数据集 iris.data 数据集概览 代码 package org.apache.spark.examples.examplesforml import org.apache.spark.Spark ...
- 掌握Spark机器学习库-08.2-朴素贝叶斯算法
数据集 iris.data 数据集概览 代码 import org.apache.spark.SparkConf import org.apache.spark.ml.classification.{ ...
- 掌握Spark机器学习库-07.14-保序回归算法实现房价预测
数据集 house.csv 数据集概览 代码 package org.apache.spark.examples.examplesforml import org.apache.spark.ml.cl ...
- 掌握Spark机器学习库-07-回归算法原理
1)机器学习模型理解 统计学习,神经网络 2)预测结果的衡量 代价函数(cost function).损失函数(loss function) 3)线性回归是监督学习
- 掌握Spark机器学习库-07-回归分析概述
1)回归与分类算法的区别 回归的预测结果是连续的,分类的预测结果是离散的. 2)spark实现的回归算法有: 3)通过相关系数衡量线性关系的程度
随机推荐
- 【leetcode】Word Break(python)
思路是这种.我们从第一个字符開始向后依次找,直到找到一个断句的地方,使得当前获得的子串在dict中,若找到最后都没找到.那么就是False了. 在找到第一个后,接下来找下一个断句处,当然是从第一个断句 ...
- LiveWriter插入高亮代码插件介绍 基于SyntaxHighighter
Codeint main() { int i; printf("%d",i); } 插件介绍 辛苦了两人小时写日志不小心浏览器崩溃了,发誓以后一定记得用Word先写好. 将Word ...
- 鉴权应用服务器 app客户端 web服务端 安全令牌(SecurityToken)、临时访问密钥(AccessKeyId, AccessKeySecret)
设置EndPoint和凭证 移动终端是一个不受信任的环境,把AccessKeyId和AccessKeySecret直接保存在终端用来加签请求,存在极高的风险.建议只在测试时使用明文设置模式,业务应用推 ...
- Navicat 提示Cannot create oci environment 解决方案
一直在使用 Navicat ,这是一个数据库客户端软件,能连接多种不同类型的数据库,给我们的日常的工作带来了不少的便捷.当Navicat 就莫名其妙的不能连接 oracle 数据库了.总是提示如下错误 ...
- mysql15--垂直分表水平分表
分表技术(表的结构不能变) 分表技术有(水平分割和垂直分割) 当一张越来越大时候,即使添加索引还慢的话,我们可以使用分表 以qq用户表来具体的说明一下分表的操作. 思路如图 : 首先我创建三张表 u ...
- 使用PXE安装CentOS7
1.环境 本文使用VMware 虚拟机进行实验. 点击VMware--编辑--虚拟网络编辑器,新建VMnet15,选择仅主机模式,取消勾选DHCP服务(因为这里使用自己的DHCP服务).我这里配好后是 ...
- JavaScript 在浏览器环境中的模块管理
如果需要,请自行复制下或下载列代码清单到本地运行(如果不修改源码,这些文件需要在同一目录 ,并且以下列文件名对应) 我只在Chrome浏览器中调试过(现在也没去处理浏览器兼容方面的问题)1. 代码/ ...
- bzoj4881 线段游戏——上升序列方案数
题目:https://www.lydsy.com/JudgeOnline/problem.php?id=4881 连题意都转化不了了... 题意是要求从一个数列中选出两个上升序列的方案数: 先判断是否 ...
- bzoj4631
4631: 踩气球 Time Limit: 10 Sec Memory Limit: 256 MBSubmit: 260 Solved: 133[Submit][Status][Discuss] ...
- UI:网络请求
JSON 外层是一个数组或者字典 富文本(相对来说比较安全).超文本,https安全超文本协议 NSURL NSURL *url = [[NSURL alloc]initWithString:@&qu ...