[聚类算法] K-means 算法

Suckseedeva 2024-09-21 05:18:43 原文

聚类和 k-means简单概括。

聚类是一种 无监督学习 问题，它的目标就是基于 相似度 将相似的子集聚合在一起。
k-means算法是聚类分析中使用最广泛的算法之一。它把n个对象根据它们的属性分为k个聚类，以便使得所获得的聚类满足：

同一聚类中的对象相似度较高；而不同聚类中的对象相似度较小。

k - means的算法原理：

(文／qinm08（简书作者）原文链接：http://www.jianshu.com/p/32e895a940a2)

使用K-Means算法进行聚类，过程非常直观：
(a) 给定集合D，有n个样本点
(b) 随机指定两个点，作为两个子集的质心
(c) 根据样本点与两个质心的距离远近，将每个样本点划归最近质心所在的子集
(d) 对两个子集重新计算质心
(e) 根据新的质心，重复操作(c)
(f) 重复操作(d)和(e)，直至结果足够收敛或者不再变化

Python demo:

from sklearn.cluster import KMeans

model=KMeans(n_clusters=4,random_state=0)

X=[

 [50.0,50.0,9.0]

,[28.0, 9.0,4.0]

,[17.0,15.0,3.0]

,[25.0,40.0,5.0]

,[28.0,40.0,2.0]

,[50.0,50.0,1.0]

,[50.0,40.0,9.0]

,[50.0,40.0,9.0]

,[40.0,40.0,5.0]

,[50.0,50.0,9.0]

,[50.0,50.0,5.0]

,[50.0,50.0,9.0]

,[40.0,40.0,9.0]

,[40.0,32.0,17.0]

,[50.0,50.0,9.0]

]

model.fit(X)

for a in X:

    print(model.predict(a),a)

结果：

(array([1]), [50.0, 50.0, 9.0])

(array([2]), [28.0, 9.0, 4.0])

(array([2]), [17.0, 15.0, 3.0])

(array([3]), [25.0, 40.0, 5.0])

(array([3]), [28.0, 40.0, 2.0])

(array([1]), [50.0, 50.0, 1.0])

(array([0]), [50.0, 40.0, 9.0])

(array([0]), [50.0, 40.0, 9.0])

(array([0]), [40.0, 40.0, 5.0])

(array([1]), [50.0, 50.0, 9.0])

(array([1]), [50.0, 50.0, 5.0])

(array([1]), [50.0, 50.0, 9.0])

(array([0]), [40.0, 40.0, 9.0])

(array([0]), [40.0, 32.0, 17.0])

(array([1]), [50.0, 50.0, 9.0])

两个缺点：
1）初始聚类中心的个数需要事先给定，一般非常困难
2）初始聚类中心的选取很随机，可能导致非常不同的聚类效果

K-means++算法：

改进了2）初始聚类中心的选取
(a)从数据集中随机选择一个点，作为第一个中心C1
(b)计算所有点到离它最近的中心的距离D(x)，然后在此中心根据概率原则选择距离“比较大”的点作为下一个中心点。
SUM(D(x))*random(0,1)>SUM(D(xi) && SUM(D(x))*random(0,1)<SUM(D(xi-1)
(c)重复操作(b)直到找到k个中心点

缺点：
k个中心点，互相依赖，即内在的有序性。

[聚类算法] K-means 算法的更多相关文章

第4章最基础的分类算法-k近邻算法
思想极度简单应用数学知识少效果好(缺点?) 可以解释机器学习算法使用过程中的很多细节问题更完整的刻画机器学习应用的流程 distances = [] for x_train in X_train ...
聚类算法：K-means 算法(k均值算法)
k-means算法: 第一步:选$K$个初始聚类中心,$z_1(1),z_2(1),\cdots,z_k(1)$,其中括号内的序号为寻找聚类中心的迭代运算的次序号. 聚类中心的向量值可任意设 ...
分类算法----k近邻算法
K最近邻(k-Nearest Neighbor,KNN)分类算法,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一.该方法的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的 ...
机器学习(四) 机器学习(四) 分类算法--K近邻算法 KNN (下)
六.网格搜索与 K 邻近算法中更多的超参数七.数据归一化 Feature Scaling 解决方案:将所有的数据映射到同一尺度八.scikit-learn 中的 Scaler preprocess ...
机器学习(四) 分类算法--K近邻算法 KNN (上)
一.K近邻算法基础 KNN------- K近邻算法--------K-Nearest Neighbors 思想极度简单应用数学知识少 (近乎为零) 效果好(缺点?) 可以解释机器学习算法使用过程中 ...
python 机器学习（二）分类算法-k近邻算法
一.什么是K近邻算法? 定义: 如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别. 来源: KNN算法最早是由Cover和Hart提 ...
KNN 与 K - Means 算法比较
KNN K-Means 1.分类算法聚类算法 2.监督学习非监督学习 3.数据类型:喂给它的数据集是带label的数据,已经是完全正确的数据喂给它的数据集是无label的数据,是杂乱无章的,经过 ...
【机器学习】聚类算法——K均值算法（k-means）
一.聚类 1.基于划分的聚类:k-means.k-medoids(每个类别找一个样本来代表).Clarans 2.基于层次的聚类:(1)自底向上的凝聚方法,比如Agnes (2)自上而下的分裂方法,比 ...
分类算法——k最近邻算法（Python实现）（文末附工程源代码）
kNN算法原理 k最近邻(k-Nearest Neighbor)算法是比较简单的机器学习算法.它采用测量不同特征值之间的距离方法进行分类,思想很简单:如果一个样本在特征空间中的k个最近邻(最相似)的样 ...
【学习笔记】分类算法-k近邻算法
k-近邻算法采用测量不同特征值之间的距离来进行分类. 优点:精度高.对异常值不敏感.无数据输入假定缺点:计算复杂度高.空间复杂度高使用数据范围:数值型和标称型用例子来理解k-近邻算法电影可以按 ...

随机推荐

.NET Framework 中的所有类型
.NET Framework 中的所有类型不是值类型就是引用类型. 值类型是使用对象实际值来表示对象的数据类型. 如果向一个变量分配值类型的实例,则该变量将被赋以该值的全新副本. 引用类型是使用对对象 ...
MySQL Index详解
FROM:http://blog.csdn.net/tianmo2010/article/details/7930482 ①MySQL Index 一.SHOW INDEX会返回以下字段 1.Tabl ...
搜索引擎关键词劫持之asp篇
摘要:关键词劫持(黑帽seo)其实原理很简单:搜索引擎关键词劫持的过程实际上就是,修改肉鸡站点(webshell站点)A的首页(希望被搜索引擎收录的页面,一般情况下是首页),使之做出判断... 黑帽S ...
usb驱动开发16之设备生命线
回到struct usb_hcd,继续努力的往下看. kref,usb主机控制器的引用计数.struct usb_hcd也有自己专用的引用计数函数,看hcd.c文件. static void hcd_ ...
SharePoint 2013:自定义ECB菜单项的添加
本文分别介绍了两种常用的添加ECB菜单项的方式. 声明式创建这也是微软最佳实践推荐的方式.在VS中创建一个SharePoint空解决方案,并添加一个“空元素”类型的SPI. 在Elements.xm ...
LeetCode 01 Two Sum swift
class TwoSum { func sumTow(nums: [Int], target: Int)->[Int]{ ,]; ;x<nums.count;x++){ ;y<num ...
HP “云图”GPU虚拟化工作站解决方案
HP PCS ”云图”GPU虚拟化工作站解决方案 ——将图形计算从桌面移到数据中心惠普云图形GPU虚拟化桌面系统是以用户为中心的私有云服务.除了保留了传统桌面虚拟化方案以集中设备为中心统一管理等优点 ...
Word中的字体大小
Word中的字体大小(几号-几磅) Word对字体大小采用两种不同的度量单位,其中一种是以"号"为度量单位,如常用的"初号.小初.一号.小一--七号.八号" ...
ORA-28000: the account is locked-的解决办法
ORA-28000: the account is locked第一步:使用PL/SQL,登录名为system,数据库名称不变,选择类型的时候把Normal修改为Sysdba;第二步:选择myjob, ...
TF400916错误修复办法
在使用TFS作为研发过程管理工具的时候,如果调整了工作项的状态信息,可能会出现下面的错误: 要解决此问题非常简单: 1.找一台安装了VS2015程序的环境.因为我们使用的是TFS2015,所以需要对应 ...