#机器学习# 文章列表浅入浅出：PageRank算法使用 TextRank 算法为文本生成关键字和摘要基于物品的协同过滤如何使用MapReduce实现基于物品的协同过滤（1）如何使用MapReduce实现基于物品的协同过滤（2）浅入浅出：K近邻算法使用mahout下的朴素贝叶斯分类器对新闻分类使用Affinity Propagation进行聚类 K-medoids聚类矩阵分解在推荐系统中的应用：NMF和经典SVD实战使用特征递归消除筛选特征如何分配权重比较NMF、PCA和VQ 方差和协方差基于SVD的协同过滤逻辑斯谛回归代码实现隐语义模型和NMF（非负矩阵分解）使用PCA处理MNIST数据集使用GBDT选取特征基于贝叶斯的文本分类系统的数据库设计在hadoop1.2.1上安装mahout 0.9 Hadoop 2.4 实现Kmeans聚类算法在Iris数据集上对比PCA、LDA、NMF 基于贝叶斯的文本分类实战单层决策树 Logistic regression（逻辑斯蒂回归）基于用户的协同过滤词袋模型与文档-词矩阵如何实现拼音与汉字的互相转换梯度下降法如何判定相似度 MovieLens数据集介绍基于KNN的文本分类实战 Jasper文本分类系列博客阅读摘录使用 Mean Shift进行聚类朴素贝叶斯的三个常用模型：高斯、多项式、伯努利使用决策树处理iris数据集浅入浅出：从Kmeans到Kmeans++ 如何持久化scikit-learn中训练好的模型浅入浅出：DBSCAN聚类算法（1）浅入浅出：DBSCAN聚类算法（2） 2015阿里移动推荐算法比赛第一赛季总结爬山算法使用朴素贝叶斯分类器划分邮件层次聚类基于MapReduce的频繁项集挖掘搜狗实体关系提取比赛

使用 Mean Shift进行聚类

2014-09-20

Mean Shift，可以翻译为均值漂移。

假设在一个多维空间中有很多数据点需要进行聚类，Mean Shift的过程如下：

1、在未被分类的数据点中随机选择一个点作为中心center；

2、找出离center距离在bandwidth之内的所有点，记做集合M，认为这些点属于簇c。

3、以center为中心点，计算从center开始到集合M中每个元素的向量，将这些向量相加，得到向量shift。

4、center = center+shift。即center沿着shift的方向移动，移动距离是||shift||。

5、重复步骤2、3、4，直到shift的大小很小（就是迭代到收敛），记住此时的center。注意，这个迭代过程中遇到的点都应该归类到簇c。如果收敛时的center已经被归类到c2，那么把c2和c合并。

6、重复1、2、3、4、5直到所有的点都被归类。

简单的说，mean shift就是沿着密度上升的方向寻找同属一个簇的数据点。

上面的算法只是mean shift的基础算法，现在已经对其进行了拓展，用于图像处理等领域。

在Mean Shift Clustering给出了mean shift的matlab代码。

Meanshift，聚类算法讲meanshift在图像处理中的应用。

Mean Shift: A Robust Approach Toward Feature Space Analysis是关于mean shift的一篇重要论文。

Mean Shift Clustering非常简要地介绍了mean shift。

( 本文完 )