机器学习里的一些小概念

ML

机器学习里的一些小概念

轮廓系数

轮廓系数(Silhouette Coefficient),是聚类效果好坏的一种评价方式。最早由 Peter J. Rousseeuw 在 1986 提出。 它结合内聚度和分离度两种因素。可以用来在相同原始数据的基础上用来评价不同算法、或者算法不同运行方式对聚类结果所产生的影响。

计算过程

假设我们已经通过一定算法,将待分类数据进行了聚类。 常用的比如使用K-means,将待分类数据分为了k个簇。 对于簇中的每个向量。分别计算它们的轮廓系数。 对于其中的一个点 i 来说:

那么i向量轮廓系数就为: {% raw %} $$ S(i) = \frac{b(i) - a(i)}{max{a(i), b(i)}} $$ {% endraw %}

判断

可见轮廓系数的值是介于 [-1,1] ,越趋近于1代表内聚度和分离度都相对较优。将所有点的轮廓系数求平均,就是该聚类结果总的轮廓系数。

未完待续