数据挖掘(一):分类与聚类、监督式机器学习与非监督式机器学习


为了通俗易懂区分分类与聚类举两个例子叭:

比如现在我有一个一堆水果,里面有苹果(青苹果,红苹果,黄苹果...)和梨(黄色的梨,绿色的梨...):现在我们可以把这堆水果分成两类(苹果和梨)这就是一个分类过程

但是呢,小朋友可能不认识这么多种苹果这么多种的梨,我们让小朋友去把这堆水果分成两类,她可能会按照水果的形状,水果的颜色等分类,这就是聚类

分类监督式机器学习:因为它先通过训练集训练一个模型,然后通过模型来做预测

聚类非监督式机器学习:它没有先训练模型,然后通过模型来进行预测的一个过程,而是通过某些相似性计算方法来预测

监督式机器学习:第一步:学习建模   第二步:预测测试

现在我有一些数据,这些数据表格中直接给出了某个人的“发展评估”,我们通过学习建模得出

然后这时候来了一堆数据,我们并不知道这堆数据中,某个人的“发展评估情况”,这就是我们数据分析要做的事情了。

我们要用我们前面建立的模型,来让电脑判断这些人的“发展评估”。

 分类技术:

  • 决策树分类
  • 贝叶斯分类
  • 最近邻分类
  • 支持向量机分类
  • 逻辑斯特回归分类
  • 神将网络分类

聚类分析技术:

  • K均值
  • 层次聚类
  • 密度聚类

2022.02.27