了解机器学*


一.概述

  机器学*是人工智能的一个分支。

  机器学*是实现人工智能的一个途径,即以机器学*为手段解决人工智能中的问题。机器学*在*30多年已发展为一门多领域交叉学科,涉及概率论、统计学、逼*论、凸分析、计算复杂性理论等多门学科。机器学*理论主要是设计和分析一些让计算机可以自动“学*”的算法。机器学*算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。

  机器学*已广泛应用于数据挖掘、计算机视觉、自然语言处理、生物特征识别、搜索引擎、医学诊断、检测信用卡欺诈、证券市场分析、DNA序列测序、语音和手写识别、战略游戏和机器人等领域。

                                                                                     ——维基百科

二. 定义

  目前并没有一个统一的定义,但是一个常被引用得英文定义为:

  "A computer program is said to learn from experience E with respect to some class of tasks T and performance measure P, if its performance at tasks in T, as measured by P, improves with experience E."

  个人理解是:一个计算机程序如果在任务T上的表现P随着经验E而提高,那么就可以说是从经验E中学*关于多分类的任务T和性能指标P

三. 主要任务

  • 分类(classification):将实例数据划分到合适的类别中。
  • 回归(regression):主要用于预测数值型数据。

四. 常见分类

  • 监督学*:
      从给定的训练数据集中学*出一个函数,当新的数据到来时,可以根据这个函数预测结果。监督学*的训练集要求是包括输入和输出,也可以说是特征和目标。训练集中的目标是由人标注的。常见的监督学*算法包括回归分析和统计分类。
  • 无监督学*:
      与监督学*相比,训练集没有人为标注的结果。常见的无监督学*算法有生成对抗网络(GAN)、聚类。
  • 半监督学*:
      介于监督学*和无监督学*之间
  • 强化学*:
      机器为了达成目标,随着环境的变动,而逐步调整其行为,并评估每一个行动之后所到的回馈是正向的或负向的。

五. 数学基础

  • 微积分
  • 统计学/概率论
  • 线性代数

六. 算法

具体的机器学*算法有:

  • 构造间隔理论分布:聚类分析和模式识别
    • 人工神经网络
    • 决策树
    • 感知器
    • 支持向量机
    • 集成学*AdaBoost
    • 降维与度量学*
    • 聚类
    • 贝叶斯分类器
  • 构造条件概率:回归分析和统计分类
    • 高斯过程回归
    • 线性判别分析
    • 最*邻居法
    • 径向基函数核
  • 通过再生模型构造概率密度函数:
    • 最大期望算法
    • 概率图模型:包括贝叶斯网和Markov随机场
    • Generative Topographic Mapping
  • *似推断技术:
    • 马尔可夫链
    • 蒙特卡罗方法
    • 变分法
  • 最优化:大多数以上方法,直接或者间接使用最优化算法。