数据挖掘(二): 认识数据


数据集:由数据对象组成

数据对象:数据库中的每一行,也叫样品、元组、行、实例、数据点、示例

一个数据库关系模型表中:除了一行行的数据外,还有解释数据的属性(列),代表一个数据对象的特征或功能

数据属性类型有:标称(Nominal)、序数(Ordinal)、区间(Interval)、比率(Ratio)

标称类型:(个人理解感觉就像是 数据类型是可列举的有限集合)

  • 发色 = {黑色,棕色,金色,红色,白色}
  • 婚姻状态 = {已婚、未婚、离婚}
  • 职业 = {教师、医生、程序员}
  • ...

还有一种特殊的标称数据类型:二进制类型

  • 只有两个状态的属性
  • 对称二进制两种结果数据对象数量规模相当:例如:男女性别
  • 不对称的二进制类型的数据对象数据规模差距较大:例如:医疗测试(阳性阴性)(某种罕见的病阴性的人会较多)

序数类型

  • 价值认知方面有一个有意义的顺序(排名),但不知道连续值之间的大小
  • 例如:大小 = {小,中,大}(并没有说清楚多大是小,多大是中,多大是大)、等级

区间标度类型

  • 以单位长度顺序性度量
  • 值有序、比如温度、日历等
  • 不存在0点,倍数没有意义、比如我们不会说2000年是1000年的2倍(从数值上是对的,但是这有什么意义呢...我们数据挖掘要做有用的事情)

比率标度类型

  • 具有固定零点的数值属性,有序且可以计算倍数
  • 例如长度、重量等

放张图以后再慢慢理解吧: