数据挖掘(二): 认识数据
数据集:由数据对象组成
数据对象:数据库中的每一行,也叫样品、元组、行、实例、数据点、示例
一个数据库关系模型表中:除了一行行的数据外,还有解释数据的属性(列),代表一个数据对象的特征或功能
数据属性类型有:标称(Nominal)、序数(Ordinal)、区间(Interval)、比率(Ratio)
标称类型:(个人理解感觉就像是 数据类型是可列举的有限集合)
- 发色 = {黑色,棕色,金色,红色,白色}
- 婚姻状态 = {已婚、未婚、离婚}
- 职业 = {教师、医生、程序员}
- ...
还有一种特殊的标称数据类型:二进制类型
- 只有两个状态的属性
- 对称二进制两种结果数据对象数量规模相当:例如:男女性别
- 不对称的二进制类型的数据对象数据规模差距较大:例如:医疗测试(阳性阴性)(某种罕见的病阴性的人会较多)
序数类型:
- 价值认知方面有一个有意义的顺序(排名),但不知道连续值之间的大小
- 例如:大小 = {小,中,大}(并没有说清楚多大是小,多大是中,多大是大)、等级
区间标度类型:
- 以单位长度顺序性度量
- 值有序、比如温度、日历等
- 不存在0点,倍数没有意义、比如我们不会说2000年是1000年的2倍(从数值上是对的,但是这有什么意义呢...我们数据挖掘要做有用的事情)
比率标度类型:
- 具有固定零点的数值属性,有序且可以计算倍数
- 例如长度、重量等
放张图以后再慢慢理解吧: