独热编码


在机器学习算法中,常会遇到分类特征是离散的,无序的。
例如:性别有男、女,城市有北京,上海,深圳等。

性别特征:["男","女"] => 0,1
地区特征:["北京","上海,"深圳"] => 0,1,2
工作特征:["演员","厨师","公务员","工程师","律师"] => 0,1,2,3,4

比如,样本(女,北京,工程师)=>(1,0,3),但是,这样的特征处理并不直接放入机器学习算法中。

我们在机器学习中,需要计算每种工作特征的距离,上面方式算出来的两种工作的距离是有问题:

d(演员,厨师) = 1
d(厨师,公务员) = 1
d(公务员,工程师) = 1
d(工程师,律师) = 1
d(演员,公务员) = 2
d(演员,工程师) = 3
.....

解决这类问题,一种解决方法是采用独热编码(One-Hot Encoding)。

机器学习:数据预处理之独热编码(One-Hot)
  • one-hot使用体会
  • onehot编码的意义