3赞

python数据归一化及三种方法详解

作者：TXCWB_523 | 2021-12-11 15:00

这篇文章主要介绍了python数据归一化及三种方法详解，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

数据标准化（归一化）处理是数据挖掘的一项基础工作，不同评价指标往往具有不同的量纲和量纲单位，这样的情况会影响到数据分析的结果，为了消除指标之间的量纲影响，需要进行数据标准化处理，以解决数据指标之间的可比性。原始数据经过数据标准化处理后，各指标处于同一数量级，适合进行综合对比评价。以下是三种常用的归一化方法：

min-max标准化（Min-Max Normalization）

也称为离差标准化，是对原始数据的线性变换，使结果值映射到[0 , 1]之间。转换函数如下：

其中max为样本数据的最大值，min为样本数据的最小值。这种方法有个缺陷就是当有新数据加入时，可能导致max和min的变化，需要重新定义。

min-max标准化python代码如下：

import numpy as np
 
arr = np.asarray([0, 10, 50, 80, 100])
for x in arr:
  x = float(x - np.min(arr))/(np.max(arr)- np.min(arr))
  print x
 
# output
# 0.0
# 0.1
# 0.5
# 0.8
# 1.0

使用这种方法的目的包括：

1、对于方差非常小的属性可以增强其稳定性；

2、维持稀疏矩阵中为0的条目。

下面将数据缩至0-1之间，采用MinMaxScaler函数

from sklearn import preprocessing  
 
import numpy as np 
 
X = np.array([[ 1., -1., 2.], 
 
       [ 2., 0., 0.], 
 
       [ 0., 1., -1.]]) 
 
min_max_scaler = preprocessing.MinMaxScaler() 
 
X_minMax = min_max_scaler.fit_transform(X)

最后输出：

array([[ 0.5 , 0. , 1. ],
[ 1. , 0.5 , 0.33333333],
[ 0. , 1. , 0. ]])

测试用例：

注意：这些变换都是对列进行处理。

当然，在构造类对象的时候也可以直接指定最大最小值的范围：feature_range=(min, max)，此时应用的公式变为：

X_std=(X-X.min(axis=0))/(X.max(axis=0)-X.min(axis=0)) 
X_minmax=X_std/(X.max(axis=0)-X.min(axis=0))+X.min(axis=0))

Z-score标准化方法

也称为均值归一化(mean normaliztion)，给予原始数据的均值（mean）和标准差（standard deviation）进行数据的标准化。经过处理的数据符合标准正态分布，即均值为0，标准差为1。转化函数为：

其中 μμ 为所有样本数据的均值，σσ为所有样本数据的标准差。

import numpy as np
 
arr = np.asarray([0, 10, 50, 80, 100])
for x in arr:
  x = float(x - arr.mean())/arr.std()
  print x
 
# output
# -1.24101045599
# -0.982466610991
# 0.0517087689995
# 0.827340303992
# 1.34442799399

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

推荐阅读

程序员
Maven插件别名如何映射

如何解决《Maven插件别名如何映射》经验，为你挑选了1个好方法。 ... [详细]
程序员
D3:鼠标悬停时从序号轴获取最接近的值

如何解决《D3:鼠标悬停时从序号轴获取最接近的值》经验，为你挑选了1个好方法。 ... [详细]
程序员
是否可以在没有VPC的情况下启动RDS实例？

如何解决《是否可以在没有VPC的情况下启动RDS实例？》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么onActivityResult总是返回0,即使按下确定按钮？

如何解决《为什么onActivityResult总是返回0,即使按下确定按钮？》经验，为你挑选了0个好方法。 ... [详细]
程序员
CSS中边框底部的曲线末端

如何解决《CSS中边框底部的曲线末端》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从我的应用程序传递和检索内存流到DLL？

如何解决《如何从我的应用程序传递和检索内存流到DLL？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Swift 2协议扩展使用

如何解决《Swift2协议扩展使用》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何将错误标记为不可重现？

如何解决《如何将错误标记为不可重现？》经验，为你挑选了1个好方法。 ... [详细]
程序员
从命令行运行的Windows上的Python 3安装

如何解决《从命令行运行的Windows上的Python3安装》经验，为你挑选了1个好方法。 ... [详细]
程序员
重定向到Firebase托管自定义域

如何解决《重定向到Firebase托管自定义域》经验，为你挑选了1个好方法。 ... [详细]
程序员
foo，bar，baz等的含义

如何解决《foo，bar，baz等的含义》经验，为你挑选了0个好方法。 ... [详细]
程序员
从文本文件中读取一行会返回不需要的斜杠

如何解决《从文本文件中读取一行会返回不需要的斜杠》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从C++中的单独线程发布要在Android主线程上运行的代码？

如何解决《如何从C++中的单独线程发布要在Android主线程上运行的代码？》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何使用Firebase的新bolt编译器定义索引

如何解决《如何使用Firebase的新bolt编译器定义索引》经验，为你挑选了1个好方法。 ... [详细]
程序员
将某个JSON值映射到Enum值C#

如何解决《将某个JSON值映射到Enum值C#》经验，为你挑选了1个好方法。 ... [详细]
程序员
PMA 4.5.2.0 file_exists():open_basedir限制生效

如何解决《PMA4.5.2.0file_exists():open_basedir限制生效》经验，为你挑选了1个好方法。 ... [详细]
程序员
Nginx无法将Docker部署到亚马逊

如何解决《Nginx无法将Docker部署到亚马逊》经验，为你挑选了1个好方法。 ... [详细]
程序员
TLS变量上的"非常线程局部引用常规符号"错误

如何解决《TLS变量上的"非常线程局部引用常规符号"错误》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用BouncyCastle和GnuPG 2.1的`pubring.kbx`文件

如何解决《使用BouncyCastle和GnuPG2.1的`pubring.kbx`文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Null检查Linq中的String.ToLower表达式

如何解决《Null检查Linq中的String.ToLower表达式》经验，为你挑选了2个好方法。 ... [详细]

TXCWB_523

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章