IBM SPSS Data Preparation 32.0.0 数据准备模块功能概览

模块定位

IBM SPSS Data Preparation 是 IBM SPSS Statistics Base 版本内置的数据准备功能模块。随着计算能力增强,数据采集的规模与复杂度持续上升,个案、变量与录入错误也随之增加,人工逐条核验已不现实。该模块用于在活动数据集中识别异常个案、无效个案、变量和数据值,并自动准备可用于建模的数据,是数据清洗到统计分析之间的关键环节。

典型使用流程

模块按元数据准备、数据验证、建模准备三个步骤组织。元数据准备阶段审查数据文件中的变量,确定其有效值、标签与测量级别,识别常见且难以察觉的错误编码组合,并据此定义验证规则;数据验证阶段运行基础检查并对照验证规则识别无效个案、变量和数据值;建模准备阶段使用自动数据准备获得可用于建模的字段变换,识别可能干扰预测模型的统计离群值。数据清理完成后即可进入其它附加模块的建模流程。

验证规则

验证规则用于判断个案是否有效,分为两类。单变量规则由一组固定检查组成,作用于单个变量,可检查越界值等,有效值可表达为数值范围或可接受值列表;交叉变量规则由用户定义,可作用于单个或组合变量,通过逻辑表达式标记无效值。规则会保存到数据文件的数据字典中,定义一次后即可复用。模块还支持从安装目录附带的外部数据文件加载预定义验证规则,快速获得一组可直接使用的规则。

数据验证

数据验证(Validate Data)对话框用于识别活动数据集中的可疑与无效个案、变量和数据值。基础检查可报告分析变量缺失值比例过高、单一类别占比过高、单例类别占比过高、变异系数过低或标准差过低等情形,也可标记不完整的个案标识、重复的个案标识以及全部变量为空的个案。单变量规则与交叉变量规则检查可输出个案违规报告,并支持按分析变量或按规则汇总违规情况,同时可生成分析变量的描述统计。结果可保存为摘要变量或逐条违规指示变量,便于后续排查与修正。

自动数据准备

自动数据准备(ADP)分析数据并自动识别修复项,筛除有问题或不太可能有用的字段,在合适时派生新属性,并通过智能筛选技术提升性能。算法支持全自动运行,也支持交互式预览,用户可逐个接受或拒绝建议的变换。ADP 可设置建模目标,在平衡速度与准确度、速度优先或准确度优先之间选择,也可自定义算法设置。字段层面支持准备日期与时间、排除低质量字段、调整测量级别、提升数据质量(处理离群值、替换缺失值、重排名义字段)以及重新缩放字段,连续目标字段可使用 Box-Cox 变换近似正态分布。经 ADP 处理生成的字段不会覆盖原字段,原字段在后续分析中不再使用。

异常个案识别与最优分箱

异常个案识别(Identify Unusual Cases)程序基于检测算法识别数据中可能干扰建模的统计离群值,支持设置异常点判断标准并输出异常个案报告,结果可保存到活动数据集。最优分箱(Optimal Binning)程序则用于将连续变量自动离散化为最优分箱,生成可解释性更强的预测变量,常用于评分卡等建模场景。两个程序分别对应 DETECTANOMALY 与 OPTIMAL BINNING 命令,可在语法中进一步扩展使用。

适用场景

该模块面向需要频繁核验相似结构数据文件的业务场景,例如每月向客户提交质量受控的报表、在建模前批量清洗问卷或运营数据、识别保险理赔中的可疑个案等。其价值在于把数据质量检查与预处理自动化,减少人工清洗时间,提高建模流程的稳健性与可复现性。

评论