从字面理解,“散”即分散、无序;“值”即数值、数据点。合起来,“散值”指的是在数据集中表现为:分布高度离散、缺乏合理逻辑支撑、与整体趋势显著偏离、或在同一语义维度下数值单位/格式不一致的数据项。
需特别注意:“散值” ≠ “异常值”。虽然二者常有重叠,但本质不同:
- 异常值(Outlier):统计意义上的极端值,可能是真实存在的罕见事件(如双11订单峰值);
- 散值:更多体现为数据逻辑断裂、语义不统一、采集不规范导致的系统性混乱,即使数值在“合理范围”,也可能因格式错乱而成为“散值”。例如:
? 散值典型表现:同一字段“用户年龄”:
• 23
• 25岁
• 三十出头
• 1998年出生
• 30±2
• (空)
• NaN
• 2023年入职时的年龄
• 23.0(浮点)
• 23(单位:月?)
→ 这些数据项数值本身未必“错”,但因单位、格式、含义不统一,构成典型散值。
业内有一句行话:“散值比脏值更致命”——因为脏值尚可清洗,而散值往往意味着数据源头逻辑缺失,若不追根溯源,后续分析如同“在流沙上建塔”。
? 小知识:在数据治理成熟度模型(DMM)中,“散值”问题通常归入“数据一致性”与“数据标准化”双维度的薄弱环节。