异常值是不符合总体规律的结果。坦诚处理它,意思是你要标出它、谨慎地解释它,并显示它对概括数值的改变有多大。评价实地考察结果时,或者陌生数据集里出现一个奇怪的数值时,就会用到这项技能。
它接在选择图表之后,属于实地考察的分析与评价。
怎样发现并处理异常值?
- 先看规律。 判断大多数点在哪里,趋势朝哪里走。
- 在图上用圆圈或标签标出远离趋势的点。
- 核对记录。 看有没有抄写错误、单位错误,或关于该地点的现场笔记。
- 提出可能的原因,用可能性的措辞。
- 显示影响。 分别计算有它和没有它的平均数与中位数。
- 把这个结果保留在数据中。 说明它如何影响你对结论的信心。
例题
下面的数据是虚构的。它重复了街道调查,但地点 E 的数值比两侧的地点高得多。
| 地点 | 距离(公里) | 十分钟内行人数 |
|---|---|---|
| A | 0.1 | 84 |
| B | 0.3 | 71 |
| C | 0.5 | 66 |
| D | 0.8 | 52 |
| E | 1.2 | 74 |
| F | 1.6 | 39 |
| G | 2.0 | 35 |
发现: 趋势从 84 下降到 35,所以在 1.2 公里处预计约 45。数值 74 远高于趋势线,因此地点 E 是异常值。
含地点 E 的平均数: 84 + 71 + 66 + 52 + 74 + 39 + 35 = 421,421 ÷ 7 = 60.1。
不含地点 E 的平均数: 421 − 74 = 347,347 ÷ 6 = 57.8。
中位数: 七个数值排序后是 35、39、52、66、71、74、84,中位数是 66。去掉 E 后,六个数值是 35、39、52、66、71、84,中位数是 (52 + 66) ÷ 2 = 59。
解释: E 处数量偏高,可能是由于该点附近有某种设施,例如巴士站或学校入口。这只是可能性,所以文字里要写明这一点没有被记录,应在重复考察时检查。
写出影响: 平均数变化 2.3,中位数变化 7,所以异常值改变了概括数值,但没有改变向下的趋势。
哪种错误会丢分?
常见的失误是把异常值删掉,却什么也不说。
错误回答: “地点 E 是错的,所以我没有用。”
这样做隐藏了证据,也没有给出理由。正确做法是保留这个点,标出来,说明原因没有被记录,并报告有它和没有它的数字。这既诚实,也显示你理解了数据。
自我检查
所有数据均为虚构。
1. 五个溪流流速读数是 10、12、11、30 和 13 厘米每秒。哪个读数是异常值?
显示答案
读数 30 远高于其他读数,其他读数都在 10 到 13 之间。
2. 分别求含异常值和不含异常值的平均数。
显示答案
含:10 + 12 + 11 + 30 + 13 = 76,76 ÷ 5 = 15.2。不含:46 ÷ 4 = 11.5。
3. 笔记中没有任何相关记录时,写一句诚实的话解释这个异常值。
显示答案
例如:“30 厘米每秒的读数是异常值,其原因没有被记录;它可能是由于测量失误或河道局部变窄,重复测量可以检验这一点。”
接下来学什么?
妥善处理异常值会让结论更有力,因为你能说明它有多可靠。接着学习把结论与调查目的联系起来。统计与分布探索器可以显示单个极端值如何拉动平均数。
如果你想让老师像考官那样追问你的解释,可以看看我们的一对一线上地理补习。