**样本量局限(sample-size limitation)**指用于实验的个体、细胞或测量值太少,不足以让人相信其中的规律。在考试答案中,你要指出这个局限,说明它为什么重要,并提出具体的更大数量。
这一课接在选择对照之后:比较公平了,接下来要问每组的证据是否足够。
为什么小样本容易误导?
生物之间有差异。两棵接受相同处理的豆苗,长得仍然不一样高,所以任何三四个一组的样本都可能含有一个不寻常的个体。这一个个体就能把平均数拉高或拉低。
样本越大,单个异常个体的影响就越被分散。这时平均数更接近整个群体的典型水平。
找出局限的步骤
- 数出每组的个体或测量值数目,把数字写在每组旁边。
- 算出每组平均数并比较。
- 看离散程度,求每组的极差。若范围互相重叠,说明两组并没有明显不同。
- 检查是否有一个个体影响很大。去掉它重新算平均数,看结论是否改变。
- 写出句子:“每组只有 n 个样本,很小,所以一个异常值就能改变平均数;应使用更大的样本,例如每组 N 个。”
例题
所有数据都是为练习而编造的。在两个地点采集蜗牛并测量壳长:阴凉溪岸四只,阳光下的溪岸四只。
| 地点 | 壳长(mm) |
|---|---|
| 阴凉 | 21, 24, 22, 25 |
| 阳光 | 20, 22, 23, 21 |
**第 1 步,数数:**每组四只。
**第 2 步,平均数:**阴凉组 =(21 + 24 + 22 + 25)÷ 4 = 92 ÷ 4 = 23 mm。阳光组 =(20 + 22 + 23 + 21)÷ 4 = 86 ÷ 4 = 21.5 mm。差异为 1.5 mm。
**第 3 步,极差:**阴凉组 21 到 25(极差 4 mm),阳光组 20 到 23(极差 3 mm)。两个范围在 21 到 23 之间重叠。
**第 4 步,单个个体:**如果把 25 mm 的那只换成 23 mm,阴凉组平均数变成 90 ÷ 4 = 22.5 mm,差距缩小为 1 mm。
第 5 步,写句子:“每个地点只测了四只蜗牛,而且范围重叠,所以 1.5 mm 的差异可能出于偶然。每个地点至少应测 30 只蜗牛。”
这个结论不是说没有差异,而是说这些数据还不足以回答问题。
要留意的错误
一个常见的答案是只说样本太小,却没有和数据联系起来。
错误答案:“样本量太小,所以结果不可靠。”
这没有给出数字、原因或改进,所以得分很少。
正确做法是写出当前数目,说明可能出什么问题(一个异常值改变平均数、范围重叠),并提出具体的更大数目。也不要提出不可能的样本,比如学校实验室里用 10 000 棵植物。
自我检测
所有数据都是编造的。
1. 三棵豌豆苗用了新堆肥,长高 10、12 和 26 cm。三棵用普通堆肥,长高 14、15 和 16 cm。为什么这个比较很弱?
查看答案
新堆肥平均数 = 48 ÷ 3 = 16 cm;普通堆肥平均数 = 45 ÷ 3 = 15 cm。差异只是由那棵 26 cm 的植物造成的,而且两组范围大量重叠。每组只有三棵,一棵异常植物就能改变结果,所以应每组至少用 20 棵。
2. 某学生对同一位同学重复做了 5 次反应时间测试,就断定青少年喝含糖饮料后反应更快。指出样本量的局限。
查看答案
只测试了一个人,所以结果可能反映的是这个人,而不是青少年整体。应测试更多不同的学生,例如 20 位,每人都在两种条件下测试。
3. 两株杂合豌豆(Tt × Tt)产生 8 个后代:7 株高、1 株矮。模型预测 6 株高、2 株矮。解释这个差别。
查看答案
模型给出的是概率,而只有 8 个后代时,偶然因素就足以让数字偏离 6:2。后代数量更大,例如 200 个,预期数字会更接近 3:1 的比例。
接下来学什么
下一课是画出带单位、能解读的图,让你的数据一目了然。遗传模型板可以让你比较模型比例与小样本、大样本的差别。