前置知识:课件 32(数据的收集与整理)—— 普查与抽样调查、总体/个体/样本、频数分布表、直方图
数据的分析 — 第 33 课
起源:古人怎么"算"平均数?
平均数的思想,比"平均数"这个词古老得多。早在公元前 3000 年,古埃及的官员在测量尼罗河两岸的土地时就发现:每年洪水退去后,地界石被冲走了,需要重新分配土地。怎么分?他们用"所有地块面积加起来,除以人数"的方法——也就是求平均数。
到了 17 世纪,天文学家发现了一个令人头疼的问题:不同的人在同一时间用同一台望远镜观察同一颗星,测出来的位置却不一样。怎么办?把所有观测值加起来除以观测次数——这就是今天"算术平均数"的由来。英国数学家托马斯·辛普森在 1755 年写了一封信,正式提出:多次观测的平均值比单次观测更可靠。
而"中位数"最早是法国数学家罗杰·博斯科维奇在 1757 年提出来的,但真正推广它的是弗朗西斯·高尔顿(达尔文的表弟)。高尔顿在研究人类身高时发现:用平均数容易受极端值影响,中位数反而更稳定。
到了 20 世纪初,英国统计学家卡尔·皮尔逊和罗纳德·费希尔把方差、标准差等概念系统化,统计学的"数据分析工具箱"正式成型。
数据分析要解决的核心问题:收集完数据之后,怎么用一个数概括一群数?怎么看这群数"散不散"?
一、集中趋势:用一个数概括一群数
假设你参加了一场数学考试,全班 5 个人的成绩是:78, 85, 90, 92, 95。你想用一个数来描述"我们班考得怎么样"。这个数有三种选法:
1. 平均数(算术平均数)
定义:把所有数据加起来,除以数据的个数。
平均数 = (数据之和) ÷ (数据个数)
用符号写:设有 n 个数据 x₁, x₂, ..., xₙ,则
x̄ = (x₁ + x₂ + ... + xₙ) / n
上面那个"x̄"读作"x bar"——在 x 上面加一横,表示平均值。
解读:这五个同学的平均分是 88 分。
绿色虚线:平均数 = 88。有的高于它,有的低于它。
2. 中位数
定义:把数据从小到大排好队,站在最中间的那个数,就是中位数。如果数据个数是偶数,中间两个数的平均数就是中位数。
一句话:中位数把数据分成两半,一半比它大,一半比它小。
偶数个:78, 85, 90, 92 → 中间两个是 85 和 90 → 中位数 = (85+90) ÷ 2 = 87.5。
3. 众数
定义:数据中出现次数最多的那个数,就是众数。一组数据可能有多个众数(复众数),也可能没有众数。
38 码出现了 3 次,最多 → 众数 = 38。
老板进货时,38 码的鞋肯定要多进一些!
小结:平均数、中位数、众数——各有什么用处?
| 指标 | 优点 | 缺点 | 适合场景 |
|---|---|---|---|
| 平均数 | 用了全部数据,信息最全 | 容易被极端值影响 | 数据比较均匀时(如身高、体重) |
| 中位数 | 不受极端值影响 | 没有用到全部数据的信息 | 有极端值时(如工资、房价) |
| 众数 | 直观,一看就懂 | 可能不存在或不唯一 | 分类数据(如鞋码、颜色偏好) |
二、波动程度:数据"散不散"?
光看平均数还不够!假设两个班的平均分都是 80 分,但 A 班成绩是 79, 80, 81,B 班成绩是 50, 80, 110。虽然平均分一样,但显然 B 班的成绩"更散"——我们需要一个数字来衡量这种"散"的程度。
1. 方差
直观想法:每个数据离平均数有多远?把这些"距离"平均一下。
但"距离"有正有负,直接加会抵消。怎么办?平方!——平方后全是正数,而且"远"的数据被放大得更厉害。
方差的定义:每个数据与平均数的差的平方的平均值。
s² = [(x₁ − x̄)² + (x₂ − x̄)² + ... + (xₙ − x̄)²] / n
(注:样本方差有时除以 n−1,初中阶段先学除以 n 的版本。)
平均数 x̄ = (2+4+6) ÷ 3 = 4
每个数与平均数的差:2−4=−2, 4−4=0, 6−4=2
平方:(−2)²=4, 0²=0, 2²=4
方差 = (4+0+4) ÷ 3 = 8/3 ≈ 2.67
2. 标准差
定义:方差的算术平方根。
s = √(s²)
为什么要开方?方差是"平方"后的结果,单位也被平方了。比如数据的单位是"分",方差的单位就是"分²"——这很别扭。开方之后,标准差又回到了"分",和原始数据同一个单位,更容易理解。
解读:B 组的标准差更大,说明 B 组数据更分散。
一句话对比:
| 方差 | 标准差 | |
|---|---|---|
| 计算 | 差的平方的平均 | 方差的平方根 |
| 单位 | 原始单位² | 与原始单位相同 |
| 用途 | 数学推导中更方便 | 解释数据时更直观 |
| 关系 | 同一个东西的两个面貌,就像"面积"和"边长" | |
三、逻辑推导:为什么方差公式长这样?
你可能想问:为什么不是直接算"偏差的平均值"?也就是 (|x₁−x̄| + ... + |xₙ−x̄|) / n?
这个叫平均绝对偏差,确实存在!但数学家们选了方差,有两个主要原因:
- 平方放大极端值:偏离 2 的贡献是 4,偏离 4 的贡献是 16——方差对"离群点"特别敏感,这恰好符合我们"极端值要引起重视"的直觉。
- 可加性:独立数据的方差可以相加,这条性质在概率论中极其重要。
四、智商是怎么测出来的?
我们常说"某某智商 130",那这个数字到底是怎么算出来的?它真的能衡量一个人的聪明程度吗?
4.1 智商测试的由来
1904 年,法国心理学家比奈(Alfred Binet)受政府委托,设计一套方法来识别需要特殊帮助的学生。他和同事西蒙编制了世界上第一份智力测验量表——比奈-西蒙量表。后来美国心理学家特曼把它引进美国,修订成"斯坦福-比奈量表",并正式提出了"智商"(IQ,Intelligence Quotient)这个概念。
4.2 智商分数是怎么算出来的?
早期的算法很简单:智商 = 智力年龄 ÷ 实际年龄 × 100。比如一个 10 岁的孩子,做题水平相当于 12 岁的平均水平,那他的 IQ = 12 ÷ 10 × 100 = 120。
但这个方法有个问题:智力年龄的增长不是匀速的,成年后基本停顿。所以现在的智商测试用的是统计方法——把你的成绩和同龄人的成绩做比较。
4.3 正态分布:智商的"钟形曲线"
统计学家发现,如果对大量人群做智力测试,成绩分布会呈现一条"中间高、两边低"的钟形曲线——这就是正态分布。很多自然现象都符合正态分布:身高、考试成绩、测量误差……智商也是其中之一。
现代智商的定义基于两个关键数字:
平均值 = 100,标准差 = 15
意思是:所有人的智商平均是 100,标准差是 15。利用上一节学过的知识,就能解读各种智商分数:
| 智商范围 | 与平均值的关系 | 人群占比(约) | 常见说法 |
|---|---|---|---|
| 85 ~ 115 | 平均值 ± 1 个标准差 | 68% | 大多数人的水平 |
| 70 ~ 130 | 平均值 ± 2 个标准差 | 95% | 覆盖绝大多数人 |
| 130 以上 | 高于平均值 2 个标准差 | 约 2.2% | 通常称为"超常" |
| 70 以下 | 低于平均值 2 个标准差 | 约 2.2% | 需要特别关注 |
钟形曲线下,85~115 之间约占总面积的 68%——这就是"大多数人的智商"。
关键解读:
- 智商 100不是"满分的一半",而是人群的平均水平。
- 标准差 15告诉我们"大部分人离平均值有多远"——约 68% 的人在 85~115 之间。
- 智商 130 意味着比 97.7% 的人都高,并不是"100 分考了 130 分"。
挑战性问题
问题 1:一组数据:5, 7, 9, 11, 13。不用计算,你能猜出平均数是多少吗?方差呢?
问题 2:如果一组数据的每个数都加上 10,平均数、中位数、众数、方差、标准差分别会怎么变化?
问题 3:小明说:"我们班的中位数是 85,平均数也是 85,所以大家的成绩都一样。"他的说法对吗?为什么?
问题 4:如果一组数据只有一个数,比如 [7],它的方差是多少?你能从方差公式推导出来吗?
拓展阅读
1. 数据波动程度的几种度量
除了方差和标准差,统计学家们还发明了其他度量数据波动的方法:
- 极差(Range):最大值 − 最小值。最简单,但只看两个数,信息太少。
- 四分位距(IQR):上四分位数(Q₃)− 下四分位数(Q₁),即中间 50% 数据的范围。不受极端值影响,比极差稳健。
- 平均绝对偏差(MAD):每个数据与平均数的差的绝对值的平均。比方差直观,但数学性质不如方差好。
- 变异系数(CV):标准差 ÷ 平均数。用于比较不同单位或不同量级的数据的波动程度。比如,比较"身高"和"体重"的变异程度,不能直接用标准差比。
这些方法各有各的用处,就像工具箱里有不同型号的螺丝刀——看你要拧什么螺丝。
2. 课题学习:体质健康测试中的数据分析
假设你们班进行了一次体质健康测试,测了 50 米跑、坐位体前屈、1 分钟跳绳、肺活量等项目。现在你拿到了全班的数据,你会怎么分析?
第一步:计算每个项目的平均数和标准差——看看全班整体水平如何,哪个项目大家差距最大(标准差最大)。
第二步:画出每个项目的直方图——看看数据分布是什么形状。是"中间高两边低"的钟形,还是偏向一边的歪斜形?
第三步:对比男女生数据——分别计算平均数和中位数,看有没有明显差异。用中位数比用平均数更可靠,因为总有几个同学特别强或特别弱。
第四步:把自己的数据和全班对比——你的 50 米跑成绩在班里排第几?用中位数和标准差,你就能知道自己的位置:是在"大多数"中间,还是"领先"或"落后"了。
试试用学过的这些方法,分析一次你们班的真实数据吧!
习题
1. 数据:12, 15, 18, 21, 24。求这组数据的平均数、中位数和众数。
2. 某小组 6 名同学的身高(cm):155, 158, 160, 160, 162, 165。求平均数、中位数和众数。
3. 一组数据:3, 3, 5, 7, 7, 7, 9。求平均数、中位数和众数。
4. 小明 5 次数学测验成绩:88, 92, 85, 90, ?。已知平均分是 89 分,求第 5 次成绩。
5. 以下数据中,哪个指标最能代表"大多数"?为什么?
某公司员工月薪(元):3000, 3200, 3500, 3500, 3800, 4000, 50000。
6. 数据:2, 4, 4, 6, 8, 10。求方差和标准差(精确到小数点后一位)。
偏差平方: (2−5.67)²=13.47, (4−5.67)²=2.79, (4−5.67)²=2.79, (6−5.67)²=0.11, (8−5.67)²=5.43, (10−5.67)²=18.75。
方差 = (13.47+2.79+2.79+0.11+5.43+18.75)÷6 = 43.34÷6 ≈ 7.2;标准差 = √7.2 ≈ 2.7。
7. 两组数据:A 组 1, 3, 5, 7, 9;B 组 4, 4, 5, 6, 6。不用计算,哪组方差大?为什么?
8. 一组数据每个数都乘以 2,方差会变成原来的几倍?为什么?
9. 小红记录了上周每天的最高气温(℃):28, 30, 29, 31, 32, 30, 30。求这组数据的平均数、中位数、众数、方差和标准差(方差精确到一位小数)。
偏差平方:(28−30)²=4, (29−30)²=1, (30−30)²=0, (30−30)²=0, (30−30)²=0, (31−30)²=1, (32−30)²=4。
方差 = (4+1+0+0+0+1+4)÷7 = 10÷7 ≈ 1.4;标准差 = √1.4 ≈ 1.2。
10. 某次数学测验,全班 40 人。小红考了 88 分,全班平均分 82 分,标准差 6 分。小红的成绩在全班处于什么水平?(提示:通常认为,在平均数上下 1 个标准差范围内是"正常水平",超出 1 个标准差算"偏上",超出 2 个标准差算"优秀"。)
如果分数近似正态分布,大约有 68% 的同学在 82±6(即 76~88)之间,小红刚好在边界上,大约比 84% 的同学考得好。
小结
- 集中趋势三兄弟:平均数(最常用,但怕极端值)、中位数(不怕极端值,排序取中间)、众数(出现最多的,适合分类数据)
- 方差:每个数据与平均数的差的平方的平均值。衡量数据"散不散"。
- 标准差:方差的平方根,和原始数据同一单位,更容易解释。
- 方差越大 → 数据越分散;方差越小 → 数据越集中。
- 注意:平均数相同 ≠ 数据分布相同。方差和标准差能告诉我们平均数"藏不住"的信息。
- 应用:智商分数就是用统计方法定义的——平均值 100、标准差 15,约 68% 的人在 85~115 之间。