← 课程列表

前置知识:课件 32(数据的收集与整理)—— 普查与抽样调查、总体/个体/样本、频数分布表、直方图

数据的分析 — 第 33 课

起源:古人怎么"算"平均数?

平均数的思想,比"平均数"这个词古老得多。早在公元前 3000 年,古埃及的官员在测量尼罗河两岸的土地时就发现:每年洪水退去后,地界石被冲走了,需要重新分配土地。怎么分?他们用"所有地块面积加起来,除以人数"的方法——也就是求平均数。

到了 17 世纪,天文学家发现了一个令人头疼的问题:不同的人在同一时间用同一台望远镜观察同一颗星,测出来的位置却不一样。怎么办?把所有观测值加起来除以观测次数——这就是今天"算术平均数"的由来。英国数学家托马斯·辛普森在 1755 年写了一封信,正式提出:多次观测的平均值比单次观测更可靠。

而"中位数"最早是法国数学家罗杰·博斯科维奇在 1757 年提出来的,但真正推广它的是弗朗西斯·高尔顿(达尔文的表弟)。高尔顿在研究人类身高时发现:用平均数容易受极端值影响,中位数反而更稳定。

到了 20 世纪初,英国统计学家卡尔·皮尔逊罗纳德·费希尔把方差、标准差等概念系统化,统计学的"数据分析工具箱"正式成型。

数据分析要解决的核心问题:收集完数据之后,怎么用一个数概括一群数?怎么看这群数"散不散"?

一、集中趋势:用一个数概括一群数

假设你参加了一场数学考试,全班 5 个人的成绩是:78, 85, 90, 92, 95。你想用一个数来描述"我们班考得怎么样"。这个数有三种选法:

1. 平均数(算术平均数)

定义:把所有数据加起来,除以数据的个数。

平均数 = (数据之和) ÷ (数据个数)

用符号写:设有 n 个数据 x₁, x₂, ..., xₙ,则

x̄ = (x₁ + x₂ + ... + xₙ) / n

上面那个"x̄"读作"x bar"——在 x 上面加一横,表示平均值。

例子:78, 85, 90, 92, 95 的平均数 = (78+85+90+92+95) ÷ 5 = 440 ÷ 5 = 88
解读:这五个同学的平均分是 88 分。
0 20 40 60 78 85 90 92 95 平均数 88 学生A 学生B 学生C 学生D 学生E

绿色虚线:平均数 = 88。有的高于它,有的低于它。

注意:平均数有一个"软肋"——容易被极端值拉偏。如果班上突然转来一个学霸考了 100 分,或者一个同学考了 20 分,平均数就会明显变化。

2. 中位数

定义:把数据从小到大排好队,站在最中间的那个数,就是中位数。如果数据个数是偶数,中间两个数的平均数就是中位数。

一句话:中位数把数据分成两半,一半比它大,一半比它小。

例子:78, 85, 90, 92, 95 已经排好序,中间是第 3 个数 → 中位数 = 90
偶数个:78, 85, 90, 92 → 中间两个是 85 和 90 → 中位数 = (85+90) ÷ 2 = 87.5
想一想:如果班上 5 个同学的成绩是 78, 85, 90, 92, 20(有个人只考了 20 分),平均数 = (78+85+90+92+20)÷5 = 73,而中位数还是 85。哪个数更能代表"大多数同学"的水平?——显然中位数更靠谱,因为它不受 20 这个极端值的影响。

3. 众数

定义:数据中出现次数最多的那个数,就是众数。一组数据可能有多个众数(复众数),也可能没有众数。

例子:鞋店老板统计了一天卖出的鞋码:36, 38, 38, 38, 39, 40, 40, 41。
38 码出现了 3 次,最多 → 众数 = 38
老板进货时,38 码的鞋肯定要多进一些!

小结:平均数、中位数、众数——各有什么用处?

指标优点缺点适合场景
平均数用了全部数据,信息最全容易被极端值影响数据比较均匀时(如身高、体重)
中位数不受极端值影响没有用到全部数据的信息有极端值时(如工资、房价)
众数直观,一看就懂可能不存在或不唯一分类数据(如鞋码、颜色偏好)
平均数 vs 中位数:极端值的影响 正常数据:78, 85, 90, 92, 95 78 85 90 92 95 平均数 = 88 / 中位数 = 90 两者接近 有极端值:78, 85, 90, 92, 20 78 85 90 92 20 平均数 = 73 / 中位数 = 85 平均数被拉低,中位数稳如泰山!

二、波动程度:数据"散不散"?

光看平均数还不够!假设两个班的平均分都是 80 分,但 A 班成绩是 79, 80, 81,B 班成绩是 50, 80, 110。虽然平均分一样,但显然 B 班的成绩"更散"——我们需要一个数字来衡量这种"散"的程度。

1. 方差

直观想法:每个数据离平均数有多远?把这些"距离"平均一下。

但"距离"有正有负,直接加会抵消。怎么办?平方!——平方后全是正数,而且"远"的数据被放大得更厉害。

方差的定义:每个数据与平均数的差的平方的平均值。

s² = [(x₁ − x̄)² + (x₂ − x̄)² + ... + (xₙ − x̄)²] / n

(注:样本方差有时除以 n−1,初中阶段先学除以 n 的版本。)

用手算一遍:数据 2, 4, 6
平均数 x̄ = (2+4+6) ÷ 3 = 4
每个数与平均数的差:2−4=−2, 4−4=0, 6−4=2
平方:(−2)²=4, 0²=0, 2²=4
方差 = (4+0+4) ÷ 3 = 8/3 ≈ 2.67
方差:衡量数据"散不散"的直观理解 A组:2, 4, 6(方差小) 2 4 6 x̄=4 差-2 差0 差+2 方差 = (4+0+4)/3 ≈ 2.67 B组:1, 4, 7(方差大) 1 4 7 x̄=4 差-3 差0 差+3 方差 = (9+0+9)/3 = 6 结论:平均数相同(都是4),但B组方差更大 → 数据更分散。 方差越大 → 数据越"散";方差越小 → 数据越"集中"。

2. 标准差

定义:方差的算术平方根

s = √(s²)

为什么要开方?方差是"平方"后的结果,单位也被平方了。比如数据的单位是"分",方差的单位就是"分²"——这很别扭。开方之后,标准差又回到了"分",和原始数据同一个单位,更容易理解。

接上例:A 组方差 ≈ 2.67,标准差 = √2.67 ≈ 1.63;B 组方差 = 6,标准差 = √6 ≈ 2.45
解读:B 组的标准差更大,说明 B 组数据更分散。

一句话对比:

方差标准差
计算差的平方的平均方差的平方根
单位原始单位²与原始单位相同
用途数学推导中更方便解释数据时更直观
关系同一个东西的两个面貌,就像"面积"和"边长"

三、逻辑推导:为什么方差公式长这样?

你可能想问:为什么不是直接算"偏差的平均值"?也就是 (|x₁−x̄| + ... + |xₙ−x̄|) / n?

这个叫平均绝对偏差,确实存在!但数学家们选了方差,有两个主要原因:

  1. 平方放大极端值:偏离 2 的贡献是 4,偏离 4 的贡献是 16——方差对"离群点"特别敏感,这恰好符合我们"极端值要引起重视"的直觉。
  2. 可加性:独立数据的方差可以相加,这条性质在概率论中极其重要。

四、智商是怎么测出来的?

我们常说"某某智商 130",那这个数字到底是怎么算出来的?它真的能衡量一个人的聪明程度吗?

4.1 智商测试的由来

1904 年,法国心理学家比奈(Alfred Binet)受政府委托,设计一套方法来识别需要特殊帮助的学生。他和同事西蒙编制了世界上第一份智力测验量表——比奈-西蒙量表。后来美国心理学家特曼把它引进美国,修订成"斯坦福-比奈量表",并正式提出了"智商"(IQ,Intelligence Quotient)这个概念。

4.2 智商分数是怎么算出来的?

早期的算法很简单:智商 = 智力年龄 ÷ 实际年龄 × 100。比如一个 10 岁的孩子,做题水平相当于 12 岁的平均水平,那他的 IQ = 12 ÷ 10 × 100 = 120。

但这个方法有个问题:智力年龄的增长不是匀速的,成年后基本停顿。所以现在的智商测试用的是统计方法——把你的成绩和同龄人的成绩做比较。

4.3 正态分布:智商的"钟形曲线"

统计学家发现,如果对大量人群做智力测试,成绩分布会呈现一条"中间高、两边低"的钟形曲线——这就是正态分布。很多自然现象都符合正态分布:身高、考试成绩、测量误差……智商也是其中之一。

现代智商的定义基于两个关键数字:

平均值 = 100,标准差 = 15

意思是:所有人的智商平均是 100,标准差是 15。利用上一节学过的知识,就能解读各种智商分数:

智商范围与平均值的关系人群占比(约)常见说法
85 ~ 115平均值 ± 1 个标准差68%大多数人的水平
70 ~ 130平均值 ± 2 个标准差95%覆盖绝大多数人
130 以上高于平均值 2 个标准差约 2.2%通常称为"超常"
70 以下低于平均值 2 个标准差约 2.2%需要特别关注
智商分布(正态分布的钟形曲线) 100 平均值 85 115 70 130 68% (85~115) 人数比例

钟形曲线下,85~115 之间约占总面积的 68%——这就是"大多数人的智商"。

关键解读:

  • 智商 100不是"满分的一半",而是人群的平均水平
  • 标准差 15告诉我们"大部分人离平均值有多远"——约 68% 的人在 85~115 之间。
  • 智商 130 意味着比 97.7% 的人都高,并不是"100 分考了 130 分"。
温馨提示:智商测试只是衡量某些认知能力(如逻辑推理、语言理解、空间想象)的一种工具,并不能代表一个人的全部价值。情商、创造力、动手能力……这些都是智商测试测不出来的。把智商当成一个参考数字就好,别太当真。

挑战性问题

问题 1:一组数据:5, 7, 9, 11, 13。不用计算,你能猜出平均数是多少吗?方差呢?

问题 2:如果一组数据的每个数都加上 10,平均数、中位数、众数、方差、标准差分别会怎么变化?

问题 3:小明说:"我们班的中位数是 85,平均数也是 85,所以大家的成绩都一样。"他的说法对吗?为什么?

问题 4:如果一组数据只有一个数,比如 [7],它的方差是多少?你能从方差公式推导出来吗?

拓展阅读

1. 数据波动程度的几种度量

除了方差和标准差,统计学家们还发明了其他度量数据波动的方法:

这些方法各有各的用处,就像工具箱里有不同型号的螺丝刀——看你要拧什么螺丝。

2. 课题学习:体质健康测试中的数据分析

假设你们班进行了一次体质健康测试,测了 50 米跑、坐位体前屈、1 分钟跳绳、肺活量等项目。现在你拿到了全班的数据,你会怎么分析?

第一步:计算每个项目的平均数和标准差——看看全班整体水平如何,哪个项目大家差距最大(标准差最大)。

第二步:画出每个项目的直方图——看看数据分布是什么形状。是"中间高两边低"的钟形,还是偏向一边的歪斜形?

第三步:对比男女生数据——分别计算平均数和中位数,看有没有明显差异。用中位数比用平均数更可靠,因为总有几个同学特别强或特别弱。

第四步:把自己的数据和全班对比——你的 50 米跑成绩在班里排第几?用中位数和标准差,你就能知道自己的位置:是在"大多数"中间,还是"领先"或"落后"了。

试试用学过的这些方法,分析一次你们班的真实数据吧!

习题

1. 数据:12, 15, 18, 21, 24。求这组数据的平均数、中位数和众数。

平均数:全部加起来除以 5;中位数:5 个数排好序,取第 3 个;众数:每个数都只出现一次,所以没有众数。
平均数 = (12+15+18+21+24)÷5 = 90÷5 = 18;中位数 = 18;众数:(每个数出现次数相同)。

2. 某小组 6 名同学的身高(cm):155, 158, 160, 160, 162, 165。求平均数、中位数和众数。

平均数:全部加起来除以 6;中位数:偶数个数据,取中间两个的平均数;众数:出现次数最多的数。
平均数 = (155+158+160+160+162+165)÷6 = 960÷6 = 160;中位数 = (160+160)÷2 = 160;众数 = 160(出现 2 次)。

3. 一组数据:3, 3, 5, 7, 7, 7, 9。求平均数、中位数和众数。

7 出现了 3 次,是最多的;中位数:7 个数,第 4 个;平均数:全部加起来除以 7。
平均数 = (3+3+5+7+7+7+9)÷7 = 41÷7 ≈ 5.86;中位数 = 7(第 4 个数);众数 = 7

4. 小明 5 次数学测验成绩:88, 92, 85, 90, ?。已知平均分是 89 分,求第 5 次成绩。

设第 5 次为 x,则 (88+92+85+90+x)÷5 = 89。解出 x。
88+92+85+90 = 355,355 + x = 89×5 = 445,x = 445−355 = 90

5. 以下数据中,哪个指标最能代表"大多数"?为什么?
某公司员工月薪(元):3000, 3200, 3500, 3500, 3800, 4000, 50000。

先算平均数和中位数,比较一下。50000 是一个极端值,看它把谁拉偏了。
平均数 = (3000+3200+3500+3500+3800+4000+50000)÷7 = 71000÷7 ≈ 10143;中位数 = 3500。平均数被 50000 拉到了 1 万多,而实际上 6 个人都在 4000 以下。所以中位数 3500 元更能代表大多数。众数 = 3500,也合理。

6. 数据:2, 4, 4, 6, 8, 10。求方差和标准差(精确到小数点后一位)。

先求平均数,再算每个数与平均数的差的平方,求平均得方差,最后开方得标准差。
平均数 = (2+4+4+6+8+10)÷6 = 34÷6 ≈ 5.67。
偏差平方: (2−5.67)²=13.47, (4−5.67)²=2.79, (4−5.67)²=2.79, (6−5.67)²=0.11, (8−5.67)²=5.43, (10−5.67)²=18.75。
方差 = (13.47+2.79+2.79+0.11+5.43+18.75)÷6 = 43.34÷6 ≈ 7.2;标准差 = √7.2 ≈ 2.7

7. 两组数据:A 组 1, 3, 5, 7, 9;B 组 4, 4, 5, 6, 6。不用计算,哪组方差大?为什么?

观察两组数据的"散开"程度。A 组从 1 到 9 跨度很大,B 组集中在 4~6 之间。
A 组方差更大。因为 A 组数据从 1 到 9,跨度大,数据分散;B 组都在 4~6 之间,非常集中。验证:A 组平均数=5,方差=8;B 组平均数=5,方差=0.8。

8. 一组数据每个数都乘以 2,方差会变成原来的几倍?为什么?

设原数据为 x₁, x₂, ..., xₙ,新数据为 2x₁, 2x₂, ..., 2xₙ。新平均数 = 2x̄,每个新偏差 = 2xᵢ−2x̄ = 2(xᵢ−x̄),平方后变成 4(xᵢ−x̄)²。
方差变成原来的 4 倍。因为每个偏差都乘以 2,平方之后就乘以 4。标准差变成原来的 2 倍

9. 小红记录了上周每天的最高气温(℃):28, 30, 29, 31, 32, 30, 30。求这组数据的平均数、中位数、众数、方差和标准差(方差精确到一位小数)。

先排序:28, 29, 30, 30, 30, 31, 32。再依次计算平均数、中位数、众数,然后算方差和标准差。
平均数 = (28+29+30+30+30+31+32)÷7 = 210÷7 = 30;中位数 = 30;众数 = 30
偏差平方:(28−30)²=4, (29−30)²=1, (30−30)²=0, (30−30)²=0, (30−30)²=0, (31−30)²=1, (32−30)²=4。
方差 = (4+1+0+0+0+1+4)÷7 = 10÷7 ≈ 1.4;标准差 = √1.4 ≈ 1.2

10. 某次数学测验,全班 40 人。小红考了 88 分,全班平均分 82 分,标准差 6 分。小红的成绩在全班处于什么水平?(提示:通常认为,在平均数上下 1 个标准差范围内是"正常水平",超出 1 个标准差算"偏上",超出 2 个标准差算"优秀"。)

小红比平均分高 88−82 = 6 分,正好是 1 个标准差。也就是说,小红在平均分上方 1 个标准差的位置。
小红比平均分高 6 分,正好等于 1 个标准差。所以小红处于偏上水平("正常范围"上界)。
如果分数近似正态分布,大约有 68% 的同学在 82±6(即 76~88)之间,小红刚好在边界上,大约比 84% 的同学考得好。

小结

下一课:概率初步 →