统计
从实际问题出发,理解"如何收集数据、分析数据、从数据中得出结论"——统计不是公式堆砌,而是从混乱中找规律的思维方式。
一、随机抽样
为什么要抽样?
假设你想知道全校 2000 名学生的平均身高,你会怎么做?如果挨个测量每一个人,工作量太大,而且有些同学可能当天不在学校。更现实的做法是:从全校学生中选出一部分人(一个样本)来测量,然后用样本的平均身高去估计全校的平均身高。
但这里有一个关键问题:怎么选"这一部分人"?如果只选篮球队员,估计值会偏高;如果只选田径队员,估计值也可能偏离总体。我们需要按预先设计的随机规则抽取样本,避免研究者凭主观挑选。这就是随机抽样的思想。
随机抽样:按照包含随机机制的规则从总体中抽取一部分个体作为样本。抽取规则必须事先明确,使入样概率可以说明;随机抽样能减少人为选择偏差,但不能保证某一次样本一定完全代表总体。
1. 简单随机抽样
这是最基本的抽样方法——从总体中逐个抽取,且每个个体被抽中的概率相同。抽签法适合总体较小的情形;使用随机数或计算机时,也可以处理较大的总体。
常用两种方式:
- 抽签法:把每个学生写在一张纸条上,放入箱子充分搅拌,然后随机抽取。简单直观,但总体很大时操作不便。
- 随机数表法:给每个学生编号(如 0001~2000),然后用随机数表(或计算机生成的随机数)选出一组编号。效率更高,避免人为偏差。
例:从 50 名同学中用抽签法选 5 人。
步骤 1:给 50 名同学每人写一张编号为 01~50 的纸条。
步骤 2:将所有纸条放入箱子,充分搅拌。
步骤 3:从中随机抽出 5 张纸条,对应的同学即为样本。
优点:操作简单,原理直观。缺点:人数太多时,搅拌不均匀可能导致偏差。
2. 系统抽样
当总体数量很大时,抽签法就不太方便了。系统抽样提供了一种更高效的替代方案。
例:从全校 2000 名学生中抽取 100 人。
步骤 1:将 2000 名学生按某种顺序编号(如学号 0001~2000)。
步骤 2:计算抽样间隔 k = 2000 ÷ 100 = 20。
步骤 3:在 1~20 中随机选一个起点,比如 7。
步骤 4:然后依次取编号为 7, 27, 47, 67, … 的学生,直到取满 100 人。
3. 分层抽样
如果全校学生中,高一、高二、高三的身高有显著差异,那么简单随机抽样可能会让某个年级的人数偏多或偏少。这时用分层抽样更好——先按年级分成"层",再按比例从各层中抽取。
例:全校 2000 人中,高一 800 人、高二 600 人、高三 600 人。要抽 100 人了解身高情况。
按照各年级人数比例分配:
高一应抽:100 × (800 ÷ 2000) = 40 人
高二应抽:100 × (600 ÷ 2000) = 30 人
高三应抽:100 × (600 ÷ 2000) = 30 人
然后在各年级内部用简单随机抽样或系统抽样抽取相应人数。
简单随机抽样:每人均等,适合小总体
系统抽样:等间隔抽取,适合大总体、无规律
分层抽样:按比例分层,适合层内差异小、层间差异大
二、用样本估计总体
从数据到信息
我们通过抽样收集到了一批数据,比如 100 名学生的身高(单位:cm):
数据:155, 158, 160, 162, 163, 165, 165, 166, 167, 168, 168, 169, 170, 170, 171, 172, 173, 174, 175, 178
(以上为简化数据,实际样本通常会更大)
面对一堆数字,我们很难直接看出规律。需要用一些方法把它们整理成可视化的形式,再从中提取关键特征。
1. 频率分布直方图
将数据分成若干组(组),统计每组数据出现的次数(频数),然后计算频率(频数 ÷ 总数),用矩形的高度表示频率密度(频率 ÷ 组距)。
以 20 个身高数据为例:
确定组距为 5,分组为:[155,160), [160,165), [165,170), [170,175), [175,180)
| 分组 | 频数 | 频率 | 频率/组距 |
|---|---|---|---|
| [155, 160) | 2 | 0.10 | 0.020 |
| [160, 165) | 3 | 0.15 | 0.030 |
| [165, 170) | 7 | 0.35 | 0.070 |
| [170, 175) | 5 | 0.25 | 0.050 |
| [175, 180) | 3 | 0.15 | 0.030 |
直方图中,所有矩形面积之和 = 1(因为各组频率之和为 1)。
2. 样本数字特征
直方图给了我们直观的形状,但我们还需要一些数字来描述数据的集中趋势和离散程度。
均值(平均数):所有数据之和 ÷ 数据个数。反映数据的"重心"。
x̄ = (x1 + x2 + … + xn) / n
中位数:将数据从小到大排列,位于中间位置的数。如果数据个数为偶数,取中间两个数的平均值。不受极端值影响。
众数:出现次数最多的数据。可能不止一个。
方差:各数据与均值之差的平方的平均值。反映数据的"波动程度"。
s2 = [(x1-x̄)2 + (x2-x̄)2 + … + (xn-x̄)2] / n
标准差:方差的正平方根 s,与原数据单位相同,更便于解释。
用上面的身高数据计算:
均值 x̄ = (155+158+160+162+163+165+165+166+167+168+168+169+170+170+171+172+173+174+175+178) ÷ 20
= 3349 ÷ 20 = 167.45 cm
中位数:第 10 个(168)和第 11 个(168)的平均数 = 168 cm
众数:165、168、170 都出现了 2 次(最多)→ 165, 168, 170
方差 s2 ≈ 32.75 cm2,标准差 s ≈ 5.72 cm
结论:样本平均身高为 167.45 cm,标准差约 5.72 cm,说明数据相对均值的典型偏离量约为 5.72 cm。仅凭均值和标准差,不能断定某个固定比例的数据必然落在 x̄ ± s 内。
方差 s2 = [(2-6)2+(4-6)2+(6-6)2+(8-6)2+(10-6)2] / 5
= [16+4+0+4+16] / 5 = 40/5 = 8。选 B。
三、回归分析
广告费越多,销售额越高吗?
假设某公司记录了 6 个月的广告投入和销售额数据:
| 广告费 x(万元) | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 销售额 y(万元) | 12 | 15 | 18 | 20 | 24 | 28 |
直观上看,广告费越多,销售额似乎越高。但两者之间的关系有多强?能否用一个数学公式来描述这种关系?
1. 散点图
将每组 (x, y) 数据在坐标系中描点,得到散点图。如果这些点大致分布在一条直线附近,我们就说 x 与 y 存在线性相关关系。
2. 最小二乘法
我们希望找到一条直线 ŷ = a + bx,使得它"最好地"拟合这些点。怎么定义"最好"?
对于每个数据点 (xi, yi),直线上的预测值是 ŷi = a + bxi,真实值与预测值的差 yi - ŷi 叫做残差。
最小二乘法的核心思想:找到 a 和 b,使得所有残差的平方和最小:
Q = ∑(yi - ŷi)2 = ∑(yi - a - bxi)2 取最小值
如果用 |yi-ŷi| 的求和,绝对值函数在零点不可导,数学上难以求解最小值。平方函数处处可导,可以通过求导得到唯一解。
而且平方放大了较大误差的影响,使得回归直线更"关注"偏离较大的点——这在大多数情况下是合理的。
通过数学推导(对 a 和 b 求偏导令其为零),得到:
线性回归方程 ŷ = a + bx
b = [∑(xi-x̄)(yi-ȳ)] / [∑(xi-x̄)2]
a = ȳ - b · x̄
其中 x̄ 是 x 的均值,ȳ 是 y 的均值
用上面的广告-销售额数据计算:
x̄ = (1+2+3+4+5+6)/6 = 3.5, ȳ = (12+15+18+20+24+28)/6 = 19.5
分子 ∑(xi-x̄)(yi-ȳ) = (1-3.5)(12-19.5)+(2-3.5)(15-19.5)+…+(6-3.5)(28-19.5)
= (-2.5)(-7.5)+(-1.5)(-4.5)+(-0.5)(-1.5)+(0.5)(0.5)+(1.5)(4.5)+(2.5)(8.5)
= 18.75 + 6.75 + 0.75 + 0.25 + 6.75 + 21.25 = 54.5
分母 ∑(xi-x̄)2 = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5
b = 54.5 / 17.5 ≈ 3.11
a = 19.5 - 3.11 × 3.5 ≈ 19.5 - 10.89 = 8.61
回归方程:ŷ = 8.61 + 3.11x
含义:广告费每增加 1 万元,销售额平均增加约 3.11 万元。
注意:当 x = x̄(均值)时,ŷ = ȳ,这是回归直线的一个性质。
四、独立性检验
吸烟与肺癌有关吗?
在医学研究中,经常需要判断两个分类变量之间是否有关联。比如"吸烟"和"患肺癌"这两个变量——通过观察数据,我们能否说吸烟的人更容易患肺癌?
假设我们调查了 500 人,得到以下数据:
| 患肺癌 | 未患肺癌 | 合计 | |
|---|---|---|---|
| 吸烟 | 40 | 160 | 200 |
| 不吸烟 | 10 | 290 | 300 |
| 合计 | 50 | 450 | 500 |
这个 2×2 的表格就是列联表。直观上看,吸烟组中患肺癌的比例是 40/200 = 20%,而不吸烟组只有 10/300 ≈ 3.3%,相差很大。但这是否具有统计显著性?即这种差异是不是偶然造成的?
卡方统计量的基本思想
独立性检验的思路是这样的:
- 第一步(假设):先假设吸烟和肺癌没有关系(即相互独立)。这叫做原假设 H0。
- 第二步(计算期望):如果 H0 成立,那么"吸烟且患肺癌"的人数应该是多少?
如果吸烟和肺癌无关,那么患肺癌的比例应该是总体比例 50/500 = 10%。
吸烟组(200 人)中,期望的患肺癌人数 = 200 × 10% = 20 人
同理可计算所有格子的"期望频数":
| 患肺癌 | 未患肺癌 | |
|---|---|---|
| 吸烟 | 20 | 180 |
| 不吸烟 | 30 | 270 |
一般公式:期望频数 = (行合计 × 列合计) / 总计
例如吸烟&肺癌 = 200 × 50 / 500 = 20
- 第三步(计算卡方):比较实际观测值 O 和期望值 E 的差异:
χ2 = ∑ (O - E)2 / E
其中 O 是实际观测频数,E 是期望频数,对 4 个格子求和
计算:
χ2 = (40-20)2/20 + (160-180)2/180 + (10-30)2/30 + (290-270)2/270
= 400/20 + 400/180 + 400/30 + 400/270
= 20 + 2.22 + 13.33 + 1.48 ≈ 37.03
- 第四步(判断):χ2 值越大,说明观测值与期望值差异越大,原假设越不可靠。通常与临界值比较(自由度为 1 时,显著性水平 0.05 的临界值为 3.841)。
结论:这里 χ2 ≈ 37.03 > 3.841,所以拒绝原假设,认为吸烟与肺癌存在关联。
① 假设两个变量独立 → ② 计算期望频数 → ③ 比较实际与期望的差距(χ2)→ ④ 差距越大,越说明两者有关
这就像"如果你说骰子没问题,但我掷了 600 次发现每个面出现次数都远偏离 100 次,那你的假设就很可疑"。
五、综合练习
以下 5 道综合题覆盖了本节全部知识点,动手试试吧!
练习 1(10 分)
某地区有农村居民 5000 人、城镇居民 3000 人。要调查该地区居民的年收入情况。
(1) 最适合的抽样方法是?
(2) 如果样本总数为 200 人,农村和城镇各应抽多少人?
(1) 请填写抽样方法名称:
(2) 农村应抽 人,城镇应抽 人
(1) 农村和城镇居民收入可能有较大差异(层间差异大),应用分层抽样。
(2) 农村比例 = 5000/8000 = 62.5%,应抽 200 × 62.5% = 125 人;城镇比例 = 3000/8000 = 37.5%,应抽 200 × 37.5% = 75 人。
练习 2(10 分)
某班 10 名同学的数学月考成绩(满分 100 分):65, 70, 72, 78, 80, 82, 85, 88, 90, 95
(1) 计算均值和中位数。
(2) 计算方差(保留一位小数)。
(1) 均值 = ,中位数 =
(2) 方差 =
(1) 均值 = (65+70+72+78+80+82+85+88+90+95)/10 = 805/10 = 80.5 分。
中位数 = (80+82)/2 = 81 分。
(2) 方差 s2 = [(65-80.5)2+(70-80.5)2+...+(95-80.5)2] / 10
= (240.25+110.25+72.25+6.25+0.25+2.25+20.25+56.25+90.25+210.25)/10
= 808.5/10 = 80.85 ≈ 80.9(保留一位小数)。
练习 3(10 分)
某产品 5 个月的产量 x(万件)与生产成本 y(万元)数据如下:
| x | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| y | 10 | 9 | 8 | 7 | 6 |
求 y 关于 x 的线性回归方程 ŷ = a + bx。
提示:先计算 x̄ 和 ȳ,再用公式求 b 和 a。
b = ,a =
x̄ = (1+2+3+4+5)/5 = 3,ȳ = (10+9+8+7+6)/5 = 8
分子 ∑(xi-x̄)(yi-ȳ) = (-2)(2)+(-1)(1)+(0)(0)+(1)(-1)+(2)(-2) = -4-1+0-1-4 = -10
分母 ∑(xi-x̄)2 = 4+1+0+1+4 = 10
b = -10/10 = -1,a = 8 - (-1)×3 = 8+3 = 11
回归方程:ŷ = 11 - x
含义:产量每增加 1 万件,成本平均降低 1 万元(规模效应)。
练习 4(10 分)
为研究"经常锻炼"与"睡眠质量"的关系,调查了 300 人,数据如下:
| 睡眠好 | 睡眠差 | 合计 | |
|---|---|---|---|
| 经常锻炼 | 80 | 40 | 120 |
| 很少锻炼 | 60 | 120 | 180 |
| 合计 | 140 | 160 | 300 |
(1) 如果锻炼与睡眠质量无关,经常锻炼且睡眠好的人的期望频数是多少?
(2) χ2 值约为多少?(保留一位小数)
(1) 期望频数 =
(2) χ2 =
(1) 期望频数 = 行合计 × 列合计 / 总数 = 120 × 140 / 300 = 56。
(2) 计算 χ2:
期望频数格子(按顺序:锻炼&睡眠好、锻炼&睡眠差、不锻炼&睡眠好、不锻炼&睡眠差):
56, 64, 84, 96
χ2 = (80-56)2/56 + (40-64)2/64 + (60-84)2/84 + (120-96)2/96
= 576/56 + 576/64 + 576/84 + 576/96
≈ 10.29 + 9.00 + 6.86 + 6.00 = 30.2(保留一位小数)。
大于临界值 3.841,说明锻炼与睡眠质量显著相关。
练习 5(10 分)
某校从高一学生中抽取 50 人,记录他们的身高和体重数据,计算得:
身高均值 x̄ = 165cm,标准差 sx = 6cm
体重均值 ȳ = 58kg,标准差 sy = 8kg
现有甲同学身高 170cm,乙同学身高 160cm。
(1) 甲同学的身高在样本中大约处于什么水平?(用标准差解释)
(2) 若身高分布近似正态,则约 95% 的数据落在 (x̄-2s, x̄+2s) 范围内。按此模型估计身高的 95% 范围是多少?
(1) 甲的身高比均值高 个标准差
(2) 身高 95% 范围: ~ cm
(1) 甲的身高减去均值:170 - 165 = 5cm,比均值高 5cm。5 ÷ 6 ≈ 0.83 个标准差,属于正常偏高。
(2) 在身高分布近似正态的前提下,约 95% 的范围 = (165 - 2×6, 165 + 2×6) = (153, 177) cm。
乙的身高 160cm 也在这个范围内。