← 返回课程列表

统计

从实际问题出发,理解"如何收集数据、分析数据、从数据中得出结论"——统计不是公式堆砌,而是从混乱中找规律的思维方式。

一、随机抽样

为什么要抽样?

假设你想知道全校 2000 名学生的平均身高,你会怎么做?如果挨个测量每一个人,工作量太大,而且有些同学可能当天不在学校。更现实的做法是:从全校学生中选出一部分人(一个样本)来测量,然后用样本的平均身高去估计全校的平均身高

但这里有一个关键问题:怎么选"这一部分人"?如果只选篮球队员,估计值会偏高;如果只选田径队员,估计值也可能偏离总体。我们需要按预先设计的随机规则抽取样本,避免研究者凭主观挑选。这就是随机抽样的思想。

随机抽样:按照包含随机机制的规则从总体中抽取一部分个体作为样本。抽取规则必须事先明确,使入样概率可以说明;随机抽样能减少人为选择偏差,但不能保证某一次样本一定完全代表总体。

1. 简单随机抽样

这是最基本的抽样方法——从总体中逐个抽取,且每个个体被抽中的概率相同。抽签法适合总体较小的情形;使用随机数或计算机时,也可以处理较大的总体。

常用两种方式:

例:从 50 名同学中用抽签法选 5 人。

步骤 1:给 50 名同学每人写一张编号为 01~50 的纸条。

步骤 2:将所有纸条放入箱子,充分搅拌。

步骤 3:从中随机抽出 5 张纸条,对应的同学即为样本。

优点:操作简单,原理直观。缺点:人数太多时,搅拌不均匀可能导致偏差。

2. 系统抽样

当总体数量很大时,抽签法就不太方便了。系统抽样提供了一种更高效的替代方案。

例:从全校 2000 名学生中抽取 100 人。

步骤 1:将 2000 名学生按某种顺序编号(如学号 0001~2000)。

步骤 2:计算抽样间隔 k = 2000 ÷ 100 = 20。

步骤 3:在 1~20 中随机选一个起点,比如 7。

步骤 4:然后依次取编号为 7, 27, 47, 67, … 的学生,直到取满 100 人。

系统抽样的关键:先确定间隔 k = N/n(N 为总体数,n 为样本数),再随机确定起点,之后每隔 k 个取一个。适用场景:总体无明显分层或周期性规律时。

3. 分层抽样

如果全校学生中,高一、高二、高三的身高有显著差异,那么简单随机抽样可能会让某个年级的人数偏多或偏少。这时用分层抽样更好——先按年级分成"层",再按比例从各层中抽取。

例:全校 2000 人中,高一 800 人、高二 600 人、高三 600 人。要抽 100 人了解身高情况。

按照各年级人数比例分配:

高一应抽:100 × (800 ÷ 2000) = 40 人

高二应抽:100 × (600 ÷ 2000) = 30 人

高三应抽:100 × (600 ÷ 2000) = 30 人

然后在各年级内部用简单随机抽样或系统抽样抽取相应人数。

三种方法的对比:
简单随机抽样:每人均等,适合小总体
系统抽样:等间隔抽取,适合大总体、无规律
分层抽样:按比例分层,适合层内差异小、层间差异大
概念 某校有走读生 300 人、住宿生 700 人。要调查学生对食堂的满意度,最合适的抽样方法是?
A. 简单随机抽样
B. 系统抽样
C. 分层抽样
D. 随意找 50 个学生
解析:走读生和住宿生对食堂的满意度可能有较大差异(层间差异大),且两类人数差异也大。用分层抽样可以按比例从两类中各抽一定人数,使样本更有代表性。选 C。
计算 从 1200 名学生中用系统抽样抽 60 人,间隔 k 是多少?如果在 1~20 中随机抽到的起点是 15,那么第 3 个被抽中的编号是多少?
A. k=20, 编号 55
B. k=20, 编号 35
C. k=20, 编号 75
D. k=20, 编号 15
解析:间隔 k = 1200 / 60 = 20。起点为 15,第 2 个为 15+20=35,第 3 个为 15+40=55。选 A。

二、用样本估计总体

从数据到信息

我们通过抽样收集到了一批数据,比如 100 名学生的身高(单位:cm):

数据:155, 158, 160, 162, 163, 165, 165, 166, 167, 168, 168, 169, 170, 170, 171, 172, 173, 174, 175, 178

(以上为简化数据,实际样本通常会更大)

面对一堆数字,我们很难直接看出规律。需要用一些方法把它们整理成可视化的形式,再从中提取关键特征。

1. 频率分布直方图

将数据分成若干组(组),统计每组数据出现的次数(频数),然后计算频率(频数 ÷ 总数),用矩形的高度表示频率密度(频率 ÷ 组距)。

以 20 个身高数据为例:

确定组距为 5,分组为:[155,160), [160,165), [165,170), [170,175), [175,180)

分组频数频率频率/组距
[155, 160)20.100.020
[160, 165)30.150.030
[165, 170)70.350.070
[170, 175)50.250.050
[175, 180)30.150.030

直方图中,所有矩形面积之和 = 1(因为各组频率之和为 1)。

为什么用"频率/组距"做高度而不是直接用频数? 因为组距不同时,直接用频数做柱状图会误导。用"频率/组距"可以保证面积 = 频率,使不同分组方案的图形有可比性。

2. 样本数字特征

直方图给了我们直观的形状,但我们还需要一些数字来描述数据的集中趋势和离散程度。

均值(平均数):所有数据之和 ÷ 数据个数。反映数据的"重心"。

x̄ = (x1 + x2 + … + xn) / n

中位数:将数据从小到大排列,位于中间位置的数。如果数据个数为偶数,取中间两个数的平均值。不受极端值影响。

众数:出现次数最多的数据。可能不止一个。

方差:各数据与均值之差的平方的平均值。反映数据的"波动程度"。

s2 = [(x1-x̄)2 + (x2-x̄)2 + … + (xn-x̄)2] / n

标准差:方差的正平方根 s,与原数据单位相同,更便于解释。

用上面的身高数据计算:

均值 x̄ = (155+158+160+162+163+165+165+166+167+168+168+169+170+170+171+172+173+174+175+178) ÷ 20

= 3349 ÷ 20 = 167.45 cm

中位数:第 10 个(168)和第 11 个(168)的平均数 = 168 cm

众数:165、168、170 都出现了 2 次(最多)→ 165, 168, 170

方差 s232.75 cm2,标准差 s ≈ 5.72 cm

结论:样本平均身高为 167.45 cm,标准差约 5.72 cm,说明数据相对均值的典型偏离量约为 5.72 cm。仅凭均值和标准差,不能断定某个固定比例的数据必然落在 x̄ ± s 内。

均值 vs 中位数:如果数据中有异常大的值(比如一个人身高 220cm),均值会被拉高,但中位数不变。所以当数据可能有极端值时,中位数更能反映"典型"水平。
概念 在频率分布直方图中,所有矩形的面积之和等于?
A. 样本容量 n
B. 组数
C. 1
D. 组距 × 组数
解析:频率分布直方图中,每个矩形的面积 = (频率/组距) × 组距 = 频率,所有矩形面积之和 = 所有频率之和 = 1。选 C。
计算 一组数据:2, 4, 6, 8, 10,这组数据的方差是多少?
A. 6
B. 8
C. 4
D. 10
解析:均值 x̄ = (2+4+6+8+10)/5 = 6。
方差 s2 = [(2-6)2+(4-6)2+(6-6)2+(8-6)2+(10-6)2] / 5
= [16+4+0+4+16] / 5 = 40/5 = 8。选 B。

三、回归分析

广告费越多,销售额越高吗?

假设某公司记录了 6 个月的广告投入和销售额数据:

广告费 x(万元)123456
销售额 y(万元)121518202428

直观上看,广告费越多,销售额似乎越高。但两者之间的关系有多强?能否用一个数学公式来描述这种关系?

1. 散点图

将每组 (x, y) 数据在坐标系中描点,得到散点图。如果这些点大致分布在一条直线附近,我们就说 x 与 y 存在线性相关关系

2. 最小二乘法

我们希望找到一条直线 ŷ = a + bx,使得它"最好地"拟合这些点。怎么定义"最好"?

对于每个数据点 (xi, yi),直线上的预测值是 ŷi = a + bxi,真实值与预测值的差 yi - ŷi 叫做残差

最小二乘法的核心思想:找到 a 和 b,使得所有残差的平方和最小:

Q = ∑(yi - ŷi)2 = ∑(yi - a - bxi)2 取最小值

为什么用平方和而不是绝对值和?
如果用 |yi-ŷi| 的求和,绝对值函数在零点不可导,数学上难以求解最小值。平方函数处处可导,可以通过求导得到唯一解。
而且平方放大了较大误差的影响,使得回归直线更"关注"偏离较大的点——这在大多数情况下是合理的。

通过数学推导(对 a 和 b 求偏导令其为零),得到:

线性回归方程 ŷ = a + bx

b = [∑(xi-x̄)(yi-ȳ)] / [∑(xi-x̄)2]

a = ȳ - b · x̄

其中 x̄ 是 x 的均值,ȳ 是 y 的均值

用上面的广告-销售额数据计算:

x̄ = (1+2+3+4+5+6)/6 = 3.5, ȳ = (12+15+18+20+24+28)/6 = 19.5

分子 ∑(xi-x̄)(yi-ȳ) = (1-3.5)(12-19.5)+(2-3.5)(15-19.5)+…+(6-3.5)(28-19.5)

= (-2.5)(-7.5)+(-1.5)(-4.5)+(-0.5)(-1.5)+(0.5)(0.5)+(1.5)(4.5)+(2.5)(8.5)

= 18.75 + 6.75 + 0.75 + 0.25 + 6.75 + 21.25 = 54.5

分母 ∑(xi-x̄)2 = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5

b = 54.5 / 17.5 ≈ 3.11

a = 19.5 - 3.11 × 3.5 ≈ 19.5 - 10.89 = 8.61

回归方程:ŷ = 8.61 + 3.11x

含义:广告费每增加 1 万元,销售额平均增加约 3.11 万元。

相关不等于因果:这条回归直线描述样本中的线性关联,不能仅凭它断言增加广告费一定导致销售额上升;季节、价格等其他变量也可能同时影响二者。超出观测范围作预测也要谨慎。
概念 最小二乘法最小化的是什么?
A. 残差的绝对值之和
B. 残差的平方和
C. 残差的和
D. 残差的最大值
解析:最小二乘法最小化的是残差的平方和 ∑(yi-ŷi)2。用平方而非绝对值是因为平方函数可导,方便数学求解。选 B。
计算 已知回归方程 ŷ = 8.61 + 3.11x,当广告费 x=3.5 万元时,预测的销售额约为多少万元?
A. 18.5
B. 19.5
C. 20.5
D. 21.5
解析:ŷ = 8.61 + 3.11 × 3.5 = 8.61 + 10.885 = 19.495 ≈ 19.5 万元。选 B。
注意:当 x = x̄(均值)时,ŷ = ȳ,这是回归直线的一个性质。

四、独立性检验

吸烟与肺癌有关吗?

在医学研究中,经常需要判断两个分类变量之间是否有关联。比如"吸烟"和"患肺癌"这两个变量——通过观察数据,我们能否说吸烟的人更容易患肺癌?

假设我们调查了 500 人,得到以下数据:

患肺癌未患肺癌合计
吸烟40160200
不吸烟10290300
合计50450500

这个 2×2 的表格就是列联表。直观上看,吸烟组中患肺癌的比例是 40/200 = 20%,而不吸烟组只有 10/300 ≈ 3.3%,相差很大。但这是否具有统计显著性?即这种差异是不是偶然造成的?

卡方统计量的基本思想

独立性检验的思路是这样的:

如果吸烟和肺癌无关,那么患肺癌的比例应该是总体比例 50/500 = 10%。

吸烟组(200 人)中,期望的患肺癌人数 = 200 × 10% = 20 人

同理可计算所有格子的"期望频数":

患肺癌未患肺癌
吸烟20180
不吸烟30270

一般公式:期望频数 = (行合计 × 列合计) / 总计

例如吸烟&肺癌 = 200 × 50 / 500 = 20

χ2 = ∑ (O - E)2 / E

其中 O 是实际观测频数,E 是期望频数,对 4 个格子求和

计算:

χ2 = (40-20)2/20 + (160-180)2/180 + (10-30)2/30 + (290-270)2/270

= 400/20 + 400/180 + 400/30 + 400/270

= 20 + 2.22 + 13.33 + 1.48 ≈ 37.03

结论:这里 χ2 ≈ 37.03 > 3.841,所以拒绝原假设,认为吸烟与肺癌存在关联。

卡方统计量的思想总结:
① 假设两个变量独立 → ② 计算期望频数 → ③ 比较实际与期望的差距(χ2)→ ④ 差距越大,越说明两者有关
这就像"如果你说骰子没问题,但我掷了 600 次发现每个面出现次数都远偏离 100 次,那你的假设就很可疑"。
概念 在 2×2 列联表的独立性检验中,如果 χ2 值很大,说明什么?
A. 两个变量很可能独立
B. 样本量太小
C. 两个变量很可能有关联
D. 数据有错误
解析:χ2 值大意味着实际观测值与期望值(假设独立时的值)相差很大,所以原假设(独立)很可能是错的,即两个变量有关联。选 C。
计算 在一项调查中,共调查了 200 人。其中男生 120 人、女生 80 人,喜欢数学的有 60 人。如果性别和喜欢数学相互独立,那么男生中喜欢数学的期望人数是多少?
A. 60
B. 36
C. 24
D. 40
解析:期望频数 = 行合计 × 列合计 / 总数 = 120 × 60 / 200 = 36。选 B。

五、综合练习

以下 5 道综合题覆盖了本节全部知识点,动手试试吧!

得分:0 / 75

练习 1(10 分)

某地区有农村居民 5000 人、城镇居民 3000 人。要调查该地区居民的年收入情况。

(1) 最适合的抽样方法是?

(2) 如果样本总数为 200 人,农村和城镇各应抽多少人?

(1) 请填写抽样方法名称:

(2) 农村应抽 人,城镇应抽

解析:
(1) 农村和城镇居民收入可能有较大差异(层间差异大),应用分层抽样
(2) 农村比例 = 5000/8000 = 62.5%,应抽 200 × 62.5% = 125 人;城镇比例 = 3000/8000 = 37.5%,应抽 200 × 37.5% = 75 人

练习 2(10 分)

某班 10 名同学的数学月考成绩(满分 100 分):65, 70, 72, 78, 80, 82, 85, 88, 90, 95

(1) 计算均值和中位数。

(2) 计算方差(保留一位小数)。

(1) 均值 = ,中位数 =

(2) 方差 =

解析:
(1) 均值 = (65+70+72+78+80+82+85+88+90+95)/10 = 805/10 = 80.5 分
 中位数 = (80+82)/2 = 81 分
(2) 方差 s2 = [(65-80.5)2+(70-80.5)2+...+(95-80.5)2] / 10
 = (240.25+110.25+72.25+6.25+0.25+2.25+20.25+56.25+90.25+210.25)/10
 = 808.5/10 = 80.85 ≈ 80.9(保留一位小数)。

练习 3(10 分)

某产品 5 个月的产量 x(万件)与生产成本 y(万元)数据如下:

x12345
y109876

求 y 关于 x 的线性回归方程 ŷ = a + bx。

提示:先计算 x̄ 和 ȳ,再用公式求 b 和 a。

b = ,a =

解析:
x̄ = (1+2+3+4+5)/5 = 3,ȳ = (10+9+8+7+6)/5 = 8
分子 ∑(xi-x̄)(yi-ȳ) = (-2)(2)+(-1)(1)+(0)(0)+(1)(-1)+(2)(-2) = -4-1+0-1-4 = -10
分母 ∑(xi-x̄)2 = 4+1+0+1+4 = 10
b = -10/10 = -1,a = 8 - (-1)×3 = 8+3 = 11
回归方程:ŷ = 11 - x
含义:产量每增加 1 万件,成本平均降低 1 万元(规模效应)。

练习 4(10 分)

为研究"经常锻炼"与"睡眠质量"的关系,调查了 300 人,数据如下:

睡眠好睡眠差合计
经常锻炼8040120
很少锻炼60120180
合计140160300

(1) 如果锻炼与睡眠质量无关,经常锻炼且睡眠好的人的期望频数是多少?

(2) χ2 值约为多少?(保留一位小数)

(1) 期望频数 =

(2) χ2 =

解析:
(1) 期望频数 = 行合计 × 列合计 / 总数 = 120 × 140 / 300 = 56
(2) 计算 χ2
 期望频数格子(按顺序:锻炼&睡眠好、锻炼&睡眠差、不锻炼&睡眠好、不锻炼&睡眠差):
 56, 64, 84, 96
 χ2 = (80-56)2/56 + (40-64)2/64 + (60-84)2/84 + (120-96)2/96
 = 576/56 + 576/64 + 576/84 + 576/96
 ≈ 10.29 + 9.00 + 6.86 + 6.00 = 30.2(保留一位小数)。
 大于临界值 3.841,说明锻炼与睡眠质量显著相关。

练习 5(10 分)

某校从高一学生中抽取 50 人,记录他们的身高和体重数据,计算得:

身高均值 x̄ = 165cm,标准差 sx = 6cm

体重均值 ȳ = 58kg,标准差 sy = 8kg

现有甲同学身高 170cm,乙同学身高 160cm。

(1) 甲同学的身高在样本中大约处于什么水平?(用标准差解释)

(2) 若身高分布近似正态,则约 95% 的数据落在 (x̄-2s, x̄+2s) 范围内。按此模型估计身高的 95% 范围是多少?

(1) 甲的身高比均值高 个标准差

(2) 身高 95% 范围: ~ cm

解析:
(1) 甲的身高减去均值:170 - 165 = 5cm,比均值高 5cm。5 ÷ 6 ≈ 0.83 个标准差,属于正常偏高。
(2) 在身高分布近似正态的前提下,约 95% 的范围 = (165 - 2×6, 165 + 2×6) = (153, 177) cm
 乙的身高 160cm 也在这个范围内。