← 课程列表

前置知识:课件 2(分数——概率是分数)课件 1 统计(数据的收集与整理)

第34课 概率初步

起源:赌徒的问题

1654 年,一位法国赌徒向数学家帕斯卡请教了一个问题:两个赌徒正在玩掷骰子的游戏,约定先赢够 3 局的人拿走全部赌金。但游戏中途被迫停止,此时甲赢了 2 局,乙赢了 1 局——赌金该怎么分才公平?

有人按已赢局数分:甲 2 局、乙 1 局,所以甲拿 2/3,乙拿 1/3。但帕斯卡觉得不对——甲只差 1 局就赢了,而乙还差 2 局,甲的优势应该更大才对。

帕斯卡写信给另一位大数学家费马。两人讨论后发现:正确的分法是看"如果继续下去,谁赢的可能性更大"。最多再玩 2 局就一定分出胜负。所有可能的结果是:

  • 甲甲 → 甲赢(甲再赢 1 局就够 3 局了)
  • 甲乙 → 甲赢(甲 3 局,乙 2 局,甲先到 3 局)
  • 乙甲 → 甲赢(乙 2 局,甲 3 局,甲先到 3 局)
  • 乙乙 → 乙赢(乙追平 3 局,甲仍 2 局)

4 种可能中,甲赢 3 种,乙赢 1 种。所以赌金应该按 3 : 1 分——甲拿 3/4,乙拿 1/4。这比按 2:1 分对甲更公平,因为甲离胜利只差一步。

帕斯卡被这个问题迷住了。他写信给费马,两人你来我往地讨论,概率论就这样诞生了。他们发现:不确定性背后,隐藏着确定的规律。虽然一次掷骰子无法预知结果,但掷很多次,结果就呈现出稳定的比例。

今天,概率论已经渗透到生活的每个角落——天气预报说"明天降雨概率 70%",保险公司用概率计算保费,药品试验用概率判断疗效,人工智能用概率来做决策。概率帮助我们理解不确定性,做出更明智的选择。

一、确定事件与随机事件

有些事情,我们事先能确定结果;有些事情,事先无法确定结果。这就是事件的分类。

确定事件:在条件不变的情况下,结果可以事先确定的事件。

  • 必然事件:一定会发生。比如"太阳从东方升起"、"一个骰子掷出的点数小于 7"。
  • 不可能事件:一定不会发生。比如"太阳从西方升起"、"一个骰子掷出 7 点"。

随机事件:在条件不变的情况下,可能发生也可能不发生,事先无法确定的事件。

比如:"抛一枚硬币,正面朝上"、"明天会下雨"、"掷骰子掷出 6 点"。

想一想:以下哪些是确定事件,哪些是随机事件?
① 水加热到 100℃ 会沸腾(标准大气压下)——必然事件
② 买一张彩票中大奖——随机事件
③ 一个正常骰子掷出 8 点——不可能事件
④ 下周一学校会下雨——随机事件
⑤ 向上抛一块石头,它会落回地面——必然事件

注意:判断一个事件是不是确定事件,要看"在给定的条件下"。比如"水在 100℃ 沸腾"在标准大气压下是必然事件,但在高山上(气压低),水不到 100℃ 就沸腾了!

二、概率的定义

随机事件虽然不确定,但我们可以用一个数来衡量它发生的可能性大小。这个数就是概率

P(A) = 事件 A 发生的结果数所有可能结果的总数

(前提:每种结果出现的可能性相等)

用分数来理解最简单:

概率的范围:

  • 必然事件的概率 = 1(100%,一定会发生)
  • 不可能事件的概率 = 0(0%,一定不会发生)
  • 随机事件的概率在 0 到 1 之间(越大越可能发生)

所以概率永远满足:0 ≤ P(A) ≤ 1

概率数轴:从不可能到必然 ↓
概率数轴 0 不可能 0.25 不太可能 0.75 很有可能 1 必然 0.5 = 1/2 掷骰子得 7 点 抛硬币正面 太阳升起

三、用列举法求概率

当可能的结果不多时,我们可以把所有可能的结果全部列出来,然后数一数。这就是列举法。常用的列举法有两种:列表法树状图

3.1 列表法

同时掷两个骰子,两个骰子的点数之和为 7 的概率是多少?

把第一个骰子的点数(1~6)写在一行,第二个骰子的点数(1~6)写在一列,交叉处就是点数之和:

骰子2=123456
骰子1=1234567
2345678
3456789
45678910
567891011
6789101112

总共 6 × 6 = 36 种等可能的结果。其中和为 7 的有 6 种(斜线方向)。

P(和为 7) = 6/36 = 1/6

3.2 树状图

抛一枚硬币三次,求恰好两次正面朝上的概率。

每次抛硬币有两种结果:正(H)或反(T)。用树状图一层层展开:

抛硬币三次的树状图 开始 正正正 正正反 正反正 正反反 反正正 反正反 反反正 反反反 共 8 种等可能结果。恰好两次正面的有:正正反、正反正、反正正,共 3 种。 P(恰好两次正面) = 3/8

列表法 vs 树状图:

  • 列表法适合"两个因素"的情况(如两个骰子),画成表格一目了然。
  • 树状图适合"多步操作"的情况(如抛三次硬币),一层层展开,不容易漏掉。
  • 无论哪种方法,关键是:不重复、不遗漏地列出所有等可能的结果。

四、用频率估计概率

有些情况下,我们无法直接列举所有可能的结果。比如:一个图钉扔到地上,钉尖朝上的概率是多少?新研发的疫苗有效概率是多少?

这时候,我们就要用实验——大量重复做同一个随机实验,用频率来估计概率

频率 = 事件发生的次数 ÷ 实验总次数

当实验次数足够多时,频率会稳定在概率附近。

历史上著名的抛硬币实验:

实验者抛掷次数正面次数正面频率
蒲丰(Buffon)4,0402,0480.5069
皮尔逊(Pearson)12,0006,0190.5016
皮尔逊(Pearson)24,00012,0120.5005

你看,抛的次数越多,频率越接近 0.5(理论概率)。这就是大数定律的思想:当实验次数足够大时,频率稳定于概率。

频率随实验次数变化:越抛越接近 0.5 ↓
抛硬币:正面频率随抛掷次数变化 0 0.25 0.50 0.75 1.00 100 200 300 400 500 理论概率 0.5 实际频率 理论概率 = 0.5

频率与概率的区别:

  • 概率是理论值,是事件固有的可能性大小(比如抛硬币正面的概率就是 1/2)。
  • 频率是实验值,是实际实验中出现的比例。每次实验的频率可能不同。
  • 当实验次数足够多时,频率会稳定在概率附近,这就是我们用频率估计概率的依据。

深入想一步:为什么"次数足够多",频率就会稳定?

这背后的道理其实很朴素,可以用一句话概括:个别的偏差会相互抵消

拿掷硬币来说。每次掷硬币都是独立的——这一掷的结果不影响下一掷。正面朝上的"真实概率"是 0.5,但任何一次具体投掷,要么是正面(+0.5 的偏差),要么是反面(−0.5 的偏差),绝不会恰好是 0.5。

关键在于:这些偏差正负交替出现,没有偏向哪一边的倾向。掷 10 次时,可能碰巧多出几次正面,频率变成 0.7;但继续掷下去,那些"多出来的正面"不会一直累积——后面的反面会把多余的正面"抵消"掉。

  • 掷 10 次:可能 7 正 3 反,频率 0.7,偏离 0.5 有 0.2
  • 掷 100 次:可能 55 正 45 反,频率 0.55,偏离 0.5 只有 0.05
  • 掷 10000 次:可能 5012 正 4988 反,频率 0.5012,几乎就是 0.5

次数越多,正负偏差抵消得越彻底,频率就越接近真实概率。这就是大数定律的直觉:不是哪一次"纠正"了之前的偏差,而是大量的独立实验让偶然的波动互相消平了。

五、「百年一遇」的大雨,真的一百年才来一次吗?

新闻里常说"这场暴雨是百年一遇的"——听到这话,很多人以为:这种雨一百年才下一次,下过一次之后,接下来一百年就可以高枕无忧了。这是大错特错!

"百年一遇"的真正含义:不是"恰好每 100 年来一次",而是"每一年发生这种强度暴雨的概率是 1%"

换句话说,"百年一遇"是一个概率概念,不是时间表。它说的是:在任意一年里,发生这种量级降雨的可能性大约是 1/100。

5.1 这个 1% 是怎么算出来的?

气象部门会收集某个地区几十年甚至上百年的降雨记录,找出每年的最大日降雨量。然后把这些数据从小到大排好,用统计方法画出一条"概率分布曲线"——这正是上一课学过的思想:用历史数据估计概率。

比如,某城市 50 年的记录显示,日降雨量超过 200 毫米的情况只发生过 1 次。粗略估计:年超越概率 ≈ 1/50 = 2%,那就是"五十年一遇"。如果超过 250 毫米的概率是 1%,那就是"百年一遇"。

重现期 = 1 ÷ 年超越概率

概率 1% → 重现期 100 年 → "百年一遇"

5.2 概率不会"记账"

这里有个容易混淆的点:每一年的概率都是独立的,就像掷骰子一样——今年掷过了,明年还是同样的概率。

算一算:假设某地"百年一遇"的暴雨概率真是每年 1%。那么连续 10 年里,至少发生一次这种暴雨的概率是多少?
思路:先算"10 年一次都不发生"的概率 = 0.9910 ≈ 0.904,所以"至少发生一次"的概率 ≈ 1 − 0.904 = 9.6%——差不多十分之一!

所以"百年一遇"并不意味着一百年内只会来一次。事实上,在一百年的时间里,至少遇到一次"百年一遇"暴雨的概率大约是 1 − 0.9910063%——比"扔硬币正面朝上"的可能性还大!

5.3 气候变化让"百年一遇"越来越频繁

这里还有一个重要的问题:"百年一遇"的标准不是一成不变的

这个 1% 的概率是根据历史数据算出来的。但如果气候在变暖、极端天气在增多,那么过去"百年一遇"的暴雨,现在可能十年就来一次——因为底层概率变了。这就好比一颗骰子被悄悄换了,原来掷出 6 的概率是 1/6,现在变成了 1/3。

所以气象学家需要不断用新数据更新概率估计。近年来很多地方的"百年一遇"洪水频频发生,并不是统计出了错,而是气候变化正在改写概率的"底牌"。

一句话总结:

  • "百年一遇" = 每年 1% 的概率,不是"一百年一次"。
  • 每年的概率独立,不会因为今年发了大水,明年就"安全"了。
  • 气候变化会改变概率,让极端天气更频繁。

六、概率计算的最基本原则:弄清"分母"是谁

概率 = 满足条件的情况数 ÷ 所有可能的情况数

这句话看起来简单,但很多人算错概率,几乎都是错在分母上——把不该算进来的算进来了,或者该算的漏掉了。关键永远是:弄清楚"所有可能的情况"到底包括哪些。

一个经典的例子:检查呈阳性,就一定患病了吗?

在年龄为 40~50 岁、无家族乳腺癌病史、本人无乳腺癌症状的每 1 000 位妇女中,就会有 8 人罹患乳腺癌。这 8 个人中有 7 个人的乳房 X 射线检查结果呈阳性。在没有患上乳腺癌的 992 人中,大约有 70 人的乳房 X 射线检查结果会错误地显示为阳性。现在有一个乳房 X 射线检查结果呈阳性的妇女,请问她实际患有乳腺癌的概率是多少?

先把所有"检查结果呈阳性"的人找出来——包括真正患病的和误报的,然后看其中真正患病的占多少。关键是:分母不是 1000,而是所有"阳性"的人。

第一步:找分母——所有"检查呈阳性"的人。

  • 真正患病且阳性:7 人
  • 没患病但误报阳性:70 人
  • 阳性总计:7 + 70 = 77 人

第二步:找分子——其中真正患病的。

  • 77 个阳性中,只有 7 人确实患病

第三步:算概率。

概率 = 7 ÷ 77 = 1/11 ≈ 9%

为什么这么低?因为乳腺癌的基数很小(1000 人中只有 8 人),即使检查很准,假阳性的人数(70)也会远超真阳性(7)。分母被 70 个假阳性撑大了,所以真正患病的比例反而很低。

核心教训:算概率时,第一步永远是问自己——"我的分母是谁?"在这个例子中,分母不是"所有 1000 人",而是"所有检查呈阳性的人"。条件变了,分母就变了,概率就变了。

挑战性问题

问题 1:小明和小红玩一个游戏:同时掷两个骰子,如果点数之和为奇数,小明赢;如果点数之和为偶数,小红赢。这个游戏公平吗?为什么?(提示:列举出所有 36 种结果,数一数奇数和偶数各有多少种。)

问题 2:一个袋子里有 3 个红球和 2 个白球,闭上眼睛摸出两个球。摸出"一红一白"的概率是多少?摸出"两个红球"呢?(提示:给球编号,用树状图或列表法列举所有可能。)

问题 3:天气预报说"明天降雨概率 70%"。这句话到底是什么意思?小明说"明天 70% 的时间会下雨",小红说"明天 70% 的地区会下雨",小华说"明天有 70% 的可能性会下雨"。谁说得对?

拓展阅读

帕斯卡和费马的书信:1654 年,帕斯卡和费马通过书信讨论赌金分配问题,这些书信被认为是概率论的起点。有趣的是,他们从未见面,所有讨论都是通过信件完成的。从这些讨论中诞生了"数学期望"的概念——如果你有 50% 的概率赢 100 元,你的"期望收益"就是 50 元。保险公司就是利用这个原理来定价的:他们计算事故发生的概率,再乘以赔偿金额,得到的数字就是你应该交的保费。

概率与决策:在生活中,我们每天都在不知不觉地使用概率思维。比如:出门带不带伞?如果降雨概率 70%,带伞是明智的;如果只有 10%,不带伞可能也没关系。又比如:要不要买彩票?中头奖的概率大约是千万分之一——比被闪电击中的概率还低!了解概率,能帮你做出更理性的选择。

推荐阅读:《牛津通识读本:概率》——用通俗的语言讲清楚了概率的基本概念和日常应用;《魔鬼数学》——里面有很多关于概率和统计的有趣故事。

习题

1. 指出下列事件中哪些是必然事件,哪些是不可能事件,哪些是随机事件:
(1)从一副扑克牌中抽出一张,这张牌是黑桃
(2)367 个人中,至少有两个人的生日相同
(3)一个正常骰子掷出 1 点
(4)负数大于正数

判断标准:一定发生?一定不发生?还是可能发生也可能不发生?注意(2)要用到"抽屉原理"——一年最多 366 天。
(1)随机事件(抽到黑桃的概率是 13/54,不是 100% 也不是 0%);(2)必然事件(一年最多 366 天,367 个人必有两人生日相同——抽屉原理);(3)随机事件;(4)不可能事件(负数永远小于正数)

2. 一个袋子里有 5 个球,分别标有数字 1、2、3、4、5。闭上眼睛从中摸出一个球,求:
(1)摸到奇数号码的概率
(2)摸到号码大于 3 的概率
(3)摸到号码是 6 的概率

5 个球等可能被摸到。奇数:1、3、5(3 个);大于 3:4、5(2 个);6:不存在(0 个)。
(1)P(奇数) = 3/5;(2)P(大于3) = 2/5;(3)P(号码是6) = 0/5 = 0(不可能事件)

3. 同时掷两个骰子,求两个骰子的点数相同的概率。

用列表法。总共有 6×6 = 36 种结果。点数相同就是(1,1)、(2,2)、(3,3)、(4,4)、(5,5)、(6,6),共 6 种。
P(点数相同) = 6/36 = 1/6

4. 抛一枚硬币两次,求两次都是正面朝上的概率。用树状图来解答。

画树状图:第一次→正/反,第二次→正/反。共 4 种结果:正正、正反、反正、反反。只有"正正"符合条件。
P(两次正面) = 1/4

5. 一个不透明的袋子里有 2 个红球和 3 个蓝球(大小、手感完全一样)。闭上眼睛摸出一个球,摸到红球的概率是多少?

总共有 5 个球,每个球被摸到的可能性相等。红球有 2 个。
P(红球) = 2/5

6. 小明抛一枚硬币 50 次,正面朝上 28 次。请计算正面朝上的频率。这个频率恰好等于概率 1/2 吗?为什么?

频率 = 28/50 = 0.56。概率是理论值,频率是实验值,两者不一定相等,但随着实验次数增多,频率会接近概率。
频率 = 28/50 = 0.56 = 56%。这并不等于概率 1/2 = 50%。因为频率是实验结果,有随机波动;概率是理论值。抛的次数越多,频率越接近 0.5。

7. 一个转盘被分成 8 个相等的扇形,其中 3 个涂红色、2 个涂蓝色、3 个涂绿色。转动转盘,指针停止后,停在红色区域的概率是多少?

8 个扇形面积相等,指针停在每个扇形的可能性相等。红色占 3 个扇形。
P(红色) = 3/8

8. 从一副去掉大小王的扑克牌(共 52 张)中随机抽一张,求:
(1)抽到红桃的概率
(2)抽到 A(Ace)的概率
(3)抽到红桃 A 的概率

52 张牌中,红桃有 13 张,A 有 4 张(每种花色一张),红桃 A 只有 1 张。
(1)P(红桃) = 13/52 = 1/4;(2)P(A) = 4/52 = 1/13;(3)P(红桃A) = 1/52

9. 小明做了一个实验:抛一枚硬币 100 次,正面朝上 45 次。他得出结论说"这枚硬币正面朝上的概率是 45%"。他的说法对吗?请说明理由。

频率和概率是不同的概念。一次实验的频率不能直接当作概率,除非实验次数非常大。
不对。他算出的是频率(45%),不是概率。概率是理论值(1/2 = 50%),频率是实验值。只有在实验次数非常大时,频率才接近概率。100 次实验的波动是正常的,如果继续抛 1000 次、10000 次,频率会更接近 50%。

10. 一个家庭有两个孩子。已知其中一个是女孩,求另一个孩子也是女孩的概率。(假设生男生女的概率各为 1/2)

两个孩子有四种等可能的情况:男男、男女、女男、女女。"已知其中一个是女孩"排除了"男男",剩下三种情况中只有"女女"符合"另一个也是女孩"。
P(另一个也是女孩) = 1/3。注意:这里不是 1/2!因为"已知一个是女孩"这个条件缩小了可能的结果范围,只剩下{男女, 女男, 女女},其中只有"女女"满足条件。

小结

返回课程列表