理性认识世界
证据 · 推理 · 判断 —— 给高一学生的思维训练课
理性不是怀疑一切,而是让判断与证据相称,并愿意根据新证据调整判断。
- 分清描述性事实主张、因果性事实主张和价值判断;
- 检查数字的来源、口径、样本和比较基准;
- 区分相关与因果,并指出可能的其他解释;
- 根据证据强弱表达不同程度的确信,并说明什么证据会改变自己的判断。
开场:一句「有数据」的广告就可信吗?
4 分钟某学习软件广告称:「高一学生使用本软件 4 周后,数学成绩平均提高 30%,效果已被多所学校验证。」
如果 0 表示「完全不能相信」,10 表示「几乎可以确定」,你现在给这句话几分?还缺少哪一条关键信息?
- 主张是什么?它说得足够明确吗?
- 证据是什么?证据来自哪里?
- 推理成立吗?证据能够支持多强的结论?
- 还有别的解释吗?什么新证据会改变判断?
第一讲 · 先把话说清楚 —— 主张与证据
9 分钟目标:先判断一句话在说什么,再讨论它是真是假
1.1 三类常见主张
| 类型 | 核心问题 | 例子 |
|---|---|---|
| 描述性事实主张 | 它对现状的描述是否与实际相符? | 「本次测验 40 人中有 35 人达到 60 分。」 |
| 因果性事实主张 | 某个因素(原因)的变化,是否会导致另一个因素(结果)发生改变? | 「使用软件使学生的成绩提高了。」 |
| 价值判断 | 评价标准是什么? | 「这个班考得不错。」 |
描述性主张和因果性主张都属于事实性主张,都需要证据。因果性主张断言「某个因素的变化导致了另一个因素改变」;要检验它,不能只看结果本身,还要比较不同条件(用了与没用、不同用法),并排除其他合理解释。只有在证据确认事实性主张符合实际后,才能称为已核实的事实。价值判断不等于随便说,它也需要公开评价标准和理由。
1.2 定义性陈述与经验性主张
定义性陈述:「所有单身汉都未婚。」它因词义而成立,能帮助我们明确概念,但没有告诉我们现实中有多少单身汉。
经验性主张:「连续使用某软件 4 周的高一学生,数学成绩平均提高。」它可能为真,也可能为假,需要观察或实验。
1.3 把模糊的话改得可以检验
「努力就会成功」中的「努力」「成功」「谁」「多长时间」都不明确。可以改为:
「在同年级且期初成绩相近的学生中,连续 4 周每周完成 5 次规定练习者,在统一测验中的平均进步分是否高于未达到这一练习频率者?」
改写后可以调查,但它首先检验的是练习完成情况与进步分之间的关系;要证明因果,还要继续改进研究设计。
分别判断「使用 4 周后平均提高 30%」「这个软件很好」「软件使学生提高了成绩」属于哪一类主张,并说出每句话还缺少什么信息。
第二讲 · 数字体检 —— 数字不会自动说真话
12 分钟目标:检查来源、口径、样本、比较和不确定性
2.1 数字的五项检查
- 来源:谁收集的?原始记录能否核查?是否存在利益关系?
- 口径:测量了什么?单位、时间范围和定义是否一致?
- 样本:研究了谁?这些人如何被选中?
- 比较:和谁比、和什么时候比?有没有合适的对照?
- 不确定性:样本有多大?结果是否可能只是随机波动?
2.2 平均数、百分比与基数
30 人中,1 人年收入 1 亿元,29 人年收入 10 万元。平均年收入是 343 万元,中位数却是 10 万元。两者都算对了,但回答的是不同问题。
某比例从 4% 变为 6%,可以说「增加 2 个百分点」,也可以说「相对原来增加 50%」。看到百分比时,必须同时寻找原来的基数。
若平均分从 50 分变为 65 分,这是增加 15 分,也是相对原分数增加 30%。只给「30%」而不给原始分数,会放大表达的冲击力。
平均数描述的是群体,不是每一个人。「平均提高 30%」不等于每名学生都提高 30%,还要查看个人变化的分布。
2.3 随机抽样有帮助,但不提供保证
简单随机抽样让抽样框中的每个个体有相同机会被选中,可以降低人为挑选造成的偏差。但样本能否较好反映总体,还取决于抽样框是否完整、样本量、无应答情况以及是否需要分层或加权。
2.4 选学拓展:比较风险要使用同一把尺
「每人」「每次」「每公里」是不同的分母,回答不同问题。某事件发生的条件概率描述个体在给定条件下的风险;当这些个体的条件和风险口径可以视为相同时,用概率乘以人数得到的是群体中事件数量的期望值,不是必然发生的人数。二者不能混称为同一种「实际风险」。
2.5 选学拓展:常见数据统计误区(5 例,约 8 分钟)
下面各例中的计算未必错误,真正的问题常常是:数字所能支持的结论,被说得过强了。建议先读材料、自己判断,再看分析;课堂时间有限时可选讲 2 至 3 例,其余留作课后自查。
误区一:把有偏样本当作全体
材料:软件只向连续使用满 4 周的用户弹出问卷,100 名回复者中有 90 人认为软件有帮助。广告据此称:「90% 的学生认可本软件。」
问题:持续使用者本来就可能更认可软件,提前停用者又没有被询问;主动回复的人也可能与未回复者不同。
正确判断:90% 只是在这 100 名回复者中的比例。若要推断全体用户,需要先明确总体,再从总体中取得更有代表性的样本。
误区二:用平均数代替多数人的情况
材料:5 名学生的进步分依次为 −4、−2、0、6、40 分,平均进步 8 分。广告据此称:「学生通常能提高 8 分。」
问题:平均数被 40 分这个较大值明显拉高,不能代表多数人的变化。
正确判断:(−4−2+0+6+40)÷5=8,计算没有错;但中位数是 0 分,只有 2 人进步。应同时查看中位数、每个人的变化和数据分布。
误区三:混淆人数与比例
材料:某月 1000 名用户中有 20 人投诉;次月 3000 名用户中有 30 人投诉。有人说:「投诉人数增加了 50%,用户体验变差了。」
问题:投诉人数确实增加了 50%,但用户总数也变了,只看人数不能判断投诉发生的频繁程度。
正确判断:投诉用户比例由 20÷1000=2% 降为 30÷3000=1%。注意两种说法:下降了 1 个百分点(这是绝对差),或相比上月的 2% 下降了 50%(这是相对变化)——两者都对,但回答的是不同问题;人数与比例也应分开报告。
误区四:利用截断坐标轴夸大差异
材料:两组平均分分别为 72 分和 75 分。柱状图纵轴从 70 分开始,两根柱的可见高度便是 2 和 5,看起来后一组是前一组的 2.5 倍。
问题:2.5 倍只是截断后可见柱高之比,不是两组成绩之比;图形放大了 3 分差异带来的视觉冲击。
正确判断:两组实际相差 3 分。截断坐标轴可以帮助观察小变化,但必须醒目标明。注意并非所有图表都必须从 0 开始——观察体温波动或股价走势时,截断纵轴是常见且合理的做法;但当柱长用于比较总量或均值的大小时,纵轴应从 0 开始,否则柱长比例会误导读者。
误区五:只挑选有利结果
材料:5 所学校各有 40 名学生参加测试,各校平均进步分依次为 8、6、1、0、−5 分。广告只展示前两所学校,并称:「多所学校验证,平均提高 7 分。」
问题:只报告最有利的两所学校,隐藏了其余结果,这叫作选择性报告。
正确判断:因为各校人数相同,全部 200 名学生的平均进步为 (8+6+1+0−5)÷5=2 分。研究应报告事先确定的全部样本和指标;而且仅有前后变化,仍不足以证明软件造成了这 2 分进步。
针对「使用 4 周后平均提高 30%」,按数据五问各提出一个需要补充的问题。
第三讲 · 从相关到因果 —— 结论不能走得比证据更远
14 分钟目标:识别混淆变量、反向因果,并设计更强的检验
3.1 两个不同的问题
在本课讨论的统计相关关系中,一个变量不能由另一个变量精确确定,但一个变量变化时,另一个变量的取值或分布仍呈现系统性变化;相关可以为正、为负,也可以存在时间滞后。因果影响是指:在明确的人群和条件下,与不改变因素 X 或使它处于另一状态相比,对 X 采取不同干预会使结果 Y 的平均水平或发生概率产生系统性差异。
自愿使用软件的学生平均进步 8 分,未使用者平均进步 3 分。这说明「是否使用」与「进步分」在这个样本中有关联,但还不能直接说明软件造成了 5 分的差异。
3.2 审查因果主张的三问
- 确有稳定关联吗?差异是否可能来自偶然波动或测量方式?
- 时间顺序正确吗?被认为的原因是否先于结果?
- 还有其他解释吗?是否存在混淆变量、选择偏差或反向因果?
可能的混淆变量:使用者原本更自律、参加了额外补习、所在班级教师不同,或期初成绩不同。
可能的选择方向:特别想提高成绩的学生更愿意主动使用软件。此时「动机」同时影响使用行为和成绩变化。
注意:三问只能帮助我们发现问题。即使暂时没有找到其他解释,也不等于因果关系已经得到证明。
3.3 怎样获得更强的因果证据
| 设计要点 | 在学习软件研究中的做法 |
|---|---|
| 随机分组 | 在自愿参加且条件合适的学生中,随机分配使用方式,降低原有差异造成的偏差。 |
| 合理对照 | 两组学习时间相同,一组使用软件,一组使用普通练习材料。 |
| 统一测量 | 使用相同前测、后测和评分标准,比较两组的平均进步分。 |
| 足够样本与重复 | 在不同班级重复研究,并报告差异大小和不确定性。 |
| 减少主观偏差 | 学生很难不知道自己是否使用软件,但阅卷者可以不知道试卷来自哪一组。 |
3.4 选学拓展:因果背后的哲学问题(约 5 分钟)
先分清两类问题:世界中是否存在产生结果的因果结构,以及我们凭什么确认某个因素是原因。前者讨论世界本身,后者讨论证据和认识;本节主要讨论后者。
1. 因果问题包含一个无法直接看到的比较。小林使用软件 4 周后提高了 8 分,这是实际发生的结果。要问「软件使他提高了多少」,还要与「同一时期其他相关条件保持可比,但他没有使用软件时会得到多少分」比较。这个没有实际发生、却用于比较的结果叫作反事实结果。
同一个人在同一时期不可能既使用又不使用软件,所以个体的两个结果无法同时观察。随机分组不能保证两组学生完全相同,但分组由随机机制决定,研究者不能系统地把基础更好的学生放进某一组;样本较大时,两组通常会更可比,从而估计两种干预下的平均因果影响。
2. 反复出现的先后关系,本身还不是完整的因果说明。闹钟可能连续许多天都在日出前响,但改变或关闭闹钟并不会改变日出。休谟提出的经典提醒是:即使事件 A 总在事件 B 之前出现,我们直接观察到的仍是重复的先后与共同变化,而不是由观察本身保证的「逻辑必然联系」。这不是说因果关系不存在,也不是说科学不能研究因果;它提醒我们,不能仅凭「每次都是先 A 后 B」就结束论证。
3. 干预证据与机制证据可以互相加强。随机对照研究在问:「有计划地改变软件使用方式,成绩分布是否随之改变?」进一步检查学习记录和不同题型,还可以研究可能的作用路径:「使用软件 → 增加针对性练习 → 掌握相应知识 → 测验成绩提高。」一个听起来顺畅的机制故事不能代替证据;一次实验观察到差异,也不表示已经弄清全部机制。
4. 因果结论通常有条件,也带有不确定性。「使用软件的学生平均多提高 5 分」不表示每名学生都恰好多提高 5 分;在自愿参加的高一学生中得到的结果,也不一定适用于所有年级、所有软件和所有教学环境。严谨的因果结论应说明对谁、在什么条件下、采用何种干预、与什么比较、结果怎样变化,并允许新证据增强、限制或修正原有判断。
找出观察性比较中的两个其他解释,再提出一项能增强因果证据的设计。
第四讲 · 科学判断 —— 可检验、可修正、有边界
11 分钟目标:理解科学结论为何可靠,又为何保留修正空间
4.1 可检验性是一项重要要求
波普尔强调:科学理论应当承担被证据反驳的风险。这里的重点不是给所有知识划一条唯一边界,而是要求经验性主张说清楚:什么结果会使我们降低对它的信心。
「如果成绩没有提高,说明你没有真正使用,或者这种方法只对相信它的人有效。」如果任何结果都能被事后解释,主张就没有承担检验风险,经验内容很弱。
4.2 逻辑检查推理,证据检查前提
在演绎推理中,前提为真且推理有效,结论才必然为真。逻辑可以检查结论是否由前提推出,却不能仅凭形式保证经验前提真实;观察和实验也只能在一定条件与误差范围内支持前提。
「如果下雨,操场会湿;操场湿了;所以一定下过雨。」形式是「如果 p,那么 q;q;所以 p」,结论并不必然成立,因为洒水也会使操场变湿。同样,看到学生成绩提高,不能仅凭这一结果断定软件是原因。
选学拓展:三种常用推理
| 推理方式 | 作用 | 应当注意 |
|---|---|---|
| 演绎 | 由前提推出必然结论 | 检查前提是否为真、形式是否有效 |
| 归纳 | 由样本概括总体或预测未来 | 结论有强弱,不具有演绎必然性 |
| 最佳解释推理 | 比较多个可能解释 | 比较证据契合、解释范围、可检验预测与简洁性,结论仍是暂定的 |
4.3 科学结论不是只有「信」或「不信」
一次小样本观察可以提供初步线索;设计良好、结果稳定的多项独立研究能带来更高信心。科学共同体依据现有证据将结论接受为目前的最佳解释,并明确其适用边界,而不是将其封为「永久的绝对真理」。一次异常结果通常也不会立刻推翻理论,需要检查仪器、方法和辅助假设,并重复检验。
第一次只有一个班的自愿使用数据;后来出现多个学校的随机对照研究,结果方向一致。你的可信度评分应怎样变化?还要保留哪些限制?
第五讲 · 从判断到行动 —— 理性决策
7 分钟目标:合理使用专家意见,在不确定条件下比较收益与成本
5.1 专家意见是证据,但不是终点
我们不可能亲自验证所有知识,合理依赖相关领域专家并不是谬误。判断专家意见时,可以检查:
选学拓展:四种常见的判断陷阱
5.2 判断与行动不是同一个问题
如果下雨概率为 40%,是否带伞还取决于淋雨的损失、带伞的麻烦和是否容易找到避雨处。理性行动不仅看概率,还比较行动后果。
- 机会成本:选择某方案时,所放弃的最佳替代方案的价值。
选学拓展:不要让沉没成本绑架下一步
沉没成本是已经发生且无法收回的成本。决定下一步时,应比较未来的收益和成本,而不是只因「已经投入很多」就继续。
先根据证据估计它对自己可能有多大帮助,再比较价格、时间和最佳替代学习方式。若已经购买,是否继续使用仍应看未来效果;如果继续使用确有收益,就不是沉没成本谬误。
总结 · 一条可以反复使用的判断链
3 分钟| # | 步骤 | 核心问题 |
|---|---|---|
| 1 | 澄清主张 | 它是描述性事实主张、因果性事实主张,还是价值判断? |
| 2 | 检查证据 | 来源、口径、样本、比较和不确定性怎样? |
| 3 | 检查推理 | 证据支持相关还是因果?还有其他解释吗? |
| 4 | 调整信心 | 目前能下多强的结论?什么证据会改变判断? |
| 5 | 选择行动 | 在不确定性下,收益、风险和机会成本怎样? |
仍然面对开场广告,请完成三件事:
- 指出「平均提高 30%」中的一个口径问题;
- 指出观察性比较中的一个可能混淆变量;
- 写出一条会明显提高或降低你对广告信心的新证据。
本节为思维训练课 · 核心课 60 分钟 · 折叠拓展可用于加课或课后阅读 · 无计分测试,含形成性检测