← 返回课程列表

理性认识世界
证据 · 推理 · 判断 —— 给高一学生的思维训练课

理性不是怀疑一切,而是让判断与证据相称,并愿意根据新证据调整判断。

对象:高一学生(已学集合与函数基础) 核心时长:60 分钟(含互动,折叠拓展另计) 形式:贯穿案例 + 讨论 + 当堂检测
学习目标学完本课,你应当能够:
  1. 分清描述性事实主张、因果性事实主张和价值判断;
  2. 检查数字的来源、口径、样本和比较基准;
  3. 区分相关与因果,并指出可能的其他解释;
  4. 根据证据强弱表达不同程度的确信,并说明什么证据会改变自己的判断。

开场:一句「有数据」的广告就可信吗?

4 分钟
贯穿全课的材料

某学习软件广告称:「高一学生使用本软件 4 周后,数学成绩平均提高 30%,效果已被多所学校验证。」

先做判断(个人 20 秒,同桌交流 40 秒)

如果 0 表示「完全不能相信」,10 表示「几乎可以确定」,你现在给这句话几分?还缺少哪一条关键信息?

全课四问面对任何主张,先问:
  1. 主张是什么?它说得足够明确吗?
  2. 证据是什么?证据来自哪里?
  3. 推理成立吗?证据能够支持多强的结论?
  4. 还有别的解释吗?什么新证据会改变判断?

第一讲 · 先把话说清楚 —— 主张与证据

9 分钟

目标:先判断一句话在说什么,再讨论它是真是假

1.1 三类常见主张

类型核心问题例子
描述性事实主张它对现状的描述是否与实际相符?「本次测验 40 人中有 35 人达到 60 分。」
因果性事实主张某个因素(原因)的变化,是否会导致另一个因素(结果)发生改变?「使用软件使学生的成绩提高了。」
价值判断评价标准是什么?「这个班考得不错。」

描述性主张和因果性主张都属于事实性主张,都需要证据。因果性主张断言「某个因素的变化导致了另一个因素改变」;要检验它,不能只看结果本身,还要比较不同条件(用了与没用、不同用法),并排除其他合理解释。只有在证据确认事实性主张符合实际后,才能称为已核实的事实。价值判断不等于随便说,它也需要公开评价标准和理由。

1.2 定义性陈述与经验性主张

定义性陈述:「所有单身汉都未婚。」它因词义而成立,能帮助我们明确概念,但没有告诉我们现实中有多少单身汉。

经验性主张:「连续使用某软件 4 周的高一学生,数学成绩平均提高。」它可能为真,也可能为假,需要观察或实验。

可检验可检验不是「已经正确」,而是说我们能够说明:观察到什么会增强信心,观察到什么会降低信心。

1.3 把模糊的话改得可以检验

「努力就会成功」中的「努力」「成功」「谁」「多长时间」都不明确。可以改为:

「在同年级且期初成绩相近的学生中,连续 4 周每周完成 5 次规定练习者,在统一测验中的平均进步分是否高于未达到这一练习频率者?」

改写后可以调查,但它首先检验的是练习完成情况与进步分之间的关系;要证明因果,还要继续改进研究设计。

分类练习(2 分钟)

分别判断「使用 4 周后平均提高 30%」「这个软件很好」「软件使学生提高了成绩」属于哪一类主张,并说出每句话还缺少什么信息。

参考:第一句是描述性事实主张,需明确样本、测验和「30%」的算法;第二句是价值判断,需说明「好」的标准;第三句是因果性事实主张,需要对照研究并排除其他原因。

第二讲 · 数字体检 —— 数字不会自动说真话

12 分钟

目标:检查来源、口径、样本、比较和不确定性

2.1 数字的五项检查

数据五问
  1. 来源:谁收集的?原始记录能否核查?是否存在利益关系?
  2. 口径:测量了什么?单位、时间范围和定义是否一致?
  3. 样本:研究了谁?这些人如何被选中?
  4. 比较:和谁比、和什么时候比?有没有合适的对照?
  5. 不确定性:样本有多大?结果是否可能只是随机波动?

2.2 平均数、百分比与基数

平均数会被极端值拉动

30 人中,1 人年收入 1 亿元,29 人年收入 10 万元。平均年收入是 343 万元,中位数却是 10 万元。两者都算对了,但回答的是不同问题。

百分点不等于百分比

某比例从 4% 变为 6%,可以说「增加 2 个百分点」,也可以说「相对原来增加 50%」。看到百分比时,必须同时寻找原来的基数。

回到「成绩提高 30%」

若平均分从 50 分变为 65 分,这是增加 15 分,也是相对原分数增加 30%。只给「30%」而不给原始分数,会放大表达的冲击力。

平均数描述的是群体,不是每一个人。「平均提高 30%」不等于每名学生都提高 30%,还要查看个人变化的分布。

2.3 随机抽样有帮助,但不提供保证

简单随机抽样让抽样框中的每个个体有相同机会被选中,可以降低人为挑选造成的偏差。但样本能否较好反映总体,还取决于抽样框是否完整、样本量、无应答情况以及是否需要分层或加权。

样本量「10 人中有 9 人同意」与「1000 人中有 900 人同意」比例相同,但后者通常更稳定。样本再大,如果只选愿意参加的人,也可能产生系统偏差。
2.4 选学拓展:比较风险要使用同一把尺

「每人」「每次」「每公里」是不同的分母,回答不同问题。某事件发生的条件概率描述个体在给定条件下的风险;当这些个体的条件和风险口径可以视为相同时,用概率乘以人数得到的是群体中事件数量的期望值,不是必然发生的人数。二者不能混称为同一种「实际风险」。

2.5 选学拓展:常见数据统计误区(5 例,约 8 分钟)

下面各例中的计算未必错误,真正的问题常常是:数字所能支持的结论,被说得过强了。建议先读材料、自己判断,再看分析;课堂时间有限时可选讲 2 至 3 例,其余留作课后自查。

误区一:把有偏样本当作全体

材料:软件只向连续使用满 4 周的用户弹出问卷,100 名回复者中有 90 人认为软件有帮助。广告据此称:「90% 的学生认可本软件。」

问题:持续使用者本来就可能更认可软件,提前停用者又没有被询问;主动回复的人也可能与未回复者不同。

正确判断:90% 只是在这 100 名回复者中的比例。若要推断全体用户,需要先明确总体,再从总体中取得更有代表性的样本。

误区二:用平均数代替多数人的情况

材料:5 名学生的进步分依次为 −4、−2、0、6、40 分,平均进步 8 分。广告据此称:「学生通常能提高 8 分。」

问题:平均数被 40 分这个较大值明显拉高,不能代表多数人的变化。

正确判断:(−4−2+0+6+40)÷5=8,计算没有错;但中位数是 0 分,只有 2 人进步。应同时查看中位数、每个人的变化和数据分布。

误区三:混淆人数与比例

材料:某月 1000 名用户中有 20 人投诉;次月 3000 名用户中有 30 人投诉。有人说:「投诉人数增加了 50%,用户体验变差了。」

问题:投诉人数确实增加了 50%,但用户总数也变了,只看人数不能判断投诉发生的频繁程度。

正确判断:投诉用户比例由 20÷1000=2% 降为 30÷3000=1%。注意两种说法:下降了 1 个百分点(这是绝对差),或相比上月的 2% 下降了 50%(这是相对变化)——两者都对,但回答的是不同问题;人数与比例也应分开报告。

误区四:利用截断坐标轴夸大差异

材料:两组平均分分别为 72 分和 75 分。柱状图纵轴从 70 分开始,两根柱的可见高度便是 2 和 5,看起来后一组是前一组的 2.5 倍。

问题:2.5 倍只是截断后可见柱高之比,不是两组成绩之比;图形放大了 3 分差异带来的视觉冲击。

正确判断:两组实际相差 3 分。截断坐标轴可以帮助观察小变化,但必须醒目标明。注意并非所有图表都必须从 0 开始——观察体温波动或股价走势时,截断纵轴是常见且合理的做法;但当柱长用于比较总量或均值的大小时,纵轴应从 0 开始,否则柱长比例会误导读者。

误区五:只挑选有利结果

材料:5 所学校各有 40 名学生参加测试,各校平均进步分依次为 8、6、1、0、−5 分。广告只展示前两所学校,并称:「多所学校验证,平均提高 7 分。」

问题:只报告最有利的两所学校,隐藏了其余结果,这叫作选择性报告。

正确判断:因为各校人数相同,全部 200 名学生的平均进步为 (8+6+1+0−5)÷5=2 分。研究应报告事先确定的全部样本和指标;而且仅有前后变化,仍不足以证明软件造成了这 2 分进步。

共同规律看到醒目的数字,不只问「算得对不对」,还要问:它描述的是谁、采用什么口径、遗漏了什么,以及结论是否超过数据真正能支持的范围。
给广告做数据体检(2 分钟)

针对「使用 4 周后平均提高 30%」,按数据五问各提出一个需要补充的问题。

参考:谁资助并收集数据?「提高 30%」怎样计算?调查了哪些学校、多少学生、如何选人?与未使用者还是与自己的前测比较?结果在不同班级是否稳定?在回答这些问题前,只能说广告提供了一个待核查的主张。

第三讲 · 从相关到因果 —— 结论不能走得比证据更远

14 分钟

目标:识别混淆变量、反向因果,并设计更强的检验

3.1 两个不同的问题

在本课讨论的统计相关关系中,一个变量不能由另一个变量精确确定,但一个变量变化时,另一个变量的取值或分布仍呈现系统性变化;相关可以为正、为负,也可以存在时间滞后。因果影响是指:在明确的人群和条件下,与不改变因素 X 或使它处于另一状态相比,对 X 采取不同干预会使结果 Y 的平均水平或发生概率产生系统性差异。

假设观察到一组数据

自愿使用软件的学生平均进步 8 分,未使用者平均进步 3 分。这说明「是否使用」与「进步分」在这个样本中有关联,但还不能直接说明软件造成了 5 分的差异。

3.2 审查因果主张的三问

因果三问
  1. 确有稳定关联吗?差异是否可能来自偶然波动或测量方式?
  2. 时间顺序正确吗?被认为的原因是否先于结果?
  3. 还有其他解释吗?是否存在混淆变量、选择偏差或反向因果?

可能的混淆变量:使用者原本更自律、参加了额外补习、所在班级教师不同,或期初成绩不同。

可能的选择方向:特别想提高成绩的学生更愿意主动使用软件。此时「动机」同时影响使用行为和成绩变化。

注意:三问只能帮助我们发现问题。即使暂时没有找到其他解释,也不等于因果关系已经得到证明。

3.3 怎样获得更强的因果证据

设计要点在学习软件研究中的做法
随机分组在自愿参加且条件合适的学生中,随机分配使用方式,降低原有差异造成的偏差。
合理对照两组学习时间相同,一组使用软件,一组使用普通练习材料。
统一测量使用相同前测、后测和评分标准,比较两组的平均进步分。
足够样本与重复在不同班级重复研究,并报告差异大小和不确定性。
减少主观偏差学生很难不知道自己是否使用软件,但阅卷者可以不知道试卷来自哪一组。
证据强度随机对照通常能提供更强的因果证据,但也不是自动正确;执行偏差、样本流失、测量误差和研究适用范围仍需检查。不能随机实验时,可以结合长期观察、自然实验、作用机制和多项独立研究。
3.4 选学拓展:因果背后的哲学问题(约 5 分钟)

先分清两类问题:世界中是否存在产生结果的因果结构,以及我们凭什么确认某个因素是原因。前者讨论世界本身,后者讨论证据和认识;本节主要讨论后者。

1. 因果问题包含一个无法直接看到的比较。小林使用软件 4 周后提高了 8 分,这是实际发生的结果。要问「软件使他提高了多少」,还要与「同一时期其他相关条件保持可比,但他没有使用软件时会得到多少分」比较。这个没有实际发生、却用于比较的结果叫作反事实结果

同一个人在同一时期不可能既使用又不使用软件,所以个体的两个结果无法同时观察。随机分组不能保证两组学生完全相同,但分组由随机机制决定,研究者不能系统地把基础更好的学生放进某一组;样本较大时,两组通常会更可比,从而估计两种干预下的平均因果影响

2. 反复出现的先后关系,本身还不是完整的因果说明。闹钟可能连续许多天都在日出前响,但改变或关闭闹钟并不会改变日出。休谟提出的经典提醒是:即使事件 A 总在事件 B 之前出现,我们直接观察到的仍是重复的先后与共同变化,而不是由观察本身保证的「逻辑必然联系」。这不是说因果关系不存在,也不是说科学不能研究因果;它提醒我们,不能仅凭「每次都是先 AB」就结束论证。

3. 干预证据与机制证据可以互相加强。随机对照研究在问:「有计划地改变软件使用方式,成绩分布是否随之改变?」进一步检查学习记录和不同题型,还可以研究可能的作用路径:「使用软件 → 增加针对性练习 → 掌握相应知识 → 测验成绩提高。」一个听起来顺畅的机制故事不能代替证据;一次实验观察到差异,也不表示已经弄清全部机制。

4. 因果结论通常有条件,也带有不确定性。「使用软件的学生平均多提高 5 分」不表示每名学生都恰好多提高 5 分;在自愿参加的高一学生中得到的结果,也不一定适用于所有年级、所有软件和所有教学环境。严谨的因果结论应说明对谁、在什么条件下、采用何种干预、与什么比较、结果怎样变化,并允许新证据增强、限制或修正原有判断。

核心认识因果判断不是寻找脱离条件的「绝对必然性」,而是借助明确的反事实比较、合适的干预设计、可信的作用机制和可重复的证据,判断某种改变会在什么条件下使结果产生怎样的差异。
改进研究(3 分钟)

找出观察性比较中的两个其他解释,再提出一项能增强因果证据的设计。

参考:动机、原有基础、补习、教师差异都可能同时影响使用选择和成绩。可以在条件相近且自愿参加的学生中随机分组,控制学习时间,统一前后测,并在多个班级重复。

第四讲 · 科学判断 —— 可检验、可修正、有边界

11 分钟

目标:理解科学结论为何可靠,又为何保留修正空间

4.1 可检验性是一项重要要求

波普尔强调:科学理论应当承担被证据反驳的风险。这里的重点不是给所有知识划一条唯一边界,而是要求经验性主张说清楚:什么结果会使我们降低对它的信心。

可检验版本「对研究范围内的高一学生,连续使用软件 4 周,在学习时间相同的条件下,实验组的平均进步分比对照组至少高 5 分。」若多次高质量研究都没有观察到这一差异,我们就应降低信心或修改主张。
不能这样保护主张

「如果成绩没有提高,说明你没有真正使用,或者这种方法只对相信它的人有效。」如果任何结果都能被事后解释,主张就没有承担检验风险,经验内容很弱。

4.2 逻辑检查推理,证据检查前提

在演绎推理中,前提为真且推理有效,结论才必然为真。逻辑可以检查结论是否由前提推出,却不能仅凭形式保证经验前提真实;观察和实验也只能在一定条件与误差范围内支持前提。

一个常见的无效推理

「如果下雨,操场会湿;操场湿了;所以一定下过雨。」形式是「如果 p,那么 q;q;所以 p」,结论并不必然成立,因为洒水也会使操场变湿。同样,看到学生成绩提高,不能仅凭这一结果断定软件是原因。

选学拓展:三种常用推理
推理方式作用应当注意
演绎由前提推出必然结论检查前提是否为真、形式是否有效
归纳由样本概括总体或预测未来结论有强弱,不具有演绎必然性
最佳解释推理比较多个可能解释比较证据契合、解释范围、可检验预测与简洁性,结论仍是暂定的

4.3 科学结论不是只有「信」或「不信」

一次小样本观察可以提供初步线索;设计良好、结果稳定的多项独立研究能带来更高信心。科学共同体依据现有证据将结论接受为目前的最佳解释,并明确其适用边界,而不是将其封为「永久的绝对真理」。一次异常结果通常也不会立刻推翻理论,需要检查仪器、方法和辅助假设,并重复检验。

科学态度结论有强弱,模型有边界,判断可更新。可检验性很重要,可靠测量、可重复性、预测能力和不同证据相互印证也同样重要。
更新判断(2 分钟)

第一次只有一个班的自愿使用数据;后来出现多个学校的随机对照研究,结果方向一致。你的可信度评分应怎样变化?还要保留哪些限制?

参考:可信度应提高,因为选择偏差减小且结果得到独立重复;但仍要检查样本是否适用于自己、效果大小、研究执行质量、是否存在未发表的相反结果,以及长期效果是否持续。

第五讲 · 从判断到行动 —— 理性决策

7 分钟

目标:合理使用专家意见,在不确定条件下比较收益与成本

5.1 专家意见是证据,但不是终点

我们不可能亲自验证所有知识,合理依赖相关领域专家并不是谬误。判断专家意见时,可以检查:

专家四问专业领域是否相关?是否给出可检查的证据?同行研究总体是否一致?是否披露赞助和利益关系?个别权威的头衔不能代替完整证据。
选学拓展:四种常见的判断陷阱
以偏概全用少数熟人或个案推断所有人,结论超过了样本能支持的范围。
确认偏误只寻找支持原有看法的证据,忽略或降低相反证据的重要性。
虚假两难把多种可能压缩成非此即彼,例如「不用这个软件就一定会落后」。
人身攻击用说话者的身份或成绩代替对其证据和推理的检查。

5.2 判断与行动不是同一个问题

同样的概率,可以产生不同的合理行动

如果下雨概率为 40%,是否带伞还取决于淋雨的损失、带伞的麻烦和是否容易找到避雨处。理性行动不仅看概率,还比较行动后果。

选学拓展:不要让沉没成本绑架下一步

沉没成本是已经发生且无法收回的成本。决定下一步时,应比较未来的收益和成本,而不是只因「已经投入很多」就继续。

是否购买学习软件?

先根据证据估计它对自己可能有多大帮助,再比较价格、时间和最佳替代学习方式。若已经购买,是否继续使用仍应看未来效果;如果继续使用确有收益,就不是沉没成本谬误。

总结 · 一条可以反复使用的判断链

3 分钟
#步骤核心问题
1澄清主张它是描述性事实主张、因果性事实主张,还是价值判断?
2检查证据来源、口径、样本、比较和不确定性怎样?
3检查推理证据支持相关还是因果?还有其他解释吗?
4调整信心目前能下多强的结论?什么证据会改变判断?
5选择行动在不确定性下,收益、风险和机会成本怎样?
退出检测(独立完成 2 分钟)

仍然面对开场广告,请完成三件事:

  1. 指出「平均提高 30%」中的一个口径问题;
  2. 指出观察性比较中的一个可能混淆变量;
  3. 写出一条会明显提高或降低你对广告信心的新证据。
参考:①先问清楚口径:「30%」是什么的 30%?是相对每个人前测成绩的平均提升幅度,还是整体平均分的提升幅度?是分数的相对增长率,还是及格率/优良率增加了 30 个百分点?再核对原始平均分与计算方法;②学习动机、原有基础、教师、补习等都可能混淆;③多个学校预先设计、执行良好的随机对照研究若重复得到相近结果,会提高信心,反之会降低信心。答案不要求完全相同,但必须说明证据如何影响判断。
最后一句:理性的人不保证永远正确,但能够说明「我为什么这样判断」,也知道「什么证据会让我改变判断」。

本节为思维训练课 · 核心课 60 分钟 · 折叠拓展可用于加课或课后阅读 · 无计分测试,含形成性检测