← 课程列表

前置知识:课件 1(自然数——计数基础)

数据的收集与整理

起源:人类为什么要统计?

公元前 3000 年,古埃及法老要做一件大事:建金字塔。他需要知道:全国有多少人?多少人能干活?仓库里有多少粮食能养活工人?于是,最早的"人口普查"就诞生了——官员挨家挨户登记人数、牲畜和粮食。

在中国,大禹治水(约公元前 2000 年)时,也统计了全国的土地和人口。《尚书·禹贡》就记载了各地的物产和赋税。到了周朝,更有了专门的"司民"官职,负责统计人口。

到了明朝洪武年间(14 世纪末),朱元璋在全国推行了著名的"鱼鳞册"(又称"鱼鳞图册")——一种用于土地登记和统计的图册。因为图册中每块土地按形状画出,一块块拼起来像鱼鳞,所以叫"鱼鳞图册"。朝廷派官员到各地丈量土地,把每块田的位置、面积、主人、肥瘠等级都登记在册,作为征收赋税的依据。这是古代中国最系统、规模最大的统计实践之一,沿用了几百年——统计不仅是"数人头",更是治国理财的基础。

到了现代,美国总统大选、奥运奖牌榜、天气预报、疫情数据……统计无处不在。数据就像侦探的眼睛,帮我们看清世界的真相。

但收集数据只是第一步——一堆杂乱的数据毫无用处,必须整理才能看出规律。这就是本课要学的内容。

一、统计调查:普查与抽样调查

想知道全班 50 个同学的身高,最好的办法是每个人都量一遍。这就是普查——对全体对象逐一调查。

但有些事不可能普查:你想知道全国人民最喜欢吃什么口味的方便面,难道要问遍 14 亿人?太慢了,也太贵了!

这时候就用抽样调查——从总体中选出一部分作为样本,用样本的情况来推测总体。

普查 vs 抽样调查:

  • 普查:对全体对象逐一调查。结果准确,但费时费力。
  • 抽样调查:只调查一部分对象。省时省力,但有误差。

什么时候用普查?对象不多、结果必须精确的时候。比如:全班同学的身高、学校运动会的报名人数。

什么时候用抽样调查?对象太多、或者调查会破坏对象的时候。比如:灯泡寿命测试(测完灯泡就坏了!)、全国收视率调查。

想一想:以下情况适合普查还是抽样调查?
① 检查一批炮弹的射程——抽样调查(炮弹打出去就没了!)
② 了解全班同学周末的作业时间——普查(才几十个人,不难)
③ 了解某品牌汽车的安全性能——抽样调查(碰撞测试会毁掉车)
④ 全国人口数量——普查(国家每 10 年搞一次,虽然辛苦但必须准确)

二、总体、个体、样本、样本容量

这四个概念是统计学的"四大金刚",一定要分清:

总体:要考察的全体对象
个体:总体中的每一个考察对象。
样本:从总体中抽取的一部分个体
样本容量:样本中个体的数目(注意:不是带单位,只是一个数字)。

例子:为了了解某校七年级 800 名学生的体重情况,从中抽查了 50 名学生的体重。

总体:该校七年级 800 名学生的体重
个体:该校七年级每一名学生的体重
样本:被抽查的 50 名学生的体重
样本容量:50(注意:只写 50,不写"50 名"!)

特别提醒:总体、个体、样本说的都是"体重"这个数据,而不是"学生"这个人!我们考察的是数据,不是人。所以总体是"800 名学生的体重",不是"800 名学生"。

三、数据的整理:频数与频率

收集数据只是第一步,一堆杂乱的数据什么也看不出来。得整理。

假设我们调查了全班 30 个同学最喜欢的运动,得到一堆数据:

篮球、足球、乒乓球、篮球、羽毛球、篮球、足球、乒乓球、篮球、篮球、跑步、足球、篮球、羽毛球、乒乓球、篮球、足球、篮球、乒乓球、跑步、篮球、足球、羽毛球、篮球、乒乓球、篮球、跑步、篮球、足球、乒乓球

乱不乱?太乱了!我们得把它们"分类计数"——这叫做频数统计

频数:就是某个数据出现的次数。

频率:频数 ÷ 总数(通常用百分数表示)。

频率 = 频数 ÷ 数据总数

用"正"字法来统计(每画一笔算一个,一个"正"字正好 5 笔):

运动项目画"正"字频数频率
篮球正正正1313 ÷ 30 ≈ 43.3%
足球正一66 ÷ 30 = 20%
乒乓球55 ÷ 30 ≈ 16.7%
跑步33 ÷ 30 = 10%
羽毛球33 ÷ 30 = 10%
合计30100%

看清规律:整理前,30 个数据杂乱无章;整理后,一眼就能看出——篮球最受欢迎(43.3%),跑步和羽毛球最少(各 10%)。这就是数据整理的力量!

四、直方图:用图形展示数据分布

表格能看出频数,但不够直观。如果数据是连续的数值(比如身高、体重、考试分数),我们常用直方图来展示。

做直方图的步骤:

  1. 找出最大值和最小值,算出极差(最大值 - 最小值)
  2. 决定分组(分成几组,每组叫一个"组距")
  3. 统计每组的频数
  4. 画图:横轴是组别,纵轴是频数,每组的柱子紧紧挨在一起
例子:某班 30 名同学的数学测验成绩如下(满分 100):

58, 62, 65, 68, 70, 72, 73, 75, 76, 78, 78, 80, 81, 82, 83, 84, 85, 85, 86, 87, 88, 89, 90, 91, 92, 93, 94, 95, 96, 98

极差 = 98 - 58 = 40。按每 10 分一组,可以分成 4 组。

分数段频数
50 ~ 601
60 ~ 703
70 ~ 807
80 ~ 9012
90 ~ 1007
直方图:点击柱子查看详细数据 ↓
某班数学成绩分布直方图 频数(人) 分数段 50~60 60~70 70~80 80~90 90~100 0 2 4 6 8 10 12 14 1 3 7 12 7 注:每个柱子代表一个分数段中的人数,柱高 = 频数

直方图 vs 条形图(注意区分!):

  • 直方图:柱子紧挨在一起,表示连续数据(如身高、分数),横轴是数值范围
  • 条形图:柱子分开,表示分类数据(如喜欢的运动项目),横轴是类别

简单说:连续的数值用直方图,分类的数据用条形图。

五、画直方图的完整步骤

第 1 步:计算极差

极差 = 最大值 - 最小值

第 2 步:决定组距和组数

组距 = 极差 ÷ 组数(通常取整数,组数一般在 5~12 组之间)

第 3 步:确定分点

每组的数据范围,要确保每个数据恰好属于一组。

第 4 步:列频数分布表

用"正"字法统计每组的数据个数。

第 5 步:画直方图

横轴标组别,纵轴标频数,柱子紧挨着画。

完整示范:以下是 40 名学生的身高数据(cm):

148, 152, 155, 156, 158, 159, 160, 161, 162, 163, 163, 164, 165, 165, 166, 166, 167, 167, 168, 168, 169, 169, 170, 170, 171, 171, 172, 172, 173, 173, 174, 175, 175, 176, 177, 178, 179, 180, 182, 185

极差 = 185 - 148 = 37。取组距为 5,则组数 = 37 ÷ 5 ≈ 7.4 → 取 8 组。

身高段(cm)频数
148 ~ 1532
153 ~ 1583
158 ~ 1635
163 ~ 1688
168 ~ 17310
173 ~ 1787
178 ~ 1834
183 ~ 1881

从中可以看出:身高集中在 168~173cm 这段的人数最多(10 人),大部分同学身高在 158~183cm 之间。

挑战性问题

问题 1:有人说"抽样调查的结果一定比普查差",你同意吗?为什么?(提示:想想测灯泡寿命的情况)

问题 2:如果样本容量太小,会产生什么问题?假设你只想通过 3 个同学的身高来推测全班 50 人的平均身高,这样做靠谱吗?

问题 3:直方图的柱子为什么要紧挨在一起,而条形图的柱子是分开的?想一想背后的道理。

拓展阅读

统计学的"开山鼻祖":英国数学家约翰·格朗特(John Graunt)在 1662 年写了一本书《关于死亡表的自然与政治观察》,这是历史上第一本用数据说话的书。他整理了伦敦几十年的死亡记录,发现:男孩出生率略高于女孩,但男性死亡率也更高,所以男女比例大致平衡。他还发现了某些疾病的流行规律——这是人类第一次用"数据"而不是"感觉"来理解世界。

有趣的统计事实:如果你在大街上随机问 1000 个人的喜好,结果就已经相当准确了——误差通常不超过 ±3%。这就是为什么美国总统大选的民调通常只问几千人,就能预测几亿人的投票结果。当然,前提是样本选得足够随机

推荐阅读:《中小学数学要义》中关于统计的章节——用通俗的语言讲明白了普查、抽样、频数分布这些概念。

习题

1. 下列调查中,适合用普查还是抽样调查?
(1)了解一批灯泡的使用寿命
(2)了解全班同学的身高
(3)检查飞机上乘客是否携带违禁物品
(4)了解全国初中生的课外阅读时间

想一想:调查会不会破坏对象?对象多不多?
(1)抽样调查(测完灯泡就坏了);(2)普查(全班人不多);(3)普查(安全问题必须逐一检查);(4)抽样调查(全国初中生太多,不可能全问)

2. 为了解某校八年级 600 名学生的视力情况,从中抽取了 50 名学生进行视力检测。请指出总体、个体、样本和样本容量。

注意:总体、个体、样本说的都是"视力"这个数据,不是"学生"。
总体:该校八年级 600 名学生的视力;个体:每一名学生的视力;样本:被抽取的 50 名学生的视力;样本容量:50

3. 在 30 次掷硬币实验中,正面朝上出现了 18 次。正面朝上的频数和频率各是多少?

频数就是出现的次数,频率 = 频数 ÷ 总数。
频数 = 18;频率 = 18 ÷ 30 = 0.6 = 60%

4. 某班 40 人数学测验成绩如下:
65, 72, 78, 81, 85, 88, 90, 66, 73, 79, 82, 85, 88, 91, 68, 74, 79, 83, 86, 89, 92, 70, 75, 80, 84, 87, 89, 93, 71, 76, 80, 84, 87, 90, 94, 69, 72, 77, 81, 82
按 60~70, 70~80, 80~90, 90~100 分组,列出频数分布表。

注意每组包含下限不包含上限(如 60~70 包含 60,不包含 70)。用"正"字法逐一统计。
60~70:5 人;70~80:12 人;80~90:17 人;90~100:6 人。合计 40 人。

5. 一组数据的最大值是 95,最小值是 42。如果组距取 10,可以分成几组?

极差 = 95 - 42 = 53。组数 = 极差 ÷ 组距,结果向上取整。
极差 = 95 - 42 = 53。53 ÷ 10 = 5.3,向上取整为 6 组。

6. 判断下列说法是否正确,并说明理由:
(1)样本容量越大越好
(2)抽样调查的结果一定有误差
(3)要了解全校学生的睡眠情况,只调查了七年级学生,这个样本具有代表性

考虑样本的代表性——样本越随机、越全面,结果越可靠。
(1)不对。样本容量越大越精确,但成本也越高,要在精确度和成本之间平衡。(2)对。抽样调查是用部分推测整体,必然有误差,但可以通过科学抽样来减小误差。(3)不对。只调查七年级,没有覆盖八年级和九年级,样本不具有代表性,结果不可靠。

7. 某校七年级 500 名学生,要了解他们对校服的满意度。下面哪种抽样方法最合理?
A. 只调查男生   B. 只调查成绩好的学生   C. 随机抽取学号末尾为 3 的学生   D. 只调查班干部

好的抽样要"随机"——每个个体被抽到的机会相等,不能有偏向。
C。随机抽取学号末尾为 3 的学生,每个学生被抽到的机会相等,没有偏向性。A(只调查男生)、B(只调查成绩好的)、D(只调查班干部)都有偏向,样本没有代表性。

8. 下表是某班 50 名学生的体重频数分布:

体重(kg)40~4545~5050~5555~6060~65
频数31018145

(1)体重在 50~55kg 的人数占总人数的百分之几?
(2)体重在 55kg 及以上的有多少人?

(1)频率 = 频数 ÷ 总数;(2)每组的频数对应的是"含下限不含上限",所以 55kg 及以上 = 55~60 组 + 60~65 组。
(1)18 ÷ 50 = 0.36 = 36%;(2)14 + 5 = 19 人

9. 小华想了解小区居民每天锻炼的时间,他在小区门口从早上 8 点到 9 点调查了路过的 50 位居民。他的调查结果能代表整个小区的情况吗?为什么?

考虑调查的时间段是否合理——早上 8~9 点出现在小区门口的都是什么人?
不能代表。早上 8~9 点在小区门口出现的,大多是上班族或送孩子上学的家长,而退休老人、夜班工作者等可能在其他时间出现。这个调查存在"时间偏差",样本不具有代表性。

10. 某校调查了 200 名学生的零花钱情况,得到以下数据:

每周零花钱(元)0~2020~4040~6060~8080~100
频数3050604020

(1)每周零花钱在 40 元以上的学生占比是多少?
(2)如果该校共有 1000 名学生,请你估计全校每周零花钱在 40~60 元的大约有多少人?

(1)40 元以上 = 40~60 + 60~80 + 80~100 三组;(2)用样本比例来估计总体:先算样本中 40~60 元的频率,再乘以 1000。
(1)(60 + 40 + 20) ÷ 200 = 120 ÷ 200 = 0.6 = 60%;(2)样本中 40~60 元的频率 = 60 ÷ 200 = 0.3,估计全校:1000 × 0.3 = 300 人。

小结

下一课:数据分析 →