夜雨聆风学习资料网

ARTICLE · 1021603

高中数学—9.2用样本估计总体(必修二)

高中数学—9.2用样本估计总体(必修二)

总体取值规律的估计

教学过程

(一)导入新课

抛出生活实例:政府要制定阶梯水价标准,既要节水,又不能影响大部分居民生活。

如何确定合理月用水量标准?

不能直接看零散原始数据,需要整理样本数据,用样本规律估计总体,引出课题总体取值规律的估计。

(二)新知讲授

  1. 案例背景:抽样得到 100 户居民月均用水量数据,总体是该市全体居民用户,个体是每户居民用户,变量是月均用水量。原始数据杂乱,需要整理。

2. 制作频率分布表、直方图五大步骤

①求极差:极差等于最大值减去最小值。

本例最大值 28.0,最小值 1.3,极差等于 26.7。

②决定组距与组数:样本量不超过 100,常分 5 到 12 组;组数太多太少都会干扰观察分布;可先定组距或者先定组数。

本例取组距等于 3,组数等于 9。

③将数据分组:第一组左端点略小于最小值,最后一组右端点略大于最大值。

本例区间[1.2,28.2],等距分成 9 组。

④列频率分布表:

⑤画频率分布直方图:

也就是对应组的频率;

全部小长方形面积总和等于 1。

3. 解读图表信息:

从图表读出本例大部分居民用水量集中在较低区间,少数用户用水量偏高。

用样本的分布去估计全市居民总体取值规律,样本存在随机性,估计会带有误差。

4. 探究组数带来的影响:

组数少、组距大,容易看出整体规律,但丢失细节信息;

组数多、组距小,保留细节,但图形容易杂乱,看不清整体。

要合理选择组距组数。

(三)巩固理解

回顾阶梯水价案例,结合频率分布表,思考标准 a 该怎么选取,呼应导入。

(四)课堂小结

绘制频率分布直方图步骤,直方图几何意义,组距组数选取要点,补充样本估计总体思想。

(五)布置作业

课后习题;

思考频率分布直方图和频数分布直方图的区别。

试讲

我今天试讲的题目是《总体取值规律的估计》,下面开始我的试讲。 

上课,同学们好,请坐。

同学们,我们国家水资源紧缺,很多城市准备实行阶梯水价。

政府要定一个月用水量标准 a,用水量不超过 a 平价收费,超出就加价收费。

这个标准定低了,会影响很多老百姓生活;定太高,又达不到节水目的。

那我们该怎么确定这个合理标准呢?第一排同学你来谈一谈你的想法。 

很好,请坐。

这位同学说到,我们需要知道全市居民不同用水量所占比例。

全市居民数量巨大,我们做抽样调查,拿到样本数据,依靠样本的规律推测全体居民的用水情况。

这就是我们今天学习的内容 —— 总体取值规律的估计。

现在我们拿到简单随机抽样得到的 100 户居民月均用水量。

这些原始数据杂乱无章,很难直接读出信息。我们初中学习过频数分布表,今天我们学习频率分布表和频率分布直方图来整理数据。

绘制它一共有五步,我们一步步来看。

第一步,求极差。

什么是极差?靠窗这位男生,你来说。 

回答很准确,请坐。

极差就是一组数据最大值减去最小值。在我们这个例子,最大值是 28.0,最小值是 1.3,极差等于 26.7,代表数据整体波动范围。

第二步,确定组距和组数。

大家注意,样本量不超过一百的时候,一般分成五到十二组。

组数过多、过少都不利于观察分布。我们可以先确定组距,也可以先确定组数。

这里我们取组距等于 3,用极差除以组距,算出来等于八点九,所以我们分成九组,这个分组比较合适。

第三步,对数据进行分组。

为了把最大最小值包含进来,第一组左端点略小于最小值,最后一组右端点略大于最大值。

我们取区间从 1.2 到 28.2,按照组距 3 划分九个区间。

第四步,列出频率分布表。

统计落在每一组的数据个数,也就是频数。一组的频率等于频数除以样本容量。

就像表格里面,第一组频数 23,样本量是 100,频率就等于零点二三。以此计算所有小组,所有频率相加等于 1。

有了频率分布表,接下来第五步,画出频率分布直方图。

大家注意,横轴表示月均用水量,纵轴不再是频率,而是频率除以组距。

那小长方形的面积代表什么呢?来,第二排这位女生,你算一算。 

非常棒,请坐。

长方形面积等于组距乘以频率除以组距,化简之后就是这一组的频率。所以每个小长方形面积代表本组频率,全部长方形面积加起来等于 1。

大家观察屏幕上这个直方图,能够读出哪些信息?这位举手的同学,你来分享。 

说得很好,请坐。

从图能够看出,大部分居民月均用水量集中在偏低区间,少数居民用水量很高,图形左边高右边低。我们就用这个样本的频率分布,去估计全市所有居民的用水分布。

当然样本具有随机性,这样估计会存在一定误差。

接下来我们思考,如果同样这 100 组数据,我们分别取组数等于 3 和组数等于 27,画出的图形会怎么样?

大家观察投影上两幅图。

组数少,组距大,容易看见整体趋势,但是丢失很多细节;组数多,组距小,细节保留多,图形却变得杂乱,看不清整体规律。

所以我们分组的时候,组数、组距要合理选择。

新知识学完,谁帮我们梳理本节课学到了什么?来,第三排同学。 

总结很完整,请坐。

我们回顾了绘制频率分布直方图五步:求极差、定组距组数、分组、列频率分布表、画直方图;知道小长方形面积等于频率,总面积之和等于 1;也明白组距组数会影响图形效果,我们用样本取值规律估计总体。

课后作业,完成课后练习;思考,频率分布直方图和频数分布直方图有什么区别。 

本节课到此结束,下课。

板书设计

总体取值规律的估计

一、步骤(频率分布直方图)

1. 求极差:极差 = 最大值-最小值

本例:28.0-1.3=26.7

2. 定组距、组数

n≤100,分 5~12 组

3. 分组:端点略扩大小、大值

4. 列频率分布表:

5. 画频率分布直方图

二、样本估计总体

样本有随机性,估计存在误差

组数组距要合理选取

组数少→看整体,丢细节

组数多→保细节,图形杂乱

作业:对比频率、频数分布直方图区别

总体取值规律的估计(例 1 空气质量)

教学过程

(一)复习导入

1、频率分布表、频率分布直方图,可以分析数值型数据。除了直方图,还有条形图、扇形图、折线图,不同图表有各自优势。

2、今天我们通过空气质量的例题,学习如何选择恰当图表解决实际统计问题。

(二)例题探究

展示例题材料。

1、关键点:6 月只有 30 天,2015 全年 365 天,总天数差距大,不能直接比较频数,必须比较频率。 

2、用频率分布条形图对比:2022 年 6 月优、良的频率高于 2015 全年,污染频率等于零,说明 6 月空气质量好于 2015 全年的平均水平。

3、思考探究:能不能由 6 月数据直接得到 “2022 全年空气质量比 2015 明显改善”? 

4、引导学生发现:6 月只是一个月的样本,局部样本不能直接代表全年总体,不能得出该结论。

(三)巩固小结

梳理各图表作用:

  • 条形图:看各组数量多少;复合条形图方便两组对比

  • 扇形图:看各组占总体比例

  • 折线图:看数据随时间变化趋势

  • 样本容量不同,优先用频率比较分布;局部样本不能随意推断整体。

(四)课堂小结

总结例题收获,图表怎么选,频数频率什么时候用,补充统计严谨性。

(五)布置作业

完成课后练习;

搜集生活中统计图表,说一说它适合展示什么信息。

试讲

我今天试讲的题目是《总体取值规律的估计》,下面开始我的试讲。 

上课,同学们好,请坐。

上一节课,我们学习了频率分布表与频率分布直方图,用来挖掘一组数据的取值规律。

除了直方图,我们还接触过条形图、扇形图、折线图。不同图表各有特点,面对真实问题,我们该怎样选择合适图表呢?

今天我们借助空气质量的例子一起来探究。

大家看大屏幕,这里给出某市 2015 年全年空气质量等级统计表,还有 2022 年 5 月、6 月的空气质量指数原始数据。我们一起来解决三个问题。

首先第一个问题,请大家分析该市 2022 年 6 月的空气质量情况。

原始只是一串指数数字,我们第一步该做什么?第一排同学你来回答。 

很好,请坐。

这位同学说,要对照空气质量等级标准,统计每个等级的天数,也就是频数,再算出对应频率。 

没错。我们统计之后得到 6 月的分布表,6 月一共三十天,空气质量优有 17 天,良有 13 天,没有污染天气。

那可以选择哪些图表展示这组数据呢?靠窗这位男生,你来说。 

回答很全面,请坐。

条形图,能直观看到每个等级天数多少;扇形图,可以看清各个等级占整月的百分比;折线图,还可以观察空气质量指数随着日期推移怎么变化。我们观察图表能够发现,6 月全部天气都是优或者良,优占比超过一半,整体来看 6 月空气质量很好。

接下来第二个问题,比较 2022 年 5 月和 6 月,哪个月空气质量会更好?第二排的女同学,你来思考。 

请坐。

5 月一共三十一天,我们同样统计 5 月各个空气质量等级的频数与频率。两个月总天数很接近,我们可以用复合条形图,把两组数据放在一张图上对比。

大家看图,两个月都没有出现污染天气;空气质量为优的天数,两个月都是 17 天;5 月良的天数比 6 月多一天。综合来看,5 月、6 月空气质量大体相近。

那第三个问题,对比 2022 年 6 月和 2015 年全年,2022 年 6 月空气质量是否好于 2015 全年?

大家注意,6 月只有三十天,2015 全年有三百六十五天。

这种情况,我们还能直接拿天数也就是频数做对比吗?来,第三排这位同学,说一说你的想法。 

说得非常到位,请坐。

两组总天数差距很大,直接对比频数没有意义,我们要转换为频率进行比较。屏幕上这张频率分布条形图,就是用频率绘制的。

从图可以看出,2022 年 6 月优、良的频率明显高于 2015 全年,污染天气的频率等于零。因此,6 月空气质量好于 2015 年全年的平均水平。

那我们能不能就此得出结论:2022 全年空气质量比 2015 年明显改善?最后一排举手的同学,你来谈谈。 

思考得很严谨,请坐。

仅仅一个 6 月的数据,只是局部样本,不能够代表 2022 完整一年,因此不能推出全年的结论。统计推断一定要注意,不能拿局部轻易推断整体。

学到这里,谁来帮我们梳理本节课收获?来,中间这位同学。 

总结得很不错,请坐。

我们复习了不同统计图表的用途:条形图看数量,扇形图看占比,折线图看随时间的变化;当两组样本容量不一样的时候,要拿频率对比,不能直接对比频数;同时做统计推断,要注意样本能不能代表总体。

课后作业,完成课后对应的习题;课后找一找生活当中的统计图表,想一想它适合展示哪一类信息。 

本节课到此结束,下课。

板书设计

总体取值规律的估计(例题)

1、常用统计图表

  • 条形图:看各组数量;复合条形图:两组对比

  • 扇形图:看各组占总体的比例

  • 折线图:看数据随时间变化趋势

2、频数 VS 频率

样本容量接近 → 可用频数对比样本容量不同 → 必须用频率对比

例:6 月(30 天)对比全年(365 天)→比较频率

3、统计注意

局部样本 不能随意推断 总体 

例:仅 6 月数据,不能推出 2022 全年空气质量

作业:搜集生活统计图表,分析作用

总体百分位数的估计

教学过程

(一)情境导入

1、用频率分布表、直方图分析 100 户居民月均用水量样本,得到大部分居民用水量集中在较低区间。

2、抛出实际问题:政府要制定用水标准,希望百分之八十居民水费不受影响,怎么确定用水量标准?

(二)新知探究

1、展示问题:要找到数a,使得不超过a的居民占百分之八十,大于a占百分之二十。使用 100 户样本估计a。100 个数据从小到大排序,第 80、81 个数据分别是 13.6 和 13.8。

区间 13.6 到 13.8 内任意数都满足条件,取二者平均数,得到 13.7,就是第 80 百分位数。实际决策允许近似,建议政府定为 14 吨。

2、给出第p百分位数定义:一组数据的第p百分位数,至少有百分之p的数据小于或等于这个值,且至少有(100 减p)% 的数据大于或等于这个值。

3、总结计算n个数据第p百分位数三步: 

第一步:数据从小到大排序; 

第二步:计算i等于n乘p%; 

第三步:判断i: 

①i不是整数:取大于i的比邻整数j,第p百分位数就是第j项数据; 

②i是整数:取第i项与第i+1项数据的平均数。

补充:中位数就是第 50 百分位数。 

四分位数:第 25、50、75 百分位数,把排序后数据四等分;25 百分位数叫下四分位数,75 百分位数叫上四分位数。

拓展常用:第 1、5、95、99 百分位数。 

强调:样本估计总体会存在偏差,实际决策可以近似取值。

(三)巩固理解

梳理计算流程,强调两种不同情况的区别;结合用水案例,理解百分位数用来辅助现实决策。

思考:样本得到标准,不一定严格保证百分之八十居民达标,因为样本和总体之间存在误差。

(四)课堂小结

引导学生自主总结百分位数定义、计算步骤、四分位数,教师补充统计思想:用样本估计总体,实际问题允许适度近似。

(五)布置作业

课本课后习题;

思考生活中哪些场景可以用百分位数,举例。

试讲

我今天试讲的题目是《总体百分位数的估计》,下面开始我的试讲。 

上课,同学们好,请坐。

上一节课,我们研究了 100 户居民月均用水量,借助频率分布表、直方图,我们发现大部分居民用水量集中在比较低的区间。

那统计得到的数据怎么给政府做决策参考呢?大家看大屏幕这个实际问题。 

市政府想要确定居民月均用水标准,希望百分之八十的居民生活用水费用不受影响,依据这 100 户样本数据,我们该给出怎样建议?

大家先思考。第一排同学你来。 

很好,请坐。

这位同学说,我们要找一个数a,月均用水量不超过a的居民占百分之八十,超过a的占百分之二十。我们就借助样本去估计这个a。

我们把 100 个样本数据从小到大排序,排序之后,第 80 个数据是 13.6,第 81 个数据是 13.8。大家想一想,满足条件的a只能是一个固定值吗?

靠窗这位男生,你来说。 

说得很好,请坐。

区间 13.6 到 13.8 当中任意一个数,都可以把这 100 个样本分成百分之八十和百分之二十两部分。

一般我们取这两个数的平均数,也就是 13.6 加 13.8,再除以二,等于 13.7。

这个数值,就叫做这组数据的第 80 百分位数。

我们用样本第 80 百分位数 13.7,估计总体的第 80 百分位数。但是样本和总体之间会存在偏差,现实决策不需要绝对精准,为方便操作,我们可以建议政府,把月用水量标准定为 14 吨。

那推广到一般情况,什么叫做一组数据的第p百分位数呢?第二排女同学,你来读一读课本定义。 

请坐。

一组数据的第p百分位数,它使得这组数据中,至少有百分之p的数据小于或等于这个值,同时至少有 100 减p百分比的数据大于或等于这个值。

那怎么计算一组n个数据的第p百分位数?跟着老师一起来梳理三步。 

第一步,把原始数据按照从小到大的顺序排列。

 第二步,计算i等于n乘以p%。 

第三步,关键就是判断这个i。

如果i不是整数,我们取大于i的比邻整数j,第p百分位数就是第j项的数据;如果i是整数,就取第i项和第i+1项两项数据的平均数。

大家回忆,初中学习的中位数,对应这里哪一个分位数?第三排同学,你来回答。 

非常棒,请坐。中位数就等于第 50 百分位数。统计里面还有一组很常用的四分位数,就是第 25、50、75 百分位数。

这三个数把排好序的数据分成四等份。第 25 百分位数又叫下四分位数,第 75 百分位数又叫上四分位数。

除此之外,统计中还经常使用第 1、5、95、99 百分位数。

这里大家要注意,百分位数是由样本算出来,用来估计总体,会存在误差。

所以 14 吨这个标准,并不能百分之百保证恰好百分之八十居民用水不超标。

好了,到这里,谁来帮我们总结本节课学到了什么?最后一排举手的同学,你来说。 

总结的很完整,请坐。

今天我们学习了第p百分位数的概念,记住三步计算方法,分清i整数、非整数两种计算情形;知道中位数是第 50 百分位数,认识了四分位数;同时懂得用样本百分位数估计总体,现实决策可以适度近似。

课后作业,完成课本对应习题;课后想一想,生活当中还有哪些场景可以用到百分位数。 

本节课到此结束,下课。

板书设计

总体百分位数的估计

实例:居民用水标准

找a:≤a占 80%,>a占 20% 

100 个数据:第 80 个:13.6;第 81 个:13.8 

第p百分位数

含义:至少p%数据≤该值;至少(100-p)%数据≥该值

计算步骤:

  1. 从小到大排序

  2. i=n×p%

  3. 判断i

    ①i非整数:取大于i的比邻整数j,取第j项

    ②i整数:第i、i+1项的平均数

四分位数

第 25%(下四分位数)、50%(中位数)、75%(上四分位数)

样本估计总体,存在误差,实际可近似

作业:课后习题,举例生活百分位数应用

总体百分位数的估计 ——例2

教学过程

一、复习导入

百分位数的计算步骤:

第一步,把数据从小到大排序;

第二步,计算 i= p%×n;

第三步,判断 i 是不是整数。

i 不是整数,向上取整,对应位置的数据就是百分位数;

i 是整数,取第 i 项和第 i 加一项数据的平均值。

今天我们通过课本例题,实操练习,用样本百分位数估计总体。

二、新课讲授

1、出示例题:根据树人中学高一年级 27 名女生身高样本数据,估计总体的第25、第50、第75百分位数。 

2、带领学生分析题目,样本容量 n=27。 

第一步:将27名女生身高数据从小到大进行排序,在黑板板书排序之后的数据。 

第二步,分别计算三个百分位数对应的 i 值。 

第25百分位数、第50百分位数、第75百分位数.

观察计算结果,三个 i 全部都不是整数,按照规则向上取整,分别取第7项、第14项、第21项的数据。 

从排好序的数据中找出对应位置数值:155.5,161,164。 

得到样本的第25、第50、第75百分位数,以此估计树人中学高一年级女生总体百分位数。 

3、引导思考:这个样本只有二十七人,样本量比较小,我们得到的估计结果会怎么样? 

学生思考后得出:样本量较小,对总体的估计会存在比较大的误差。

三、巩固练习

给出简短小练习:一组共 8 个已经排好的数据,求该组数据的第三十百分位数,随机请同学口述解题步骤,强化做题流程。

四、课堂小结

总结本节课内容:百分位数做题步骤,样本估计总体,小样本存在估计误差,教师补充完善。

五、布置作业

完成课后对应习题,选取生活中一组数据尝试计算它的百分位数。

试讲

我今天试讲的题目是《总体百分位数的估计 ——例2》,下面开始我的试讲。 

上课,同学们好,请坐。 

上节课我们学习了如何计算一组样本数据的百分位数,哪位同学可以回忆一下,求百分位数的步骤是什么?

靠窗第二排同学你来。 

很好,请坐。

这位同学说得很完整。

第一步把数据从小到大排序;

第二步,计算 i 等于 p 百分之乘以样本容量 n;

第三步判断 i 是否为整数,如果 i 不是整数,向上取整,对应位置的数据就是百分位数;如果 i 是整数,取第 i 项与第 i 加一项数据的平均值。 

那我们算出样本的百分位数之后,有什么用处呢?

没错,可以用来估计总体的百分位数。

今天我们就借助课本例题,一起实操练习。 

大家看 PPT 上面的例题,根据树人中学高一年级二十七名女生的样本数据,估计树人中学高一年级女生的第二十五、第五十、第七十五百分位数。读完题目,大家找一找,这里样本容量 n 等于多少?

第一排同学你来。 

对,样本容量 n 等于二十七。

那按照我们的解题步骤,第一步要干什么?

没错,把全部样本数据按照从小到大的顺序进行排序。

老师已经把排序完成的数据展示在屏幕上,大家可以看一下。 

接下来第二步,我们分别计算三个百分位数对应的 i 值。我们先来算第二十五百分位数,百分之二十五乘以二十七,计算结果等于六点七五。接着算第五十百分位数,百分之五十乘以二十七等于十三点五。最后算第七十五百分位数,百分之七十五乘以二十七等于二十点二五。同学们观察这三个计算出来的 i,六点七五、十三点五、二十点二五,它们都是整数吗?

中间第三排同学,你来说。 

说得非常好,全部都不是整数。

根据我们的规则,i 不是整数的时候,我们要向上取整。那六点七五向上取整得到七,对应取第七项的数据;十三点五向上取整得到十四,取第十四项的数据;二十点二五向上取整得到二十一,取第二十一项的数据。 

现在请大家看向屏幕排好序的数据,我们一起来数。

第一项一百四十八点零,第二项一百四十九点零…… 数到第七项,数值是一百五十五点五;继续往后数,第十四项等于一百六十一;再往后,第二十一项等于一百六十四。也就是说,我们这个样本的第二十五百分位数等于一百五十五点五,第五十百分位数等于一百六十一,第七十五百分位数等于一百六十四。我们就用样本的这三个百分位数,来估计树人中学高一年级全体女生的总体百分位数。讲到这里老师有一个思考,这个样本一共只有二十七名女生,样本量比较小,那我们得到的估计结果就一定非常精准吗?

大家前后四人小组,给大家一点时间互相讨论一下。 

好,时间到,哪个小组愿意分享你们的想法?

来,第四小组代表你来回答。 

很不错,请坐。

这个小组发现,样本的数量比较少,用小样本去估计总体,得到的估计结果,会存在比较大的误差。所以在实际统计当中,我们会尽量选择样本量大一些的数据,减小估计的误差。 

那接下来我们快速做一个小练习巩固,有八个已经排好的数据,请大家快速求出这一组数据的第三十百分位数。

好,大部分同学已经完成,这位举手的同学,你说你的解题过程。 

很好,步骤完全正确。

先算 i 等于百分之三十乘以八等于二点四,不是整数向上取整,取第三项数据,看来大家已经掌握做题流程。那这节课快要结束了,谁来梳理今天学到了什么?

最后一排同学你来。 

很好,请坐。

这位同学总结,复习了百分位数计算三步法,会用样本百分位数估计总体百分位数,还记住样本量小的时候,估计总体的误差会比较大。 

老师补充一点,统计的估计不是绝对准确,我们要客观看待估计出来的结果。 

课后请大家完成课后习题,也可以自己找一组生活数据,动手算一算它的百分位数。 

本节课到此结束,同学们下课。 

我的试讲完毕。

板书设计

总体百分位数的估计 ——例2

解题步骤

  1. 数据从小到大排序

  2. 计算i=p%× n

  3. 判断 i:

    i 非整数:向上取整,取对应项

    i 整数:第 i、i+1 项平均值

例题:n = 27

25% × 27=6.75 →第 7 项:155.5 

50% × 27=13.5 →第 14 项:161 

75% × 27=20.25→第 21 项:164

估计总体:25%→155.5;50%→161;75%→164

注意:样本量小,估计存在较大误差

总体百分位数的估计:例3

教学过程

一、复习导入

1、原始数据计算百分位数的方法。

2、提出疑问:当我们没有原始数据,只有整理完成的分组统计表,该怎样求出百分位数?

二、例题讲授

1、展示例 3,题目为根据统计表估计月均用水量样本数据的 80% 和 95% 分位数。 

2、引导学生分析分组数据的特点:分组表格只知道区间内数据个数,不知道每一个原始数据,信息存在丢失,统计上我们假设组内数据均匀分布。 

3、带领学生计算 80% 分位数:

根据累计占比,13.2 吨以下占 77%,16.2 吨以下占 86%。80% 介于 77% 与 86% 之间,因此 80% 分位数落在区间

[13.2,16.2),组距等于 3。

代入估算公式算出结果等于 14.2。 

类比推导 95% 分位数:查找累计占比,确定 95% 分位数落在 [22.2,25.2),组距等于 3,代入公式计算得到 22.95。 

4、着重强调:分组数据得到的百分位数是估计值,不是精确结果。

3. 巩固练习

给出简单分组累计频率材料,请学生口头判断百分位数所处区间,巩固本节课核心步骤。

4. 课堂小结

梳理分组数据求百分位数完整流程,再次点明组内均匀分布假设、结果为估计值。

5. 布置作业

完成课后习题,找生活中的统计图表,尝试估算对应百分位数。

试讲

我今天试讲的题目是《总体百分位数的估计:例3》,下面开始我的试讲。 

上课,同学们好,请坐。 

上节课我们学习了有完整原始数据时百分位数的求法,那我来考考大家,第一排同学你来,说一说原始数据求百分位数主要步骤是什么。 

很好,请坐。

这位同学回答要先把数据从小到大排序,再计算对应 i 值,再确定百分位数。 

那老师有一个新问题,如果我们手中没有每一组原始数据,只有整理好的统计表,我们还能求百分位数吗?

这就是本节课我们要解决的问题,请大家看屏幕上的例题 3。 

题目要求我们,根据表格估计月均用水量样本数据的百分之八十和百分之九十五分位数。

大家仔细阅读例题的分析部分,思考分组统计表有什么局限。

中间第三排的同学,你来说。 

说得非常好,请坐。

就像这位同学所说,分组统计表只告诉我们每一个区间一共有多少数据,但是区间内部每一个具体数值我们是不清楚的,部分原始信息丢失了。 

在统计当中,我们有一个处理手段,我们做一个假设:区间内部的数据是均匀分布在这个区间上,依靠这个假设,我们就可以完成百分位数的估算。 

我们先来研究百分之八十分位数。

大家看表格给出的累计比例,月均用水量 13.2 吨以下用户占比是百分之七十七,月均用水量 16.2 吨以下用户占比是百分之八十六。 

接下来前后四人小组交流思考,百分之八十会落在哪个区间,给大家一点时间。 

好,时间到,靠窗第二小组,派代表说一说你们的结论。 

没错,百分之八十大于百分之七十七,同时小于百分之八十六,所以百分之八十分位数就落在 13.2 到 16.2 这个区间,这个区间组距等于 3。接下来我们代入估算公式,区间下限,加上组距,乘上目标占比减去区间左侧累计占比,再除以区间右侧累计占比减去区间左侧累计占比。 

把数值代入,13.2 加上 3 乘(0.80−0.77)÷(0.86−0.77),计算结果等于 14.2。

因此我们估计百分之八十分位数约等于 14.2。弄懂了百分之八十分位数,大家类比思考,百分之九十五分位数如何求解。 

我们一起来完成,查找累计占比,百分之九十五介于百分之九十四和百分之九十八中间,对应区间是 22.2 到 25.2,组距依旧等于 3。 

代入公式,22.2 加上 3 乘(0.95−0.94)÷(0.98−0.94),计算得到 22.95,也就是百分之九十五分位数约等于 22.95。 

这里老师提醒各位同学,这个数值是估计值,是建立在组内数据均匀分布的假设之上,并不是精确结果。 

接下来我们做个小练习,屏幕给出一组分组和累计频率,请大家快速判断百分之七十分位数在哪一个区间。

好,大部分同学已经思考完毕,最后一排举手的同学你来回答。 

区间定位完全准确,看来大家已经掌握本节课最关键的一步。 

马上就要下课,谁来总结今天的学习收获?

第四排这位同学,你来。 

请坐,总结的十分完整。

他说到,处理分组数据要假设组内数据均匀分布。

第一步依靠累计百分比锁定百分位数所在区间

第二步代入公式计算,最后得到的是估计值。 

老师补充,对比原始数据计算,分组数据只能估算,会产生一定误差。 

课后,请大家完成课后习题,找一份生活中的统计图表,尝试估算它的百分位数。 

本节课到此结束,同学们下课。

我的试讲完毕。

板书设计

总体百分位数的估计:例3

前提假设:组内数据均匀分布

估算公式: 

例 3 月均用水量

注意:分组数据结果为估计值

平均数与中位数:例4

教学过程

一、复习导入

1、平均数、中位数概念。

2、抛出问题:拿到样本数据,如何利用样本的平均数、中位数去估计总体?

二、例题讲解

1、出示例 4,100 户居民用户月均用水量数据。

2、带领学生计算样本平均数,算出结果等于 8.79。

再将 100 个数据排序,第 50、第 51 个数都是 6.8,得到样本中位数等于 6.8。

因为是简单随机样本,据此估计全市居民月均用水量平均数 8.79,中位数 6.8。 

3、展示思考问题:录入数据时,把 7.7 错录成 77,对比真实和录入后的平均数、中位数。

4、学生讨论后总结:平均数发生很大改变,中位数不变。

得到结论:平均数和全部数据有关,对极端值敏感;中位数只和中间位置数据有关,不容易受极端值影响。 

5、接着开展探究活动,观察三种单峰频率分布直方图。

对称分布,平均数约等于中位数;

右拖尾,平均数大于中位数;

左拖尾,平均数小于中位数。

总结规律:平均数向长尾巴一侧靠拢。

三、巩固练习

给出简短小习题,一组带有极端值的数据,请学生快速说出平均数、中位数哪一个更容易被极端数据干扰,巩固知识点。

四、课堂小结

请学生自主总结本节课知识,教师补充,梳理平均数、中位数特点,以及不同分布下二者大小关系。

五、布置作业

完成课后习题,搜集一组生活数据,分别计算平均数和中位数。

试讲

我今天试讲的题目是《平均数与中位数:例4》,下面开始我的试讲。 

上课,同学们好,请坐。 

之前我们已经学习过平均数和中位数,它们都可以刻画一组数据的集中趋势。

那第一排同学你来,说一说什么叫一组数据的中位数。 

很好,请坐。

把数据从小到大排序,如果总个数是偶数,中位数取中间两个数的平均值,如果是奇数,就取正中间那一个数据。 

那我们得到样本之后,怎样用样本的平均数、中位数估计总体呢?

今天我们就通过例题来研究,请大家看屏幕上的例 4。 

题目给了 100 户居民用户月均用水量的调查数据,要求计算样本的平均数和中位数,并且估计全市居民的月均用水量平均数和中位数。 

大家先看平均数的计算,回忆样本平均数计算公式。中间第三排同学,你来说。 

回答非常准确,请坐。

样本平均数,等于全部数据相加之后,除以数据总个数。 

这里一共有 100 组数据,我们把一百户用水量全部相加,再除以 100,得到样本平均数等于 8.79 吨。 

接下来求中位数,总共有 100 个数据,是偶数,排序之后我们取第 50 个和第 51 个数据。经过查看,第 50 个、第 51 个数据全部等于 6.8,因此样本中位数等于 6.8 吨。 

因为这 100 户是全市当中抽取的简单随机样本,我们就可以用样本去估计总体,估计全市居民月均用水量平均数等于 8.79 吨,中位数等于 6.8 吨。 

接下来请大家看屏幕的思考栏目。假设录入的时候,不小心把 7.7 录成了 77,请大家想一想,错误录入之后,平均数、中位数会发生怎样的变化?

前后四人小组讨论一下。 

好,时间到。靠窗第二小组,你们派代表分享你们的发现。 

不错,请坐。

这个小组发现,平均数变成 9.483,发生了很大变化,但是中位数依旧是 6.8,没有改变。那大家思考,为什么会出现这样的现象呢?

大家看,平均数用到了全部一百个数据,任意一个数据改动,平均数都会跟着变化,所以平均数对极端值很敏感。

而中位数,只看排序之后中间位置的数据,其余数据改动,不一定会改变中位数。 

搞懂了二者的特点,接下来我们一起来探究,在频率分布直方图当中,数据分布形态,会对平均数、中位数的大小带来什么影响,请大家观察屏幕上这三幅图。 

第一幅图,图形左右对称。大家观察,平均数和中位数是什么关系?最后一排举手的同学,你来。 

说得很好,请坐。

对称的时候,平均数和中位数大体相等。 

那第二种,图形向右拖长尾,也就是右边有少数很大的数据,这时候二者大小如何?

大家一起说,对,平均数大于中位数。

第三种图形向左拖尾巴,平均数小于中位数。我们可以记住,平均数总是向着长尾巴那一边靠拢。 

那我们做个小练习,一组数据里面存在特别大的极端数值,如果我们想刻画集中趋势,更适合选平均数还是中位数?

来,第四排这位同学。 

对,选用中位数,因为中位数不容易被极端值干扰。 

本节课快要结束,谁来梳理今天的收获?第四排这位同学,你来。 

请坐,总结很完整。

他说,样本平均数用到全部数据,对极端值敏感;中位数只和中间位置的数据有关;在直方图中,平均数会偏向长尾巴一侧;我们可以用样本平均数、中位数估计总体。 

老师补充,实际处理数据的时候,我们要结合数据特点,合理选择统计量。 

课后,请大家完成课后习题,找一组生活当中的数据,自己算一算平均数和中位数。

 本节课到此结束,同学们下课。 

我的试讲完毕。

板书设计

平均数与中位数:例4

1、例 4 100 户居民月均用水量

样本平均数:

样本中位数:第 50、51 个数均为 6.8,中位数=6.8

用样本估计总体:

全市平均数≈8.79,全市中位数≈6.8

2、特点

平均数:用到全部数据,对极端值敏感

中位数:只看中间位置数据,不易受极端值影响

3、直方图分布规律

①对称分布:平均数 ≈ 中位数

②右拖尾:平均数 > 中位数

③左拖尾:平均数 < 中位数

平均数向 “长尾巴” 一侧靠拢

注意:用样本统计量估计总体

众数:例5

教学过程

一、复习导入

1、平均数、中位数。

2、问题:生活当中还有一类分类数据,不是用来计算大小运算,这种数据我们用什么统计量描述集中趋势?

二、例题讲授

1、出示例 5。

提出问题:如果只用一个量代表校服规格,中位数、平均数、众数哪一个更合适。 

2、引导学生分析:

校服规格 155、160 这些数字,本质是分类类别,不是可以随意运算的数值。

观察表格和条形图,规格 165 的频数等于 167,频数最高,所以众数是 165,选用众数更合适。 

3、接着探究:

能不能用这一所学校的数据,去估计全国高一女生校服规格?

学生讨论得出,全国各地身高有差异,样本不具备代表性,这样估计不合理。 

4、特点:

众数只用到出现次数最多的数据,传递信息少,对极端值不敏感。 

5、归纳总结:

数值型数据,例如身高、用水量,可以用平均数、中位数;分类类型数据,例如校服规格、等级,适合使用众数。

三、巩固练习

给出简短习题,商品不同型号销量统计表,请学生判断选用哪一个统计量描述集中趋势,巩固分类数据选众数。

四、课堂小结

学生自主总结本节课知识点,教师补充,梳理众数特点、两类数据统计量的选择,样本估计总体需要样本有代表性。

五、布置作业

完成课后习题,找生活当中一组分类数据,找出它的众数。

试讲

我今天试讲的题目是《众数:例5》,下面开始我的试讲。 

上课,同学们好,请坐。 

前面两节课,我们学习了平均数和中位数,它们可以描述数值数据的集中趋势。

那第一排同学你来回忆一下,中位数指的是什么?

 很好,请坐。

把一组数据从小到大排序之后,处于中间位置的数据就是中位数。 

那老师有一个新问题,如果我们面对的不是普通数值,而是分类类别,我们该用什么量描述它的集中趋势呢?

今天我们就一起来学习众数,请大家看屏幕上的例 5。 

学校要定制高一年级的校服,表格统计了高一女生不同校服规格的频数,总共有三百八十六名同学。

题目问,如果只用一个量代表校服规格,中位数、平均数和众数当中,哪一个量更加合适。 

大家仔细观察表格思考,校服规格一百五十五、一百六十这些数字,是单纯用来计算大小的数字吗?

中间第三排同学,你来说。 

很不错,请坐。

这位同学发现,校服规格虽然写的是数字,本质代表不同类别,我们不能直接拿规格做求平均运算。 

接下来前后四人小组交流,结合表格当中的频数,想一想哪一个统计量更适合代表校服规格,大家可以结合屏幕上的条形图观察。 

好,时间到,靠窗第二小组,派代表分享你们小组的看法。 

说得非常到位,请坐。

小组观察条形图发现,规格一百六十五对应的频数最高,等于一百六十七,所以这组数据的众数是一百六十五,选用众数更加合适。既然我们得到这所学校女生校服规格众数是一百六十五,那我们能不能拿这一所学校的数据,直接估计全国高一年级女生的校服规格呢?

大家思考一下,最后一排举手的同学,你来回答。 

回答得很好,请坐。

全国各地的女生身高是存在差异的,这一个学校的样本,不能够代表全国,因此这样的估计是不合理的。

这也提醒我们,用样本估计总体的时候,一定要保证样本具有代表性。 

那接下来我们继续思考众数有什么特点,大家阅读课本的文字。

众数只利用出现次数最多的数值,它只知道这个数出现次数比别的多,但是看不出多多少,所以众数传递的数据信息比较少,同时众数对极端值不敏感。 

那我们什么时候用众数,什么时候用平均数、中位数呢?

大家跟着老师一起总结。

对于用水量、身高这类数值型数据,我们可以选用平均数、中位数;而校服规格、产品等级这类分类类型数据,适合选用众数。 

接下来我们做一个小练习,屏幕给出不同型号鞋子的销量表,如果鞋厂要生产鞋子,参考哪一个统计量?

来,第四排这位同学。 

没错,参考众数,卖得最多的型号多生产。

看来大家已经学会结合场景选统计量。马上接近课堂尾声,谁来总结今天学到的知识?

第四排这位同学,你来。 

请坐,总结很完整。

他说到,众数是出现频数最高的数据;分类类型的数据适合用众数;众数对极端值不敏感;用样本估计总体,样本要有代表性。 

老师补充,实际处理问题,我们要先分清数据类型,再挑选合适的统计量。 

课后,请大家完成课后习题,找生活当中的一组分类数据,尝试找出它的众数。 

本节课到此结束,同学们下课。 

我的试讲完毕。

板书设计

众数

例 5 :定制高一女生校服 

总人数:386

1、众数:出现频数最高的数据 

频数最高为 167,众数 = 165,适合代表校服规格 

本校数据不能估计全国,样本要有代表性

2、众数特点 

只用到最多频数的数据;信息少;对极端值不敏感

3、统计量选择 

①数值型数据(身高、用水量):平均数、中位数 

②分类类型数据(校服规格、等级):众数

频率分布直方图中的平均数、中位数、众数

教学过程

一、复习导入

1、平均数、中位数、众数。

2、疑问:如果我们没有原始数据,只有整理好的频率分布直方图,该怎样估计这三个统计量?

二、新课讲授

开展课本探究,说明没有原始数据时,我们做组内均匀分布的假设,以此做近似估计。 

1、平均数:

每个小矩形底边中点横坐标,乘小矩形面积也就是本组频率,全部相加,得到平均数近似值。

结合月均用水量例题计算,得到近似平均数等于 8.96,和原始数据 8.79 接近。 

2、中位数:

中位数左右两侧直方图面积各等于零点五。

累加频率锁定中位数落在区间[4.2,7.2),设中位数为 x,列方程求解,算出 x 约等于 6.71,和原始中位数 6.8 接近。 

3、众数:

取最高小矩形底边中点,也就是 5.7,作为众数估计。 

结合企业平均收入案例讲解:平均数容易受极端值影响,只看平均数容易被误导,要综合多个统计量分析数据。

三、巩固练习

给出简易频率分布直方图,请学生口述平均数、众数如何估计,巩固核心方法。

四、课堂小结

学生自主梳理本节课知识,教师补充,梳理三个统计量在直方图中的估计方法,强调组内均匀分布假设,理性看待统计结果。

五、布置作业

完成课后习题,观察生活当中统计报道,思考是否存在数据误导。

试讲

我今天试讲的题目是《频率分布直方图中的平均数、中位数、众数》,下面开始我的试讲。 

上课,同学们好,请坐。 

前面我们学习了,有原始数据的时候,可以直接计算平均数、中位数与众数。

那第一排同学你来想一想,如果我们手中只有频率分布直方图,拿不到每一组原始数据,我们该怎么办呢? 

很好,请坐。

这位同学产生了困惑,这也是我们这节课要解决的问题,请大家看屏幕上的探究内容。 

当我们只有统计表、统计图,没有原始样本数据,课本告诉我们,通常做一个假设,假设各组内的数据是均匀分布的,依靠这个假设,我们就可以近似估计平均数、中位数、众数。

我们就用月均用水量的频率分布直方图一起来研究。 

先看平均数,大家阅读课本,想一想直方图当中平均数怎么估算。

中间第三排同学,你来分享你的理解。 

说得不错,请坐。

样本平均数等于数据乘对应频率再求和。放到直方图中,就是每一个小矩形底边中点的横坐标,乘这个小矩形的面积,也就是本组的频率,把全部乘积相加,就得到平均数近似值。 

我们代入例题计算,算出来近似平均数等于 8.96,大家可以对比,原始数据算出来是 8.79,两个数值相差不大,说明这个估计方法是可行的。 

接下来我们研究中位数。

大家回忆中位数含义,一半数据小于等于中位数,一半大于等于中位数。反映在直方图上,中位数左右两边图形的面积都要等于零点五。 

接下来前后四人小组,结合屏幕上的直方图,找一找中位数落在哪一个区间,试着想一想怎么列式。 

好,时间到,靠窗第二小组派代表说一说你们的思路。 

非常棒,请坐。

我们累加各组的频率,发现累计到 4.2 的时候,面积等于零点二三幺,还不足零点五;累计到 7.2 的时候面积等于零点五五二,超过零点五。因此中位数落在区间 4.2 到 7.2 之内。 

我们设中位数等于 x,列写方程,零点零七七乘三加上零点一零七乘括号 x 减四点二括号等于零点五,求解得到 x 约等于 6.71,和原始中位数 6.8 很接近。 

那众数该如何估计呢?

大家观察直方图,哪一组频数最多。最后一排举手的同学,你来。 

没错,最高的小矩形对应区间是 4.2 到 7.2,我们取这个区间底边中点 5.7,作为众数的估计值。 

学会三种估计方法之后,我们来看生活实例。

一家企业对外宣传员工年平均收入是二十万元,这个说法一定代表大部分员工工资很高吗?大家思考一下。第四排这位同学,你来回答。 

说得很到位,请坐。

有可能少数高薪人员拉高平均数,大部分普通员工工资并不高。只看平均数,我们就很容易被数据误导。

分析数据,要综合平均数、中位数、众数多个统计量。 

我们做个小练习,给出一个简易频率分布直方图,谁来说众数怎么找?

好,就是最高矩形底边中点,看来大家已经掌握。 

马上就要下课,谁来总结今天的收获?第四排这位同学,你来。 

请坐,总结很完整。

他说到,在频率分布直方图中,要假设组内数据均匀分布;平均数是中点乘频率求和;中位数左右面积各等于零点五;众数取最高矩形中点;还要理性看待统计数据,防止被误导。 

老师补充,这些数值全部都是近似估计值,和真实样本统计量会存在小偏差。 

课后,请大家完成课后习题,在生活里找一找统计报道,思考有没有被数据误导的情况。 

本节课到此结束,同学们下课。 

我的试讲完毕。

板书设计

频率分布直方图中的平均数、中位数、众数

前提假设:组内数据均匀分布

1、平均数 

各组小矩形中点横坐标 × 小矩形面积(频率),全部相加 

例题近似平均数 = 8.96

2、中位数 

中位数左右两侧总面积 = 0.5 

落在 [4.2,7.2) 

(0.077×3+0.107×(x-4.2)=0.5

解得 x≈6.71

3、众数:最高小矩形底边中点 

众数估计值 = 5.7

注意:均为近似值;理性看待数据,防止被平均数误导

问题3:总体离散程度的估计

教学过程

一、复习导入

1、平均数、中位数、众数刻画数据集中趋势。

2、抛出课本射击运动员问题,两组数据集中趋势完全相同,但是成绩波动不一样,引出本节课,需要刻画数据离散程度。

二、新课讲授

展示甲乙两名运动员 10 次射击环数。

计算发现甲乙平均数、中位数、众数全部等于 7,但是甲成绩分散,乙成绩集中稳定。 

1、首先介绍极差:极差等于最大值减去最小值。甲极差等于 6,乙极差等于 4。

2、点明缺点:极差只用到最大最小两个数据,信息少。 

3、思考:如何衡量每一个数据和平均数之间的距离。引出平均距离,也就是每个数据减平均数的绝对值,取平均值。

为避开绝对值运算,改用平方,得到方差。 

说明方差单位和原始数据不一致,对方差开算术平方,得到标准差。 

4、讲解含义:标准差越大,数据波动越大、离散程度越大;标准差越小,数据越稳定。 

5、区分总体方差标准差、样本方差标准差。

6、实际当中用样本标准差去估计总体标准差。 

7、代入例题,甲标准差等于 2,乙标准差约等于 1.095。甲大于乙,所以乙成绩更稳定。

8、补充实际选拔的策略:平均成绩相当时选更稳定的选手。

三、巩固练习

简单口述练习:两组平均数相同的数据,比较标准差大小,巩固 “标准差越大波动越大”。

四、课堂小结

学生自主总结极差、方差、标准差,各自特点,标准差的实际意义,教师补充。

五、布置作业

课后习题,自行找一组数据计算样本方差与标准差。

试讲

我今天试讲的题目是《总体离散程度的估计》,下面开始我的试讲。 

上课,同学们好,请坐。 

之前我们学习了平均数、中位数、众数,它们用来描述一组数据的集中趋势。

第一排同学你来,你说一说,如果两组数据平均数完全一样,代表两组数据就没有差别吗? 

很好,请坐,这位同学提出了自己的疑惑,我们一起来看屏幕上的射击测试问题。 

甲乙两名运动员,每人射击十次。大家观察两组环数,我们计算可以得到,甲乙的平均数、中位数、众数全部都是 7。

集中趋势看不出区别,但是观察条形图,能够看到甲的成绩很分散,乙的成绩更加集中稳定。那我们该怎样度量这种波动、离散程度呢?

这就是本节课要研究的内容。 

大家想一想,最简单衡量波动的办法是什么?中间第三排同学,你来谈谈想法。 

不错,请坐。

有同学想到,拿最大值减去最小值,这个量叫做极差。

我们一起来算一算,甲的极差等于 10 减 4 等于 6,乙的极差等于 9 减 5 等于 4。从极差能看出甲波动范围更大。

但是大家思考,极差只使用了最大值和最小值,其余的数据完全没有参与,包含的信息非常少,所以我们需要更好的工具。 

那能不能用每个数据和平均数之间的距离,去反映波动呢?前后四人小组,给大家一点时间思考,怎么定义这个平均距离。 

好,时间到,靠窗第二小组,分享你们小组讨论结果。 

回答很棒,请坐。

我们可以拿每一个数据减去平均数,取绝对值,再求平均值,这就是平均距离。

但是绝对值计算起来不方便,于是数学上,我们改用平方代替绝对值,就得到方差。 

大家请看黑板

每一项就是数据与平均数差的平方,再取平均值。大家观察,方差的单位是原始数据单位的平方,单位不匹配。那该如何处理?

最后一排举手的同学,你来。 

没错,请坐,我们对方差取算术平方根

标准差单位和原始数据保持一致。那标准差大小代表什么含义呢?

标准差越大,代表数据离散程度越大,波动越大;标准差越小,数据越稳定。

除了样本方差标准差,还有对应的总体方差、总体标准差。

现实中总体未知,我们就用样本标准差去估计总体标准差。 

回到射击例题,经过计算,甲的标准差等于 2,乙的标准差约等于 1.095。

甲的标准差大于乙,说明甲成绩波动更大,乙发挥更加稳定。如果选拔比赛,两人平均水平相当,我们优先选择发挥稳定的乙。 

我们来做个快速小思考,两组平均数相同的数据,A 组标准差大,B 组标准差小,哪一组更稳定?

第四排这位同学。 

对,B 组,看来大家掌握了。 

快要下课了,谁来总结本节课学到的内容?第四排这位同学,你来。 

请坐,总结很完整。

他说,极差简单但是信息少;方差利用平方消除绝对值;标准差可以衡量离散程度,标准差越大波动越大;可以用样本标准差估计总体标准差。 

老师补充,实际做决策的时候,我们既要参考集中趋势,也要参考离散程度,综合分析。 

课后,请大家完成课后习题,自己找一组数据,尝试计算样本方差与标准差。

 本节课到此结束,同学们下课。 

我的试讲完毕。

板书设计

总体离散程度的估计

实例:

甲乙射击 10 次,平均数、中位数、众数都等于 7 

1、极差:最大值-最小值 

甲:10-4=6 乙:9-5=4 

缺点:只用最大、最小值,信息量少

2、方差、标准差 

样本方差:

样本标准差:

意义: 

标准差越大→离散程度大,波动大 

标准差越小→数据越稳定

例题结果:

s=2,s≈1.095

s>s,乙成绩更稳定

用样本标准差估计总体标准差

例6:分层随机抽样的总样本方差

教学过程

一、复习导入

1、分层随机抽样,回忆分层抽样总样本平均数的计算。

2、例题:分层抽样只知道男生、女生各自样本量、平均数、方差,没有原始数据,怎么计算总样本方差。

二、例题讲授

1、出示例 6。

先求总样本平均数,利用分层抽样平均数加权公式,算出总样本平均数等于 165.2。 

问题:不知道每一个原始身高数据,如何算全部五十人的总样本方差。 

2、板书总样本方差定义式,引导学生观察式子,对式子变形拆分

得到总样本方差的分层计算公式。 

把数值代入公式,计算出总样本方差等于 51.4862。

说明这个总样本方差,可以用来估计高一年级全体学生身高的总体方差。 

3、拓展:结合月均用水量案例,说明平均数和标准差结合,可以刻画数据分布,大部分数据落在平均数加减一倍标准差区间内,绝大部分落在平均数加减二倍标准差区间内。

三、巩固练习

简单巩固:两层样本,已知各层样本量、平均数、方差,口述第一步求总平均数,再代入方差公式。

四、课堂小结

学生自主梳理:分层抽样总样本平均数、总样本方差求解思路,用样本方差估计总体方差。

教师补充,计算总方差不能直接对两层方差取平均值。

五、布置作业

完成课后习题,巩固分层抽样总方差计算。

试讲

我今天试讲的题目是《分层随机抽样的总样本方差》,下面开始我的试讲。 

上课,同学们好,请坐。 

上节课我们学习了分层随机抽样,第一排同学你来回忆一下,比例分配分层抽样,总样本平均数怎么计算? 

很好,请坐,要把每一层的平均数,按照样本数量加权求和。

那老师提出新的问题,如果我们只有每层的样本量、每层平均数和每层方差,拿不到每一个原始数据,我们该怎么求总样本的方差呢?

今天我们就一起来解决这个问题。 

请看屏幕上的例题,树人中学高一年级做身高调查,分层随机抽样抽取男生 23 人,女生 27 人。男生样本平均数 170.6,方差 12.59;女生样本平均数 160.6,方差 38.62。

我们能不能依靠这些条件,算出总样本方差,并且估计全体高一学生身高的总体方差?大家先独立思考,前后四人小组互相交流,

我们第一步应该算什么。 

好,时间到,靠窗第二小组,你们来说。 

思路很清晰,请坐。

第一步我们先计算总样本的平均数。按照分层抽样加权平均,总样本平均数等于 50 分之,23 乘 170.6 加上 27 乘 160.6,计算结果等于 165.2。总样本平均数我们已经得到。 

那总样本方差怎么处理呢?大家看黑板,总共有五十个样本,总样本方差的定义,等于 50 分之一,中括号,男生每一个数据减去总平均数的平方全部求和,加上女生每一个数据减去总平均数的平方全部求和,中括号。 

但是我们没有原始数据,无法直接计算,那怎么办呢?

中间第三排同学,你有什么想法。 

不错,请坐,提示我们做代数变形。

同理处理女生部分。展开平方之后,有交叉项。

根据我们之前所学

因此交叉项相加结果等于 0,式子就得到化简。 

化简之后,总样本方差就可以写成 50 分之一,大括号,23 乘以中括号男生方差加上,男生层平均数减去总平均数的平方,中括号,加上 27 乘以中括号女生方差加上,女生层平均数减去总平均数的平方,中括号,大括号。 

这个公式非常关键,大家要注意,总样本方差,不等于两层方差直接求平均,还要加上每层平均数和总平均数差值的平方。 

接下来我们把题目给的数字代入公式,男生、女生的样本量,各自方差,还有已经算出的总平均数 165.2,全部代入进行运算。最终算出来总样本方差等于 51.4862。 

那这个总样本方差有什么用处呢?最后一排举手的同学,你来回答。 

说得很好,请坐。

我们就用这个总样本方差,来估计高一年级全体学生身高的总体方差。 

我们再拓展看一看,结合前面月均用水量例子,平均数搭配标准差,能够刻画数据分布特点。大部分的数据落在平均数加减一倍标准差的区间里面,绝大部分数据落在平均数加减二倍标准差的区间之内。 

我们快速做一个小回顾,想一想计算分层总样本方差,分为哪两步。

第四排这位同学。 

对,第一步计算总样本加权平均数,第二步代入变形后的方差公式,看来大家理解了。 

马上就要下课,谁来梳理本节课的收获?第四排这位同学,你来。 

请坐,总结的很不错。

他说,分层抽样求总样本方差,先算加权总平均数,再用变形公式计算总样本方差;不能直接简单平均两层方差;总样本方差用来估计总体方差。老师补充,公式里面千万不要漏掉层平均数与总平均数差的平方这一部分,这是高频出错点。 

课后,请大家完成课后习题,巩固分层抽样总样本方差计算。 

本节课到此结束,同学们下课。

 我的试讲完毕。

板书设计

分层随机抽样的总样本方差

总样本量:23+27=50

注意:不能直接对两层方差求平均 

拓展:平均数、标准差结合分析数据分布

相关学习资料

返回首页浏览学习资料