跳转至

10.4样本的数字特征

本页由讲义拆分版 TeX 初步转换生成;答案默认收起。

讲义正文

样本的数字特征

我们通常用样本的数字特征来估计总体的数字特征,例如,我们常用样本平均数 \(\displaystyle \overline{y}\) 去估计总体平均数 \(\displaystyle \overline{Y}\),用样本频率来估计总体的概率分布.我们在初中还学习了众数、中位数、方差\footnote{此处不再赘述.}等数字特征,他们可以被用来描述数据的集中趋势或离散程度,下面介绍几个新的数字特征.

定义 2.2.1

样本标准差是样本方差的算术平方根,记作 \(\displaystyle s\).

一组数据中最大值与最小值的差称为**极差**.

一组数据的**第 $\displaystyle p$ 百分位数**是这样一个值,它使得这组数据中至少有 $\displaystyle p\%$ 的数据小于或等于这个值,且至少有 $\displaystyle (100-p)\%$ 的数据大于或等于这个值.

中位数就是第50百分位数,在实际应用中,常用的分位数还有\(\displaystyle 25\) 百分位数,\(\displaystyle 75\) 百分位数.这两个分位数也被称为四分位数,其中第 \(\displaystyle 25\) 百分位数被称为第一四分位数下四分位数,第 \(\displaystyle 75\) 百分位数被称为第三四分位数上四分位数.

我们可以通过下面的步骤计算一组 \(\displaystyle n\) 个数据的第 \(\displaystyle p\) 百分位数:

\(\displaystyle \text{Step 1:}\)按从小到大排列原始数据.

\(\displaystyle \text{Step 2:}\)计算 \(\displaystyle i=n\times p\%\).

\(\displaystyle \text{Step 3:}\)\(\displaystyle i\) 不是整数,则第 \(\displaystyle p\) 百分位数为\(\displaystyle \lceil i\rceil\) 项数据;若 \(\displaystyle i\) 是整数,则第 \(\displaystyle p\) 百分位数为\(\displaystyle i\) 项与第 \(\displaystyle (i+1)\) 项数据的平均数.

A 组习题

\(\displaystyle \quad\)

A组

  1. 【2014 四川文2】 在"世界读书日"前夕,为了了解某地\(\displaystyle 5000\)名居民某天的阅读时间,从中抽取了\(\displaystyle 200\)名居民的阅读时间进行统计分析.在这个问题中,\(\displaystyle 5000\)名居民的阅读时间的全体是

    • 总体
    • 个体
    • 样本的容量
    • 从总体中抽取的一个样本
    答案

    A.

    1. 【新人教A版选修二习题5.3第9题】\(\displaystyle x_1, x_2, \dots, x_n\) 为样本数据,令 \(\displaystyle f(x) = \sum_{i=1}^n (x_i-x)^2\),则 \(\displaystyle f(x)\) 的最小值点为

    2. \(\displaystyle \text{样本众数}\)

    3. \(\displaystyle \text{样本中位数}\)
    4. \(\displaystyle \text{样本标准差}\)
    5. \(\displaystyle \text{样本平均数}\)
答案

D. 方法一:当\(\displaystyle f\left(x\right)\)取最小值时,\(\displaystyle f'\left(x\right)=0\),即 $\(\displaystyle \sum_{i=1}^{n}2\left(x-x_i\right)=0\)$ 即\(\displaystyle 2nx-2\sum_{i=1}^{n}x_i=0\),所以\(\displaystyle x=\frac{1}{n}\sum_{i=1}^{n}x_i\),故最小值点为样本平均数.

方法二:因为\(\displaystyle f\left(x\right)\)是关于\(\displaystyle x\)的二次函数,配方得 $\(\displaystyle f\left(x\right)&=\sum_{i=1}^{n}\left(x_i^2-2x_ix+x^2\right)=nx^2-2\left(x_1+\cdots+x_n\right)x+\sum_{i=1}^{n}x_i^2 &=n\left(x-\frac{x_1+\cdots+x_n}{n}\right)^2-\frac{\left(x_1+\cdots+x_n\right)^2}{n}+\sum_{i=1}^{n}x_i^2\)$ $$\displaystyle $$

所以当\(\displaystyle x=\frac{x_1+\cdots+x_n}{n}\)(即为样本平均数)时,\(\displaystyle f\left(x\right)\)取最小值.

  1. 【2020全国III卷理3】在一组样本数据中, \(\displaystyle 1, 2, 3, 4\) 出现的频率分别为 \(\displaystyle p_1, p_2, p_3, p_4\),且 \(\displaystyle \sum_{i=1}^4 p_i = 1\),则下面四种情形中,对应样本的标准差最大的一组是

  2. \(\displaystyle p_1 = p_4 = 0.1, p_2 = p_3 = 0.4\)

  3. \(\displaystyle p_1 = p_4 = 0.4, p_2 = p_3 = 0.1\)
  4. \(\displaystyle p_1 = p_4 = 0.2, p_2 = p_3 = 0.3\)
  5. \(\displaystyle p_1 = p_4 = 0.3, p_2 = p_3 = 0.2\)
答案

B. 四个情形的均值都是\(\displaystyle 2.5\),而代入标准差的计算公式,可知\(\displaystyle A\)\(\displaystyle B\)\(\displaystyle C\)\(\displaystyle D\)选项的标准差分别为\(\displaystyle 0.65\)\(\displaystyle 2.5\)\(\displaystyle 2.05\)\(\displaystyle 1.05\).故选B.

  1. 【2012江西9】样本\(\displaystyle (x_1,x_2,\cdots,x_n)\)的平均数为\(\displaystyle \overline{x}\), 样本\(\displaystyle (y_1,y_2,\cdots,y_n)\)的平均数为\(\displaystyle \overline{y}(\overline{x}\neq\overline{y})\). 若样本\(\displaystyle (x_1,x_2,\cdots,x_n,y_1,y_2,\cdots,y_n)\)的平均数\(\displaystyle \overline{z}=a\overline{x}+(1-a)\overline{y}\), 其中\(\displaystyle 0< a < \dfrac{1}{2}\), 则\(\displaystyle n,m\)的大小关系为

  2. \(\displaystyle n < m\)

  3. \(\displaystyle n>m\)
  4. \(\displaystyle n=m\)
  5. 不能确定

5. 【2024新高考II卷4】某农业研究部门在面积相等的 \(\displaystyle 100\) 块稻田上种植一种新型水稻,得到各块稻田的亩产量(单位:\(\displaystyle \text{kg}\))并整理得下表:

| {|c|c|c|c|}

亩产量 \(\displaystyle [900, 950)\) \(\displaystyle [950, 1000)\) \(\displaystyle [1000, 1050)\)
频数 \(\displaystyle 6\) \(\displaystyle 12\) \(\displaystyle 18\)
亩产量 \(\displaystyle [1050, 1100)\) \(\displaystyle [1100, 1150)\) \(\displaystyle [1150, 1200)\)
频数 \(\displaystyle 30\) \(\displaystyle 24\) \(\displaystyle 10\)

据表中数据,下列结论中正确的是

6. 【2018全国I卷理3】某地区经过一年的新农村建设,农村的经济收入增加了一倍,实现翻番.为更好地了解该地区农村的经济收入变化情况,统计了该地区新农村建设前后农村的经济收入构成比例,得到如下饼图:

3

则下面结论中不正确的是

7. 【2009上海文18理17】在发生某公共卫生事件期间,专业机构认为该事件在一段时间内没有发生大规模群体感染的标志为“连续 \(\displaystyle 10\) 日,每天新增疑似病例不超过 \(\displaystyle 7\) 人”.根据过去10天甲、乙、丙、丁四地新增疑似病例数据,一定符合该标志的是

答案

D. 甲地可能不符合, 反例为\(\displaystyle 0,0,0,0,4,4,4,4,4,10\). 乙地可能不符合, 反例: \(\displaystyle 0,0,0,0,0,0,0,0,1,9\). 丙地可能不符合, 反例: \(\displaystyle 0,0,0,1,1,3,3,3,3,100\). 丁地符合, 证明如下: 设10天数据为\(\displaystyle \{x_k\}_{k=1}^{10}\)(按疑似病例数从小到大排列), 则\(\displaystyle \sum\limits_{k=1}^{10}x_k=20\). 方差 $\(\displaystyle 3=\dfrac{1}{10}\sum\limits_{k=1}^{10}(x_k-2)^2 \geqslant \dfrac{1}{10}(x_{10}-2)^2\)$ , 则\(\displaystyle x_{10}\leqslant 2+\sqrt{30}\). 由于\(\displaystyle x_{10}\)是整数, 所以\(\displaystyle x_{10}\leqslant 7\). 即疑似病例数最多不超过7.

  1. 【2020新高考II卷9】(多选)我国新冠肺炎疫情防控进入常态化,各地有序推动复工复产.下面是某地连续 \(\displaystyle 11\) 天的复工、复产指数折线图.

2

根据该折线图

9. 【202新高考I卷9】(多选)有一组样本数据 \(\displaystyle x_1, x_2, \cdots, x_6\),其中 \(\displaystyle x_1\) 是最小值, \(\displaystyle x_6\) 是最大值,则

10. 【2021新高考II卷9】(多选)下列统计量中可用度量样本 \(\displaystyle x_1, x_2, \cdots, x_n\) 离散程度的有

答案

AC. 统计中,反映随机变量离散程度的有:极差、方差、标准差;刻画集中趋势的有平均数、中位数、众数.

  1. 【2026“fiddie”模拟考10】(多选)根据某河流观测点的若干年水位数据,得到频率分布直方图(如图). 若 \(\displaystyle p\) 是河流水位大于 \(\displaystyle x\) 米的概率,\(\displaystyle T=\frac{1}{p}\)(单位:年),则称 \(\displaystyle T\)\(\displaystyle x\) 米水位的重现期. 洪水等级与重现期的关系如下表.

1

用频率估计概率,估计该观测点处

答案

ACD. 扩充表格,把重现期对应的概率取值范围也列出来.

| {|c|c|c|}

洪水等级 重现期 \(\displaystyle T\) 概率 \(\displaystyle p = T^{-1}\)
小洪水 \(\displaystyle T < 5\) \(\displaystyle p > 0.2\)
中洪水 \(\displaystyle 5 \leqslant T < 20\) \(\displaystyle 0.05 \leqslant p < 0.2\)
大洪水 \(\displaystyle 20 \leqslant T < 50\) \(\displaystyle 0.02 \leqslant p < 0.05\)
特大洪水 \(\displaystyle T \geqslant 50\) \(\displaystyle p \leqslant 0.02\)

对于 A 选项,水位大于 47 米的频率是 \(\displaystyle 4.5\%+2\%+1\%+0.5\%+0.5\%=8.5\% \in [0.05,0.2]\),所以 47 米水位属于中洪水. A 选项正确.

对于 B 选项,水位大于 48 米的频率是 \(\displaystyle 2\%+1\%+0.5\%+0.5\%=4\%=0.04 \in [0.02,0.05]\),所以估计 48 米的水位属于大洪水,B 选项错误. 实际上可以计算出属于特大洪水的最低水位是 49 米.

对于 C 选项,根据直方图,估计河流水位大于 50 米的概率是 \(\displaystyle 0.5\%+0.5\%=1\%\),所以 50 米的河流水位的重现期是 100 年(即所谓的“百年一遇”). C 选项正确.

对于 D 选项,水位大于 40 米的频率是 \(\displaystyle 46.5\%\),水位在 \(\displaystyle (39,40)\) 中的频率大于 \(\displaystyle 6\%\),所以水位大于 39 米的频率是 \(\displaystyle 52.5\%\). 因此水位的中位数位于区间 \(\displaystyle (39,40)\). D 选项正确.

Fiddie评:本题改编自【2007湖南文7】,但原题题干不够严谨,且没有提及“重现期”、“洪水等级”的概念,这些新概念取自鄂教版必修第四册的“阅读与讨论”. 问题源于实际,洪水等级与重现期的对应关系见于《水文情报预报规范》,这是真实的规范文件,可在网上查到.

  1. 求样本数据\(\displaystyle 2,8,14,16,20\)第的\(\displaystyle 80\)分位数.
  2. 【2013湖北文12】求样本\(\displaystyle 7,8,7,9,5,4,9,10,7,4\)的标准差。
  3. 【2014安徽理6】已知样本数据 \(\displaystyle x_1, x_2, \cdots, x_{10}\) 的标准差为 \(\displaystyle 8\),求数据 \(\displaystyle 2x_1-1, 2x_2-1, \cdots, 2x_{10}-1\) 的标准差.
  4. 【2020上海6】已知\(\displaystyle a,b,1,2\)的中位数为3,平均数为4,求\(\displaystyle ab\).
答案

7;2.

  1. 【2008上海文10理9】已知总体的各个体的值由小到大依次为\(\displaystyle 2,3,3,7,a,b,12,13.7,18.3,20\), 且总体的中位数为\(\displaystyle 10.5\). 若要使该总体的方差最小, 求\(\displaystyle a,b\)的值。
答案

\(\displaystyle 10.5,10.5\). 由条件, \(\displaystyle a+b=21\), 则这组数据的平均数是10, 所以方差为\(\displaystyle s^2=\dfrac{1}{10}[C+(a-10)^2+(b-10)^2]=\dfrac{a^2+b^2}{10}+C'\), 其中\(\displaystyle C,C'\)是常数. 利用不等式\(\displaystyle 2(a^2+b^2)\geq (a+b)^2\), 等号成立当且仅当\(\displaystyle a=b\), 可得\(\displaystyle a,b\)取值都是10.5时总体方差最小.

  1. 某班级有30名男生和20名女生,调查学生周末在家学习时长(单位:小时),得到男生样本数据的平均值为8,方差为2,女生样本数据的平均值为10.5,方差为0.75,求该班级全体学生周末在家学习时长的平均值\(\displaystyle \overline{x}\)与方差\(\displaystyle s^2\).
  2. 【2025集英苑5月(网络联考)13】已知样本数据\(\displaystyle 1,4,a,a,b,6,7\)的众数为\(\displaystyle 0\),方差为\(\displaystyle \frac{48}{7}\),求该样本数据的中位数.
  3. 已知\(\displaystyle n(n\in\mathbb{N^*})\)个数据\(\displaystyle x_1,x_2,\cdots,x_n\)的平均数和标准差分别为\(\displaystyle \overline{x},S\),设\(\displaystyle n+1\)个数据\(\displaystyle x_1,x_2,\cdots,x_n,\overline{x}\)的标准差为\(\displaystyle S'\),判断\(\displaystyle S\)\(\displaystyle S'\)的大小关系.
  4. 【2013辽宁文16理16】为了考察某校各班参加课外书法小组的人数,在全校随机抽取5个班级, 把每个班级参加该小组的人数作为样本数据. 已知样本平均数是7, 样本方差是4, 且样本数据互不相同,求样本数据中的最大值。
答案

10. 设5个班级参加书法小组的人数为\(\displaystyle x_1,x_2,x_3,x_4,x_5\). 不妨设\(\displaystyle x_1 < x_2 < x_3 < x_4 < x_5\), 则\(\displaystyle \dfrac{1}{5}(x_1+x_2+x_3+x_4+x_5)=7\), 且\(\displaystyle \dfrac{1}{5}\sum\limits_{k=1}^5(x_k-7)^2=4\). 再次由样本数据互不相同, 从而\(\displaystyle x_k+1\leqslant x_{k+1}\)(即相邻两数相差至少为1). 所以\(\displaystyle x_5\geqslant x_1+4, x_5\geq x_2+3,x_5\geqslant x_3+2,x_5\geqslant x_4+1\). 所以\(\displaystyle 35=x_1+x_2+x_3+x_4+x_5\leqslant -10+5x_5\Rightarrow x_5\geqslant 9\). 又由于\(\displaystyle (x_5-7)^2 < \sum\limits_{k=1}^5(x_k-7)^2=16\), 从而\(\displaystyle x_5 < 11\). 则\(\displaystyle x_5\in\{9,10\}\).

(1)如果$\displaystyle x_5=10$, 则$\displaystyle x_1+x_2+x_3+x_4=25$, 为奇数, 且$\displaystyle \sum\limits_{k=1}^4(x_k-7)^2=11$, 而11写成四个数的平方和只可能为$\displaystyle 11=0^2+1^2+1^2+3^2$, 所以$\displaystyle x_1=4,x_2=6,x_3=7,x_4=8$.

(2)如果$\displaystyle x_5=9$, 则$\displaystyle x_1+x_2+x_3+x_4=26$为偶数, 且$\displaystyle \sum\limits_{k=1}^4(x_k-7)^2=16$, 而16写成4个数的平方和只可能为$\displaystyle 16=2^2+2^2+2^2+2^2$或$\displaystyle 16=0^2+0^2+0^2+4^2$, 这两种情况都会产生相同样本数据, 矛盾.
  1. 【2010安徽文14】某地有居民100000户,其中普通家庭99000户,高收入家庭1000户.从普通家庭中以简单随机抽样方式抽取990户,从高收入家庭中以简单随机抽样方式抽取100户进行调查,发现共有120户家庭拥有3套或3套以上住房,其中普通家庭50户,高收入家庭70户.依据这些数据并结合所掌握的统计知识,你认为该地拥有3套或3套以上住房的家庭所占比例的合理估计是多少?
  2. 某地区的公共卫生部门为调查本地区中学生的吸烟情况,随机抽样了 \(\displaystyle 200\) 名学生,占总学生数的 \(\displaystyle 1\%\).调查中使用了两个问题:

问题 1:你父亲的公历生日日期是不是奇数?

问题 2:你是否经常吸烟?

每个被调查者随机从一个装有大小、形状和质量完全一样的 \(\displaystyle 50\) 个白球和 \(\displaystyle 50\) 个红球的袋子中摸取 \(\displaystyle 1\) 个球(摸出的球重新放回袋中).摸到白球的学生如实回答第一个问题,摸到红球的学生如实回答第二个问题,回答“是”的人往一个盒子中放一个小石子,回答“否”的人什么都不要做.调查结束后,盒子中放有 \(\displaystyle 58\) 个小石子.

根据以上材料,估计该地区吸烟的中学生人数,并解释以上调查方法的好处.

\iffalse

\answer{\(\displaystyle 1600\)人;该调查方法能较好保护被调查者隐私,减轻其顾虑,从而更容易获得较真实的调查结果.

\hrule

通过调查获取数据的基本方式是询问,无论是面对面的调查,如入户调查,还是非面对面的调查,如电话调查、网络调查等,调查问卷都是必需的.

在中学阶段,对统计学参数估值板块的考察往往侧重于分析数据,这使得许多中学生未能意识到数据收集的重要性与艺术性.事实上,在人文社科领域,能否实现数据的收集、能否收集到“好”的数据往往决定一个研究的成败——设计问卷作为一种收集高质量数据的常用手段,有很大的学问.

例如,调查问题的措辞会对被调查者产生影响:在“你在多大程度上喜欢吸烟”和“你在多大程度上不喜欢吸烟”这两种问法中,相比后者,被调查者会对前者给出更为肯定的答案.再如,问题在问卷中的位置也会对被调查者产生影响.一般地,比较容易的、不涉及个人隐私情况的问题应当排在比较靠前的位置,较难的、涉及个人隐私的问题应排得比较靠后.除此以外,对一些敏感性问题,例如学生在考试中有无作弊、某人是否偷税漏税等,更要精心设计问卷及调查方法,设法消除被调查者的顾虑,使他们能够如实回答问题.否则,被调查者往往会拒绝回答,或不提供真实情况.}

\fi 23. 某大学计算机专业的考研人数连创新高.今年报名刚结束,某考生想知道报考人数并计算“上岸”概率.考生的考号按“0001,0002,...”的顺序从小到大排列.这位考生随机了解的 \(\displaystyle 50\) 个考生的考号如下:

0400 0904 0747 0090 0636 0714 0017 0432 0403 0276

0986 0804 0697 0419 0735 0278 0358 0434 0946 0123

0647 0349 0105 0186 0079 0434 0960 0543 0495 0974

0219 0380 0397 0283 0504 0140 0518 0966 0559 0910

0658 0442 0694 0065 0757 0702 0498 0156 0225 0327

请给出至少 \(\displaystyle 2\) 种方法,根据这 \(\displaystyle 50\) 个随机抽取得考号估计报考人数.

\iffalse \answer{

方法一:用样本最大值估计总体最大编号,样本中的最大考号为\(\displaystyle 0986\),故可估计报考人数约为\(\displaystyle 986\)

方法二:用样本平均数估计总体平均编号,若编号从\(\displaystyle 1\)\(\displaystyle N\)连续排列,则总体平均编号约为\(\displaystyle \frac{N+1}{2}\),由数据可得样本平均数\(\displaystyle \overline{x}=491.42\),据此估计报考人数约为\(\displaystyle 983\)人.

\hrule

这一问题出自著名的德军坦克问题.

二战期间,盟军一直在努力确定德军坦克的生产速度,为获取此数据,盟军通过传统间谍情报网络与统计学两种方法进行了估算,下表是战后缴获的德军真实生产纪录、统计学估值与常规间谍情报估值的数据:

[tab:contingency] | {|cccc|}

      月份 | 常规间谍情报估值 | 统计学估值 | 德军实产量(战后解密) |

| --- | --- | --- | --- | | 1940年6月 | 1000辆 | 169辆 | 122辆 | | 1941年6月 | 1550辆 | 244辆 | 271辆 | | 1942年8月 | 1550辆 | 327辆 | 342辆 |

常规情报部门(审讯战俘、侦察机航拍、解密电报等)严重夸大了德军的产能,而统计学估算则极其贴近真实情况.

为什么会统计学估算可以如此准确呢?

原来,德军在制造坦克时秉承了严谨的工业管理传统,他们对每一个关键部件(发动机、变速箱、底盘等)都进行了连续的、从1开始的正整数序列号标记.当盟军在战场上击毁、俘获德军坦克,或者从废弃厂房中获得坦克零件时,统计学家收集了这些序列号,以此来估算德军的坦克总产量.

假设德军某月生产的坦克总数为\(\displaystyle N\),缴获的该月生产的\(\displaystyle k\)辆坦克编号从小到大为\(\displaystyle x_1,x_2,\cdots,x_k\),记\(\displaystyle m=x_k\),即它们之中的最大值,要利用 \(\displaystyle k\)\(\displaystyle m\)来估计 \(\displaystyle N\) .

这里我们使用矩估计,这是一种用“样本矩”去匹配“总体矩”的参数估计方法.此处\(\displaystyle M=\max\{x_1,x_2,\cdots,x_k\}\),样本矩是\(\displaystyle m\),下求解总体矩: $\(\displaystyle E(M) = \sum_{m=k}^{N} m \cdot P(M = m) = \sum_{m=k}^{N} m \frac{\mathrm{C}_{m-1}^{k-1}}{\mathrm{C}_{N}^{k}}=\frac{k(N+1)}{k+1}\)$

解出 \(\displaystyle N = \frac{k+1}{k} E(M) - 1\)

数学与统计学的主要区别是,统计学在处理问题时不像数学那么严格,有点像是数据与模型之间的对话. }

\fi 24. 叙述并证明分层(2层)取样的平均数与方差公式,并推广到\(\displaystyle L\)层取样方差公式,即已知样本共分为\(\displaystyle L\)层、各层样本占比分别为\(\displaystyle w_1,w_2,\cdots w_L\)、各层平均数分别为\(\displaystyle \overline{x_1},\overline{x_2},\cdots,\overline{x_L}\)、各层方差分别为\(\displaystyle S_1^2,S_2^2,\cdots,S_L^2\),求样本平均数\(\displaystyle \overline{x}\)与样本方差\(\displaystyle s^2\). 25. 解答下述问题: 1. 【2009上海文18理17】在发生某公共卫生事件期间,专业机构认为该事件在一段时间内没有发生大规模群体感染的标志为“连续 \(\displaystyle 10\) 日,每天新增疑似病例不超过 \(\displaystyle 7\) 人”.过去 \(\displaystyle 10\) 日,判断下述四地新增疑似病例数据是否符合该标志:

| {@{}ll@{}}
甲地:总体均值为 $\displaystyle 3$,中位数为 $\displaystyle 4$ | 乙地:总体均值为 $\displaystyle 1$,总体方差大于 $\displaystyle 3$ |
| --- | --- |
| 丙地:中位数为 $\displaystyle 2$,众数为 $\displaystyle 3$ | 丁地:总体均值为 $\displaystyle 2$,总体方差为 $\displaystyle 3$ |
  1. 四名同学各掷骰子5 次,分别记录每次骰子出现的点数.根据四名同学的统计结果,可以判断一定没有出现点数 6 的是

    | {@{}ll@{}} 同学甲:平均数为 \(\displaystyle 3\),中位数为 \(\displaystyle 2\) | 同学乙:中位数为 \(\displaystyle 3\),众数为\(\displaystyle 2\) | | --- | --- | | 同学丙:平均数为 \(\displaystyle 2\),方差为 \(\displaystyle 2.4\) | 同学丁:中位数为 \(\displaystyle 3\),方差为 \(\displaystyle 2.8\) |

\iffalse 甲、乙、丙都不一定符合,丁一定符合.

甲地反例:\(\displaystyle 0,0,1,1,4,4,4,4,4,8\)

乙地反例:\(\displaystyle 0,0,0,0,0,0,0,0,0,10\)

丙地反例:\(\displaystyle 0,0,1,1,2,2,3,3,3,12\)

丁地一定符合.由平均数为2,方差为3,\(\displaystyle ns^2=\sum_{i=1}^{10}x_i^2-n\overline{x}^2\),可解得数据平方和为70.

假设某天超过7人,则至少有一天不小于8,此时其余9天总和至多为12,对应平方和必定大于6,此时平方和大于70,矛盾.

故丁地一定不存在超过7人的一天.} \anspart{2}{丙.

甲反例:\(\displaystyle 1,1,2,5,6\)

乙反例:\(\displaystyle 1,2,2,4,6\)

丁反例:\(\displaystyle 1,2,3,3,6\)

丙证明:若出现6,则在平均数为2的条件下其余4次点数和只能为4,而$\(\displaystyle ns^2=\sum_{i=1}^{5}x_i^2-n\overline{x}^2\iff \sum_{i=1}^{5}x_i^2=32<36\)$矛盾,故丙一定没有出现6.}}

\fi 26. 上一年度某公司的 \(\displaystyle 50\) 名员工中,最高年收入达到了 \(\displaystyle 400\) 万元,员工年收入的平均数是 \(\displaystyle 20\) 万元.而你的预期是获得 \(\displaystyle 18\) 万元年薪,正犹豫是否受聘.

  1. 是否能判断年薪为 \(\displaystyle 18\) 万元的员工在这家公司算高收入者?并说明理由;
  2. 已知该公司员工的最低年收入是 \(\displaystyle 6\) 万,员工收入的第一四分位数为 \(\displaystyle 9\) 万,第三四分位数为 \(\displaystyle 19\) 万, 1. 求员工年收入中位数的取值范围并解释其小于平均数的原因;
    1. 你将如何使用上述信息做出是否受聘的决定?

B 组习题

C 组习题

D 组习题