跳转至

10.9总复习题

本页由讲义拆分版 TeX 初步转换生成;答案默认收起。

讲义正文

A 组习题

总复习题

  1. 【2022全国乙卷理19】为估计一林区某种树木的总材积量,随机选取了 \(\displaystyle 10\) 棵这种树木,测量每棵树的根部横截面积(单位:\(\displaystyle \text{m}^2\))和材积量(单位:\(\displaystyle \text{m}^3\)),得到如下数据:

    | {c|cccccccccc} \Xhline{1pt} 样本号 \(\displaystyle i\) | \(\displaystyle 1\) | \(\displaystyle 2\) | \(\displaystyle 3\) | \(\displaystyle 4\) | \(\displaystyle 5\) | \(\displaystyle 6\) | \(\displaystyle 7\) | \(\displaystyle 8\) | \(\displaystyle 9\) | \(\displaystyle 10\) | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | 根部横截面积 \(\displaystyle x_i\) | \(\displaystyle 0.04\) | \(\displaystyle 0.06\) | \(\displaystyle 0.04\) | \(\displaystyle 0.08\) | \(\displaystyle 0.08\) | \(\displaystyle 0.05\) | \(\displaystyle 0.05\) | \(\displaystyle 0.07\) | \(\displaystyle 0.07\) | \(\displaystyle 0.06\) | | 材积量 \(\displaystyle y_i\) | \(\displaystyle 0.25\) | \(\displaystyle 0.40\) | \(\displaystyle 0.22\) | \(\displaystyle 0.54\) | \(\displaystyle 0.51\) | \(\displaystyle 0.34\) | \(\displaystyle 0.36\) | \(\displaystyle 0.46\) | \(\displaystyle 0.42\) | \(\displaystyle 0.40\) | | \Xhline{1pt} | | | | | | | | | | |

    并计算得 \(\displaystyle \sum_{i=1}^{10} x_i^2 = 0.038\), \(\displaystyle \sum_{i=1}^{10} y_i^2 = 1.6158\), \(\displaystyle \sum_{i=1}^{10} x_i y_i = 0.2474\).

    1. 求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到 \(\displaystyle 0.01\));
    2. 现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为 \(\displaystyle 186\text{ m}^2\).已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.

      参考数据:$\displaystyle \sqrt{1.896} \approx 1.377$
      
      1. 【2018全国II卷理18】下图是某地区 \(\displaystyle 2000\) 年至 \(\displaystyle 2016\) 年环境基础设施投资额 \(\displaystyle y\)(单位:亿元)的折线图. 为了预测该地区 \(\displaystyle 2018\) 年的环境基础设施投资额,建立了 \(\displaystyle y\) 与时间变量 \(\displaystyle t\) 的两个线性回归模型.根据 \(\displaystyle 2000\) 年至 \(\displaystyle 2016\) 年的数据(时间变量 \(\displaystyle t\) 的值依次为 \(\displaystyle 1, 2, \cdots, 17\))建立模型\(\displaystyle (a)\)\(\displaystyle \hat{y} = -30.4 + 13.5t\);根据 \(\displaystyle 2010\) 年至 \(\displaystyle 2016\) 年的数据(时间变量 \(\displaystyle t\) 的值依次为 \(\displaystyle 1, 2, \cdots, 7\))建立模型\(\displaystyle (b)\)\(\displaystyle \hat{y} = 99 + 17.5t\).你认为用哪个模型得到的预测值更可靠?并说明理由.
      2. 【2017全国I卷理19】为了监控某种零件的一条生产线的生产过程,检验员每天从该生产线上随机抽取 \(\displaystyle 16\) 个零件,并测量其尺寸(单位:\(\displaystyle \text{cm}\)).根据长期生产经验,可以认为这条生产线正常状态下生产的零件的尺寸服从正态分布 \(\displaystyle N(\mu, \sigma^2)\).
    3. 假设生产状态正常,记 \(\displaystyle X\) 表示一天内抽取的 \(\displaystyle 16\) 个零件中其尺寸在 \(\displaystyle (\mu - 3\sigma, \mu + 3\sigma)\) 之外的零件数,求 \(\displaystyle P(X \geqslant 1)\)\(\displaystyle X\) 的数学期望;

    4. 一天内抽检零件中,如果出现了尺寸在 \(\displaystyle (\mu - 3\sigma, \mu + 3\sigma)\) 之外的零件,就认为这条生产线在这一天的生产过程可能出现了异常情况,需对当天的生产过程进行检查. 1. 试说明上述监控生产过程方法的合理性;

      1. 下面是检验员在一天内抽取的 \(\displaystyle 16\) 个零件的尺寸: \(\displaystyle 9.95, 10.12, 9.96, 9.96, 10.01, 9.92\)

        \(\displaystyle 9.98, 10.04, 10.26, 9.91, 10.13, 10.02\)

        \(\displaystyle 9.22, 10.04, 10.05, 9.95\)

        经计算得 \(\displaystyle \overline{x} = \frac{1}{16} \sum_{i=1}^{16} x_i = 9.97, s = \sqrt{\frac{1}{16} \sum_{i=1}^{16} (x_i - \overline{x})^2} = \sqrt{\frac{1}{16} \left( \sum_{i=1}^{16} x_i^2 - 16\overline{x}^2 \right)} \approx 0.212\),其中 \(\displaystyle x_i\) 为抽取的第 \(\displaystyle i\) 个零件的尺寸, \(\displaystyle i = 1, 2, \cdots, 16\). 用样本平均数 \(\displaystyle \overline{x}\) 作为 \(\displaystyle \mu\) 的估计值 \(\displaystyle \hat{\mu}\),用样本标准差 \(\displaystyle s\) 作为 \(\displaystyle \sigma\) 的估计值 \(\displaystyle \hat{\sigma}\),利用估计值判断是否需对当天的生产过程进行检查?剔除 \(\displaystyle (\hat{\mu} - 3\hat{\sigma}, \hat{\mu} + 3\hat{\sigma})\) 之外的数据,用剩下的数据估计 \(\displaystyle \mu\)\(\displaystyle \sigma\)(精确到 \(\displaystyle 0.01\)). 附:若随机变量 \(\displaystyle Z\) 服从正态分布 \(\displaystyle N(\mu, \sigma^2)\),则 \(\displaystyle P(\mu - 3\sigma < Z < \mu + 3\sigma) = 0.9974\). \(\displaystyle 0.9974^{16} \approx 0.9592, \sqrt{0.008} \approx 0.09\). 4. 【2023新高考II卷19】某研究小组经过研究发现某种疾病的患病者与未患病者的某项医学指标有明显差异,经过大量调查,得到如下的患病者和未患病者该指标的频率分布直方图: 利用该指标制定一个检测标准,需要确定临界值 \(\displaystyle c\),将该指标大于 \(\displaystyle c\) 的人判定为阳性,小于或等于 \(\displaystyle c\) 的人判定为阴性.此检测标准的漏诊率是将患病者判定为阴性的概率,记为 \(\displaystyle p(c)\);误诊率是将未患病者判定为阳性的概率,记为 \(\displaystyle q(c)\).假设数据在组内均匀分布.以事件发生的频率作为相应事件发生的概率.

    5. 当漏诊率 \(\displaystyle p(c) = 0.5\%\) 时,求临界值 \(\displaystyle c\) 和误诊率 \(\displaystyle q(c)\)

    6. 设函数 \(\displaystyle f(c) = p(c) + q(c)\).当 \(\displaystyle c \in [95, 105]\) 时,求 \(\displaystyle f(c)\) 的解析式,并求 \(\displaystyle f(c)\) 在区间 \(\displaystyle [95, 105]\) 的最小值.
    7. 【2024北京18】某保险公司为了了解该公司某种保险产品的索赔情况,从合同保险期限届满的保单中随机抽取 \(\displaystyle 1000\) 份,记录并整理这些保单的索赔情况,获得数据如下表:

    | {c|ccccc} \Xhline{1pt} 索赔次数 | \(\displaystyle 0\) | \(\displaystyle 1\) | \(\displaystyle 2\) | \(\displaystyle 3\) | \(\displaystyle 4\) | | --- | --- | --- | --- | --- | --- | | 保单份数 | \(\displaystyle 800\) | \(\displaystyle 100\) | \(\displaystyle 60\) | \(\displaystyle 30\) | \(\displaystyle 10\) | | \Xhline{1pt} | | | | | |

    假设一份保单的保费为 \(\displaystyle 0.4\) 万元;前三次索赔时,保险公司每次赔偿 \(\displaystyle 0.8\) 万元;第四次索赔时,保险公司赔偿 \(\displaystyle 0.6\) 万元. 假设不同保单的索赔次数相互独立,用频率估计概率.

    1. 估计一份保单索赔次数不少于 \(\displaystyle 2\) 的概率;
    2. 一份保单的毛利润定义为这份保单的保费与赔偿总金额之差. 1. 记 \(\displaystyle X\) 为一份保单的毛利润,估计 \(\displaystyle X\) 的数学期望 \(\displaystyle EX\)
      1. 如果无索赔的保单的保费减少 \(\displaystyle 4\%\),有索赔的保单的保费增加 \(\displaystyle 20\%\),试比较这种情况下一份保单毛利润的数学期望估计值与(i)中 \(\displaystyle EX\) 估计值的大小.
    3. 【2019北京理17】为了解某校学生上个月 \(\displaystyle A, B\) 两种移动支付方式的使用情况,从全校学生中随机抽取了 \(\displaystyle 100\) 人,发现样本中 \(\displaystyle A, B\) 两种支付方式都不使用的有 \(\displaystyle 5\) 人,样本中仅使用 \(\displaystyle A\) 和仅使用 \(\displaystyle B\) 的学生的支付金额分布情况如下:

    | {c|c c c} \Xhline{1pt} \multirow{2}{*}{支付方式} | \multicolumn{3}{c}{支付金额(元)} | | | | --- | --- | --- | --- | | | \(\displaystyle (0,1000]\) | \(\displaystyle (1000,2000]\) | 大于 \(\displaystyle 2000\) | | 使用 \(\displaystyle A\) | 18 人 | 9 人 | 3 人 | | 使用 \(\displaystyle B\) | 10 人 | 14 人 | 1 人 | | \Xhline{1pt} | | | |

    已知上个月样本学生的支付方式在本月没有变化.现从样本仅使用 \(\displaystyle A\) 的学生中,随机抽查 \(\displaystyle 3\) 人,发现他们本月的支付金额都大于 \(\displaystyle 2000\) 元.根据抽查结果,能否认为样本仅使用 \(\displaystyle A\) 的学生中本月支付金额大于 \(\displaystyle 2000\) 元的人数有变化?说明理由. 7. 【2022新高考I卷20】一医疗团队为研究某地的一种地方性疾病与当地居民的卫生习惯(卫生习惯分为良好和不够良好两类)的关系,在已患该疾病的病例中随机调查了 \(\displaystyle 100\) 例(称为病例组),同时在未患该疾病的人群中随机调查了 \(\displaystyle 100\) 人(称为对照组),得到如下数据:

    | {c|cc} \Xhline{1pt} | 不够良好 | 良好 | | --- | --- | --- | | 病例组 | \(\displaystyle 40\) | \(\displaystyle 60\) | | 对照组 | \(\displaystyle 10\) | \(\displaystyle 90\) | | \Xhline{1pt} | | |

    从该地的人群中任选一人, \(\displaystyle A\) 表示事件“选到的人卫生习惯不够良好”, \(\displaystyle B\) 表示事件“选到的人患有该疾病”, \(\displaystyle \frac{P(B\mid A)}{P(\overline{B}\mid A)}\)\(\displaystyle \frac{P(B\mid \overline{A})}{P(\overline{B}\mid \overline{A})}\) 的比值是卫生习惯不够良好对患该疾病风险程度的一项度量指标,记该指标为 \(\displaystyle R\). 1. 证明: \(\displaystyle R = \frac{P(A\mid B)}{P(\overline{A}\mid B)} \cdot \frac{P(\overline{A}\mid \overline{B})}{P(A\mid \overline{B})}\); 2. 利用该调查数据,给出 \(\displaystyle P(A\mid B), P(A\mid \overline{B})\) 的估计值,并利用(i)的结果给出 \(\displaystyle R\) 的估计值. ??? answer "答案"

    (1)
            $$\displaystyle R&=\frac{P\left(B\left|A\right.\right)}{P\left(B\left|\overline{A}\right.\right)}\cdot\frac{P\left(\overline{B}\left|A\right.\right)}{P\left(\overline{B}\left|\overline{A}\right.\right)}=\frac{P\left(B\left|A\right.\right)P\left(A\right)}{P\left(B\left|\overline{A}\right.\right)P\left(\overline{A}\right)}\cdot\frac{P\left(\overline{B}\left|A\right.\right)P\left(A\right)}{P\left(\overline{B}\left|\overline{A}\right.\right)P\left(\overline{A}\right)}
     &=\frac{P\left(AB\right)}{P\left(\overline{A}B\right)}\cdot\frac{P\left(A\overline{B}\right)}{P\left(\overline{A}\overline{B}\right)}=\frac{P\left(A\left|B\right.\right)}{P\left(\overline{A}\left|B\right.\right)}\cdot\frac{P\left(\overline{A}\left|\overline{B}\right.\right)}{P\left(A\left|\overline{B}\right.\right)}.$$
    
    (2)由该调查数据得,病例组中卫生习惯不够良好的频率为$\displaystyle \frac{40}{100}=0.4$,对照组中卫生习惯不够良好的频率为$\displaystyle \frac{10}{100}=0.1$,所以$\displaystyle P\left(A\left|B\right.\right)$的估计值为$\displaystyle 0.4$,$\displaystyle P\left(A\left|\overline{B}\right.\right)$的估计值为$\displaystyle 0.1$.
    $\displaystyle P\left(\overline{A}\left|B\right.\right)$的估计值为$\displaystyle 0.6$,$\displaystyle P\left(\overline{A}\left|\overline{B}\right.\right)$的估计值为$\displaystyle 0.9$,利用(1)的结果可得$\displaystyle R$的估计值为$\displaystyle \frac{0.4}{0.6}\times\frac{0.9}{0.1}=6$.
    
    评:此题释放了一个明确的信号:概率统计里面的公式推导非常重要.尤其是条件概率在高中的要求提升了,增加了全概率公式和贝叶斯公式。
    
    实测数据:(福建)阅卷数据如下:
    
    <div align="center" markdown>
    
    | {c|cccc}
    \Xhline{1pt}
    类别 | 平均分 | 难度 | 区分度 | 零分率 |
    | --- | --- | --- | --- | --- |
    | \Xhline{1pt}
    物理组20(2) | 1.51 | 0.19 | 0.41 | 0.59 |
    | 历史组20(2) | 0.76 | 0.10 | 0.23 | 0.75 |
    | 总体20(2) | 1.29 | 0.16 | 0.37 | 0.64 |
    | \Xhline{1pt} |  |  |  |  |
    
    </div>
    

B 组习题

C 组习题

D 组习题