112 年 國立臺北大學統計學系碩士班《統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題10 分

I. Researchers conducted a large-sample study to determine if smoking causes cancer. For each sample, they recorded information including smoking status (ever-smoker, never-smoker), weight, and cancer status (yes, no).

  1. (10%) Use the researchers' data. Design a two-dimensional plot to display the association between weight and smoking status by cancer status. Explain your design.

登入後即可作答並保存紀錄。

這一題的完整詳解

此題要求設計一個二維圖形來展示體重、吸菸狀態與癌症狀態之間的關聯性。由於有三個變數,且其中體重是連續變數,吸菸狀態與癌症狀態是類別變數,我們可以考慮使用散佈圖(Scatter Plot)或箱型圖(Box Plot)來呈現。

設計方向:

  1. 散佈圖 (Scatter Plot):

    • 軸的設定:將體重(連續變數)放在其中一個軸上,例如 Y 軸。另一個軸(例如 X 軸)則可以放置其中一個類別變數,例如吸菸狀態(Ever-Smoker, Never-Smoker)。
    • 區分第三個變數:癌症狀態(Yes, No)可以透過不同的顏色或符號來區分散佈圖上的點。
    • 說明:例如,我們可以繪製一個散佈圖,X 軸為吸菸狀態,Y 軸為體重。對於每個點,我們使用不同的顏色來表示癌症狀態。這樣,我們可以觀察在相同的吸菸狀態下,有癌症與無癌症者的體重分佈是否有差異,同時也能比較不同吸菸狀態下的體重分佈。
  2. 箱型圖 (Box Plot):

    • 分組:箱型圖適合比較不同組別的連續變數分佈。我們可以將資料先按照癌症狀態分組(Yes/No),然後在每一組內部,再依據吸菸狀態(Ever-Smoker/Never-Smoker)進一步分組。
    • 繪製:例如,我們可以繪製四個箱型圖:
      • 癌症狀態為 Yes,吸菸狀態為 Ever-Smoker
      • 癌症狀態為 Yes,吸菸狀態為 Never-Smoker
      • 癌症狀態為 No,吸菸狀態為 Ever-Smoker
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題10 分

  1. (10%) Let X, W, and Y be random variables representing smoking status, weight, and cancer status, respectively. Specify the three random variables by their sample spaces and distributions. Explain your notations and parameters.

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

本題考查「隨機變數的樣本空間與機率分布」:

  • 吸菸狀態與癌症狀態屬於二元類別變數,可用 Bernoulli 分布表示。
  • 體重屬於連續型數值變數,通常以連續分布表示;若題目未提供實際資料,常用常態分布作為合理假設。
  • 每個隨機變數都必須說明:
    1. 可能取值所形成的樣本空間;
    2. 各取值的機率分布;
    3. 分布中的參數及其意義。

解題方法

先將類別文字轉換為數值,再依變數型態指定分布。

1. 吸菸狀態 XX

定義

X={1,表示有吸菸0,表示沒有吸菸X= \begin{cases} 1, & \text{表示有吸菸}\\ 0, & \text{表示沒有吸菸} \end{cases}

因此,XX 的樣本空間為

X={0,1}.\mathcal{X}=\{0,1\}.

令吸菸人口比例為 pp,則

X∼Bernoulli⁡(p),X\sim \operatorname{Bernoulli}(p),

其機率質量函數為

P(X=x)=px(1−p)1−x,x∈{0,1},P(X=x)=p^x(1-p)^{1-x},\qquad x\in\{0,1\},

其中

P(X=1)=p,P(X=0)=1−p,P(X=1)=p,\qquad P(X=0)=1-p,

且 0≤p≤10\leq p\leq 1。

參數 pp 表示隨機抽取一名研究對象具有吸菸狀態的機率。

2. 體重 WW

體重是連續型變數,其樣本空間可寫為

W=(0,∞),\mathcal{W}=(0,\infty),

實際應用上也可依研究對象限制寫成合理的體重範圍。

在未提供資料分布的情況下,採用常見的常態分布模型:

W∼N(μ,σ2),W\sim N(\mu,\sigma^2),

其中:

  • μ\mu 是母體平均體重;
  • σ2\sigma^2 是體重的母體變異數;
  • σ>0\sigma>0 是母體標準差。

其機率密度函數為

fW(w)=12πσ2exp⁡[−(w−μ)22σ2],−∞<w<∞.f_W(w)=\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{(w-\mu)^2}{2\sigma^2}\right], \qquad -\infty<w<\infty.

常態分布的理論樣本空間是整個實數集合,但體重在實際意義上必須為正值;常態模型是對體重分布的近似描述。若資料呈現明顯偏態,也可改用對數常態分布等正值連續分布。

3. 癌症狀態 YY

定義

Y={1,表示罹患癌症0,表示未罹患癌症Y= \begin{cases} 1, & \text{表示罹患癌症}\\ 0, & \text{表示未罹患癌症} \end{cases}

因此,YY 的樣本空間為

Y={0,1}.\mathcal{Y}=\{0,1\}.

令癌症盛行率為 qq,則

Y∼Bernoulli⁡(q),Y\sim \operatorname{Bernoulli}(q),

其機率質量函數為

P(Y=y)=qy(1−q)1−y,y∈{0,1},P(Y=y)=q^y(1-q)^{1-y},\qquad y\in\{0,1\},

其中

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

  1. (10%) Select appropriate measures.
    (1) (5%) Write down a measure you would use to compare the weights between people of different cancer statuses.
    (2) (5%) Write down a measure you would use to help the researchers answer their question.

登入後即可作答並保存紀錄。

這一題的完整詳解

此題要求選擇合適的統計量來比較不同群體的特徵。

核心觀念:
選擇統計量時,需考量變數的類型(連續或類別)以及分析的目的。

(1) 比較不同癌症狀態者之間的體重

  • 目的:比較兩組(有癌症 vs. 無癌症)連續變數(體重)的分佈。

  • 變數類型:體重是連續變數,癌症狀態是類別變數(二元)。

  • 合適的測量方法:

    • 平均數 (Mean):比較兩組的平均體重。例如,計算有癌症者的平均體重與無癌症者的平均體重。
    • 中位數 (Median):如果體重分佈可能存在偏態 (skewness),中位數會是比平均數更穩健 (robust) 的測量。
    • 標準差 (Standard Deviation) 或四分位距 (Interquartile Range, IQR):用來衡量體重的離散程度。可以比較兩組體重的變異性。
    • 百分位數 (Percentiles):例如,比較兩組體重的第 25、50、75 百分位數。
  • 選擇:最直接且常用的是比較平均數或中位數。如果體重分佈假設為常態,平均數是最佳選擇。若無此假設,中位數更為穩健。

(2) 幫助研究者回答「吸菸是否導致癌症」的問題

  • 目的:評估吸菸狀態(類別)與癌症狀態(類別)之間的關聯性,並探討其是否能推論因果關係。
  • 變數類型:吸菸狀態(Ever-Smoker, Never-Smoker)是類別變數,癌症狀態(Yes, No)也是類別變數。
  • 合適的測量方法:
    • 風險比 (Risk Ratio, RR) 或優勢比 (Odds Ratio, OR):這是衡量暴露(吸菸)與結果(癌症)之間關聯性的標準方法。
      • 風險比 (RR):計算暴露組(吸菸者)罹患癌症的風險與非暴露組(不吸菸者)罹患癌症的風險之比。
        RR=P(Cancer|Smoker)P(Cancer|Non-smoker)=NS,C/NSNNS,C/NNSRR = \frac{P(\text{Cancer|Smoker})}{P(\text{Cancer|Non-smoker})} = \frac{N_{S,C}/N_S}{N_{NS,C}/N_{NS}}
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題20 分

  1. (20%) Suppose the number of samples in the researchers' data in each category is summarized in the following table.
Ever SmokerNever-Smoker
Cancer Status Yes60205792
Cancer Status No1398324109

(1) (5%) Calculate an estimate of your proposed measure in 3. (2).
(2) (10%) Derive an approximate distribution of the estimator in 4. (1).
(3) (5%) Comment and explain: how well the distribution you derive in 4. (2) approximates the exact distribution.

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是基於前一題所選的測量指標,利用提供的數據進行計算、推導分佈並評估近似效果。

核心觀念:

  • 第 3(2) 題提出的指標是風險比 (RR) 或優勢比 (OR),用於評估兩個類別變數的關聯性。
  • 大樣本下,比例的估計量及其分佈通常近似常態分佈。
  • 卡方檢定與比例的檢定有關。

數據整理:
首先,我們需要從表格中計算出總人數以及各組人數。

  • 吸菸者 (Ever Smoker, ES) 總數 NES=6020+13983=20003N_{ES} = 6020 + 13983 = 20003
  • 不吸菸者 (Never-Smoker, NS) 總數 NNS=5792+24109=29901N_{NS} = 5792 + 24109 = 29901
  • 有癌症者 (Cancer Status Yes, C) 總數 NC=6020+5792=11812N_C = 6020 + 5792 = 11812
  • 無癌症者 (Cancer Status No, NC) 總數 NNC=13983+24109=38092N_{NC} = 13983 + 24109 = 38092
  • 總樣本數 N=NES+NNS=20003+29901=49904N = N_{ES} + N_{NS} = 20003 + 29901 = 49904
  • 總樣本數 N=NC+NNC=11812+38092=49904N = N_C + N_{NC} = 11812 + 38092 = 49904

表格中的數據可以表示為:

Ever Smoker (ESES)Never-Smoker (NSNS)Total
Cancer (CC)nES,C=6020n_{ES,C} = 6020nNS,C=5792n_{NS,C} = 5792NC=11812N_C = 11812
No Cancer (NCNC)nES,NC=13983n_{ES,NC} = 13983nNS,NC=24109n_{NS,NC} = 24109NNC=38092N_{NC} = 38092
TotalNES=20003N_{ES} = 20003NNS=29901N_{NS} = 29901N=49904N = 49904

(1) 計算第 3.(2) 題提出的指標的估計值

我們將計算風險比 (RR) 和優勢比 (OR) 的估計值。

  • 風險比 (Risk Ratio, RR) 的估計值 RR^\hat{RR}:

    • 吸菸者罹患癌症的比例 (風險):p^ES,C=nES,CNES=602020003≈0.30095\hat{p}_{ES,C} = \frac{n_{ES,C}}{N_{ES}} = \frac{6020}{20003} \approx 0.30095
    • 不吸菸者罹患癌症的比例 (風險):p^NS,C=nNS,CNNS=579229901≈0.19371\hat{p}_{NS,C} = \frac{n_{NS,C}}{N_{NS}} = \frac{5792}{29901} \approx 0.19371
    • RR^=p^ES,Cp^NS,C=6020/200035792/29901≈0.300950.19371≈1.5536\hat{RR} = \frac{\hat{p}_{ES,C}}{\hat{p}_{NS,C}} = \frac{6020/20003}{5792/29901} \approx \frac{0.30095}{0.19371} \approx 1.5536
  • 優勢比 (Odds Ratio, OR) 的估計值 OR^\hat{OR}:

    • 吸菸者罹患癌症的優勢 (odds):o^ES=nES,CnES,NC=602013983≈0.43052\hat{o}_{ES} = \frac{n_{ES,C}}{n_{ES,NC}} = \frac{6020}{13983} \approx 0.43052
    • 不吸菸者罹患癌症的優勢 (odds):o^NS=nNS,CnNS,NC=579224109≈0.24024\hat{o}_{NS} = \frac{n_{NS,C}}{n_{NS,NC}} = \frac{5792}{24109} \approx 0.24024
    • OR^=o^ESo^NS=6020/139835792/24109≈0.430520.24024≈1.7919\hat{OR} = \frac{\hat{o}_{ES}}{\hat{o}_{NS}} = \frac{6020/13983}{5792/24109} \approx \frac{0.43052}{0.24024} \approx 1.7919

由於題目未明確指定要計算 RR 或 OR,且兩者都符合第 3(2) 的要求,一般情況下,題目會要求計算其中一個。通常 OR 在理論上和計算上更常用。我們這裡提供兩個估計值。

(2) 推導估計量 (4.1) 的近似分佈

我們將推導 p^ES,C\hat{p}_{ES,C} 和 p^NS,C\hat{p}_{NS,C} 的近似分佈,進而推導 RR^\hat{RR} 和 OR^\hat{OR} 的近似分佈。

  • 估計量 p^ES,C\hat{p}_{ES,C} 和 p^NS,C\hat{p}_{NS,C} 的近似分佈:
    根據大樣本理論,比例的估計量近似服從常態分佈。

    • p^ES,C∼N(pES,C,pES,C(1−pES,C)NES)\hat{p}_{ES,C} \sim N(p_{ES,C}, \frac{p_{ES,C}(1-p_{ES,C})}{N_{ES}})
    • p^NS,C∼N(pNS,C,pNS,C(1−pNS,C)NNS)\hat{p}_{NS,C} \sim N(p_{NS,C}, \frac{p_{NS,C}(1-p_{NS,C})}{N_{NS}})
      其中 pES,C=602020003p_{ES,C} = \frac{6020}{20003} 和 pNS,C=579229901p_{NS,C} = \frac{5792}{29901} 是真實的比例。
      在實際應用中,我們用樣本比例來估計標準誤 (Standard Error, SE):
    • SE(p^ES,C)=p^ES,C(1−p^ES,C)NES=0.30095(1−0.30095)20003≈0.2103720003≈0.00325SE(\hat{p}_{ES,C}) = \sqrt{\frac{\hat{p}_{ES,C}(1-\hat{p}_{ES,C})}{N_{ES}}} = \sqrt{\frac{0.30095(1-0.30095)}{20003}} \approx \sqrt{\frac{0.21037}{20003}} \approx 0.00325
    • SE(p^NS,C)=p^NS,C(1−p^NS,C)NNS=0.19371(1−0.19371)29901≈0.1562029901≈0.00229SE(\hat{p}_{NS,C}) = \sqrt{\frac{\hat{p}_{NS,C}(1-\hat{p}_{NS,C})}{N_{NS}}} = \sqrt{\frac{0.19371(1-0.19371)}{29901}} \approx \sqrt{\frac{0.15620}{29901}} \approx 0.00229
  • RR^\hat{RR} 的近似分佈:
    RR 的估計量 RR^=p^ES,C/p^NS,C\hat{RR} = \hat{p}_{ES,C} / \hat{p}_{NS,C}。由於 RR^\hat{RR} 是兩個隨機變數的比值,其分佈推導較複雜。通常我們考慮其對數 ln⁡(RR^)\ln(\hat{RR}) 的分佈,因為對數轉換可以將乘法變成加法,且分佈更接近常態。
    ln⁡(RR^)=ln⁡(p^ES,C)−ln⁡(p^NS,C)\ln(\hat{RR}) = \ln(\hat{p}_{ES,C}) - \ln(\hat{p}_{NS,C})
    根據 Delta 方法 (Delta Method),ln⁡(RR^)\ln(\hat{RR}) 近似服從常態分佈:
    ln⁡(RR^)∼N(ln⁡(RR),Var(ln⁡(RR^)))\ln(\hat{RR}) \sim N(\ln(RR), Var(\ln(\hat{RR})))
    其中 RR=pES,C/pNS,CRR = p_{ES,C}/p_{NS,C} 是真實的風險比。
    Var(ln⁡(RR^))≈1−pES,CNESpES,C+1−pNS,CNNSpNS,CVar(\ln(\hat{RR})) \approx \frac{1-p_{ES,C}}{N_{ES} p_{ES,C}} + \frac{1-p_{NS,C}}{N_{NS} p_{NS,C}}
    我們用樣本比例和樣本數來估計變異數:
    SE(ln⁡(RR^))≈1−p^ES,CNESp^ES,C+1−p^NS,CNNSp^NS,CSE(\ln(\hat{RR})) \approx \sqrt{\frac{1-\hat{p}_{ES,C}}{N_{ES} \hat{p}_{ES,C}} + \frac{1-\hat{p}_{NS,C}}{N_{NS} \hat{p}_{NS,C}}}
    SE(ln⁡(RR^))≈1−0.3009520003×0.30095+1−0.1937129901×0.19371SE(\ln(\hat{RR})) \approx \sqrt{\frac{1-0.30095}{20003 \times 0.30095} + \frac{1-0.19371}{29901 \times 0.19371}}

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 II.1 題10 分

II. The significance level is 0.05 for all questions in II unless otherwise specified.

  1. (10%) A market research firm estimates the proportion of adults in a city who have tablets, and they believe more than half of the adults in this city have tablets. A confidence interval for the population proportion of adults have tablets from a random sample of 400 adults is constructed. The lower limit is 0.5597 and the upper limit is 0.6403.
    (1) (5%) Determine the level of confidence used to construct the confidence interval.
    (2) (5%) If another random sample of 400 adults is taken, and 218 adults have tablets. To test the hypothesis if more than half of the adults in the city have tablets, what is the P-value and your conclusion?

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是關於比例的信賴區間與假設檢定。

核心觀念:

  • 比例的信賴區間公式:p^±zα/2p^(1−p^)n\hat{p} \pm z_{\alpha/2} \sqrt{\frac{\hat{p}(1-\hat{p})}{n}}
  • 假設檢定:設定虛無假設 H0H_0 與對立假設 H1H_1,計算檢定統計量,求 P-value,並與顯著水準 α\alpha 比較。

已知資訊:

  • 樣本大小 n=400n = 400
  • 信賴區間為 [0.5597,0.6403][0.5597, 0.6403]
  • 樣本比例 p^\hat{p} 是信賴區間的中心點。
  • 顯著水準 α=0.05\alpha = 0.05 (除非另有說明)。

(1) 求信賴區間的信賴水準 (Confidence Level)

信賴區間的結構為:
Lower Limit=p^−zα/2×SE(p^)\text{Lower Limit} = \hat{p} - z_{\alpha/2} \times SE(\hat{p})
Upper Limit=p^+zα/2×SE(p^)\text{Upper Limit} = \hat{p} + z_{\alpha/2} \times SE(\hat{p})

其中 p^\hat{p} 是樣本比例,SE(p^)=p^(1−p^)nSE(\hat{p}) = \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} 是樣本比例的標準誤。

首先,計算樣本比例 p^\hat{p}:
p^=Lower Limit+Upper Limit2=0.5597+0.64032=1.20002=0.6000\hat{p} = \frac{\text{Lower Limit} + \text{Upper Limit}}{2} = \frac{0.5597 + 0.6403}{2} = \frac{1.2000}{2} = 0.6000

接著,計算標準誤 SE(p^)SE(\hat{p}) 的估計值。我們知道:
Upper Limit−p^=zα/2×SE(p^)\text{Upper Limit} - \hat{p} = z_{\alpha/2} \times SE(\hat{p})
0.6403−0.6000=0.04030.6403 - 0.6000 = 0.0403
所以,zα/2×SE(p^)=0.0403z_{\alpha/2} \times SE(\hat{p}) = 0.0403。

我們也可以從公式 SE(p^)=p^(1−p^)nSE(\hat{p}) = \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} 計算出 SE(p^)SE(\hat{p}),然後再求 zα/2z_{\alpha/2}。
SE(p^)=0.6000(1−0.6000)400=0.6000×0.4000400=0.2400400=0.0006≈0.02449SE(\hat{p}) = \sqrt{\frac{0.6000(1-0.6000)}{400}} = \sqrt{\frac{0.6000 \times 0.4000}{400}} = \sqrt{\frac{0.2400}{400}} = \sqrt{0.0006} \approx 0.02449

現在,我們可以找到 zα/2z_{\alpha/2}:
zα/2=0.0403SE(p^)=0.04030.02449≈1.6455z_{\alpha/2} = \frac{0.0403}{SE(\hat{p})} = \frac{0.0403}{0.02449} \approx 1.6455

我們需要找到一個 zα/2z_{\alpha/2} 值,使得標準常態分佈中,大於 zα/2z_{\alpha/2} 的機率為 α/2\alpha/2。
查閱標準常態分佈表,臨界值 z=1.645z = 1.645 對應的右尾機率為 1−Φ(1.645)≈1−0.9500=0.051 - \Phi(1.645) \approx 1 - 0.9500 = 0.05。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 II.2 題10 分

II. The significance level is 0.05 for all questions in II unless otherwise specified.

  1. (10%) A doctor is studying whether walking leads to a reduction in systolic blood pressure (measured in mmHg). To answer the question, 9 volunteers began a one-week walking program. Their blood pressures were measured before and after the program and the data is as follows:
Subject123456789
before134122118130144125127133128
after131123122124139119124131130

(1) (5%) Suppose the doctor would like to see if the data support that walking for one week will reduce the systolic blood pressure. What is the test statistics and your conclusion?
(2) (5%) Construct a 95% confidence interval for the reduction in systolic blood pressure.

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是關於配對樣本的假設檢定與信賴區間。

核心觀念:

  • 配對樣本檢定:當我們有兩組相關的觀察值(例如同一受試者前後的測量值)時,我們通常分析其差值。
  • 配對 t 檢定:用於檢定配對樣本的平均數差異是否顯著。
  • 信賴區間:用於估計平均數差異的範圍。

已知資訊:

  • 樣本大小 n=9n = 9 (9 位志願者)
  • 測量值為收縮壓 (Systolic Blood Pressure, SBP)
  • 資料包含「前」與「後」的測量值。

數據整理:
首先,我們計算每位受試者血壓的「差值」(Difference, D)。我們定義差值為: D=SBPbefore−SBPafterD = \text{SBP}_{\text{before}} - \text{SBP}_{\text{after}}。如果走路能降低血壓,我們預期差值 D 應為正值。

SubjectbeforeafterDifference (D)
11341313
2122123-1
3118122-4
41301246
51441395
61251196
71271243
81331312
9128130-2

計算差值 D 的樣本平均數 Dˉ\bar{D} 和樣本標準差 sDs_D。
∑D=3+(−1)+(−4)+6+5+6+3+2+(−2)=18\sum D = 3 + (-1) + (-4) + 6 + 5 + 6 + 3 + 2 + (-2) = 18
Dˉ=∑Dn=189=2.0\bar{D} = \frac{\sum D}{n} = \frac{18}{9} = 2.0

計算差值的平方和:
D2D^2: 9,1,16,36,25,36,9,4,49, 1, 16, 36, 25, 36, 9, 4, 4
∑D2=9+1+16+36+25+36+9+4+4=140\sum D^2 = 9 + 1 + 16 + 36 + 25 + 36 + 9 + 4 + 4 = 140

計算樣本標準差 sDs_D:
sD2=∑D2−(∑D)2nn−1=140−(18)299−1=140−32498=140−368=1048=13s_D^2 = \frac{\sum D^2 - \frac{(\sum D)^2}{n}}{n-1} = \frac{140 - \frac{(18)^2}{9}}{9-1} = \frac{140 - \frac{324}{9}}{8} = \frac{140 - 36}{8} = \frac{104}{8} = 13
sD=13≈3.6056s_D = \sqrt{13} \approx 3.6056

(1) 檢定血壓是否降低

  • 目的:檢定走路是否能降低收縮壓。

  • 虛無假設 (H0H_0):平均差值 μD≤0\mu_D \le 0 (走路不能降低血壓,或會升高)。

  • 對立假設 (H1H_1):平均差值 μD>0\mu_D > 0 (走路能降低血壓)。

  • 檢定類型:單尾 t 檢定 (右尾檢定),因為我們關心差值 D 是否顯著大於 0。

  • 顯著水準:α=0.05\alpha = 0.05。

  • 計算檢定統計量 (t-statistic):
    t=Dˉ−μD,0sD/nt = \frac{\bar{D} - \mu_{D,0}}{s_D / \sqrt{n}}
    在 H0H_0 下,μD,0=0\mu_{D,0} = 0。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

  1. (10%) The data of a class of students on the days of the week they are absent is as follows:
DayMonTueWedThurFri
number of students absent1396814

The professor would like to know if the absence is equally likely to occur on any of the five days.
(1) (5%) Determine the test statistics for the hypothesis: the absence is equally likely to occur on any of the five days.
(2) (5%) What is the critical value for testing the hypothesis above? What is your conclusion?

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是關於卡方適合度檢定 (Chi-squared Goodness-of-Fit Test)。

核心觀念:

  • 卡方適合度檢定用於檢定一個類別變數的觀察頻率分佈是否與某個理論上的預期分佈相符。
  • 檢定統計量公式:χ2=∑i=1k(Oi−Ei)2Ei\chi^2 = \sum_{i=1}^{k} \frac{(O_i - E_i)^2}{E_i},其中 OiO_i 是觀察頻率,EiE_i 是期望頻率,kk 是類別數。
  • 自由度:df=k−1−mdf = k - 1 - m,其中 mm 是估計的參數個數(在此題中為 0)。

已知資訊:

  • 類別數 k=5k = 5 (五個星期天)
  • 觀察頻率:OMon=13,OTue=9,OWed=6,OThur=8,OFri=14O_{Mon}=13, O_{Tue}=9, O_{Wed}=6, O_{Thur}=8, O_{Fri}=14
  • 總樣本數 N=13+9+6+8+14=50N = 13 + 9 + 6 + 8 + 14 = 50

假設:

  • 虛無假設 (H0H_0):學生缺席在五天中是均等可能發生的。也就是說,每一天的缺席機率都是 1/51/5。
  • 對立假設 (H1H_1):學生缺席在五天中不是均等可能發生的。

顯著水準:題目未指定,通常預設為 α=0.05\alpha = 0.05。

(1) 計算檢定統計量

  • 計算期望頻率 (EiE_i):
    如果缺席是均等可能發生的,那麼每天的期望缺席人數應為總人數除以天數。
    Ei=Nk=505=10E_i = \frac{N}{k} = \frac{50}{5} = 10
    所以,對於每一天 (Mon, Tue, Wed, Thur, Fri),期望缺席人數 Ei=10E_i = 10。

  • 計算卡方檢定統計量 (χ2\chi^2):
    χ2=∑i=15(Oi−Ei)2Ei\chi^2 = \sum_{i=1}^{5} \frac{(O_i - E_i)^2}{E_i}

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題10 分

  1. (10%) We randomly selected 36 males and 25 females and compared the average time (in hours) they spent watching TV every day. The data are as follows:
meanstandard deviation
males1.60.8
females1.40.7

(1) (5%) To test if the average time spent watching TV is equal between male and female, what is the test statistics? Assume that the variance of time spent watching TV is equal for male and female.
(2) (5%) To test if the variance of time spent watching TV is equal for male and female, what is the test statistics and what is your conclusion?

登入後即可作答並保存紀錄。

這一題的完整詳解

此題包含兩個獨立的假設檢定:比較兩個獨立樣本的平均數,以及比較兩個獨立樣本的變異數。

核心觀念:

  • 獨立樣本 t 檢定 (Independent Samples t-test):用於比較兩個獨立群體的平均數。當變異數相等時,使用合併變異數 (pooled variance) 的 t 檢定。
  • F 檢定 (F-test for Equality of Variances):用於比較兩個獨立群體的變異數。

已知資訊:

  • 男性樣本:n1=36n_1 = 36, xˉ1=1.6\bar{x}_1 = 1.6, s1=0.8s_1 = 0.8
  • 女性樣本:n2=25n_2 = 25, xˉ2=1.4\bar{x}_2 = 1.4, s2=0.7s_2 = 0.7

(1) 檢定平均時間是否相等 (假設變異數相等)

  • 目的:檢定男性和女性每天看電視的平均時間是否相等。

  • 虛無假設 (H0H_0):μ1=μ2\mu_1 = \mu_2 (或 μ1−μ2=0\mu_1 - \mu_2 = 0)。

  • 對立假設 (H1H_1):μ1≠μ2\mu_1 \neq \mu_2 (雙尾檢定)。

  • 假設:σ12=σ22\sigma_1^2 = \sigma_2^2 (變異數相等)。

  • 計算合併變異數 (sp2s_p^2):
    當假設變異數相等時,我們使用合併變異數來估計共同的變異數。
    sp2=(n1−1)s12+(n2−1)s22n1+n2−2s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1+n_2-2}
    sp2=(36−1)(0.82)+(25−1)(0.72)36+25−2s_p^2 = \frac{(36-1)(0.8^2) + (25-1)(0.7^2)}{36+25-2}
    sp2=35×0.64+24×0.4959s_p^2 = \frac{35 \times 0.64 + 24 \times 0.49}{59}
    sp2=22.4+11.7659=34.1659≈0.57898s_p^2 = \frac{22.4 + 11.76}{59} = \frac{34.16}{59} \approx 0.57898

  • 計算檢定統計量 (t-statistic):
    t=(xˉ1−xˉ2)−(μ1−μ2)0sp2(1n1+1n2)t = \frac{(\bar{x}_1 - \bar{x}_2) - (\mu_1 - \mu_2)_0}{\sqrt{s_p^2 (\frac{1}{n_1} + \frac{1}{n_2})}}
    在 H0H_0 下,(μ1−μ2)0=0(\mu_1 - \mu_2)_0 = 0。
    t=(1.6−1.4)−00.57898(136+125)t = \frac{(1.6 - 1.4) - 0}{\sqrt{0.57898 (\frac{1}{36} + \frac{1}{25})}}
    t=0.20.57898(0.02778+0.04000)t = \frac{0.2}{\sqrt{0.57898 (0.02778 + 0.04000)}}
    t=0.20.57898×0.06778t = \frac{0.2}{\sqrt{0.57898 \times 0.06778}}
    t=0.20.03924t = \frac{0.2}{\sqrt{0.03924}}

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題10 分

  1. (10%) A manager wants to test if different packaging (A, B, C, D) have an effect on coffee beans sale at supermarket. She randomly assigns each supermarket to one of the 4 packages and records packs of coffee beans sold in a one-week period. The average coffee beans sold for all supermarkets in the week is 53 packs, and sum of square total (SST) is 1624.
packagingnumber of supermarketsmeanvariance
A94823.50
B95039.00
C85620.86
D85944.57

The average coffee beans sold for all supermarkets in the week is 53 packs, and sum of square total (SST) is 1624.
(1) (5%) What is the sum of square between (among)?
(2) (5%) What is the test statistics for testing the hypothesis: there is no difference in sales of coffee beans for 4 different packaging? What is your conclusion?

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是關於單因子變異數分析 (One-Way ANOVA)。

核心觀念:

  • ANOVA:用於比較三個或以上群體的平均數。
  • 平方和 (Sum of Squares):
    • 總平方和 (SST, Total Sum of Squares):衡量總體數據的總變異。
    • 組間平方和 (SSB, SS Between, SS Among):衡量各組平均數與總平均數之間差異的變異。
    • 組內平方和 (SSW, SS Within, SSE, SS Error):衡量各組內部數據的變異。
    • 關係:SST=SSB+SSWSST = SSB + SSW。
  • F 檢定:用於檢定各組平均數是否相等。

已知資訊:

  • 群體數 k=4k = 4 (包裝 A, B, C, D)
  • 總樣本數 N=nA+nB+nC+nD=9+9+8+8=34N = n_A + n_B + n_C + n_D = 9 + 9 + 8 + 8 = 34
  • 總平均數 xˉTotal=53\bar{x}_{Total} = 53
  • 總平方和 SST=1624SST = 1624

各組資訊:

Packagingnin_ixˉi\bar{x}_isi2s_i^2 (variance)
A94823.50
B95039.00
C85620.86
D85944.57

(1) 計算組間平方和 (SSB)

  • 公式:
    SSB=∑i=1kni(xˉi−xˉTotal)2SSB = \sum_{i=1}^{k} n_i (\bar{x}_i - \bar{x}_{Total})^2
    其中 nin_i 是第 i 組的樣本數,xˉi\bar{x}_i 是第 i 組的樣本平均數,xˉTotal\bar{x}_{Total} 是總平均數。

  • 計算:
    SSB=9×(48−53)2+9×(50−53)2+8×(56−53)2+8×(59−53)2SSB = 9 \times (48 - 53)^2 + 9 \times (50 - 53)^2 + 8 \times (56 - 53)^2 + 8 \times (59 - 53)^2
    SSB=9×(−5)2+9×(−3)2+8×(3)2+8×(6)2SSB = 9 \times (-5)^2 + 9 \times (-3)^2 + 8 \times (3)^2 + 8 \times (6)^2
    SSB=9×25+9×9+8×9+8×36SSB = 9 \times 25 + 9 \times 9 + 8 \times 9 + 8 \times 36
    SSB=225+81+72+288SSB = 225 + 81 + 72 + 288
    SSB=666SSB = 666

組間平方和 (SSB) 為 666。

  • 驗算:
    我們也可以計算組內平方和 (SSW) 來驗證。
    SSW=∑i=1k(ni−1)si2SSW = \sum_{i=1}^{k} (n_i - 1) s_i^2
    SSW=(9−1)×23.50+(9−1)×39.00+(8−1)×20.86+(8−1)×44.57SSW = (9-1) \times 23.50 + (9-1) \times 39.00 + (8-1) \times 20.86 + (8-1) \times 44.57
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題