112 年 國立成功大學數據科學研究所《統計學(含迴歸分析)》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題5 分

(1)(2%) X1,X2,X3,…,X10X_1, X_2, X_3, \dots, X_{10} 算不算是一組隨機樣本, 原因?
(2)(3%) 若把 X1,X2,X3,…,X20X_1, X_2, X_3, \dots, X_{20} 依大小排列, 取前 10 名, 請這樣算不算一組隨機樣本, 原因?

登入後即可作答並保存紀錄。

這一題的完整詳解

本題主要在考驗對「隨機樣本」定義的理解。

(1) 隨機樣本的定義是指從母體中隨機抽取的一組觀察值,並且這些觀察值之間是相互獨立的。題目僅說明 X1,X2,X3,…,X10X_1, X_2, X_3, \dots, X_{10} 是一組隨機樣本,但未說明其抽取的過程或母體,因此無法判斷。然而,如果此敘述是基於「它們是從某母體隨機抽取的,且彼此獨立」的前提,那麼它們就構成一個隨機樣本。但若題目僅是列出十個數字,則不能直接斷定。
一般而言,在統計學的語境下,若題目直接稱其為「隨機樣本」,通常預設了其抽樣過程的隨機性和獨立性。因此,若題目提供此敘述,我們通常會接受它是一個隨機樣本。但若要嚴格論證,則需要更多關於抽樣過程的資訊。

(2) 將一組隨機樣本 X1,X2,X3,…,X20X_1, X_2, X_3, \dots, X_{20} 依大小排列後取前 10 名,這組新的數值不再是隨機樣本。原因如下:

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題10 分

令 x1,x2,x3,x4x_1, x_2, x_3, x_4 是一組隨機樣本觀察值。令 YY 表示從 {x1,x2,x3,x4}\{x_1, x_2, x_3, x_4\} 中隨機任取一數 (取完再放回) 所得的隨機變數。
(1)(5%) 請寫出 YY 的 cumulative distribution function (cdf)。
(2)(5%) 今觀察到 x1=1.5,x2=0,x3=−0.5,x4=1x_1=1.5, x_2=0, x_3=-0.5, x_4=1, 請寫出 x1,x2,x3,x4x_1, x_2, x_3, x_4 的 empirical CDF。

登入後即可作答並保存紀錄。

這一題的完整詳解

本題主要考驗對累積分布函數 (CDF) 和經驗累積分布函數 (Empirical CDF) 的理解。

(1) 累積分布函數 (CDF) 的定義:
隨機變數 YY 的累積分布函數 FY(y)F_Y(y) 定義為 FY(y)=P(Y≤y)F_Y(y) = P(Y \le y)。
在本題中,YY 是從 {x1,x2,x3,x4}\{x_1, x_2, x_3, x_4\} 中隨機任取一數 (取完再放回)。由於是隨機任取,所以每取到一個值 xix_i 的機率是 14\frac{1}{4}。
因此,YY 的 CDF 可以表示為:
FY(y)=P(Y≤y)=∑i=14P(Y≤y∣Y=xi)P(Y=xi)F_Y(y) = P(Y \le y) = \sum_{i=1}^{4} P(Y \le y | Y = x_i) P(Y = x_i)
由於 YY 是從 {x1,x2,x3,x4}\{x_1, x_2, x_3, x_4\} 中任取,所以 P(Y=xi)=14P(Y=x_i) = \frac{1}{4}。
FY(y)=∑i=14P(xi≤y)⋅14F_Y(y) = \sum_{i=1}^{4} P(x_i \le y) \cdot \frac{1}{4}
P(xi≤y)P(x_i \le y) 這個項是 1 如果 xi≤yx_i \le y,是 0 如果 xi>yx_i > y。
所以,FY(y)=14∑i=14I(xi≤y)F_Y(y) = \frac{1}{4} \sum_{i=1}^{4} I(x_i \le y),其中 I(⋅)I(\cdot) 是指示函數 (indicator function),即當條件為真時為 1,否則為 0。

這個 CDF 的形式取決於 x1,x2,x3,x4x_1, x_2, x_3, x_4 的具體數值。它是一個階梯函數,在每個 xix_i 的位置上跳躍 14\frac{1}{4}。

(2) 經驗累積分布函數 (Empirical CDF) 的定義:
給定一組觀察值 x1,x2,…,xnx_1, x_2, \dots, x_n,其經驗累積分布函數 F^n(x)\hat{F}_n(x) 定義為:
F^n(x)=小於或等於 x 的觀察值個數n\hat{F}_n(x) = \frac{\text{小於或等於 } x \text{ 的觀察值個數}}{n}
在本題中,觀察值為 x1=1.5,x2=0,x3=−0.5,x4=1x_1=1.5, x_2=0, x_3=-0.5, x_4=1,總數 n=4n=4。
首先,我們將觀察值從小到大排序:−0.5,0,1,1.5-0.5, 0, 1, 1.5。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

令 f(x)f(x) 代表一個 probability density function (pdf)。令 g(x)=f(x)+f(−x)2g(x) = \frac{f(x)+f(-x)}{2}。
(1)(5%) 請問 g(x)g(x) 是否是一個 pdf? 原因為何?
(2)(5%) 若 g(x)g(x) 代表一母體的分布, 其母體平均為何?

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

機率密度函數 h(x)h(x) 必須滿足:

  1. 對所有 xx,h(x)≥0h(x)\ge 0;
  2. 全部面積為 11,即
    ∫−∞∞h(x) dx=1.\int_{-\infty}^{\infty}h(x)\,dx=1.

本題利用變數代換 u=−xu=-x,判斷 g(x)g(x) 是否符合 pdf 定義,並計算其母體平均數。


解題方法

(1) 判斷 g(x)g(x) 是否為 pdf

已知 f(x)f(x) 是 pdf,因此:

f(x)≥0,f(−x)≥0.f(x)\ge 0,\qquad f(-x)\ge 0.

所以

g(x)=f(x)+f(−x)2≥0.g(x)=\frac{f(x)+f(-x)}{2}\ge 0.

再計算 g(x)g(x) 的積分:

∫−∞∞g(x) dx=∫−∞∞f(x)+f(−x)2 dx=12∫−∞∞f(x) dx+12∫−∞∞f(−x) dx.\begin{aligned} \int_{-\infty}^{\infty}g(x)\,dx &=\int_{-\infty}^{\infty}\frac{f(x)+f(-x)}{2}\,dx\\ &=\frac{1}{2}\int_{-\infty}^{\infty}f(x)\,dx +\frac{1}{2}\int_{-\infty}^{\infty}f(-x)\,dx. \end{aligned}

第一項為 11。對第二項令 u=−xu=-x,則 dx=−dudx=-du,可得:

∫−∞∞f(−x) dx=∫−∞∞f(u) du=1.\int_{-\infty}^{\infty}f(-x)\,dx = \int_{-\infty}^{\infty}f(u)\,du =1.

因此:

∫−∞∞g(x) dx=12(1)+12(1)=1.\int_{-\infty}^{\infty}g(x)\,dx =\frac{1}{2}(1)+\frac{1}{2}(1)=1.

g(x)g(x) 非負且積分為 11,所以 g(x)g(x) 是一個 pdf。

此外,g(x)g(x) 具有對稱性:

g(−x)=f(−x)+f(x)2=g(x).g(-x)=\frac{f(-x)+f(x)}{2}=g(x).

因此 g(x)g(x) 是關於 00 對稱的機率密度函數。


(2) 母體平均數

令由 g(x)g(x) 所代表的隨機變數為 XX。在母體平均數存在的通常假設下:

E(X)=∫−∞∞xg(x) dx.E(X)=\int_{-\infty}^{\infty}xg(x)\,dx.
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題10 分

民俗中常用筊杯請問祖先或神祉是否同意, 由兩片木製的半圓形, 陽面為平面, 陰面為凸面。擲出一陰一陽則取得同意。
(1)(5%) 假設兩個筊杯出現陽面的機率都是 1/21/2, 請問取得同意的擲茭期望次數為何?
(2)(5%) 假設一個筊杯出現陽面的機率是 1/21/2, 另一個出現陽面的機率是 3/43/4, 請問取得同意的擲茭期望次數為何?

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗幾何分布的期望值計算。取得同意的定義是「一陰一陽」,這意味著兩個筊杯的結果一個是陽面,一個是陰面。

(1) 兩個筊杯陽面機率均為 1/21/2:
設兩個筊杯分別為筊杯 A 和筊杯 B。
P(A 陽)=P(B 陽)=1/2P(A \text{ 陽}) = P(B \text{ 陽}) = 1/2
P(A 陰)=P(B 陰)=1/2P(A \text{ 陰}) = P(B \text{ 陰}) = 1/2
取得同意的條件是「一陰一陽」,這表示以下兩種情況之一發生:

  • A 陽且 B 陰:P(A 陽∩B 陰)=P(A 陽)×P(B 陰)P(A \text{ 陽} \cap B \text{ 陰}) = P(A \text{ 陽}) \times P(B \text{ 陰}) (假設獨立) =12×12=14= \frac{1}{2} \times \frac{1}{2} = \frac{1}{4}。
  • A 陰且 B 陽:P(A 陰∩B 陽)=P(A 陰)×P(B 陽)P(A \text{ 陰} \cap B \text{ 陽}) = P(A \text{ 陰}) \times P(B \text{ 陽}) (假設獨立) =12×12=14= \frac{1}{2} \times \frac{1}{2} = \frac{1}{4}。

所以,一次擲茭取得同意的機率 pp 為:
p=P(一陰一陽)=P(A 陽∩B 陰)+P(A 陰∩B 陽)=14+14=12p = P(\text{一陰一陽}) = P(A \text{ 陽} \cap B \text{ 陰}) + P(A \text{ 陰} \cap B \text{ 陽}) = \frac{1}{4} + \frac{1}{4} = \frac{1}{2}。

取得同意的過程可以視為一個重複進行獨立伯努利試驗,直到第一次成功的試驗。這符合幾何分布的定義。
幾何分布的期望值是 E[X]=1pE[X] = \frac{1}{p},其中 pp 是成功的機率。
在這裡,p=1/2p = 1/2,所以期望次數為:

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題10 分

令 X1,X2,X3X_1, X_2, X_3 為三個相同分布且獨立的柏努利隨機變數 Bernoulli(p=0.5p=0.5)。
(1)(5%) 求兩個統計量:平均數和眾數的抽樣分布。
(2)(5%) 求平均數和眾數這兩個統計量的期望值和變異數。

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對獨立同分布 (i.i.d.) 隨機變數、柏努利分布、統計量的抽樣分布、期望值與變異數的計算。

首先,我們知道 X1,X2,X3X_1, X_2, X_3 是獨立且同分布的柏努利隨機變數,其中 p=0.5p=0.5。
對於單一的柏努利隨機變數 X∼Bernoulli(p)X \sim \text{Bernoulli}(p):
P(X=1)=pP(X=1) = p
P(X=0)=1−pP(X=0) = 1-p
期望值 E[X]=pE[X] = p
變異數 Var(X)=p(1−p)Var(X) = p(1-p)

在本題中,p=0.5p=0.5,所以:
P(Xi=1)=0.5P(X_i=1) = 0.5
P(Xi=0)=0.5P(X_i=0) = 0.5
E[Xi]=0.5E[X_i] = 0.5
Var(Xi)=0.5(1−0.5)=0.5×0.5=0.25Var(X_i) = 0.5(1-0.5) = 0.5 \times 0.5 = 0.25

(1) 兩個統計量:平均數和眾數的抽樣分布

  • 平均數 (Sample Mean):
    設樣本平均數為 Xˉ=X1+X2+X33\bar{X} = \frac{X_1+X_2+X_3}{3}。
    由於 X1,X2,X3X_1, X_2, X_3 是 i.i.d. Bernoulli(0.5),則它們的和 S=X1+X2+X3S = X_1+X_2+X_3 服從二項分布 B(n,p)B(n, p),其中 n=3n=3 (樣本數) 且 p=0.5p=0.5 (成功機率)。
    S∼B(3,0.5)S \sim B(3, 0.5)。
    SS 可能的取值為 0, 1, 2, 3。
    P(S=0)=(30)(0.5)0(0.5)3=1×1×0.125=0.125P(S=0) = \binom{3}{0} (0.5)^0 (0.5)^3 = 1 \times 1 \times 0.125 = 0.125 (即 X1=0,X2=0,X3=0X_1=0, X_2=0, X_3=0)
    P(S=1)=(31)(0.5)1(0.5)2=3×0.5×0.25=0.375P(S=1) = \binom{3}{1} (0.5)^1 (0.5)^2 = 3 \times 0.5 \times 0.25 = 0.375 (即一個 1, 兩個 0)
    P(S=2)=(32)(0.5)2(0.5)1=3×0.25×0.5=0.375P(S=2) = \binom{3}{2} (0.5)^2 (0.5)^1 = 3 \times 0.25 \times 0.5 = 0.375 (即兩個 1, 一個 0)
    P(S=3)=(33)(0.5)3(0.5)0=1×0.125×1=0.125P(S=3) = \binom{3}{3} (0.5)^3 (0.5)^0 = 1 \times 0.125 \times 1 = 0.125 (即 X1=1,X2=1,X3=1X_1=1, X_2=1, X_3=1)

    樣本平均數 Xˉ=S/3\bar{X} = S/3。所以 Xˉ\bar{X} 的可能取值為 0/3=00/3=0, 1/31/3, 2/32/3, 3/3=13/3=1。
    Xˉ\bar{X} 的抽樣分布為:
    P(Xˉ=0)=P(S=0)=0.125P(\bar{X}=0) = P(S=0) = 0.125
    P(Xˉ=1/3)=P(S=1)=0.375P(\bar{X}=1/3) = P(S=1) = 0.375
    P(Xˉ=2/3)=P(S=2)=0.375P(\bar{X}=2/3) = P(S=2) = 0.375
    P(Xˉ=1)=P(S=3)=0.125P(\bar{X}=1) = P(S=3) = 0.125

  • 眾數 (Sample Mode):
    眾數是指在樣本中出現頻率最高的數值。
    由於 X1,X2,X3X_1, X_2, X_3 的取值是 0 或 1,所以樣本平均數 Xˉ\bar{X} 的可能取值是 0, 1/3, 2/3, 1。
    我們需要看哪一個值在樣本中出現的頻率最高。

    • 如果 S=0S=0 (三個 0),樣本為 {0, 0, 0},此時眾數為 0。
    • 如果 S=1S=1 (一個 1, 兩個 0),樣本為 {0, 0, 1},此時眾數為 0。
    • 如果 S=2S=2 (兩個 1, 一個 0),樣本為 {0, 1, 1},此時眾數為 1。
    • 如果 S=3S=3 (三個 1),樣本為 {1, 1, 1},此時眾數為 1。

    因此,眾數的可能取值是 0 或 1。
    眾數為 0 的情況發生在 S=0S=0 或 S=1S=1 時,總機率為 P(S=0)+P(S=1)=0.125+0.375=0.5P(S=0) + P(S=1) = 0.125 + 0.375 = 0.5。
    眾數為 1 的情況發生在 S=2S=2 或 S=3S=3 時,總機率為 P(S=2)+P(S=3)=0.375+0.125=0.5P(S=2) + P(S=3) = 0.375 + 0.125 = 0.5。
    眾數的抽樣分布為:
    P(Mode=0)=0.5P(\text{Mode}=0) = 0.5
    P(Mode=1)=0.5P(\text{Mode}=1) = 0.5
    這表示眾數是一個離散隨機變數,取值為 0 或 1,且機率各為 0.5。

(2) 期望值和變異數

  • 平均數 Xˉ\bar{X}:
    • 期望值 E[Xˉ]E[\bar{X}]:
      根據期望值的性質,E[Xˉ]=E[X1+X2+X33]=13(E[X1]+E[X2]+E[X3])E[\bar{X}] = E[\frac{X_1+X_2+X_3}{3}] = \frac{1}{3} (E[X_1]+E[X_2]+E[X_3])。
      由於 E[Xi]=p=0.5E[X_i] = p = 0.5,
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 6 題15 分

Covid-19 致死率平均大約 0.2%。過去三個月 A 醫院和 B 醫院因 Covid-19 住院的死亡和存活人數表:

A 醫院B 醫院總計
住院死亡人數12020140
住院存活人數28809803860
總計300010004000

(1)(5%) 請比較 A 醫院和 B 醫院因 Covid-19 住院的死亡率。這裡並沒有問如何進行檢定。如果依照你的計算,你會建議 Covid-19 病患到哪一間醫院住院,原因為何?
(2)(5%) 已知年長者有多慢性疾病狀況, 今將資料表加入年齡考慮, 分 60 歲以上和以下。

年齡低於 60 歲年齡高於 60 歲
A 醫院B 醫院A 醫院B 醫院
住院死亡人數1010住院死亡人數11010
住院存活人數880880住院存活人數2000100
總計890890總計2110110

(3)(5%) 經過(1)和(2)的分析, 這個問題提醒我們在比較分析時應注意什麼?

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對死亡率的計算、比較,以及在進行比較分析時應注意的潛在混淆變數 (confounding variable) 問題。

(1) 比較 A 醫院和 B 醫院的死亡率,以及建議就醫地點

死亡率的計算公式為:
死亡率=死亡人數總住院人數×100%\text{死亡率} = \frac{\text{死亡人數}}{\text{總住院人數}} \times 100\%

  • A 醫院死亡率:
    死亡率A=1203000×100%=0.04×100%=4%\text{死亡率}_A = \frac{120}{3000} \times 100\% = 0.04 \times 100\% = 4\%

  • B 醫院死亡率:
    死亡率B=201000×100%=0.02×100%=2%\text{死亡率}_B = \frac{20}{1000} \times 100\% = 0.02 \times 100\% = 2\%

比較: B 醫院的死亡率 (2%) 低於 A 醫院的死亡率 (4%)。

建議:
如果僅從這份數據來看,會建議 Covid-19 病患到 B 醫院住院,因為 B 醫院的死亡率較低,顯示其治療效果可能較好,或者對病患的照顧較佳。

(2) 加入年齡考慮後的死亡率比較

現在我們需要分別計算不同年齡層在兩家醫院的死亡率。

  • 年齡低於 60 歲:

    • A 醫院 (年齡 < 60):
      死亡率A,<60=10890×100%≈0.011236×100%≈1.12%\text{死亡率}_{A, <60} = \frac{10}{890} \times 100\% \approx 0.011236 \times 100\% \approx 1.12\%
    • B 醫院 (年齡 < 60):
      死亡率B,<60=10890×100%≈0.011236×100%≈1.12%\text{死亡率}_{B, <60} = \frac{10}{890} \times 100\% \approx 0.011236 \times 100\% \approx 1.12\%
      在年齡低於 60 歲的群體中,兩家醫院的死亡率非常接近,幾乎相同。
  • 年齡高於 60 歲:

    • A 醫院 (年齡 > 60):
      死亡率A,>60=1102110×100%≈0.052133×100%≈5.21%\text{死亡率}_{A, >60} = \frac{110}{2110} \times 100\% \approx 0.052133 \times 100\% \approx 5.21\%
    • B 醫院 (年齡 > 60):
      死亡率B,>60=10110×100%≈0.090909×100%≈9.09%\text{死亡率}_{B, >60} = \frac{10}{110} \times 100\% \approx 0.090909 \times 100\% \approx 9.09\%
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 7 題20 分

(20%) LED 的使用日漸普遍, 如車燈、家用照明、面板背光。壽命長度是 LED 重要的品質指標之一。一有家大廠進行 LED 壽命測試, 研究三種材料 (Material 1, 2, 3) 在三個溫度 (Temperature, 15, 70, 125 度) 下的 LED 壽命 (單位 10 天)。假設本實驗採取完全隨機化設計, 該廠工程師先使用迴歸分析 (regression)。

Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 134.5000 11.4717 11.725 4.03e-13 ***
Material2 25.1667 12.0590 2.087 0.04494 *
Material3 41.9167 12.0590 3.476 0.00149 **
Temperature -0.7333 0.1096 -6.689 1.50e-07 ***

Signif. codes: 0 '' 0.001 '' 0.01 '' 0.05 '.' 0.1 ' ' 1
Residual standard error: 29.54 on 32 degrees of freedom
Multiple R-squared: 0.6404, Adjusted R-squared: 0.6067

(1)(5%) 請寫出迴歸分析的數學模型, 請寫清楚解釋應變數和自變數的定義。
(2)(5%) 請說明 Material2 的估計方法, 並解釋估計量 25.1667 的意義。
(3)(5%) 請解釋 Temperature 的估計量 -0.7333 的意義。
(4)(5%) 請列出 Adjusted R-squared 的計算公式與 0.6067 的意義。

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對多元迴歸模型的理解,包括模型的建立、係數的解釋、以及 R-squared 的概念。

實驗設計簡述:
實驗研究三種材料 (Material 1, 2, 3) 在三種溫度 (15, 70, 125 度) 下的 LED 壽命。

  • 應變數 (Response Variable): LED 壽命 (單位 10 天)。
  • 自變數 (Predictor Variables): 材料 (Material) 和溫度 (Temperature)。
  • 實驗設計: 完全隨機化設計。

模型中自變數的編碼:
由於「材料」是一個類別變數 (categorical variable) 有三個水準 (Material 1, 2, 3),在迴歸模型中需要進行編碼。常見的編碼方式是使用虛擬變數 (dummy variables)。
假設 Material 1 是參照組 (reference group)。那麼我們需要兩個虛擬變數:

  • M2M_2: 如果材料是 Material 2,則 M2=1M_2=1,否則 M2=0M_2=0。
  • M3M_3: 如果材料是 Material 3,則 M3=1M_3=1,否則 M3=0M_3=0。
    如果材料是 Material 1,則 M2=0M_2=0 且 M3=0M_3=0。

「溫度」是一個連續變數 (continuous variable)。

(1) 迴歸分析的數學模型

一個典型的多元迴歸模型形式為:
Y=β0+β1X1+β2X2+⋯+βkXk+ϵY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \dots + \beta_k X_k + \epsilon

在此實驗中,應變數是 LED 壽命,自變數是材料和溫度。
設 YY 為 LED 壽命 (單位 10 天)。
設 M2M_2 和 M3M_3 為材料的虛擬變數,如上定義。
設 TT 為溫度 (單位 度)。

模型可以寫成:
Y=β0+β1M2+β2M3+β3T+ϵY = \beta_0 + \beta_1 M_2 + \beta_2 M_3 + \beta_3 T + \epsilon

其中:

  • YY: LED 壽命 (應變數)。
  • M2M_2: 材料 2 的指示變數。
  • M3M_3: 材料 3 的指示變數。
  • TT: 溫度 (自變數)。
  • β0\beta_0: 截距項。
  • β1\beta_1: 材料 2 相對於 Material 1 的預測壽命差異。
  • β2\beta_2: 材料 3 相對於 Material 1 的預測壽命差異。
  • β3\beta_3: 溫度對 LED 壽命的影響係數。
  • ϵ\epsilon: 誤差項。

根據迴歸輸出的係數,我們可以寫出預測模型:
Y^=134.5000+25.1667M2+41.9167M3−0.7333T\hat{Y} = 134.5000 + 25.1667 M_2 + 41.9167 M_3 - 0.7333 T

(2) Material2 的估計方法與 25.1667 的意義

  • 估計方法:
    迴歸係數的估計通常是使用最小平方法 (Ordinary Least Squares, OLS) 來求得。OLS 的目標是最小化實際觀測值與模型預測值之間的殘差平方和。

  • 估計量 25.1667 的意義:
    這個係數 β^1=25.1667\hat{\beta}_1 = 25.1667 是虛擬變數 M2M_2 的估計值。
    它表示,在控制了溫度 (T) 的影響後,與參照組 (Material 1) 相比,使用 Material 2 的 LED 壽命預期會增加 25.1667 個單位 (即 25.1667×1025.1667 \times 10 天)。
    換句話說,當溫度固定時,Material 2 的 LED 壽命比 Material 1 的 LED 壽命平均高出 25.1667 (單位 10 天)。

(3) Temperature 的估計量 -0.7333 的意義

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 8 題20 分

(20%) 承上一題, 該廠工程師決定接續使用兩因子變異數分析 (anova)。

DfSum SqMean SqF valuePr(>F)
Material21068453427.9110.00198 **
Temperature2391191955928.9681.91e-07 ***
Material:Temperature4961424033.5600.01861 *
Residuals2718231675

Signif. codes: 0 '' 0.001 '' 0.01 '' 0.05 '.' 0.1 ' ' 1

(1)(5%) 請寫出變異數分析的數學模型, 請寫清楚解釋模型符號的定義。
(2)(5%) 說明 Material:Temperature 這項 Pr(>F)=0.01861 所代表的意義。
(3)(5%) 迴歸分析和變異數分析中對 Temperature 這個變項的分析方式有何不同?
(4)(5%) Pr(>F) 的計算需要那些資料的假設? 如果假設錯誤如何進行檢定?

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對雙因子變異數分析 (Two-way ANOVA) 的理解,包括模型、交互作用的解釋、以及與迴歸分析的比較,還有 ANOVA 的基本假設。

實驗設計簡述:

  • 應變數 (Response Variable): LED 壽命 (單位 10 天)。
  • 因子 (Factors): 材料 (Material) 有 3 個水準 (Material 1, 2, 3)。溫度 (Temperature) 有 3 個水準 (15, 70, 125 度)。
  • 實驗設計: 完全隨機化設計。

ANOVA 表格提供了 Sum of Squares (SS), Degrees of Freedom (Df), Mean Square (MS), F-statistic, 和 p-value (Pr(>F))。

(1) 變異數分析的數學模型

一個雙因子變異數分析模型,考慮主效應和交互作用,可以寫成:
Yijk=μ+αi+βj+(αβ)ij+ϵijkY_{ijk} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \epsilon_{ijk}

其中:

  • YijkY_{ijk}: 因子 A (Material) 在第 ii 水準,因子 B (Temperature) 在第 jj 水準下的第 kk 個觀測值。
  • μ\mu: 整體平均值 (overall mean)。
  • αi\alpha_i: 因子 A (Material) 的主效應,表示 Material ii 相對於整體平均值的平均差異。
  • βj\beta_j: 因子 B (Temperature) 的主效應,表示 Temperature jj 相對於整體平均值的平均差異。
  • (αβ)ij(\alpha\beta)_{ij}: 因子 A 和因子 B 的交互作用效應,表示 Material ii 和 Temperature jj 同時存在時對平均值的額外影響。
  • ϵijk\epsilon_{ijk}: 隨機誤差項,假設 ϵijk∼N(0,σ2)\epsilon_{ijk} \sim N(0, \sigma^2) 且相互獨立。

根據 ANOVA 表格的 Df,我們知道:

  • Material 的 Df = 2,對應 3 個水準 (3-1=2)。
  • Temperature 的 Df = 2,對應 3 個水準 (3-1=2)。
  • Material:Temperature 的 Df = 4,對應 (3−1)×(3−1)=2×2=4(3-1) \times (3-1) = 2 \times 2 = 4。
  • Residuals 的 Df = 27。總樣本數 n=(Sum of Df)+1=(2+2+4+27)+1=35+1=36n = (\text{Sum of Df}) + 1 = (2+2+4+27) + 1 = 35+1 = 36。

(2) Material:Temperature 這項 Pr(>F)=0.01861 所代表的意義

Pr(>F) 是 p-value,用於檢定對應效應的顯著性。
Material:Temperature 的 Pr(>F) = 0.01861。
這個 p-value 對應的檢定是:
H0:(αβ)ij=0H_0: (\alpha\beta)_{ij} = 0 對所有 i,ji, j (即 Material 和 Temperature 之間沒有交互作用)。
H1:(αβ)ij≠0H_1: (\alpha\beta)_{ij} \ne 0 至少有一個 i,ji, j (即 Material 和 Temperature 之間存在交互作用)。

由於 p-value (0.01861) 小於常用的顯著水準 α=0.05\alpha = 0.05 (也小於 α=0.01\alpha = 0.01),我們拒絕虛無假設 H0H_0。
因此,我們得出結論:Material 和 Temperature 這兩個因子之間存在顯著的交互作用。
這意味著,溫度對 LED 壽命的影響,會因所使用的材料不同而有所差異,反之亦然。

(3) 迴歸分析與變異數分析中對 Temperature 的分析方式有何不同?

  • 迴歸分析 (Regression Analysis):

    • 在多元迴歸模型中,Temperature 被視為一個連續的預測變數 (continuous predictor variable)。
    • 模型假設溫度對應變數的影響是線性的 (除非加入溫度的高次項或交互項)。
    • 迴歸輸出的係數 (β^3=−0.7333\hat{\beta}_3 = -0.7333) 直接量化了溫度每增加一個單位,應變數預期改變多少。
    • 迴歸分析可以包含連續變數、類別變數 (透過虛擬變數編碼),以及它們的交互作用。
  • 變異數分析 (ANOVA):

    • 在 ANOVA 模型中,Temperature 被視為一個因子 (factor),其具有幾個離散的水準 (discrete levels)。
    • ANOVA 主要用於比較不同水準下的平均值是否有顯著差異。
    • ANOVA 表格提供了關於因子主效應 (Temperature 的主效應) 和因子與其他因子之間交互作用效應的顯著性檢定 (透過 F 值和 p-value)。
    • ANOVA 模型不直接提供溫度每增加一個單位會如何影響壽命的量化係數,而是告訴我們不同溫度水準下的平均壽命是否有顯著差異。

主要區別:

  • 變數性質的假設: 迴歸將其視為連續變數,ANOVA 視為離散因子。
  • 分析的重點: 迴歸關注係數的估計和解釋,以及整體模型的擬合優度 (R2R^2)。ANOVA 關注各因子主效應和交互作用的顯著性檢定。
  • 模型的表達: 迴歸模型通常以 Y^=…\hat{Y} = \dots 的形式呈現,係數直接解釋。ANOVA 模型更多是以效應 (main effects, interaction effects) 的形式來描述。

關聯性:
實際上,當因子是類別變數時,ANOVA 與迴歸分析是密切相關的。如果將 ANOVA 模型中的類別因子用虛擬變數編碼後代入迴歸模型,會得到非常相似的結果。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題

112 年成功大學的其他科目

成功大學《統計學》其他年度