112 年 國立成功大學數據科學研究所《統計學(含迴歸分析)》
第 1 題5 分
(1)(2%) 算不算是一組隨機樣本, 原因?
(2)(3%) 若把 依大小排列, 取前 10 名, 請這樣算不算一組隨機樣本, 原因?
登入後即可作答並保存紀錄。
本題主要在考驗對「隨機樣本」定義的理解。
(1) 隨機樣本的定義是指從母體中隨機抽取的一組觀察值,並且這些觀察值之間是相互獨立的。題目僅說明 是一組隨機樣本,但未說明其抽取的過程或母體,因此無法判斷。然而,如果此敘述是基於「它們是從某母體隨機抽取的,且彼此獨立」的前提,那麼它們就構成一個隨機樣本。但若題目僅是列出十個數字,則不能直接斷定。
一般而言,在統計學的語境下,若題目直接稱其為「隨機樣本」,通常預設了其抽樣過程的隨機性和獨立性。因此,若題目提供此敘述,我們通常會接受它是一個隨機樣本。但若要嚴格論證,則需要更多關於抽樣過程的資訊。
(2) 將一組隨機樣本 依大小排列後取前 10 名,這組新的數值不再是隨機樣本。原因如下:
第 2 題10 分
令 是一組隨機樣本觀察值。令 表示從 中隨機任取一數 (取完再放回) 所得的隨機變數。
(1)(5%) 請寫出 的 cumulative distribution function (cdf)。
(2)(5%) 今觀察到 , 請寫出 的 empirical CDF。
登入後即可作答並保存紀錄。
本題主要考驗對累積分布函數 (CDF) 和經驗累積分布函數 (Empirical CDF) 的理解。
(1) 累積分布函數 (CDF) 的定義:
隨機變數 的累積分布函數 定義為 。
在本題中, 是從 中隨機任取一數 (取完再放回)。由於是隨機任取,所以每取到一個值 的機率是 。
因此, 的 CDF 可以表示為:
由於 是從 中任取,所以 。
這個項是 1 如果 ,是 0 如果 。
所以,,其中 是指示函數 (indicator function),即當條件為真時為 1,否則為 0。
這個 CDF 的形式取決於 的具體數值。它是一個階梯函數,在每個 的位置上跳躍 。
(2) 經驗累積分布函數 (Empirical CDF) 的定義:
給定一組觀察值 ,其經驗累積分布函數 定義為:
在本題中,觀察值為 ,總數 。
首先,我們將觀察值從小到大排序:。
第 3 題10 分
令 代表一個 probability density function (pdf)。令 。
(1)(5%) 請問 是否是一個 pdf? 原因為何?
(2)(5%) 若 代表一母體的分布, 其母體平均為何?
登入後即可作答並保存紀錄。
核心觀念
機率密度函數 必須滿足:
- 對所有 ,;
- 全部面積為 ,即
本題利用變數代換 ,判斷 是否符合 pdf 定義,並計算其母體平均數。
解題方法
(1) 判斷 是否為 pdf
已知 是 pdf,因此:
所以
再計算 的積分:
第一項為 。對第二項令 ,則 ,可得:
因此:
非負且積分為 ,所以 是一個 pdf。
此外, 具有對稱性:
因此 是關於 對稱的機率密度函數。
(2) 母體平均數
令由 所代表的隨機變數為 。在母體平均數存在的通常假設下:
第 4 題10 分
民俗中常用筊杯請問祖先或神祉是否同意, 由兩片木製的半圓形, 陽面為平面, 陰面為凸面。擲出一陰一陽則取得同意。
(1)(5%) 假設兩個筊杯出現陽面的機率都是 , 請問取得同意的擲茭期望次數為何?
(2)(5%) 假設一個筊杯出現陽面的機率是 , 另一個出現陽面的機率是 , 請問取得同意的擲茭期望次數為何?
登入後即可作答並保存紀錄。
本題考驗幾何分布的期望值計算。取得同意的定義是「一陰一陽」,這意味著兩個筊杯的結果一個是陽面,一個是陰面。
(1) 兩個筊杯陽面機率均為 :
設兩個筊杯分別為筊杯 A 和筊杯 B。
取得同意的條件是「一陰一陽」,這表示以下兩種情況之一發生:
- A 陽且 B 陰: (假設獨立) 。
- A 陰且 B 陽: (假設獨立) 。
所以,一次擲茭取得同意的機率 為:
。
取得同意的過程可以視為一個重複進行獨立伯努利試驗,直到第一次成功的試驗。這符合幾何分布的定義。
幾何分布的期望值是 ,其中 是成功的機率。
在這裡,,所以期望次數為:
第 5 題10 分
令 為三個相同分布且獨立的柏努利隨機變數 Bernoulli()。
(1)(5%) 求兩個統計量:平均數和眾數的抽樣分布。
(2)(5%) 求平均數和眾數這兩個統計量的期望值和變異數。
登入後即可作答並保存紀錄。
本題考驗對獨立同分布 (i.i.d.) 隨機變數、柏努利分布、統計量的抽樣分布、期望值與變異數的計算。
首先,我們知道 是獨立且同分布的柏努利隨機變數,其中 。
對於單一的柏努利隨機變數 :
期望值
變異數
在本題中,,所以:
(1) 兩個統計量:平均數和眾數的抽樣分布
-
平均數 (Sample Mean):
設樣本平均數為 。
由於 是 i.i.d. Bernoulli(0.5),則它們的和 服從二項分布 ,其中 (樣本數) 且 (成功機率)。
。
可能的取值為 0, 1, 2, 3。
(即 )
(即一個 1, 兩個 0)
(即兩個 1, 一個 0)
(即 )樣本平均數 。所以 的可能取值為 , , , 。
的抽樣分布為:
-
眾數 (Sample Mode):
眾數是指在樣本中出現頻率最高的數值。
由於 的取值是 0 或 1,所以樣本平均數 的可能取值是 0, 1/3, 2/3, 1。
我們需要看哪一個值在樣本中出現的頻率最高。- 如果 (三個 0),樣本為 {0, 0, 0},此時眾數為 0。
- 如果 (一個 1, 兩個 0),樣本為 {0, 0, 1},此時眾數為 0。
- 如果 (兩個 1, 一個 0),樣本為 {0, 1, 1},此時眾數為 1。
- 如果 (三個 1),樣本為 {1, 1, 1},此時眾數為 1。
因此,眾數的可能取值是 0 或 1。
眾數為 0 的情況發生在 或 時,總機率為 。
眾數為 1 的情況發生在 或 時,總機率為 。
眾數的抽樣分布為:
這表示眾數是一個離散隨機變數,取值為 0 或 1,且機率各為 0.5。
(2) 期望值和變異數
- 平均數 :
- 期望值 :
根據期望值的性質,。
由於 ,
- 期望值 :
第 6 題15 分
Covid-19 致死率平均大約 0.2%。過去三個月 A 醫院和 B 醫院因 Covid-19 住院的死亡和存活人數表:
| A 醫院 | B 醫院 | 總計 | |
|---|---|---|---|
| 住院死亡人數 | 120 | 20 | 140 |
| 住院存活人數 | 2880 | 980 | 3860 |
| 總計 | 3000 | 1000 | 4000 |
(1)(5%) 請比較 A 醫院和 B 醫院因 Covid-19 住院的死亡率。這裡並沒有問如何進行檢定。如果依照你的計算,你會建議 Covid-19 病患到哪一間醫院住院,原因為何?
(2)(5%) 已知年長者有多慢性疾病狀況, 今將資料表加入年齡考慮, 分 60 歲以上和以下。
| 年齡低於 60 歲 | 年齡高於 60 歲 | ||||
|---|---|---|---|---|---|
| A 醫院 | B 醫院 | A 醫院 | B 醫院 | ||
| 住院死亡人數 | 10 | 10 | 住院死亡人數 | 110 | 10 |
| 住院存活人數 | 880 | 880 | 住院存活人數 | 2000 | 100 |
| 總計 | 890 | 890 | 總計 | 2110 | 110 |
(3)(5%) 經過(1)和(2)的分析, 這個問題提醒我們在比較分析時應注意什麼?
登入後即可作答並保存紀錄。
本題考驗對死亡率的計算、比較,以及在進行比較分析時應注意的潛在混淆變數 (confounding variable) 問題。
(1) 比較 A 醫院和 B 醫院的死亡率,以及建議就醫地點
死亡率的計算公式為:
-
A 醫院死亡率:
-
B 醫院死亡率:
比較: B 醫院的死亡率 (2%) 低於 A 醫院的死亡率 (4%)。
建議:
如果僅從這份數據來看,會建議 Covid-19 病患到 B 醫院住院,因為 B 醫院的死亡率較低,顯示其治療效果可能較好,或者對病患的照顧較佳。
(2) 加入年齡考慮後的死亡率比較
現在我們需要分別計算不同年齡層在兩家醫院的死亡率。
-
年齡低於 60 歲:
- A 醫院 (年齡 < 60):
- B 醫院 (年齡 < 60):
在年齡低於 60 歲的群體中,兩家醫院的死亡率非常接近,幾乎相同。
- A 醫院 (年齡 < 60):
-
年齡高於 60 歲:
- A 醫院 (年齡 > 60):
- B 醫院 (年齡 > 60):
- A 醫院 (年齡 > 60):
第 7 題20 分
(20%) LED 的使用日漸普遍, 如車燈、家用照明、面板背光。壽命長度是 LED 重要的品質指標之一。一有家大廠進行 LED 壽命測試, 研究三種材料 (Material 1, 2, 3) 在三個溫度 (Temperature, 15, 70, 125 度) 下的 LED 壽命 (單位 10 天)。假設本實驗採取完全隨機化設計, 該廠工程師先使用迴歸分析 (regression)。
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 134.5000 11.4717 11.725 4.03e-13 ***
Material2 25.1667 12.0590 2.087 0.04494 *
Material3 41.9167 12.0590 3.476 0.00149 **
Temperature -0.7333 0.1096 -6.689 1.50e-07 ***
Signif. codes: 0 '' 0.001 '' 0.01 '' 0.05 '.' 0.1 ' ' 1
Residual standard error: 29.54 on 32 degrees of freedom
Multiple R-squared: 0.6404, Adjusted R-squared: 0.6067
(1)(5%) 請寫出迴歸分析的數學模型, 請寫清楚解釋應變數和自變數的定義。
(2)(5%) 請說明 Material2 的估計方法, 並解釋估計量 25.1667 的意義。
(3)(5%) 請解釋 Temperature 的估計量 -0.7333 的意義。
(4)(5%) 請列出 Adjusted R-squared 的計算公式與 0.6067 的意義。
登入後即可作答並保存紀錄。
本題考驗對多元迴歸模型的理解,包括模型的建立、係數的解釋、以及 R-squared 的概念。
實驗設計簡述:
實驗研究三種材料 (Material 1, 2, 3) 在三種溫度 (15, 70, 125 度) 下的 LED 壽命。
- 應變數 (Response Variable): LED 壽命 (單位 10 天)。
- 自變數 (Predictor Variables): 材料 (Material) 和溫度 (Temperature)。
- 實驗設計: 完全隨機化設計。
模型中自變數的編碼:
由於「材料」是一個類別變數 (categorical variable) 有三個水準 (Material 1, 2, 3),在迴歸模型中需要進行編碼。常見的編碼方式是使用虛擬變數 (dummy variables)。
假設 Material 1 是參照組 (reference group)。那麼我們需要兩個虛擬變數:
- : 如果材料是 Material 2,則 ,否則 。
- : 如果材料是 Material 3,則 ,否則 。
如果材料是 Material 1,則 且 。
「溫度」是一個連續變數 (continuous variable)。
(1) 迴歸分析的數學模型
一個典型的多元迴歸模型形式為:
在此實驗中,應變數是 LED 壽命,自變數是材料和溫度。
設 為 LED 壽命 (單位 10 天)。
設 和 為材料的虛擬變數,如上定義。
設 為溫度 (單位 度)。
模型可以寫成:
其中:
- : LED 壽命 (應變數)。
- : 材料 2 的指示變數。
- : 材料 3 的指示變數。
- : 溫度 (自變數)。
- : 截距項。
- : 材料 2 相對於 Material 1 的預測壽命差異。
- : 材料 3 相對於 Material 1 的預測壽命差異。
- : 溫度對 LED 壽命的影響係數。
- : 誤差項。
根據迴歸輸出的係數,我們可以寫出預測模型:
(2) Material2 的估計方法與 25.1667 的意義
-
估計方法:
迴歸係數的估計通常是使用最小平方法 (Ordinary Least Squares, OLS) 來求得。OLS 的目標是最小化實際觀測值與模型預測值之間的殘差平方和。 -
估計量 25.1667 的意義:
這個係數 是虛擬變數 的估計值。
它表示,在控制了溫度 (T) 的影響後,與參照組 (Material 1) 相比,使用 Material 2 的 LED 壽命預期會增加 25.1667 個單位 (即 天)。
換句話說,當溫度固定時,Material 2 的 LED 壽命比 Material 1 的 LED 壽命平均高出 25.1667 (單位 10 天)。
(3) Temperature 的估計量 -0.7333 的意義
第 8 題20 分
(20%) 承上一題, 該廠工程師決定接續使用兩因子變異數分析 (anova)。
| Df | Sum Sq | Mean Sq | F value | Pr(>F) | |
|---|---|---|---|---|---|
| Material | 2 | 10684 | 5342 | 7.911 | 0.00198 ** |
| Temperature | 2 | 39119 | 19559 | 28.968 | 1.91e-07 *** |
| Material:Temperature | 4 | 9614 | 2403 | 3.560 | 0.01861 * |
| Residuals | 27 | 18231 | 675 |
Signif. codes: 0 '' 0.001 '' 0.01 '' 0.05 '.' 0.1 ' ' 1
(1)(5%) 請寫出變異數分析的數學模型, 請寫清楚解釋模型符號的定義。
(2)(5%) 說明 Material:Temperature 這項 Pr(>F)=0.01861 所代表的意義。
(3)(5%) 迴歸分析和變異數分析中對 Temperature 這個變項的分析方式有何不同?
(4)(5%) Pr(>F) 的計算需要那些資料的假設? 如果假設錯誤如何進行檢定?
登入後即可作答並保存紀錄。
本題考驗對雙因子變異數分析 (Two-way ANOVA) 的理解,包括模型、交互作用的解釋、以及與迴歸分析的比較,還有 ANOVA 的基本假設。
實驗設計簡述:
- 應變數 (Response Variable): LED 壽命 (單位 10 天)。
- 因子 (Factors): 材料 (Material) 有 3 個水準 (Material 1, 2, 3)。溫度 (Temperature) 有 3 個水準 (15, 70, 125 度)。
- 實驗設計: 完全隨機化設計。
ANOVA 表格提供了 Sum of Squares (SS), Degrees of Freedom (Df), Mean Square (MS), F-statistic, 和 p-value (Pr(>F))。
(1) 變異數分析的數學模型
一個雙因子變異數分析模型,考慮主效應和交互作用,可以寫成:
其中:
- : 因子 A (Material) 在第 水準,因子 B (Temperature) 在第 水準下的第 個觀測值。
- : 整體平均值 (overall mean)。
- : 因子 A (Material) 的主效應,表示 Material 相對於整體平均值的平均差異。
- : 因子 B (Temperature) 的主效應,表示 Temperature 相對於整體平均值的平均差異。
- : 因子 A 和因子 B 的交互作用效應,表示 Material 和 Temperature 同時存在時對平均值的額外影響。
- : 隨機誤差項,假設 且相互獨立。
根據 ANOVA 表格的 Df,我們知道:
- Material 的 Df = 2,對應 3 個水準 (3-1=2)。
- Temperature 的 Df = 2,對應 3 個水準 (3-1=2)。
- Material:Temperature 的 Df = 4,對應 。
- Residuals 的 Df = 27。總樣本數 。
(2) Material:Temperature 這項 Pr(>F)=0.01861 所代表的意義
Pr(>F) 是 p-value,用於檢定對應效應的顯著性。
Material:Temperature 的 Pr(>F) = 0.01861。
這個 p-value 對應的檢定是:
對所有 (即 Material 和 Temperature 之間沒有交互作用)。
至少有一個 (即 Material 和 Temperature 之間存在交互作用)。
由於 p-value (0.01861) 小於常用的顯著水準 (也小於 ),我們拒絕虛無假設 。
因此,我們得出結論:Material 和 Temperature 這兩個因子之間存在顯著的交互作用。
這意味著,溫度對 LED 壽命的影響,會因所使用的材料不同而有所差異,反之亦然。
(3) 迴歸分析與變異數分析中對 Temperature 的分析方式有何不同?
-
迴歸分析 (Regression Analysis):
- 在多元迴歸模型中,Temperature 被視為一個連續的預測變數 (continuous predictor variable)。
- 模型假設溫度對應變數的影響是線性的 (除非加入溫度的高次項或交互項)。
- 迴歸輸出的係數 () 直接量化了溫度每增加一個單位,應變數預期改變多少。
- 迴歸分析可以包含連續變數、類別變數 (透過虛擬變數編碼),以及它們的交互作用。
-
變異數分析 (ANOVA):
- 在 ANOVA 模型中,Temperature 被視為一個因子 (factor),其具有幾個離散的水準 (discrete levels)。
- ANOVA 主要用於比較不同水準下的平均值是否有顯著差異。
- ANOVA 表格提供了關於因子主效應 (Temperature 的主效應) 和因子與其他因子之間交互作用效應的顯著性檢定 (透過 F 值和 p-value)。
- ANOVA 模型不直接提供溫度每增加一個單位會如何影響壽命的量化係數,而是告訴我們不同溫度水準下的平均壽命是否有顯著差異。
主要區別:
- 變數性質的假設: 迴歸將其視為連續變數,ANOVA 視為離散因子。
- 分析的重點: 迴歸關注係數的估計和解釋,以及整體模型的擬合優度 ()。ANOVA 關注各因子主效應和交互作用的顯著性檢定。
- 模型的表達: 迴歸模型通常以 的形式呈現,係數直接解釋。ANOVA 模型更多是以效應 (main effects, interaction effects) 的形式來描述。
關聯性:
實際上,當因子是類別變數時,ANOVA 與迴歸分析是密切相關的。如果將 ANOVA 模型中的類別因子用虛擬變數編碼後代入迴歸模型,會得到非常相似的結果。