113 年 國立成功大學測量及空間資訊學系碩士班在職生《統計學》
第 1 題5 分
- 請問統計學中的(1)「平均數(mean)」代表什麼意義?(5分)
(2) 什麼是「中央極限定理 (central limit theorem)」? (10分)
登入後即可作答並保存紀錄。
本題主要在探討統計學的基礎概念:平均數的定義與中央極限定理。
(1) 平均數(Mean)的意義:
平均數是統計學中最基本且常用的集中趨勢測量指標。它代表了一組數據的「算術平均值」,是將所有數據的總和除以數據的個數。平均數能夠提供一個數據集的中心位置的代表值,但它對極端值(離群值)較為敏感。
在數學上,對於一組數據 ,其樣本平均數 定義為:
對於母體平均數 ,若已知母體所有數據,則其定義為:
其中 為母體大小。
(2) 中央極限定理(Central Limit Theorem, CLT):
中央極限定理是機率論與統計學中的一個核心定理。
第 2 題15 分
- 令 MSTR 為 mean square due to treatments (處理間均方), MSE 為 mean square due to error (誤差均方)。請問要比較兩個母體是否一致,為何可以使用 MSTR/MSE 作為檢定統計量? (15分)
登入後即可作答並保存紀錄。
本題考驗對變異數分析(ANOVA)中 F 檢定的理解,特別是 MSTR 和 MSE 的意義以及它們如何用於比較母體。
核心概念:
在單因子變異數分析 (One-Way ANOVA) 中,我們將總變異分解為「組間變異」(Treatment Variation)和「組內變異」(Error Variation)。
- MSTR (Mean Square Treatment) 代表組間變異的平均值,衡量不同處理(或組別)之間的差異。
- MSE (Mean Square Error) 代表組內變異的平均值,衡量同一組內的隨機變異或誤差。
在檢定兩個(或多個)母體平均數是否相等時,我們實際上是在檢定不同處理組的平均數之間是否存在顯著差異。
- 如果母體平均數相等(即母體一致),那麼觀察到的組間差異應該主要來自於隨機抽樣誤差。此時,MSTR 的值應該與 MSE 的值差不多。
- 如果母體平均數不相等(即母體不一致),那麼組間差異會顯著大於組內隨機誤差,此時 MSTR 的值會遠大於 MSE 的值。
檢定統計量 F 值的定義:
這個 F 值就是 F 統計量,它用於檢定所有組別的母體平均數是否相等。
為什麼 MSTR/MSE 可以作為檢定統計量?
- 檢定組間變異相對於組內變異的大小:F 統計量直接比較了由處理(組別)引起的變異(MSTR)與隨機誤差引起的變異(MSE)的大小比例。
第 3 題15 分
- 在全球氣候變遷的影響下,某地區之氣象單位擷取出過去5年間特定月份同一個為期5天的每日
高溫,期望利用這一資料判斷每日高溫是否服從常態分配。故請使用 a = 0.01 判斷這一資料是否
來自於一常態機率分配。(15分)
12.8 30.0 34.4 14.4 12.8 35.0 12.8 11.1 20.6 35.0 32.2 18.3 30.6
10.0 13.3 12.8 13.9 36.7 14.4 26.1 33.3 16.7 15.0 31.1 18.3
(提示:建議分割為5個區間。)
登入後即可作答並保存紀錄。
核心觀念
本題檢定每日高溫是否來自常態分配,適用皮爾遜卡方適合度檢定。
- 虛無假設::高溫資料來自某一常態分配。
- 對立假設::高溫資料不來自常態分配。
- 顯著水準:。
- 由樣本估計常態分配的平均數與變異數,因此自由度為
其中 為區間數,扣除的 個參數為 與 。
解題方法
1. 計算樣本平均數與標準差
樣本數為
資料總和為
因此樣本平均數為
又
樣本變異數為
所以
以樣本估計的常態分配為
2. 分割為五個區間
將常態分配切成五個機率相等的區間。標準常態的五等分點為
轉換回原尺度:
因此四個分割點約為
五個區間為
每個區間在假設的常態分配下皆有機率 ,故期望次數為
第 4 題30 分
- 早期利用 GPS 測量技術,針對同一個基本控制點,在不同時間點進行重複觀測來獲得高程坐標
(單位:公尺),結果如下:
| | 1998年 | 1999年 | 2002年 |
|---|---|---|---|
| 第1次觀測 | 60 | 65 | 70 |
| 第2次觀測 | 43 | 75 | 55 |
| 第3次觀測 | 57 | 88 | 48 |
| 第4次觀測 | 48 | 79 | 51 |
| 第5次觀測 | 52 | 84 | 57 |
(1) 在 a=0.05 的顯著水準下,請檢定這三次測量成果的平均數是否存在顯著差異?(15分)
(2) 若有,則請利用費雪 LSD 程序,找出哪些測量成果的平均數存在差異?(15分)
登入後即可作答並保存紀錄。
本題考驗單因子變異數分析 (One-Way ANOVA) 的應用,用於檢定不同年份(處理組)的 GPS 測量高程平均值是否存在顯著差異,並在顯著差異存在時,使用 Fisher's LSD (Least Significant Difference) 程序進行事後比較。
核心概念:
- 單因子變異數分析 (One-Way ANOVA):用於比較兩個或多個獨立樣本的平均數。這裡的「因子」是「測量年份」,有三個水平(1998, 1999, 2002)。
- 顯著水準 :在假設檢定中,用來決定拒絕虛無假設的標準。
- F 檢定:ANOVA 的核心檢定統計量,用於比較組間變異與組內變異。
- Fisher's LSD:一種事後比較 (post-hoc test) 方法,用於在 ANOVA 檢定結果顯著後,找出具體哪些組別的平均數之間存在顯著差異。
步驟 1:定義虛無假設與對立假設 (Part 1)
- : 這三個年份(1998, 1999, 2002)的 GPS 測量高程平均數相等。
() - : 至少有一個年份的 GPS 測量高程平均數與其他年份不同。
步驟 2:計算樣本統計量
首先,計算每個年份的樣本平均數、樣本數以及總體統計量。
| 年份 | 觀測值 (公尺) | 平均數 | |
|---|---|---|---|
| 1998 | 60, 43, 57, 48, 52 | 5 | |
| 1999 | 65, 75, 88, 79, 84 | 5 | |
| 2002 | 70, 55, 48, 51, 57 | 5 |
總樣本數 。
計算總平均數 :
步驟 3:計算變異數分析表 (ANOVA Table)
我們需要計算組間平方和 (SSB, Sum of Squares Between) 和組內平方和 (SSW, Sum of Squares Within),以及自由度,以得到均方 (MSB, Mean Square Between) 和 MSW (Mean Square Within)。
-
組間平方和 (SSB):
-
組內平方和 (SSW):
首先計算各組的組內平方和:
1998年:
1999年:
2002年:
-
自由度 (Degrees of Freedom, df):
組間自由度 (k為組數)
組內自由度
總自由度 -
均方 (Mean Squares):
組間均方 (MSTR, Mean Square Treatment) =
第 5 題25 分
- 若使用簡單線性回歸,針對下方的時間序列資料進行分析,
| 年 | 2 | 5 | 9 | 12 | 20 |
| :--- | :- | :- | :- | :- | :- |
| 坐標(mm) | 7 | 15 | 9 | 25 | 22 |
(1) 請問估計值的標準誤(standard error of the estimate)是多少?(10分)
(2) 在 a=0.05 的顯著水準下,請問此時間序列的線性關係是否顯著?(15分)
登入後即可作答並保存紀錄。
本題考驗簡單線性迴歸的應用,包括估計值的標準誤計算以及迴歸模型的顯著性檢定。
核心概念:
- 簡單線性迴歸:模型形式為 ,其中 是應變數, 是自變數, 是截距, 是斜率, 是誤差項。
- 估計值的標準誤 (Standard Error of the Estimate, ):衡量迴歸線對數據點的平均擬合程度,反映了預測值與實際觀測值之間的平均差異。
- 迴歸模型的顯著性檢定:用於判斷自變數 與應變數 之間是否存在顯著的線性關係。通常使用 F 檢定或 t 檢定。
數據整理:
自變數 X (年):2, 5, 9, 12, 20
應變數 Y (坐標 mm):7, 15, 9, 25, 22
樣本數 。
步驟 1:計算迴歸係數
首先,需要計算迴歸線的截距 和斜率 。
計算所需的總和:
計算斜率 :
計算截距 :
首先計算平均值
迴歸方程為:
Part (1): 計算估計值的標準誤 ()
估計值的標準誤 的計算公式為:
其中 SSE (Sum of Squared Errors) 是殘差平方和。
SSE 可以通過以下公式計算:
或者,更常用的是:
或者:
另一個計算 SSE 的公式是:
其中 SST (Total Sum of Squares) =