112 年 國立中央大學土木工程學系碩士班己:運輸工程組一般生《統計學》
第 1 題20 分
請列出三種統計之點估計方法並詳述其內容與特性。(20分)
登入後即可作答並保存紀錄。
本題主要在考察統計學中點估計 (Point Estimation) 的基本概念與方法。點估計是利用樣本數據來估計母體參數的單一數值。
以下列出三種常見的點估計方法,並詳述其內容與特性:
-
最大概似估計法 (Maximum Likelihood Estimation, MLE)
- 內容: 最大概似估計法的核心思想是,對於給定的樣本數據,選擇最有可能產生這些數據的母體參數值。它透過最大化樣本數據的概似函數 (Likelihood Function) 來找到最佳的估計量。概似函數 是所有樣本點 的聯合機率密度函數 (或機率質量函數),將母體參數 視為變數。
- 特性:
- 一致性 (Consistency): 當樣本數 趨近無限大時,MLE 估計量會趨近真實的母體參數。
- 漸近有效性 (Asymptotic Efficiency): 當樣本數足夠大時,MLE 估計量具有最小的漸近方差,其效率接近 Cramér-Rao 下界。
- 漸近常態性 (Asymptotic Normality): 當樣本數足夠大時,MLE 估計量近似於一個常態分配。
- 不變性 (Invariance): 若 是 的 MLE,則 是 的 MLE,其中 是一個函數。
- 缺點: 在小樣本情況下,MLE 可能不是最佳的估計量,有時可能無法找到閉形式解,需要數值方法求解。
-
動差法 (Method of Moments, MOM)
- 內容: 動差法是一種較為直觀的估計方法。
第 2 題20 分
一間交通號誌工廠所生產之紅綠燈組壽命具有常態分配,根據歷史資料得知紅綠燈組壽命標準差為40小時。今品管人員抽查了新生產的30組紅綠燈,求得樣本平均壽命時數為800小時,試問在95%的信賴水準之下平均壽命時數的信賴區間,以及若要求抽樣誤差小於等於10小時的機率為90%,則須抽樣幾個紅綠燈組?(20分)
登入後即可作答並保存紀錄。
本題包含兩個部分:一是計算母體平均數的信賴區間,二是計算確定樣本大小以達到特定抽樣誤差和信賴水準。
核心觀念:
- 常態分配母體下,當母體標準差已知時,計算平均數信賴區間使用 Z 分配。
- 樣本大小的決定與信賴水準、預期抽樣誤差有關。
已知條件:
- 母體分配:常態分配
- 母體標準差 小時
- 樣本數 組
- 樣本平均壽命 小時
- 信賴水準 (Part 1):95%
- 要求抽樣誤差 小時
- 要求機率 (Part 2):90%
Part 1: 計算平均壽命時數的95%信賴區間
由於母體為常態分配且母體標準差 已知,我們可以使用 Z 分配來建構信賴區間。
信賴區間的公式為:
其中:
- 是對應於 95% 信賴水準的 Z 值。對於 95% 信賴水準,,所以 。查標準常態分配表可知,。
計算標準誤 (Standard Error, SE):
第 3 題20 分
假設桃園市隨機抽出 250 部自用小客車,調查一年的車輛行駛里程數記錄,經統計得知 250部自用小客車一年平均行駛12,000公里,且有2,500公里的標準差。試取顯著水準a=0.01,檢定每部自用小客車一年平均行駛里程是否超過10,000公里?(20分)
登入後即可作答並保存紀錄。
本題為單一樣本平均數的假設檢定。我們需要檢定母體平均行駛里程是否顯著大於特定數值。
核心觀念:
單一樣本平均數的 Z 檢定或 T 檢定。由於題目提供了樣本標準差,並且樣本數 較大,我們可以近似使用 Z 檢定,或者嚴謹地使用 T 檢定(因為我們使用的是樣本標準差來估計母體標準差)。在此我們採用 T 檢定,因為它在樣本數較大時,其結果會非常接近 Z 檢定。
已知條件:
- 樣本數 部
- 樣本平均里程 公里
- 樣本標準差 公里
- 檢定數值 公里
- 顯著水準
- 檢定方向:是否超過 10,000 公里(右尾檢定)
步驟:
-
建立虛無假設 () 與對立假設 ()
- 虛無假設 : 母體平均行駛里程 公里。
- 對立假設 : 母體平均行駛里程 公里。
這是右尾檢定,因為我們想檢定的是「是否超過」。
-
計算檢定統計量
由於我們使用樣本標準差 來估計母體標準差 ,且樣本數 很大,我們可以使用 t 檢定統計量:
將已知數值代入:
計算分母:
計算 t 值:
第 4 題20 分
機車製造廠商為了解機車性能,由所生產的機車任選12輛做測試,在不同的行駛速度中緊急煞車,分別量測它們煞車後的滑行距離,其測得資料如下表所示,試利用最小平方法估計迴歸方程式及樣本相關係數:(20分)
表1:簡迴歸模式之資料
| 行駛速度xi (公里/小時) | 30 | 40 | 40 | 50 | 50 | 60 | 70 | 80 | 80 | 90 | 90 | 100 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 滑行距離yi(公寸) | 1.6 | 2.1 | 2.6 | 3.6 | 4.2 | 4.3 | 4.9 | 5.5 | 5.3 | 6.2 | 6.0 | 7.0 |
登入後即可作答並保存紀錄。
核心觀念
本題考查一元簡單線性迴歸的最小平方法,以及樣本相關係數的計算。
設迴歸模型為
其中:
- :截距
- :斜率
- :行駛速度
- :煞車後滑行距離
最小平方法估計式為
其中
樣本相關係數為
其中
解題方法與計算
共有 筆資料。先計算各項總和:
因此
為方便計算,再求:
因此
交叉離差平方和為
因此迴歸斜率為
截距為
第 5 題20 分
何謂因素分析(factor analysis)與主成分分析(principal component analysis)請分別說明其內容與兩者主要之差異。(20分)
登入後即可作答並保存紀錄。
本題旨在考察對因素分析 (Factor Analysis, FA) 和主成分分析 (Principal Component Analysis, PCA) 這兩種多變量統計技術的理解,以及它們之間的異同。
核心觀念:
兩者都是用來處理高維度數據,試圖尋找潛在結構或簡化變數空間的方法。
1. 因素分析 (Factor Analysis, FA)
-
內容:
因素分析是一種統計技術,用於識別變數集合中潛在的、不可觀測的「因素」(factors)。它假設觀測到的變數是基於少數幾個共同因素 (common factors) 和獨特因素 (unique factors) 的線性組合。其主要目的是尋找這些共同因素,以便能夠解釋原始變數之間的共變異 (covariance) 或相關性。
FA 的模型通常表示為:
其中, 是第 個觀測變數, 是第 個共同因素, 是第 個變數對第 個共同因素的負荷量 (factor loading), 是第 個變數的獨特因素 (unique factor), 是獨特因素的強度。
FA 的重點在於「模型」:它假設變數的變異中,一部分是由共同因素解釋的(共變異),另一部分是獨特因素造成的(特異變異)。FA 的目標是估計這些共同因素和它們的負荷量。 -
目的:
- 識別潛在結構或維度。
- 數據簡化與降維。
- 解釋變數之間的相關性。
- 用於構建問卷、測驗等。
-
假設:
- 變數是連續的。
- 存在共同因素,它們是所有或部分變數的線性組合。
- 獨特因素與共同因素及其他獨特因素是不相關的。
2. 主成分分析 (Principal Component Analysis, PCA)
-
內容:
主成分分析是一種統計技術,用於將一組可能相關的變數轉換為一組線性不相關的新變數,稱為「主成分」(principal components)。這些主成分是原始變數的線性組合,並且按照它們所解釋的總變異量 (total variance) 的多少進行排序。第一個主成分解釋的變異量最多,第二個次之,以此類推。
PCA 的目標是找到這些主成分,以便用較少的主成分來近似原始數據集,從而達到降維的目的。
PCA 的模型可以看作是將原始變數 轉換為一組新的變數 (主成分),其中 ,A 是變換矩陣,其行向量是特徵向量。 -
目的:
- 降維 (Dimensionality Reduction):用較少的主成分來代表原始變數。
- 數據壓縮。
- 去除變數間的相關性。
- 為後續的分析(如迴歸、聚類)提供一個更簡潔的輸入。
-
假設:
- PCA 本身沒有嚴格的統計模型假設,它主要是一種數學轉換。
- 通常在變數具有不同尺度時,會對數據進行標準化處理。
3. 主要差異 (Differences)