112 年 國立中央大學土木工程學系碩士班己:運輸工程組在職生《統計學》
第 1 題20 分
計算題需計算過程,無計算過程者不予計分
- 請列出三種統計之點估計方法並詳述其內容與特性。(20分)
登入後即可作答並保存紀錄。
本題主要在考察統計學中點估計(Point Estimation)的基本概念與方法。點估計是使用樣本數據來估計母體參數的單一數值。
統計學中常見的三種點估計方法包括:
-
矩量法 (Method of Moments, MoM):
- 內容:此方法是將樣本的各階矩(例如樣本平均數、樣本變異數)與母體的各階矩相等,然後解出母體參數。最常見的是使用一階矩(樣本平均數)來估計母體平均數。
- 特性:
- 優點:計算相對簡單,直觀,且通常能得到參數的一致估計量(consistent estimator)。
- 缺點:不一定能得到有效估計量(efficient estimator),即估計量的變異數可能不是最小的。有時解聯立方程式可能很複雜。
-
最大概似法 (Maximum Likelihood Estimation, MLE):
- 內容:此方法是尋找一組母體參數,使得在這些參數下,觀察到當前樣本數據的機率(或機率密度)最大。這個過程通常涉及建立樣本的概似函數(likelihood function),然後對概似函數求導,令其等於零來尋找最大值點,或者取對數概似函數(log-likelihood function)來簡化計算。
- 特性:
第 2 題20 分
- 一間交通號誌工廠所生產之紅綠燈組壽命具有常態分配,根據歷史資料得知
紅綠燈組壽命標準差為40小時。今品管人員抽查了新生產的30組紅綠燈,
求得樣本平均壽命時數為800小時,試問在95%的信賴水準之下平均壽命時
數的信賴區間,以及若要求抽樣誤差小於等於10小時的機率為90%,則須抽
樣幾個紅綠燈組?(20分)
登入後即可作答並保存紀錄。
本題分為兩個子問題:
(a) 計算母體平均壽命時數在95%信賴水準下的信賴區間。
(b) 計算要達到指定抽樣誤差與信賴水準所需的樣本數。
已知資訊:
- 母體壽命時數服從常態分配。
- 母體標準差 小時。
- 樣本數 組。
- 樣本平均壽命時數 小時。
- 信賴水準為 95%。
(a) 計算95%信賴區間
由於母體標準差 已知,我們可以使用 Z 分配來計算信賴區間。
信賴區間的公式為:
其中:
- 信賴水準為 95%,表示 。
- 。由標準常態分配表可知,。
計算標準誤 (Standard Error, SE):
計算邊際誤差 (Margin of Error, ME):
第 3 題20 分
- 假設桃園市隨機抽出 250 部自用小客車,調查一年的車輛行駛里程數記錄,
經統計得知 250部自用小客車一年平均行駛12,000公里,且有2,500公里的
標準差。試取顯著水準a=0.01,檢定每部自用小客車一年平均行駛里程是
否超過10,000公里?(20分)
登入後即可作答並保存紀錄。
本題為一典型的假設檢定問題,我們要檢定母體平均行駛里程是否顯著大於某特定值。
已知資訊:
- 樣本數 部。
- 樣本平均里程 公里。
- 樣本標準差 公里。
- 檢定值(待檢定是否超過) 公里。
- 顯著水準 。
步驟一:建立假設
我們想檢定的是「平均行駛里程是否超過 10,000 公里」。
- 虛無假設 :母體平均里程 公里。
- 對立假設 :母體平均里程 公里。(這是我們要證明的,屬於右尾檢定)
步驟二:選擇檢定統計量
由於樣本數 很大(通常 即可視為大樣本),且母體標準差 未知,我們可以使用 Z 檢定,以樣本標準差 近似母體標準差 。
檢定統計量為:
步驟三:計算檢定統計量的值
將已知數據代入公式:
步驟四:決定檢定區域(或計算 P 值)
第 4 題20 分
- 機車製造廠商為了解機車性能,由所生產的機車任選12輛做測試,在不同的
行駛速度中緊急煞車,分別量測它們煞車後的滑行距離,其測得資料如下表
所示,試利用最小平方法估計迴歸方程式及樣本相關係數:(20分)
表1:簡迴歸模式之資料
行駛速度xi (公里 30 40 40 50 50 60 70 80 80 90 90 100
/小時)
滑行距離yi(公寸) 1.6 2.1 2.6 3.6 4.2 4.3 4.9 5.5 5.3 6.2 6.0 7.0
登入後即可作答並保存紀錄。
本題要求我們利用最小平方法估計簡單線性迴歸方程式,並計算樣本相關係數。
已知資訊:
- 樣本數 。
- 自變數 :行駛速度 (公里/小時)。
- 應變數 :滑行距離 (公寸)。
- 數據如下表:
第一部分:估計迴歸方程式 (最小平方法)
簡單線性迴歸模型為 。
最小平方法旨在最小化殘差平方和 (Sum of Squared Residuals, SSR):。
估計的迴歸方程式為 。
估計量 和 的公式為:
首先,我們需要計算所需的總和:
計算 :
第 5 題20 分
- 何謂因素分析(factor analysis)與主成分分析(principal component analysis)請分
別說明其內容與兩者主要之差異。(20分)
登入後即可作答並保存紀錄。
本題主要在比較和對比統計學中兩種常用的降維技術:因素分析 (Factor Analysis, FA) 和主成分分析 (Principal Component Analysis, PCA)。
1. 因素分析 (Factor Analysis, FA)
-
內容:
因素分析是一種統計技術,用於識別觀測變數(例如問卷中的問題、多項測驗分數)背後潛在的、不可直接測量的潛在變數(稱為「因素」或「因子」)。其基本假設是,觀測變數的變異性可以被少數幾個未觀測的共同因素(common factors)和獨特因素(unique factors)所解釋。- 模型:
其中, 是第 個觀測變數, 是第 個共同因素, 是第 個變數與第 個因素的負荷量 (factor loading),表示因素對變數的影響程度, 是獨特因素(包含誤差項)。 - 目標:尋找能夠解釋變數之間共變異(covariance)或相關性(correlation)的潛在因素。它試圖將變數的變異分解為共同變異和獨特變異。
- 模型:
-
主要目的:
- 結構檢驗:檢驗潛在的理論結構,例如人格特質、態度、認知能力等。
- 變數簡化:將大量的觀測變數歸納為少數幾個更易於管理的潛在因素。
- 概念化:幫助研究者理解和命名變數之間的潛在關係。
2. 主成分分析 (Principal Component Analysis, PCA)
-
內容:
主成分分析是一種數據降維技術,旨在將原始的、可能高度相關的一組變數轉換為一組新的、線性組合的不相關變數,稱為「主成分」。這些主成分是原始變數的線性組合,並且按照它們所能解釋的變異量大小進行排序。第一個主成分解釋了數據中最大的變異量,第二個主成分解釋了剩餘變異量中的最大部分,且與第一個主成分不相關,依此類推。- 模型:
其中, 是第 個主成分, 是第 個原始變數, 是第 個主成分的係數。 - 目標:最大化每個主成分所能解釋的總變異量,並使各主成分之間相互獨立。它關注的是數據的總體變異(total variance)。
- 模型:
-
主要目的:
- 降維:減少數據的維度,同時盡可能保留原始數據中的大部分變異。
- 特徵提取:提取數據中的主要變化模式。
- 數據壓縮:為後續的分析(如迴歸、分類)創建一個更簡潔的數據集。
兩者主要差異