112 年 國立高雄大學統計學研究所碩士班《統計學》
第 1 題5 分
選擇題(可複選,全對才給分)
- (5%) 考慮任意兩隨機變數 和 服從標準常態分佈 (standard normal distribution), 下列敘述何者為非:
(A) 和 相加的結果仍然服從常態分佈;
(B) 和 相乘的結果則為卡方分佈 (chi-square distribution);
(C) 給定 的值, 的分佈不受影響, 仍然服從常態分佈;
(D) 將 取對數 (log), 其結果可得到對數常態分佈 (log-normal distribution)。
登入後即可作答並保存紀錄。
此題主要在檢驗對常態分佈基本性質的理解,包含獨立常態變數之和、積、條件分佈以及對數轉換的特性。
首先,我們分析各選項:
(A) 若 且 為獨立隨機變數,則 的和服從常態分佈,其期望值為 ,變異數為 (由於獨立性)。因此,。此敘述正確。
(B) 若 和 為獨立標準常態隨機變數,則 和 皆服從自由度為 1 的卡方分佈 ()。然而, 的乘積並非卡方分佈。卡方分佈通常是獨立標準常態變數的平方和,例如 。因此,此敘述錯誤。
(C) 根據常態分佈的定義,若 和 是獨立的,則給定 的值, 的分佈不會改變。由於 本身服從標準常態分佈,即使給定 的值, 仍然服從標準常態分佈 。此敘述正確。
(D) 若 ,則 的值可以是負數。對數函數 的定義域要求 。因此,標準常態分佈的隨機變數取對數,結果可能不存在(當 時)。
第 2 題5 分
選擇題(可複選,全對才給分)
2. (5%)下列敘述何者為非:
(A) 統計量是資料與母體參數所構成的函數;
(B) 資料本身就是充分統計量 (sufficient statistic);
(C) 最小充分統計量 (minimal sufficient statistic) 可以有很多個;
(D) 輔助統計量 (Ancillary statistic) 一定與充分統計量獨立。
登入後即可作答並保存紀錄。
核心觀念
本題考查統計量、充分統計量、最小充分統計量與輔助統計量的定義,以及 Basu 定理的適用條件。
- 統計量是樣本資料的函數,不能依賴未知母體參數。
- 充分統計量保留了樣本中關於母體參數的全部資訊。
- 最小充分統計量是充分統計量中資訊量最精簡者;若兩個統計量可由彼此一對一轉換得到,通常視為同一最小充分統計量的不同表示。
- 輔助統計量的分配不依賴母體參數。Basu 定理指出:若統計量是完全充分統計量,則它與任何輔助統計量獨立;少了「完全」條件,不能直接推出獨立。
解題方法
逐項核對敘述是否符合定義,並特別注意 Basu 定理的條件。統計量是否依賴參數,決定 (A);原始樣本是否仍保留全部資訊,決定 (B);最小充分統計量是否只允許一種表達方式,決定 (C);輔助統計量與充分統計量是否必然獨立,則須檢查是否具備「完全充分」條件,決定 (D)。
選項分析
(A) 錯誤。
統計量只能是樣本資料的函數。若樣本為 ,統計量應寫成
不能再依賴未知母體參數 。因此「資料與母體參數所構成的函數」不符合統計量的定義。
第 3 題5 分
選擇題(可複選,全對才給分)
3. (5%) 考慮一組獨立資料 服從指數分佈 ,其母體參數為期望值 。下列敘述何者為非:
(A) 其動差估計量 (method of moment estimator) 之解唯一;
(B) 其最大概似估計量 (maximum likelihood estimator) 之解唯一;
(C) 其動差估計量必為不偏估計量 (unbiased estimator);
(D) 其最大概似估計量亦為不偏估計量。
登入後即可作答並保存紀錄。
核心觀念
設 相互獨立,且
此處 是指數分佈的尺度參數,因此機率密度函數為
本題考查:
- 動差估計法;
- 最大概似估計法;
- 估計量的不偏性。
解題方法
一、動差估計量
指數分佈的母體第一階動差為
以樣本第一階動差 代替母體第一階動差,得到動差方程式:
因此動差估計量為
由於方程式 對 只有一個解,所以動差估計量的解唯一。
二、最大概似估計量
由於樣本相互獨立,概似函數為
取對數概似函數:
對 微分:
令一階導數為零:
乘上 得
因此
再看二階導數:
在 處,
第 4 題5 分
選擇題(可複選,全對才給分)
4. (5%) 考慮一組獨立資料 服從常態分佈 ,其母體參數為期望值 與變異數 。下列敘述何者為非:
(A) 其動差估計量之解唯一;
(B) 其最大概似估計量之解唯一;
(C) 其動差估計量必為不偏估計量;
(D) 其最大概似估計量亦為不偏估計量。
登入後即可作答並保存紀錄。
此題考察對常態分佈參數動差估計量 (M.M.E.) 和最大概似估計量 (M.L.E.) 的性質,特別是解的唯一性與不偏性。
常態分佈 的 PDF 為 。
母體動差:
一階動差:
二階動差:
(A) 動差估計量 (M.M.E.) 的解唯一性:
我們需要估計兩個參數 和 ,因此需要兩個動差。
令樣本動差等於母體動差:
從第一個方程式,我們得到 。
將 代入第二個方程式:
。
這就是樣本變異數的定義 (除以 n)。
因此,動差估計量為 和 。
這兩個估計量的解是唯一的。此敘述正確。
(B) 最大概似估計量 (M.L.E.) 的解唯一性:
概似函數 。
對數概似函數 。
對 微分並令其為零:
。
所以 。
第 5 題5 分
選擇題(可複選,全對才給分)
5. (5%) 考慮一個檢定問題,下列敘述何者為非:
(A) 顯著水準 (significance level) 的值愈大,代表在拒絕虛無假設 (null hypothesis) 時,其結果愈可信;
(B) 在同一虛無假設下,拒絕域 (reject region) 的建立與對立假設 (alternative hypothesis) 無關;
(C) 一個檢定的結果有可能同時犯了型一錯誤 (Type I error) 與型二錯誤 (Type II error);
(D) 於概似比檢定 (likelihood ratio test) 中,其檢定統計量值愈大,則愈傾向拒絕虛無假設。
登入後即可作答並保存紀錄。
此題在檢驗對統計檢定基本概念的理解,包含顯著水準、拒絕域、型一錯誤、型二錯誤以及概似比檢定。
我們逐一分析各選項:
(A) 顯著水準與結果可信度:
顯著水準 是在虛無假設為真時,錯誤地拒絕虛無假設的機率,即 P(型一錯誤)。
如果 的值愈大,表示我們愈容易拒絕虛無假設。當我們拒絕虛無假設時,這意味著我們認為觀察到的資料不太可能在虛無假設為真的情況下出現。
然而, 愈大,我們犯型一錯誤的機率就愈高。因此,拒絕虛無假設的結果並非「愈可信」,反而可能是因為我們設定了較寬鬆的拒絕標準(較大的 )。
所以,此敘述是錯誤的。
(B) 拒絕域與對立假設的關係:
拒絕域 (reject region) 是樣本空間的一個子集,當觀察到的樣本落入此區域時,我們就拒絕虛無假設 。
拒絕域的建立是直接與對立假設 (或 ) 有關的。對立假設指明了我們希望證明什麼,而拒絕域的範圍通常是設定在樣本統計量的值最有利於對立假設的方向。
例如,若 且 ,則拒絕域通常是 ,其中 是根據 和 分佈確定的。如果 ,則拒絕域是 。
因此,拒絕域的建立是與對立假設密切相關的。此敘述「無關」是錯誤的。
(C) 同時犯型一錯誤與型二錯誤:
型一錯誤 (Type I error) 是指當虛無假設 為真時,我們拒絕了 。
型二錯誤 (Type II error) 是指當對立假設 為真時,我們未能拒絕 。
第 1 題5 分
問答與計算題
- 考慮一組獨立隨機樣本 服從 Beta() 分佈,其中 , 且 。
(a) (5%) 若 已知,試求母體參數 的動差估計量;
(b) (10%) 若 與 皆未知,試求母體參數 的動差估計量。
登入後即可作答並保存紀錄。
核心觀念
本題考查「動差估計法」。其基本做法是:
- 將樣本動差與母體動差相等;
- 解出未知參數;
- 將母體動差中的未知量以樣本動差替代。
令
Beta 分佈的平均數與變異數為
以及
由於 ,變異數也可改寫為
又因為
所以
解題方法
(a) 已知,求 的動差估計量
由母體平均數公式:
以樣本平均數 估計母體平均數,依動差估計法令
解出 :
因此
其中
(a)答案
(b) 與 皆未知,求 的動差估計量
此時有兩個未知參數 ,必須使用兩個母體動差。題目要求的是 ,可利用母體平均數與變異數。
令
Beta 分佈的變異數為
因此
解出 :
第 2 題10 分
問答與計算題
2. (10%) 動差估計法 (method of moment estimation) 的一個缺點是其估計量與母體參數的範圍有時會不一致,請問最大概似估計法 (maximum likelihood estimation) 如何避免上述的缺點?
登入後即可作答並保存紀錄。
此題在於探討動差估計法 (M.M.E.) 和最大概似估計法 (M.L.E.) 的一個重要區別:參數範圍的一致性。
動差估計法 (M.M.E.) 的缺點:範圍不一致
動差估計法是基於將樣本動差與母體動差相等來求解參數。然而,這種方法有時會產生一個估計量,其值可能超出母體參數允許的實際範圍。
舉例來說:
-
Beta 分佈: Beta() 的參數 且 。如果我們試圖通過 和 來估計 和 ,我們會發現這兩個動差是線性相關的,無法獨立求解。如果我們使用 和 ,我們得到 。
考慮一個簡單的例子,如果我們用 和 去估計 和 。
令 。
如果我們直接從 解出 ,得到 。如果 是未知的,我們無法得到 的估計量。
若我們從 解出 和 的比例 。
若我們使用 和 (其中 )。
由於 ,則 。
同時, 且 。
因此, 必須大於 0,且 必須大於 0。這意味著 。
然而,動差估計量本身並不保證 落在 區間內。如果樣本資料有誤,或者我們計算樣本動差的方法不當,可能導致 或 。
例如,如果我們試圖估計 ,而我們得到 。如果 恰好非常小(接近 0),那麼 會非常大。
更直接的例子是,如果我們試圖估計一個參數 。假設 M.M.E. 。這顯然超出了參數的允許範圍。 -
對數常態分佈: 如果 ,則 服從對數常態分佈。參數是 和 。 的值域為 。
M.M.E. 的計算可能得到 或 為負值,這是不允許的,因為 必須大於 0。
最大概似估計法 (M.L.E.) 如何避免此缺點:
M.L.E. 的核心是最大化概似函數 (或對數概似函數 )。在尋找最大值時, M.L.E. 的過程會自動在參數空間 中進行搜索。
第 3 題10 分
問答與計算題
3. 考慮兩組獨立隨機樣本 與 分別服從常態分佈 與 ,假設兩組樣本亦獨立。假設欲檢定 VS. 。
(a) (10%) 若 與 已知,試求一檢定統計量與於 假設下該統計量之分佈;
(b) (10%) 若 與 未知但相等,試求一檢定統計量與於 假設下該統計量之分佈;
(c) (10%) 若 與 未知且不相等,假設樣本數 ,試求一檢定統計量與於 假設下該統計量之分佈。
登入後即可作答並保存紀錄。
此題要求在不同情況下,針對兩個獨立常態樣本的均值進行假設檢定,並找出檢定統計量及其在虛無假設下的分佈。檢定的方向是單尾檢定 ()。
基本概念:
當比較兩個獨立常態樣本的均值時,我們通常會用到 Z 檢定或 t 檢定,取決於變異數是否已知以及是否相等。
(a) 與 已知:
這是最簡單的情況,我們直接使用 Z 檢定。
在虛無假設 下,我們可以令 。
考慮檢定統計量:
在 下, 。
所以,檢定統計量為:
由於 且 ,且它們獨立,
則 。
在 下, ,所以 。
因此,統計量 服從標準常態分佈。
。
檢定方向是 ,即 。
我們希望觀察到的 的值是否顯著為負。
因此,我們拒絕 當 足夠小時(即非常負)。
檢定統計量 越小(越負),越傾向於拒絕 。
【答案】
檢定統計量:
在 假設下,該統計量服從標準常態分佈:。
(b) 與 未知但相等:
當兩個獨立常態樣本的變異數未知但相等時,我們使用合併變異數的 t 檢定。
首先,我們估計共同的變異數 。
合併變異數的估計量為:
其中 和 是樣本變異數。
在虛無假設 下,檢定統計量為:
在 下, 。
第 4 題5 分
問答與計算題
4. 考慮一組獨立隨機樣本 服從常態分佈 。
(a) (5%) 試求樣本變異數 (sample variance, 定義為 ) 的分佈;
(b) (15%) 試以 建立 信賴係數為 的信賴區間 (confidence interval)。
登入後即可作答並保存紀錄。
此題考察樣本變異數的分佈及其在建立母體變異數信賴區間的應用。
(a) 樣本變異數 的分佈:
樣本變異數的定義為 。
當樣本 來自一個常態分佈 時,樣本均值 和樣本變異數 之間存在一個重要的關係。
我們知道, ,其中 表示自由度為 的卡方分佈。
同時, 。
根據 Fisher 提出的定理,當 服從常態分佈時, 服從自由度為 的卡方分佈。
因此, 。
這表明樣本變異數 的分佈可以通過卡方分佈來描述。
我們可以將 表示為:
其中 是一個服從自由度為 的卡方分佈的隨機變數。
【答案】
樣本變異數 的分佈為:,其中 是自由度為 的卡方分佈。
(b) 建立 信賴係數為 的信賴區間:
基於 (a) 的結果,我們知道 服從自由度為 的卡方分佈。
為了建立信賴區間,我們需要找到一個包含 的不等式,並使其機率為 。
我們從卡方分佈的分位數開始。設 表示自由度為 的卡方分佈的第 百分位數。
我們選擇兩個分位數,使得它們之間的區域機率為 。