108 年 國立高雄大學統計學研究所碩士班《統計學》
第 1 題
國立高雄大學 108 學年度研究所碩士班招生考試試題
科目:統計學
考試時間:100 分鐘
系所:統計學研究所(無組別)
本科原始成績:100 分
是否使用計算機:否
- 回答下列問題,並定義所使用之符號,如令 為某連續型隨機變數之機率密度函數。
(a) (5%) 定義何為充分統計量 (sufficient statistics);
(b) (5%) 定義何為最大概似函數估計量 (maximum likelihood estimator);
(c) (5%) 定義何為假設檢定中之型一誤差與型二誤差 (Type I error & Type II error)。
登入後即可作答並保存紀錄。
本題主要在考驗對統計學基本名詞的定義與理解,包含充分統計量、最大概似估計量以及假設檢定中的兩種誤差。
(a) 充分統計量 (Sufficient Statistic):
一個統計量 被稱為母體參數 的充分統計量,如果它包含了樣本 中所有關於參數 的資訊。換句話說,在已知統計量 的值之後,樣本 中任何關於 的額外資訊都無法被獲取。
嚴格來說,根據費雪定理 (Fisher-Neyman factorization theorem),對於一個具有參數 的分佈,其聯合機率密度函數為 。統計量 是 的充分統計量,若且唯若對於所有可能的樣本值 和所有可能的參數值 ,聯合機率密度函數可以分解為:
其中 是依賴於 和 的函數,而 是一個不依賴於 的函數(只依賴於樣本值)。
(b) 最大概似函數估計量 (Maximum Likelihood Estimator, MLE):
對於一個給定的樣本 ,其聯合機率密度函數(或機率質量函數)為 ,其中 是一個或多個未知參數。最大概似函數 (Likelihood Function) 被定義為:
第 2 題15 分
- (15%) 考慮一二變量 之聯合機率密度函數如下:
試算機率值 。
登入後即可作答並保存紀錄。
核心觀念
本題考查二變量連續型隨機變數的聯合機率密度函數,以及利用二重積分計算事件機率。
若事件 對應的區域為 ,則
題目給定的支持區域為
先確認其確為聯合機率密度函數:
解題方法
要求
直接積分時,需依照 的範圍分段。由於 :
- 當 時,最大可能的 小於 ,事件不可能發生。
- 當 時,需有 。
- 當 時,因為 ,必有 。
因此事件區域可表示為
以及
故
第 3 題15 分
- (15%) 考慮兩獨立隨機變數 和 服從標準常態分佈,即 和 。試求 與 之聯合密度函數。
登入後即可作答並保存紀錄。
核心觀念
本題考查二維隨機變數的變數變換法。已知 、 相互獨立且皆服從標準常態分佈,因此其聯合密度為
定義新變數
由於 無法直接唯一決定 的正負,因此必須分別考慮 與 兩種情況。
解題方法與變數反變換
因為 ,所以 時有兩個分支:
分支一:
此時
其雅可比矩陣為
故雅可比行列式的絕對值為
因此此分支對聯合密度的貢獻為
分支二:
此時
雅可比矩陣為
其雅可比行列式絕對值同樣為
此分支的貢獻為
第 4 題
- 若一函數 為凸函數 (convex function),且一隨機變數 之期望值 與 皆存在,則 。試利用此不等式證明:
(a) (5%) ;
(b) (5%) , 其中 。
登入後即可作答並保存紀錄。
本題主要考驗對 Jensen 不等式的理解與應用。Jensen 不等式指出,對於凸函數 和隨機變數 ,有 。我們需要利用此性質來證明兩個具體的不等式。
(a) 證明
我們需要找到一個凸函數 和一個隨機變數 ,使得 並且 和 可以被計算。
考慮函數 。
我們需要判斷 是否為凸函數。
計算二階導數:, 。
由於 對於所有實數 都成立,所以 是一個凸函數。
同時,題目假設 和 皆存在。對於 ,我們需要 存在。如果 存在,則 必然存在(因為 或考慮其他方法)。
根據 Jensen 不等式,對於凸函數 ,我們有:
代入 :
這就是我們需要證明的結果。
第 5 題
- 考慮一組獨立之隨機樣本 皆服從密度函數為 之分佈,其中 。試求:
(a) (5%) 參數 之概似函數 (likelihood function);
(b) (5%) 虛無假設 與對立假設 概似比檢定 (likelihood-ratio test) 之拒絕域。
登入後即可作答並保存紀錄。
核心觀念
本題考查:
- 由獨立樣本將單一觀測值的密度函數相乘,建立概似函數。
- 利用概似函數求最大概似估計量。
- 建立概似比統計量
- 利用最小次序統計量 的分布決定顯著水準為 的拒絕域。
由於本題的密度函數具有條件 ,樣本資訊主要集中在最小觀測值 。
(a) 參數 的概似函數
單一觀測值的密度函數可寫成
其中 為指示函數。
因為 相互獨立,故聯合密度函數即為概似函數:
因此
整理指數項:
所有指示函數同時為 的條件是
所以概似函數可寫成
亦即
最大概似估計量
在允許範圍 內,
會隨著 單調遞增。因此概似函數在 時達到最大值,故
全參數空間下的最大概似值為
(b) 概似比檢定之拒絕域
考慮
第一步:求虛無假設下的最大概似值
在 下,必須同時滿足
因此 下可行的最大 為
所以
第二步:建立概似比統計量
概似比統計量為
代入前述結果:
第 5 題
- 考慮一組獨立之隨機樣本 皆服從密度函數為 之分佈,其中 。試求:
(c) (10%) 試根據上述結果解釋概似比檢定如何根據樣本提供之訊息,在虛無假設 與對立假設 下,決定是否拒絕 。
登入後即可作答並保存紀錄。
本題延續上一小題,要求解釋概似比檢定在 vs 的情況下,如何根據樣本資訊做出決策。
我們在上小題中推導出概似比檢定的拒絕域為 ,其中 是由顯著水準 和 決定的常數,具體為 。
解釋概似比檢定決策過程:
-
檢定統計量與決策規則:
概似比檢定的核心思想是比較在虛無假設 下參數空間中的最大似然估計量 (MLE) 所對應的概似函數值,與在整個參數空間 下的 MLE 所對應的概似函數值。如果虛無假設下的 MLE 所對應的概似值遠小於整個參數空間下的 MLE 所對應的概似值,則我們傾向於拒絕虛無假設。
對於本題的檢定統計量 ,我們拒絕 當 小於某個臨界值 。
經過推導,這個拒絕域等價於 ,其中 。 -
樣本資訊的解讀:
- 隨機變數 的分佈: 的密度函數為 。這表示 是服從指數分佈(參數為 1)並加上偏移量 。這個分佈的特性是,所有觀測值 都必須大於或等於參數 。因此,樣本的最小值 提供了一個關於 的上限資訊。
- 參數 的估計: 從概似函數最大化的角度來看, 是參數 的最大似然估計量。這意味著樣本的最小值是 最有可能的值。
- 虛無假設 : 虛無假設認為真實的參數 不超過 。
- 對立假設 : 對立假設認為真實的參數 大於 。
第 6 題
- 假設一組獨立之隨機樣本 皆服從伯努利 (bernoulli) 分佈,即 ,其中 為試驗成功之機率。假設 之事前分佈 (prior distribution) 為 :
(a) (5%) 試求 之之事後分佈 (posterior distribution);
(b) (5%) 試驗證 之貝氏估計量 (Bayes estimator) 為 與最大概似估計量之線性組合;
(c) (5%) 試根據上述結果解釋貝氏估計量如何根據樣本數 大或小時,如何偏重事前分佈與觀測樣本所提供之訊息進行估計。
登入後即可作答並保存紀錄。
本題考驗貝氏統計中的後驗分佈計算、貝氏估計量推導以及對貝氏估計量性質的理解。
(a) 求 之之事後分佈 (posterior distribution)
根據貝氏定理,後驗分佈 與概似函數 和事前分佈 的乘積成正比。
樣本 ,其機率質量函數為 ,其中 。
設樣本中有 個成功 (即 ),則 個失敗 (即 )。
概似函數為:
事前分佈為 :
其中 是歸一化常數。
因此,後驗分佈與以下乘積成正比:
這正是 分佈的形式。
後驗分佈為 。
其中 是樣本中的成功次數。
(b) 驗證貝氏估計量是事前分佈期望值與最大概似估計量之線性組合
在貝氏統計中,通常使用後驗期望值作為點估計量(貝氏估計量),特別是當損失函數為平方損失函數 (squared error loss) 時。
後驗分佈為 。
分佈的期望值為 。
所以,後驗期望值(貝氏估計量)為:
現在我們看最大概似估計量 (MLE)。
對於伯努利分佈,樣本均值是 的 MLE。
我們要驗證 是否是 與 的線性組合。
令 是事前分佈的期望值 。
我們將 改寫成:
這看起來不像我們期望的形式。讓我們試著用 來表示。
我們可以將其寫成加權平均的形式:
這個形式是 和 的線性組合。
我們需要驗證它是否是 和 的線性組合。
讓我們將 改寫成:
我們知道 且 。
我們也知道 。
這是一個加權平均的形式,其中權重是 和 。
並且 。
所以, 確實是 和 的線性組合。
第 7 題
- 試回答下列敘述正確或錯誤。
(a) (5%) 輔助統計量 (ancillary statistic) 之分佈與樣本母體參數 無關,故與充分統計量獨立;
(b) (5%) 母體參數 之一致最小變異不偏估計量 (uniformly minimum variance unbiased estimator, UMVUE),是所有估計量中,變異數最小之估計量。
登入後即可作答並保存紀錄。
本題考驗對統計學中幾個重要概念的理解:輔助統計量、充分統計量、獨立性、一致最小變異不偏估計量 (UMVUE)。
(a) 輔助統計量 (ancillary statistic) 之分佈與樣本母體參數 無關,故與充分統計量獨立;
- 輔助統計量 (Ancillary Statistic): 一個統計量 被稱為輔助統計量,如果其機率分佈不依賴於母體參數 。
- 充分統計量 (Sufficient Statistic): 一個統計量 被稱為母體參數 的充分統計量,如果它包含了樣本中關於 的所有資訊。
- 獨立性: 兩個統計量 和 是獨立的,如果 對於所有 成立。
分析:
題目中說「輔助統計量之分佈與樣本母體參數 無關」,這是輔助統計量的定義,所以這部分是正確的。
然而,後半句「故與充分統計量獨立」則不一定正確。
反例或解釋:
雖然輔助統計量的分佈不依賴於 ,而充分統計量的分佈依賴於 (通常),但這並不自動意味著它們是獨立的。
- 充分統計量 : 它的分佈 依賴於 。
- 輔助統計量 : 它的分佈 不依賴於 。
考慮聯合分佈 。
如果 和 是獨立的,則 。
所以, 。
這意味著聯合分佈是邊際分佈的乘積,並且對於所有 都成立。
然而,在很多情況下,輔助統計量與充分統計量是相關的。
一個經典的例子是,當我們考慮一個參數模型,並且我們將樣本空間分解為充分統計量 和輔助統計量 的函數。
例如,考慮二維隨機向量 ,其聯合密度函數為 。
假設 是 的充分統計量,而 是輔助統計量。
如果 和 獨立,則 。
這意味著,對於任何給定的 , 在 的固定值上,相對於 的分佈是獨立於 的。
更直接的說法:
輔助統計量 的分佈不依賴於 。充分統計量 的分佈依賴於 。
如果 和 是獨立的,那麼 。
這並沒有矛盾。但是,很多時候 和 並不總是獨立的。