113 年 國立臺北大學統計學系碩士班《數理統計(含機率概論)》
第 I.1 題15 分
Let the joint pdf of random variables X and Y be given by
Let Z = X + Y. Derive the CDF of Z.
登入後即可作答並保存紀錄。
核心觀念
本題考查:
-
聯合機率密度函數的正規化。
-
由聯合密度求函數 的累積分布函數:
-
依照直線 與原始定義域的交集,分段計算二重積分。
原始定義域為
這是在單位正方形中,由 、 與 所圍成的三角形。
第一步:求常數
由聯合機率密度函數的總積分必須等於 :
因此
所以
故聯合密度為
第二步:建立 的積分區域
由定義,
因此需在區域
上積分:
由於 且 ,所以 ;又因為 、,所以 。因此只需討論 。
直線 與 的交點滿足
故
這會造成 前後的積分區域不同,因此必須分成兩段。
情形一:
此時直線 完全位於 以下。
對固定的 而言, 的範圍為
且必須滿足
因此
所以
先對 積分:
計算得
情形二:
第 I.2 題15 分
Let the joint pdf of random variables X and Y be given by
Let Z = X + Y. Compute E(X|Z).
登入後即可作答並保存紀錄。
本題要求計算條件期望值 。我們需要先求出 X 在給定 Z 下的條件機率密度函數 (conditional pdf),然後計算其期望值。
步驟一:計算 X 的邊際機率密度函數 (Marginal pdf of X)
對於 ,積分範圍為 。
步驟二:計算 Z 的機率密度函數 (pdf of Z)
由上一題的 CDF ,我們可以求得 Z 的 pdf 。
對於 : 。
對於 : 。
步驟三:計算條件機率密度函數
這裡的 指的是 X 和 Z 的聯合機率密度函數。然而,我們已知 X 和 Y 的聯合 pdf ,且 。
更直接的定義是:
我們需要確定 X 的取值範圍,在給定 z 的條件下。
我們知道 且 。
將 代入 :
。
。
所以,對於給定的 z,x 的範圍是 。
因此,
我們需要分情況討論 z 的範圍:
-
情況 1:
此時,,所以 。
x 的範圍是 。
。
驗證積分為 1:
正確。 -
情況 2:
此時,,所以 。
x 的範圍是 。
。
第 I.3 題10 分
Let the joint pdf of random variables X and Y be given by
Compute E[E(X|Z)] based on your answer in 2.
登入後即可作答並保存紀錄。
本題要求計算 。根據全期望定理 (Law of Total Expectation),我們知道 。因此,我們可以利用上一題的結果 來計算 ,或者直接計算 。直接計算 通常比較簡便。
方法一:利用全期望定理
首先,我們需要計算 X 的邊際機率密度函數 (marginal pdf of X)。
對於 ,積分範圍為 。
現在計算 :
所以,。
方法二:利用上一題的 結果
根據定義,。
我們需要分段積分:
其中, 和 的表達式來自前兩題。
第一部分:
第二部分:
第 I.4 題5 分
Let the joint pdf of random variables X and Y be given by
Compute E(X) based on the pdf of X.
登入後即可作答並保存紀錄。
本題要求根據 X 的機率密度函數 (pdf) 來計算 X 的期望值 。我們需要先求出 X 的邊際機率密度函數,然後再計算其期望值。
步驟一:計算 X 的邊際機率密度函數
聯合機率密度函數為 在 的區域。
對於 ,積分範圍是 。
因此,X 的邊際機率密度函數為:
第 I.5 題5 分
Suppose you are dealing with an unknown joint pdf f(x, y). Suppose you only have two random samples of size n: one is X1, X2, ..., Xn from the distribution of X, and the other is W1, W2, ..., Wn from the distribution of W, where W = E(X|Z). Can you determine which random sample would allow you to derive a more precise estimator of E(X)? Provide an explanation for your choice.
登入後即可作答並保存紀錄。
本題旨在探討,在不知道聯合機率密度函數 的情況下,我們有兩組獨立同分佈 (i.i.d.) 的隨機樣本:一組是來自隨機變數 X 的樣本 ,另一組是來自隨機變數 W 的樣本 ,其中 。我們要判斷哪一個樣本集(X 或 W)能提供對 更精確的估計,並給出解釋。
核心觀念:
估計的精確度通常與估計量的變異數 (variance) 有關。變異數越小,估計越精確。對於來自同一分佈的樣本,其算術平均數是該分佈期望值的無偏估計量,而其變異數的大小決定了估計的精確度。
分析:
我們有兩個樣本集:
- 樣本集 1:,來自 X 的分佈。我們想估計 。一個自然的估計量是樣本平均數 。
- 樣本集 2:,來自 W 的分佈,其中 。我們想估計 。一個自然的估計量是樣本平均數 。
由於 ,這意味著 W 是 X 的一個「條件期望值」。通常情況下,條件期望值會比原始隨機變數「更穩定」或「更集中」。
數學解釋:
我們需要比較 和 作為 的估計量的精確度。精確度由估計量的變異數來衡量。
(假設 存在)。
(假設 存在)。
我們知道,對於任何隨機變數 X 和 Z,全期望定理告訴我們 。
由於 ,所以 。這表示 和 都是 的無偏估計量。
現在我們比較 和 。
我們有 。
由於 ,所以 。
因為 是條件變異數,它是一個非負的隨機變數。所以 。
因此, 。
如果 在 Z 的分佈上不是恆為零(也就是說,對於某些 Z 的值,X 的條件變異數不為零),那麼 ,這將導致 。
第 II.1.a 題5 分
Let be a random sample from Bernoulli(p). Consider two estimators, and . Find the limiting distribution of and , respectively.
登入後即可作答並保存紀錄。
核心觀念
本題考查:
- 樣本平均數的中央極限定理。
- 估計量的偏誤與一致性。
- 判斷標準化後的隨機變數是否具有有限的極限分布。
對於 ,
當 時,由中央極限定理,
一、估計量
直接套用中央極限定理:
因此,
二、估計量
給定
考慮其極限:
由大數法則,,而分母 ,所以
因此,當 時, 並不一致估計 。進一步計算標準化形式:
第 II.1.b 題5 分
Let be a random sample from Bernoulli(p). Consider two estimators, and . Show that and are the consistent estimators of p.
登入後即可作答並保存紀錄。
核心觀念
估計量 為參數 的一致估計量,定義為
亦即對任意 ,
本題使用大數法則:
因為 。
一、證明 為一致估計量
由於
可得
由切比雪夫不等式,對任意 ,
當 時,
因此
所以
故 是 的一致估計量。
二、檢查 是否一致
題目給定
由於 ,因此
右側隨 趨近於 ,故由夾擠定理,
也可利用 寫成
第 II.1.c 題5 分
Let be a random sample from Bernoulli(p). Consider two estimators, and . Find a consistent estimator of .
登入後即可作答並保存紀錄。
本題要求我們尋找一個參數 的一致估計量。我們已經知道 是 的一個一致估計量,且 ,。
核心觀念:
如果 是 的一致估計量,且 是一個在 的鄰域內連續的函數,那麼 通常是 的一致估計量。
尋找 的估計量:
由於 是一致估計量,且 且 。
考慮函數 。我們想找到 的一致估計量。
一個自然的嘗試是使用 。
證明 是一致估計量:
我們需要證明 。
這等價於證明 。
根據 Slutsky 定理,如果 ,其中 是一個常數,且 在 點連續,則 。
我們知道 (根據大數法則)。
如果 ,則函數 在 點是連續的。
因此,。
這意味著 是 的一致估計量,只要 。
第 II.1.d 題5 分
Let be a random sample from Bernoulli(p). Consider two estimators, and . Use to show that no unbiased estimator of exists.
登入後即可作答並保存紀錄。
本題要求使用 的情況,證明不存在 的無偏估計量 (unbiased estimator)。
無偏估計量的定義:
一個估計量 被稱為參數 的無偏估計量,如果 。
考慮 的情況:
當 ,我們只有一個樣本 。
,所以 且 。
。
。
我們需要證明不存在任何函數 使得 對於所有的 都成立。
考慮我們已知的估計量:
在上一題中,我們找到了 作為 的一致估計量(當 )。
當 ,。所以,我們考慮估計量 。
計算 :
的定義域為 。
當 ,。
當 , 是無窮大,其期望值是未定義的。
即使我們忽略 的情況,只考慮 的情況,其期望值是:
。
然而,我們需要 對於所有的 。
如果 ,則 必定是 1,所以 。這似乎是滿足的。
但是,如果 ,則 有可能為 0。
。
在這種情況下, 的計算涉及到除以零,其期望值是無窮大,或者在嚴格的機率論定義下,這個期望值是未定義的。
嚴格證明:
假設存在一個 的無偏估計量 ,使得 對於所有的 成立。
第 II.2.a 題5 分
Let be a random sample from . Find the shortest length confidence interval for in the class .
登入後即可作答並保存紀錄。
核心觀念
本題給定的信賴區間類別為
其中 應為與樣本無關的常數。要成為 的信賴區間,必須使覆蓋率
等於或至少達到 ,且應與未知參數 無關。
然而,本題所給的「除以 」形式會使覆蓋率依賴 ,因此無法形成固定信賴水準的信賴區間。
覆蓋率分析
令
則 為來自 的隨機樣本,且
覆蓋事件為
若假設 ,上式等價於
可見覆蓋事件直接含有 ,所以其機率一般會隨 改變。
例如,當 時,
在 時,由於
因此
第 II.2.b 題5 分
Let be a random sample from . Prove that for , where is the confidence interval found in part (a).
登入後即可作答並保存紀錄。
本題要求證明,對於一個真實值 ,我們在 part (a) 中找到的信賴區間 ,包含 的機率 小於 。
這實際上是要求證明信賴區間的覆蓋機率。對於一個置信水準為 的信賴區間 ,我們要求 對於所有 成立。
題目要求證明 for 。這句話的表述有些不尋常。通常,信賴區間的定義是 對於所有 成立。
如果 是一個 的信賴區間,那麼對於任何 ,我們有 。
這裡 是某個特定的值,而不是隨機變數。
重新理解題目:
這句話的意思可能是:如果我們固定了 和 ,使得對於某個 ,有 ,那麼對於另一個 ,我們有 。
這是在問信賴區間的覆蓋機率是否「精確」為 或「大於」(稱為過度覆蓋,over-coverage)。
假設 part (a) 找到了這樣一組 使得 對於所有 成立。
那麼,對於任何一個特定的值 ,我們將 中的 替換為 。
。
由於 和 是基於 的隨機變數,它們的分佈取決於 。
。
。
令 和 。
。
如果 part (a) 找到了 使得 對所有 成立,這意味著 和 必須是常數。
如果 和 是常數,那麼 的計算將會依賴於 。
。
核心問題:
信賴區間的覆蓋機率 應該是 對於所有 。
如果 part (a) 確實找到了這樣的 ,那麼 對於任何 的值,其意義何在?
一種可能的解釋:
「Confidence interval」的定義是 。
如果 part (a) 找到了這樣的 ,那麼對於任何 ,這個機率定義就是 。
這與題目要求證明 相矛盾。
另一種解釋:
也許 part (a) 找到的區間是「最短長度」的,但可能不是「精確」的 覆蓋。
例如,對於某些分佈,最短長度的 CI 可能會導致過度覆蓋 (over-coverage),即 ,且對於某些 ,嚴格大於 。
如果 part (a) 確實找到了 的 CI:
那麼 。
題目要求證明 for 。
這句話的結構是:對於一個固定的 ,其機率小於 。
這意味著,對於某個 ,我們計算 ,這個機率小於 。
讓我們假設 part (a) 找到了 使得 對於所有 成立。
那麼,對於任何一個特定的值 , 我們計算 。
.
令 和 。
.
.
如果 是常數,那麼 和 會隨著 的變化而變化。
這意味著 是一個關於 的函數。
第 II.3.a 題5 分
Let be a random sample from the pdf . Find a sufficient statistic of .
登入後即可作答並保存紀錄。
本題要求找出參數 的一個充分統計量 (sufficient statistic)。
充分統計量的定義:
一個統計量 被稱為參數 的充分統計量,如果給定 ,樣本 的條件機率分佈不依賴於 。
即,。
因子分解定理 (Factorization Theorem):
一個統計量 是 的充分統計量,若且唯若聯合機率密度函數 可以分解為:
其中 依賴於 和 ,而 僅僅依賴於樣本 。
步驟一:寫出聯合機率密度函數 (Joint pdf)
樣本 是 i.i.d. 且來自 ,其中 。
聯合 pdf 為:
這個條件 對於所有 成立,意味著 。
令 。
所以,
並且在其他情況下為 0。
步驟二:應用因子分解定理
我們將聯合 pdf 分解為 的形式。
我們需要將條件 包含在 或 中。
令 ,其中 ,且 是指示函數。
令 。
這個分解似乎是有效的,但我們需要確保 不依賴於 。
檢查分解:
第 II.3.b 題5 分
Let be a random sample from the pdf . Find the maximum likelihood estimator (MLE) of .
登入後即可作答並保存紀錄。
本題要求我們找到參數 的最大概似估計量 (Maximum Likelihood Estimator, MLE)。
步驟一:寫出概似函數 (Likelihood Function)
聯合機率密度函數 (joint pdf) 為:
這個函數對於 對所有 成立。這等價於 。
令 。
則概似函數為:
且 for 。
第 II.3.c 題5 分
Let be a random sample from the pdf . Find the method of moments estimator of .
登入後即可作答並保存紀錄。
核心觀念
方法矩估計法(Method of Moments)是令樣本矩等於母體矩。對單一未知參數 ,通常使用一階樣本矩:
並令其等於母體期望值:
本題的關鍵在於判斷 是否存在且為有限值。
解題方法
已知機率密度函數為
其中 。
先計算母體平均數:
整理得
由於
因此
第 II.4 題5 分
Consider the testing problem versus based on i.i.d. from . Show that the uniformly most powerful (UMP) test with rejection region or is a likelihood ratio (LR) test with size .
登入後即可作答並保存紀錄。
核心觀念
本題考查:
- 母體下最大次序統計量 的分布。
- 似然比檢定(likelihood ratio test, LR test)。
- 複合對立假設下的 UMP 檢定。
- 檢定大小(size)的計算。
令
若 ,則
因此,在 下,
解題方法:建立似然比
樣本的聯合密度為
由於似然函數在 時為 ,且隨 遞減,因此最大概似估計量為
考慮廣義似然比
分兩種情況討論。
情況一:
此時 ,因為樣本中有觀察值大於 。所以
因此,所有滿足
的樣本都應拒絕 。
情況二:
此時
而
故
依 LR 檢定原理, 越小越應拒絕 。若將臨界值取為 ,則在 時,
等價於
因此,正確的 LR 拒絕域為
檢查檢定大小
在 下,