108 年 國立清華大學動力機械工程學系碩士班丙組《統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題30 分

  1. (30 pts.) True or False. 答對得3分,空白得0分,答錯得-2分(也就是,倒扣 2 分,所以請勿猜答案)(扣到本大題0分為止)
    (a) T F The event-probability P(X=x)=0P(X = x) = 0, where XX is any random variable and xx is any real value.
    (b) T F We call an unbiased estimator of θ\theta if Var(θ^)=0Var(\hat{\theta}) = 0.
    (c) T F Suppose that TT follows a tt distribution with degrees of freedom 10 and ZZ follows a standard normal distribution. P(T>2)≥P(Z>2)P(T > 2) \ge P(Z > 2).
    (d) T F If X1,…,XnX_1, \dots, X_n are random variables with the same mean μX\mu_X and same variance Var(X)Var(X), and with the lag-one correlation corr(Xi,Xi+1)=0.9corr(X_i, X_{i+1}) = 0.9. The variance of the sample mean Var(Xˉ)=Var(X)/nVar(\bar{X}) = Var(X)/n.
    (e) T F Suppose that TT follows a tt distribution with degrees of freedom 17. P(T>a)=0.025P(T > a) = 0.025, where 2<a<32 < a < 3. (Hint. See tt distribution table attached).
    (f) T F Suppose that ZZ follows a Normal distribution with mean 0 and variance 1. P(Z>b)=0.025P(Z > b) = 0.025, where 2<a<2.22 < a < 2.2. (Hint. See normal distribution table attached).
    (g) T F Suppose that we obtain a 95% confidence interval of the mean μ\mu to be (65.5,68.4)(65.5, 68.4). We know that P(65.5≤μ≤68.4)=0.95P(65.5 \le \mu \le 68.4) = 0.95.
    (h) T F Let X1,…,XnX_1, \dots, X_n be a random sample of size nn. Let the sample mean be denoted as Xˉ\bar{X}. The Central Limit Theorem is: Xˉ→dNormal distribution\bar{X} \xrightarrow{d} \text{Normal distribution}, as n→∞n \to \infty.
    (i) T F The terms ANOVA stands for "analysis of variance". In experimental design with two factors A and B, ANOVA is used to test the equality of variances of random variables, where each random variable denotes for responses for some factor (say Factor A) with a corresponding level.
    (j) T F Let θ\theta denote for μ\mu (the population mean of one distribution) or μ1−μ2\mu_1 - \mu_2 (the difference of two population means of two associated distributions). Let θ^\hat{\theta} be the estimator of θ\theta. Suppose that the standard error of θ^\hat{\theta}, denoted as se(θ^)se(\hat{\theta}), is known. The 95% confidence interval of the population parameter θ\theta can be written as (θ^−c⋅se(θ^),θ^+c⋅se(θ^))(\hat{\theta} - c \cdot se(\hat{\theta}), \hat{\theta} + c \cdot se(\hat{\theta})), where cc is some constant.

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

本題綜合考查:

  • 隨機變數與事件機率
  • 不偏估計量與變異數
  • tt 分配與標準常態分配的尾端機率
  • 樣本平均數的變異數與相關性
  • 信賴區間的正確解釋
  • 中央極限定理
  • ANOVA 的用途
  • 信賴區間的一般形式

(a)

敘述: 對任意隨機變數 XX 及任意實數 xx,皆有 P(X=x)=0P(X=x)=0。

判斷:錯(F)

連續型隨機變數通常滿足

P(X=x)=0,P(X=x)=0,

但離散型隨機變數不一定。例如若 XX 為擲骰子的點數,則

P(X=1)=16>0.P(X=1)=\frac{1}{6}>0.

題目說的是「任意隨機變數」,只要存在離散型反例,敘述即錯誤。

解題技巧: 看到「任意隨機變數」時,應立即檢查離散型與連續型兩種情形,不能只套用連續型分配的性質。


(b)

敘述: 若 Var(θ^)=0Var(\hat{\theta})=0,則稱 θ^\hat{\theta} 為 θ\theta 的不偏估計量。

判斷:錯(F)

不偏估計量的定義是

E(θ^)=θ.E(\hat{\theta})=\theta.

而

Var(θ^)=0Var(\hat{\theta})=0

只表示 θ^\hat{\theta} 幾乎必定為某個固定常數,並不保證該常數等於 θ\theta。

例如令 θ^=0\hat{\theta}=0,則

Var(θ^)=0,Var(\hat{\theta})=0,

但若 θ≠0\theta\ne 0,則

E(θ^)=0≠θ,E(\hat{\theta})=0\ne\theta,

因此 θ^\hat{\theta} 並非不偏估計量。

解題技巧:
「不偏」看期望值;「穩定程度」看變異數。兩者是不同概念。


(c)

敘述: 若 T∼t10T\sim t_{10},Z∼N(0,1)Z\sim N(0,1),則

P(T>2)≥P(Z>2).P(T>2)\ge P(Z>2).

判斷:對(T)

自由度為 1010 的 tt 分配相較於標準常態分配具有較厚的尾端,因此在正的臨界值 22 右側,

P(T>2)>P(Z>2).P(T>2)>P(Z>2).

由表可得約為

P(T10>2)≈0.036,P(T_{10}>2)\approx 0.036,

而

P(Z>2)≈0.0228.P(Z>2)\approx 0.0228.

因此確實有

P(T>2)≥P(Z>2).P(T>2)\ge P(Z>2).

解題技巧: tt 分配自由度有限時尾端較厚;當自由度增加,tt 分配逐漸接近標準常態分配。


(d)

敘述: X1,…,XnX_1,\ldots,X_n 具有相同平均數與變異數,且相鄰變數的相關係數為 0.90.9,則

Var(Xˉ)=Var(X)n.Var(\bar X)=\frac{Var(X)}{n}.

判斷:錯(F)

樣本平均數為

Xˉ=1n∑i=1nXi.\bar X=\frac{1}{n}\sum_{i=1}^n X_i.

其變異數為

Var(Xˉ)=1n2[∑i=1nVar(Xi)+2∑i<jCov(Xi,Xj)].Var(\bar X) = \frac{1}{n^2} \left[ \sum_{i=1}^n Var(X_i) + 2\sum_{i<j}Cov(X_i,X_j) \right].

只有在所有 XiX_i 彼此不相關,亦即所有共變異數皆為 00 時,才有

Var(Xˉ)=Var(X)n.Var(\bar X)=\frac{Var(X)}{n}.

本題給出相鄰變數的相關係數為 0.90.9,因此

Cov(Xi,Xi+1)=0.9Var(X)>0.Cov(X_i,X_{i+1}) = 0.9Var(X)>0.

這些共變異數會增加樣本平均數的變異數,所以不能直接寫成 Var(X)/nVar(X)/n。

解題技巧: 公式 Var(Xˉ)=σ2/nVar(\bar X)=\sigma^2/n 的前提是獨立同分布,不能只知道平均數與變異數相同。


(e)

敘述: 若 T∼t17T\sim t_{17},且

P(T>a)=0.025,P(T>a)=0.025,

則 2<a<32<a<3。

判斷:對(T)

條件

P(T>a)=0.025P(T>a)=0.025

表示 aa 是自由度 1717 的 tt 分配之第 97.597.5 百分位數,即

a=t0.975,17.a=t_{0.975,17}.

查 tt 分配表可得

t0.975,17≈2.110.t_{0.975,17}\approx 2.110.

因此

2<a<3.2<a<3.

解題技巧: 右尾機率為 0.0250.025,要查的是 t0.975,νt_{0.975,\nu},不是左尾 0.0250.025 的負值。


(f)

敘述: 若 Z∼N(0,1)Z\sim N(0,1),則

P(Z>b)=0.025,P(Z>b)=0.025,

且題目給出的區間為 2<a<2.22<a<2.2。

判斷:錯(F)

題目中的區間變數應為 bb,依條件

P(Z>b)=0.025,P(Z>b)=0.025,

可知 bb 是標準常態分配的第 97.597.5 百分位數。因此

b=z0.975≈1.96.b=z_{0.975}\approx 1.96.

所以正確範圍應為

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題10 分

  1. (10 pts.) Consider a stochastic network, shown in Figure 1, with only one work-station (WS1), which has random capacity, say X1X_1, determined by a known discrete probability distribution. Moreover, with positive probability p1p_1, an output entity from WS1 is non-defective, 0<p1≤10 < p_1 \le 1. Let b0b_0 be the available items (or work in process, WIP) at the beginning of the process. Moreover, A1A_1 denotes the no. of items that allowed to enter WS1, and B1B_1 denotes the no. of non-defective items produced from WS1. Specifically,
    • A1=min⁡(b0,the capacity X1)A_1 = \min(b_0, \text{the capacity } X_1).
    • O=B1O = B_1 for the above-mentioned one workstation network.

🖼️【此處有附圖,請對照原卷】Figure 1: A network with one workstation, WS1

The goal is to compute the probability that the random non-defective output OO of the above-mentioned network WS1 meets the pre-determined constant demand dd, i.e., P(O≥d)P(O \ge d).
Suppose that parameters used are b0=5b_0 = 5, d=4d = 4, and p1=0.9p_1 = 0.9. The possible capacity values X1X_1 are given in Table 1.

Table 1: X1X_1: Capacity of WS1

X₁012345Others
prob.0.0010.0190.030.050.10.80

Questions.
(a) (5 pts.) Compute the probability P(A1=a1∣b0=5)×P(B1=b1∣A1=a1)P(A_1 = a_1 | b_0 = 5) \times P(B_1 = b_1 | A_1 = a_1), where a1=4,b1=4a_1 = 4, b_1 = 4.
(b) (5 pts.) Compute θ=P(O≥d)\theta = P(O \ge d) for the above-mentioned WS1.

🖼️ 本題含圖表,以下為原卷對應頁面:
原卷第 3 頁

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗機率計算與隨機變數的定義。

(a) 首先計算 P(A1=a1∣b0=5)P(A_1 = a_1 | b_0 = 5)。
A1=min⁡(b0,X1)A_1 = \min(b_0, X_1)。當 b0=5b_0 = 5 時,A1=min⁡(5,X1)A_1 = \min(5, X_1)。
我們需要計算 P(A1=4∣b0=5)P(A_1 = 4 | b_0 = 5)。
A1=4A_1 = 4 表示 min⁡(5,X1)=4\min(5, X_1) = 4。這意味著 X1X_1 必須是 4。
從 Table 1 中,我們知道 P(X1=4)=0.1P(X_1 = 4) = 0.1。
因此,P(A1=4∣b0=5)=P(X1=4)=0.1P(A_1 = 4 | b_0 = 5) = P(X_1 = 4) = 0.1。

接著計算 P(B1=b1∣A1=a1)P(B_1 = b_1 | A_1 = a_1)。
B1B_1 是非缺陷產品的數量。已知 p1=0.9p_1 = 0.9 是生產非缺陷產品的機率。
B1B_1 的產生是基於進入 WS1 的項目數量 A1A_1 進行二項分配的。
具體來說,B1∼Binomial(A1,p1)B_1 \sim Binomial(A_1, p_1)。
我們需要計算 P(B1=4∣A1=4)P(B_1 = 4 | A_1 = 4)。
這表示在有 4 個進入的項目,且每個項目有 0.9 的機率是非缺陷的情況下,恰好有 4 個是非缺陷產品的機率。
根據二項分配的機率質量函數:P(B1=k)=(nk)pk(1−p)n−kP(B_1=k) = \binom{n}{k} p^k (1-p)^{n-k}
其中 n=A1=4n = A_1 = 4, k=b1=4k = b_1 = 4, p=p1=0.9p = p_1 = 0.9。
P(B1=4∣A1=4)=(44)(0.9)4(1−0.9)4−4=1×(0.9)4×(0.1)0=(0.9)4=0.6561P(B_1 = 4 | A_1 = 4) = \binom{4}{4} (0.9)^4 (1-0.9)^{4-4} = 1 \times (0.9)^4 \times (0.1)^0 = (0.9)^4 = 0.6561。

最後,計算兩個機率的乘積:
P(A1=4∣b0=5)×P(B1=4∣A1=4)=0.1×0.6561=0.06561P(A_1 = 4 | b_0 = 5) \times P(B_1 = 4 | A_1 = 4) = 0.1 \times 0.6561 = 0.06561。

(b) 計算 θ=P(O≥d)\theta = P(O \ge d)。
O=B1O = B_1 且 d=4d = 4。所以我們需要計算 P(B1≥4)P(B_1 \ge 4)。
B1B_1 是非缺陷產品的數量,其分佈取決於 A1A_1。
A1=min⁡(b0,X1)=min⁡(5,X1)A_1 = \min(b_0, X_1) = \min(5, X_1)。
B1∼Binomial(A1,p1=0.9)B_1 \sim Binomial(A_1, p_1=0.9)。

我們需要考慮所有可能的 A1A_1 值,並根據其對應的機率進行加權平均。
A1A_1 的可能值取決於 X1X_1 的值:

  • 若 X1=0X_1 = 0, A1=min⁡(5,0)=0A_1 = \min(5, 0) = 0
  • 若 X1=1X_1 = 1, A1=min⁡(5,1)=1A_1 = \min(5, 1) = 1
  • 若 X1=2X_1 = 2, A1=min⁡(5,2)=2A_1 = \min(5, 2) = 2
  • 若 X1=3X_1 = 3, A1=min⁡(5,3)=3A_1 = \min(5, 3) = 3
  • 若 X1=4X_1 = 4, A1=min⁡(5,4)=4A_1 = \min(5, 4) = 4
  • 若 X1=5X_1 = 5, A1=min⁡(5,5)=5A_1 = \min(5, 5) = 5
  • 若 X1=OthersX_1 = \text{Others}, A1=min⁡(5,X1)A_1 = \min(5, X_1)。由於 X1X_1 是離散分佈,我們假設 "Others" 代表 X1≥5X_1 \ge 5 的情況。如果 X1≥5X_1 \ge 5,則 A1=min⁡(5,X1)=5A_1 = \min(5, X_1) = 5。

我們需要計算 P(B1≥4)P(B_1 \ge 4)。這意味著 B1B_1 可以是 4 或 5 (因為 A1A_1 的最大值是 5)。
我們將使用全機率公式,對 A1A_1 的所有可能值進行分類計算:

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

  1. (10 pts.) Let XX be the size (μ\mu) (unit: cm) of some electrical component. To estimate the expected value of the size (μX\mu_X), we take a random sample of size nn. Let Xˉ\bar{X} be the sample mean. Assume that data are independent with the standard deviation (σX\sigma_X) 0.3 cm.
    (a) (5 pts.) Compute P(∣Xˉ−μX∣≤0.05)P(|\bar{X} - \mu_X| \le 0.05) for n=121n = 121. List any assumption if needed.
    (b) (5 pts.) Find the smallest sample size such that P(∣Xˉ−μX∣≤0.05)=0.95P(|\bar{X} - \mu_X| \le 0.05) = 0.95. List any assumption if needed.

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗中央極限定理的應用,以及信賴區間與樣本數的計算。

題目已知:
母體標準差 σX=0.3\sigma_X = 0.3 cm。
樣本大小 nn。
樣本平均數 Xˉ\bar{X}。
母體平均數 μX\mu_X。
Xˉ\bar{X} 的抽樣分配近似於常態分配,其期望值 E(Xˉ)=μXE(\bar{X}) = \mu_X。
Xˉ\bar{X} 的標準差(標準誤)為 SE(Xˉ)=σXnSE(\bar{X}) = \frac{\sigma_X}{\sqrt{n}}。

(a) 計算 P(∣Xˉ−μX∣≤0.05)P(|\bar{X} - \mu_X| \le 0.05) for n=121n = 121。
首先,我們計算樣本平均數的標準誤:
SE(Xˉ)=σXn=0.3121=0.311≈0.02727SE(\bar{X}) = \frac{\sigma_X}{\sqrt{n}} = \frac{0.3}{\sqrt{121}} = \frac{0.3}{11} \approx 0.02727。

我們要計算的機率是 P(∣Xˉ−μX∣≤0.05)P(|\bar{X} - \mu_X| \le 0.05)。
這可以改寫成 P(−0.05≤Xˉ−μX≤0.05)P(-0.05 \le \bar{X} - \mu_X \le 0.05)。
將不等式兩邊同時除以標準誤 SE(Xˉ)SE(\bar{X}),我們得到標準常態變數 ZZ:
P(−0.05SE(Xˉ)≤Xˉ−μXSE(Xˉ)≤0.05SE(Xˉ))=P(−0.050.02727≤Z≤0.050.02727)P\left(-\frac{0.05}{SE(\bar{X})} \le \frac{\bar{X} - \mu_X}{SE(\bar{X})} \le \frac{0.05}{SE(\bar{X})}\right) = P\left(-\frac{0.05}{0.02727} \le Z \le \frac{0.05}{0.02727}\right)。

計算臨界值:
0.050.02727≈1.8334\frac{0.05}{0.02727} \approx 1.8334。
所以,我們要計算 P(−1.8334≤Z≤1.8334)P(-1.8334 \le Z \le 1.8334)。
這個機率等於 P(Z≤1.8334)−P(Z≤−1.8334)P(Z \le 1.8334) - P(Z \le -1.8334)。
由於標準常態分配是對稱的,P(Z≤−1.8334)=1−P(Z≤1.8334)P(Z \le -1.8334) = 1 - P(Z \le 1.8334)。
所以,機率等於 P(Z≤1.8334)−(1−P(Z≤1.8334))=2×P(Z≤1.8334)−1P(Z \le 1.8334) - (1 - P(Z \le 1.8334)) = 2 \times P(Z \le 1.8334) - 1。

查標準常態分配表,當 Z=1.83Z = 1.83 時,P(Z≤1.83)≈0.9664P(Z \le 1.83) \approx 0.9664。
當 Z=1.84Z = 1.84 時,P(Z≤1.84)≈0.9671P(Z \le 1.84) \approx 0.9671。
我們可以近似取 P(Z≤1.8334)≈0.9666P(Z \le 1.8334) \approx 0.9666 (透過內插法或直接使用統計軟體)。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題30 分

  1. (30 points)
    When diagnostics indicate that some assumptions of the linear regression model are violated, remedial measures may need to be taken. The assumption of common variance of the error term plays a key role in least squares. An approach to handling heterogeneous variances, called heteroscedasticity, is the use of weighted least squares.
    Consider the simple linear regression model
    Yi=β0+β1Xi1+εiY_i = \beta_0 + \beta_1 X_{i1} + \varepsilon_i, i=1,…,ni = 1, \dots, n,
    where the errors εi\varepsilon_i are pairwise independent with mean 0, and the variance of εi\varepsilon_i is ci2σ2c_i^2 \sigma^2 for some non-null coefficients cic_i that are not all equal (we have ci≠cjc_i \ne c_j for some i,ji, j). Since coefficients cic_i are not all equal, there is heteroscedasticity.
    Consider wi=1/ci2w_i = 1/c_i^2, i=1,…,ni = 1, \dots, n. The weighted least squares method is a generalization of the least squares that accounts for heteroscedasticity.

(10 points) (a) The weighted least squares estimators β^w0\hat{\beta}_{w0} and β^w1\hat{\beta}_{w1} of β0\beta_0 and β1\beta_1, respectively, minimize the weighted least squares criterion
Q(β0,β1)=∑i=1nwi(Yi−β0−β1Xi1)2Q(\beta_0, \beta_1) = \sum_{i=1}^n w_i (Y_i - \beta_0 - \beta_1 X_{i1})^2.
Prove or disprove the weighted least squares estimators
β^w1=∑i=1nwiXi1Yi−(∑i=1nwiXi1)(∑i=1nwiYi)/(∑i=1nwi)∑i=1nwiXi12−(∑i=1nwiXi1)2/(∑i=1nwi)\hat{\beta}_{w1} = \frac{\sum_{i=1}^n w_i X_{i1} Y_i - (\sum_{i=1}^n w_i X_{i1}) (\sum_{i=1}^n w_i Y_i) / (\sum_{i=1}^n w_i)}{\sum_{i=1}^n w_i X_{i1}^2 - (\sum_{i=1}^n w_i X_{i1})^2 / (\sum_{i=1}^n w_i)}
β^w0=∑i=1nwiYi∑i=1nwi−β^w1∑i=1nwiXi1∑i=1nwi\hat{\beta}_{w0} = \frac{\sum_{i=1}^n w_i Y_i}{\sum_{i=1}^n w_i} - \hat{\beta}_{w1} \frac{\sum_{i=1}^n w_i X_{i1}}{\sum_{i=1}^n w_i}
Show all your work. Partial work will not receive full credit.

(10 points) (b) Are the weighted least squares estimators β^w0\hat{\beta}_{w0} and β^w1\hat{\beta}_{w1} unbiased estimators of β0\beta_0 and β1\beta_1, respectively? Justify and show all your work.

(10 points) (c) Show that the weighted least squares estimators are equal to the ordinary (unweighted) least squares estimators, i.e.,
β^w1=β^1=∑i=1nXi1Yi−(∑i=1nXi1)(∑i=1nYi)n∑i=1nXi12−(∑i=1nXi1)2n\hat{\beta}_{w1} = \hat{\beta}_1 = \frac{\sum_{i=1}^n X_{i1} Y_i - \frac{(\sum_{i=1}^n X_{i1})(\sum_{i=1}^n Y_i)}{n}}{\sum_{i=1}^n X_{i1}^2 - \frac{(\sum_{i=1}^n X_{i1})^2}{n}}
β^w0=β^0=Yˉ−β^1Xˉ\hat{\beta}_{w0} = \hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}
when the errors have common variance σ2\sigma^2. Show all the details of your proof.

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

本題考查異質變異下的加權最小平方法(weighted least squares, WLS)。

給定

Yi=β0+β1Xi1+εi,Y_i=\beta_0+\beta_1X_{i1}+\varepsilon_i,

且

E(εi)=0,Var⁡(εi)=ci2σ2.E(\varepsilon_i)=0,\qquad \operatorname{Var}(\varepsilon_i)=c_i^2\sigma^2.

令

wi=1ci2>0.w_i=\frac{1}{c_i^2}>0.

加權最小平方法藉由最小化

Q(β0,β1)=∑i=1nwi(Yi−β0−β1Xi1)2Q(\beta_0,\beta_1) = \sum_{i=1}^n w_i(Y_i-\beta_0-\beta_1X_{i1})^2

使變異數較大的觀測值獲得較小權重,變異數較小的觀測值獲得較大權重。

定義加權平均數

Xˉw=∑i=1nwiXi1∑i=1nwi,Yˉw=∑i=1nwiYi∑i=1nwi.\bar X_w=\frac{\sum_{i=1}^n w_iX_{i1}}{\sum_{i=1}^n w_i}, \qquad \bar Y_w=\frac{\sum_{i=1}^n w_iY_i}{\sum_{i=1}^n w_i}.

(a) 推導加權最小平方法估計量

第一步:建立一階條件

令

ei=Yi−β0−β1Xi1.e_i=Y_i-\beta_0-\beta_1X_{i1}.

則

Q(β0,β1)=∑i=1nwiei2.Q(\beta_0,\beta_1)=\sum_{i=1}^n w_ie_i^2.

分別對 β0\beta_0 與 β1\beta_1 微分:

∂Q∂β0=−2∑i=1nwi(Yi−β0−β1Xi1),\frac{\partial Q}{\partial\beta_0} = -2\sum_{i=1}^n w_i(Y_i-\beta_0-\beta_1X_{i1}), ∂Q∂β1=−2∑i=1nwiXi1(Yi−β0−β1Xi1).\frac{\partial Q}{\partial\beta_1} = -2\sum_{i=1}^n w_iX_{i1}(Y_i-\beta_0-\beta_1X_{i1}).

令兩個偏導數皆為零,得到加權常態方程:

∑i=1nwiYi=β0∑i=1nwi+β1∑i=1nwiXi1,\sum_{i=1}^n w_iY_i = \beta_0\sum_{i=1}^n w_i + \beta_1\sum_{i=1}^n w_iX_{i1}, ∑i=1nwiXi1Yi=β0∑i=1nwiXi1+β1∑i=1nwiXi12.\sum_{i=1}^n w_iX_{i1}Y_i = \beta_0\sum_{i=1}^n w_iX_{i1} + \beta_1\sum_{i=1}^n w_iX_{i1}^2.

第二步:先解出 β^w0\hat\beta_{w0}

將估計量代入第一條常態方程:

∑i=1nwiYi=β^w0∑i=1nwi+β^w1∑i=1nwiXi1.\sum_{i=1}^n w_iY_i = \hat\beta_{w0}\sum_{i=1}^n w_i + \hat\beta_{w1}\sum_{i=1}^n w_iX_{i1}.

因此

β^w0=∑i=1nwiYi∑i=1nwi−β^w1∑i=1nwiXi1∑i=1nwi.\hat\beta_{w0} = \frac{\sum_{i=1}^n w_iY_i}{\sum_{i=1}^n w_i} - \hat\beta_{w1} \frac{\sum_{i=1}^n w_iX_{i1}}{\sum_{i=1}^n w_i}.

即

β^w0=Yˉw−β^w1Xˉw.\boxed{ \hat\beta_{w0} = \bar Y_w-\hat\beta_{w1}\bar X_w }.

第三步:解出 β^w1\hat\beta_{w1}

將

β^w0=Yˉw−β^w1Xˉw\hat\beta_{w0} = \bar Y_w-\hat\beta_{w1}\bar X_w

代入第二條常態方程:

∑i=1nwiXi1Yi=(Yˉw−β^w1Xˉw)∑i=1nwiXi1+β^w1∑i=1nwiXi12.\sum_{i=1}^n w_iX_{i1}Y_i = \left(\bar Y_w-\hat\beta_{w1}\bar X_w\right) \sum_{i=1}^n w_iX_{i1} + \hat\beta_{w1}\sum_{i=1}^n w_iX_{i1}^2.

由於

Xˉw=∑i=1nwiXi1∑i=1nwi,Yˉw=∑i=1nwiYi∑i=1nwi,\bar X_w= \frac{\sum_{i=1}^n w_iX_{i1}}{\sum_{i=1}^n w_i}, \qquad \bar Y_w= \frac{\sum_{i=1}^n w_iY_i}{\sum_{i=1}^n w_i},

整理後可得

β^w1=∑i=1nwiXi1Yi−(∑i=1nwiXi1)(∑i=1nwiYi)∑i=1nwi∑i=1nwiXi12−(∑i=1nwiXi1)2∑i=1nwi.\hat\beta_{w1} = \frac{ \sum_{i=1}^n w_iX_{i1}Y_i - \frac{ \left(\sum_{i=1}^n w_iX_{i1}\right) \left(\sum_{i=1}^n w_iY_i\right) }{ \sum_{i=1}^n w_i } }{ \sum_{i=1}^n w_iX_{i1}^2 - \frac{ \left(\sum_{i=1}^n w_iX_{i1}\right)^2 }{ \sum_{i=1}^n w_i } }.

因此題目所給的估計量正確:

β^w1=∑i=1nwiXi1Yi−(∑i=1nwiXi1)(∑i=1nwiYi)∑i=1nwi∑i=1nwiXi12−(∑i=1nwiXi1)2∑i=1nwi\boxed{ \hat\beta_{w1} = \frac{ \sum_{i=1}^n w_iX_{i1}Y_i - \frac{ \left(\sum_{i=1}^n w_iX_{i1}\right) \left(\sum_{i=1}^n w_iY_i\right) }{ \sum_{i=1}^n w_i } }{ \sum_{i=1}^n w_iX_{i1}^2 - \frac{ \left(\sum_{i=1}^n w_iX_{i1}\right)^2 }{ \sum_{i=1}^n w_i } } }

以及

β^w0=∑i=1nwiYi∑i=1nwi−β^w1∑i=1nwiXi1∑i=1nwi.\boxed{ \hat\beta_{w0} = \frac{\sum_{i=1}^n w_iY_i}{\sum_{i=1}^n w_i} - \hat\beta_{w1} \frac{\sum_{i=1}^n w_iX_{i1}}{\sum_{i=1}^n w_i} }.

也可以使用加權離均差形式表示:

β^w1=∑i=1nwi(Xi1−Xˉw)(Yi−Yˉw)∑i=1nwi(Xi1−Xˉw)2,\hat\beta_{w1} = \frac{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)(Y_i-\bar Y_w) }{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)^2 }, β^w0=Yˉw−β^w1Xˉw.\hat\beta_{w0}=\bar Y_w-\hat\beta_{w1}\bar X_w.

(b) 是否為不偏估計量

假設 Xi1X_{i1} 視為固定值。若 Xi1X_{i1} 為隨機變數,以下結果可解讀為條件於所有 Xi1X_{i1} 下的不偏性。

β^w1\hat\beta_{w1} 的不偏性

由模型

Yi=β0+β1Xi1+εiY_i=\beta_0+\beta_1X_{i1}+\varepsilon_i

代入加權離均差形式:

Yi−Yˉw=β1(Xi1−Xˉw)+(εi−εˉw),Y_i-\bar Y_w = \beta_1(X_{i1}-\bar X_w) + (\varepsilon_i-\bar\varepsilon_w),

其中

εˉw=∑i=1nwiεi∑i=1nwi.\bar\varepsilon_w = \frac{\sum_{i=1}^n w_i\varepsilon_i}{\sum_{i=1}^n w_i}.

因此

β^w1=∑i=1nwi(Xi1−Xˉw)[β1(Xi1−Xˉw)+(εi−εˉw)]∑i=1nwi(Xi1−Xˉw)2.\hat\beta_{w1} = \frac{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w) \left[ \beta_1(X_{i1}-\bar X_w) + (\varepsilon_i-\bar\varepsilon_w) \right] }{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)^2 }.

分子可分成兩部分:

β^w1=β1+∑i=1nwi(Xi1−Xˉw)(εi−εˉw)∑i=1nwi(Xi1−Xˉw)2.\hat\beta_{w1} = \beta_1 + \frac{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w) (\varepsilon_i-\bar\varepsilon_w) }{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)^2 }.

注意

∑i=1nwi(Xi1−Xˉw)=0,\sum_{i=1}^n w_i(X_{i1}-\bar X_w)=0,

所以

∑i=1nwi(Xi1−Xˉw)εˉw=0.\sum_{i=1}^n w_i(X_{i1}-\bar X_w)\bar\varepsilon_w=0.

因此

β^w1=β1+∑i=1nwi(Xi1−Xˉw)εi∑i=1nwi(Xi1−Xˉw)2.\hat\beta_{w1} = \beta_1 + \frac{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)\varepsilon_i }{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)^2 }.

取期望:

E(β^w1)=β1+∑i=1nwi(Xi1−Xˉw)E(εi)∑i=1nwi(Xi1−Xˉw)2.E(\hat\beta_{w1}) = \beta_1 + \frac{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)E(\varepsilon_i) }{ \sum_{i=1}^n w_i(X_{i1}-\bar X_w)^2 }.
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題20 分

  1. (20 points)
    (10 points) (a) Derive the expected mean squares of error E(MSE)E(MSE) in the two-way ANOVA table below, from the model
    Yijk=μ+αi+βj+(αβ)ij+εijkY_{ijk} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \varepsilon_{ijk}, 1≤i≤r1 \le i \le r, 1≤j≤m1 \le j \le m, 1≤k≤n1 \le k \le n.
TermSS
ASSA=nm∑i=1r(Yˉi..−Yˉ...)2SSA = nm \sum_{i=1}^r (\bar{Y}_{i..} - \bar{Y}_{...})^2
BSSB=nr∑j=1m(Yˉ.j.−Yˉ...)2SSB = nr \sum_{j=1}^m (\bar{Y}_{.j.} - \bar{Y}_{...})^2
ABSSAB=n∑i=1r∑j=1m(Yˉij.−Yˉi..−Yˉ.j.+Yˉ...)2SSAB = n \sum_{i=1}^r \sum_{j=1}^m (\bar{Y}_{ij.} - \bar{Y}_{i..} - \bar{Y}_{.j.} + \bar{Y}_{...})^2
ErrorSSE=∑i=1r∑j=1m∑k=1n(Yijk−Yˉij.)2SSE = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (Y_{ijk} - \bar{Y}_{ij.})^2

(10 points) (b) Prove or disprove that sum of squares of total SSTSST equals sum of squares of regression plus sum of squares of error SSR+SSESSR + SSE. (Here, SSR=SSA+SSB+SSABSSR = SSA+ SSB + SSAB. )

• Yˉ...\bar{Y}_{...}: the overall average of the YijkY_{ijk}, i.e., 1nmr∑i=1r∑j=1m∑k=1nYijk\frac{1}{nmr} \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n Y_{ijk}.
• Yˉij.\bar{Y}_{ij.}: the average of all responses for the ii-th A factor and jj-th B factor, i.e., 1n∑k=1nYijk\frac{1}{n} \sum_{k=1}^n Y_{ijk}.
• Yˉi..\bar{Y}_{i..}: the average of all responses for the ii-th A factor, i.e., 1nm∑j=1m∑k=1nYijk\frac{1}{nm} \sum_{j=1}^m \sum_{k=1}^n Y_{ijk}.
• Yˉ.j.\bar{Y}_{.j.}: the average of all responses for the jj-th B factor, i.e., 1nr∑i=1r∑k=1nYijk\frac{1}{nr} \sum_{i=1}^r \sum_{k=1}^n Y_{ijk}.
• For each factor combination ijij, the random error terms εijk\varepsilon_{ijk} are N(0,σ2)N(0, \sigma^2); the variance σ2\sigma^2 is the same for each factor combination.
• The random error terms εijk\varepsilon_{ijk} are independent.
• Sum of squares of total SST=∑i=1r∑j=1m∑k=1n(Yijk−Yˉ...)2SST = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (Y_{ijk} - \bar{Y}_{...})^2.
• Mean squares of error MSE=SSEdegree of freedom of errorMSE = \frac{SSE}{\text{degree of freedom of error}}.

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗兩因子變異數分析 (Two-way ANOVA) 的期望均方 (Expected Mean Squares, EMS) 推導,以及總平方和 (SST) 的分解性質。

模型為:Yijk=μ+αi+βj+(αβ)ij+εijkY_{ijk} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \varepsilon_{ijk}
其中 εijk∼N(0,σ2)\varepsilon_{ijk} \sim N(0, \sigma^2) 且獨立。
總共有 rr 個 A 層級,mm 個 B 層級,nn 個重複觀測。總觀測數 N=rmnN = rmn。

(a) 推導 E(MSE)E(MSE)。
MSE=SSEdegree of freedom of errorMSE = \frac{SSE}{\text{degree of freedom of error}}。
首先,我們需要計算 SSE 的期望值 E(SSE)E(SSE),並確定誤差的自由度。
SSE=∑i=1r∑j=1m∑k=1n(Yijk−Yˉij.)2SSE = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (Y_{ijk} - \bar{Y}_{ij.})^2
將模型代入 SSE:
Yijk−Yˉij.=(μ+αi+βj+(αβ)ij+εijk)−(μ+αi+βj+(αβ)ij+εˉij.)Y_{ijk} - \bar{Y}_{ij.} = (\mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \varepsilon_{ijk}) - (\mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \bar{\varepsilon}_{ij.})
=εijk−εˉij.= \varepsilon_{ijk} - \bar{\varepsilon}_{ij.}
其中 εˉij.=1n∑k=1nεijk\bar{\varepsilon}_{ij.} = \frac{1}{n} \sum_{k=1}^n \varepsilon_{ijk}。

所以,SSE=∑i=1r∑j=1m∑k=1n(εijk−εˉij.)2SSE = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (\varepsilon_{ijk} - \bar{\varepsilon}_{ij.})^2。
現在計算 E(SSE)E(SSE):
E(SSE)=E[∑i=1r∑j=1m∑k=1n(εijk−εˉij.)2]E(SSE) = E\left[\sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (\varepsilon_{ijk} - \bar{\varepsilon}_{ij.})^2\right]
=∑i=1r∑j=1m∑k=1nE[(εijk−εˉij.)2]= \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n E[(\varepsilon_{ijk} - \bar{\varepsilon}_{ij.})^2]
=∑i=1r∑j=1m∑k=1nE[εijk2−2εijkεˉij.+εˉij.2]= \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n E[\varepsilon_{ijk}^2 - 2\varepsilon_{ijk}\bar{\varepsilon}_{ij.} + \bar{\varepsilon}_{ij.}^2]
=∑i=1r∑j=1m∑k=1n(E[εijk2]−2E[εijkεˉij.]+E[εˉij.2])= \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (E[\varepsilon_{ijk}^2] - 2E[\varepsilon_{ijk}\bar{\varepsilon}_{ij.}] + E[\bar{\varepsilon}_{ij.}^2])

由於 εijk∼N(0,σ2)\varepsilon_{ijk} \sim N(0, \sigma^2),所以 E[εijk2]=Var(εijk)+(E[εijk])2=σ2+02=σ2E[\varepsilon_{ijk}^2] = Var(\varepsilon_{ijk}) + (E[\varepsilon_{ijk}])^2 = \sigma^2 + 0^2 = \sigma^2。
E[εijkεˉij.]=E[εijk1n∑l=1nεijl]=1nE[εijk(εijk+∑l≠kεijl)]E[\varepsilon_{ijk}\bar{\varepsilon}_{ij.}] = E\left[\varepsilon_{ijk} \frac{1}{n} \sum_{l=1}^n \varepsilon_{ijl}\right] = \frac{1}{n} E\left[\varepsilon_{ijk} (\varepsilon_{ijk} + \sum_{l \ne k} \varepsilon_{ijl})\right]
=1n(E[εijk2]+∑l≠kE[εijkεijl])= \frac{1}{n} (E[\varepsilon_{ijk}^2] + \sum_{l \ne k} E[\varepsilon_{ijk}\varepsilon_{ijl}])
由於 ε\varepsilon 之間是獨立的,當 l≠kl \ne k 時,E[εijkεijl]=E[εijk]E[εijl]=0×0=0E[\varepsilon_{ijk}\varepsilon_{ijl}] = E[\varepsilon_{ijk}]E[\varepsilon_{ijl}] = 0 \times 0 = 0。
所以,E[εijkεˉij.]=1nE[εijk2]=1nσ2E[\varepsilon_{ijk}\bar{\varepsilon}_{ij.}] = \frac{1}{n} E[\varepsilon_{ijk}^2] = \frac{1}{n} \sigma^2。

E[εˉij.2]=Var(εˉij.)+(E[εˉij.])2E[\bar{\varepsilon}_{ij.}^2] = Var(\bar{\varepsilon}_{ij.}) + (E[\bar{\varepsilon}_{ij.}])^2。
E[εˉij.]=E[1n∑k=1nεijk]=1n∑k=1nE[εijk]=1n∑k=1n0=0E[\bar{\varepsilon}_{ij.}] = E\left[\frac{1}{n} \sum_{k=1}^n \varepsilon_{ijk}\right] = \frac{1}{n} \sum_{k=1}^n E[\varepsilon_{ijk}] = \frac{1}{n} \sum_{k=1}^n 0 = 0。
Var(εˉij.)=Var(1n∑k=1nεijk)=1n2Var(∑k=1nεijk)Var(\bar{\varepsilon}_{ij.}) = Var\left(\frac{1}{n} \sum_{k=1}^n \varepsilon_{ijk}\right) = \frac{1}{n^2} Var\left(\sum_{k=1}^n \varepsilon_{ijk}\right)
由於 εijk\varepsilon_{ijk} 獨立, Var(∑k=1nεijk)=∑k=1nVar(εijk)=∑k=1nσ2=nσ2Var\left(\sum_{k=1}^n \varepsilon_{ijk}\right) = \sum_{k=1}^n Var(\varepsilon_{ijk}) = \sum_{k=1}^n \sigma^2 = n\sigma^2。
所以,Var(εˉij.)=1n2(nσ2)=σ2nVar(\bar{\varepsilon}_{ij.}) = \frac{1}{n^2} (n\sigma^2) = \frac{\sigma^2}{n}。
因此,E[εˉij.2]=σ2n+02=σ2nE[\bar{\varepsilon}_{ij.}^2] = \frac{\sigma^2}{n} + 0^2 = \frac{\sigma^2}{n}。

將這些代回 E(SSE)E(SSE) 的計算:
E(SSE)=∑i=1r∑j=1m∑k=1n(σ2−2σ2n+σ2n)E(SSE) = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (\sigma^2 - 2\frac{\sigma^2}{n} + \frac{\sigma^2}{n})
E(SSE)=∑i=1r∑j=1m∑k=1n(σ2−σ2n)E(SSE) = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (\sigma^2 - \frac{\sigma^2}{n})
總共有 r×m×nr \times m \times n 項。
E(SSE)=rmn(σ2−σ2n)=rmnσ2(1−1n)E(SSE) = rmn (\sigma^2 - \frac{\sigma^2}{n}) = rmn \sigma^2 (1 - \frac{1}{n})
E(SSE)=rmnσ2n−1n=rm(n−1)σ2E(SSE) = rmn \sigma^2 \frac{n-1}{n} = rm(n-1) \sigma^2。

誤差的自由度 (degree of freedom of error) 是總觀測數減去模型中所有參數的估計數。
在固效模型 (fixed effects model) 中,參數包括 μ\mu, r−1r-1 個 αi\alpha_i, m−1m-1 個 βj\beta_j, (r−1)(m−1)(r-1)(m-1) 個 (αβ)ij(\alpha\beta)_{ij}。
總參數數為 1+(r−1)+(m−1)+(r−1)(m−1)=1+r−1+m−1+rm−r−m+1=rm−11 + (r-1) + (m-1) + (r-1)(m-1) = 1 + r - 1 + m - 1 + rm - r - m + 1 = rm - 1。
自由度為 N−(參數數)=rmn−(rm−1)=rmn−rm+1N - (\text{參數數}) = rmn - (rm - 1) = rmn - rm + 1。
然而,這裡的 SSE 公式是針對 Yˉij.\bar{Y}_{ij.},這暗示我們是基於因子組合的平均值來定義 SSE。
在 ANOVA 中,SSE 的自由度計算是:總觀測數 NN 減去模型中被估計的參數數量。
在固效模型下,我們估計 μ,αi,βj,(αβ)ij\mu, \alpha_i, \beta_j, (\alpha\beta)_{ij}。
總共有 1+(r−1)+(m−1)+(r−1)(m−1)=rm1 + (r-1) + (m-1) + (r-1)(m-1) = rm 個獨立的參數(如果考慮約束條件 ∑αi=0,∑βj=0,∑j(αβ)ij=0\sum \alpha_i = 0, \sum \beta_j = 0, \sum_j (\alpha\beta)_{ij} = 0 for each i, ∑i(αβ)ij=0\sum_i (\alpha\beta)_{ij} = 0 for each j)。
或者,如果我們不考慮約束條件,而是估計 rr 個 αi\alpha_i, mm 個 βj\beta_j, rmrm 個 (αβ)ij(\alpha\beta)_{ij},加上 μ\mu,總共有 1+r+m+rm1+r+m+rm 個參數。
但通常我們是以約束條件來定義參數的獨立性。
對於 Yijk=μ+αi+βj+(αβ)ij+εijkY_{ijk} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \varepsilon_{ijk},
若 ∑iαi=0\sum_i \alpha_i = 0, ∑jβj=0\sum_j \beta_j = 0, ∑j(αβ)ij=0\sum_j (\alpha\beta)_{ij} = 0 for each i, ∑i(αβ)ij=0\sum_i (\alpha\beta)_{ij} = 0 for each j。
則獨立參數個數為 1+(r−1)+(m−1)+(r−1)(m−1)=rm−11 + (r-1) + (m-1) + (r-1)(m-1) = rm-1。
總觀測數為 rmnrmn。
自由度為 rmn−(rm−1)=rmn−rm+1rmn - (rm-1) = rmn - rm + 1。
然而,SSE 的定義是基於 Yˉij.\bar{Y}_{ij.},這意味著我們已經處理了 A 和 B 的效應。
SSE=∑i=1r∑j=1m∑k=1n(Yijk−Yˉij.)2SSE = \sum_{i=1}^r \sum_{j=1}^m \sum_{k=1}^n (Y_{ijk} - \bar{Y}_{ij.})^2。
這裡 Yˉij.\bar{Y}_{ij.} 是一個估計,它包含了 μ,αi,βj,(αβ)ij\mu, \alpha_i, \beta_j, (\alpha\beta)_{ij} 的資訊。
對於每一個 (i,j)(i, j) 組合,有 nn 個觀測值 YijkY_{ijk}。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題