108 年 國立臺北大學企業管理學系碩士班甲組《統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題

線性迴歸模式:Yi=β0+β1X1i+β2X2i+ϵiY_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + \epsilon_i,β0\beta_0 是截距項,β1\beta_1、β2\beta_2 是解釋變數 (X1iX_{1i} 與 X2iX_{2i}) 的係數,ϵi\epsilon_i 是隨機誤差項,i=1,2,…,ni = 1, 2, \dots, n。模式估計與檢定需要一些假設:(1) 誤差項的變異數同質 (var(ϵi)=σ2\text{var}(\epsilon_i) = \sigma^2);(2) 誤差項之間不共變 (cov(ϵi,ϵj)=0,i≠j\text{cov}(\epsilon_i, \epsilon_j) = 0, i \neq j);(3) X1X_1、X2X_2 沒有共線性 (collinearity)。

(a) 請分別說明違反這些假設,該模式估計或檢定會產生什麼問題?(15%)
(b) 請寫出這個模式 F-value 的式子及其所檢定的虛無 (null) 與對立 (alternative) 假設為何?(5%)
(c) 如果無法拒絕虛無假設,並不表示 ϵ\epsilon 與 X1X_1、X2X_2 沒有關係?為什麼?(10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題主要在考察學生對線性迴歸模型基本假設的理解,以及違反假設時對模型估計與檢定的影響。

(a) 違反線性迴歸模型假設的問題:

  1. 誤差項變異數非同質 (Heteroscedasticity):

    • 問題:當誤差項的變異數不是常數 (var(ϵi)≠σ2\text{var}(\epsilon_i) \neq \sigma^2) 時,雖然迴歸係數的估計值 (OLS estimators) 仍然是「不偏」的 (unbiased),但它們不再是「有效」的 (efficient),也就是說,它們的變異數不是最小的。更重要的是,使用標準的 Ordinary Least Squares (OLS) 方法計算出的標準誤 (standard errors) 會是錯誤的,這會導致 t-檢定和 F-檢定的結果不可靠,進而影響係數顯著性的判斷。例如,標準誤可能被低估,導致過度拒絕虛無假設。
    • 解決方法:可使用穩健標準誤 (robust standard errors),或對模型進行加權最小平方法 (Weighted Least Squares, WLS)。
  2. 誤差項之間存在共變 (Autocorrelation / Serial Correlation):

    • 問題:當誤差項之間存在相關性 (cov(ϵi,ϵj)≠0\text{cov}(\epsilon_i, \epsilon_j) \neq 0 for i≠ji \neq j),尤其常見於時間序列資料。與變異數非同質類似,OLS 估計量仍然是不偏的,但不再是有效的。標準誤的計算同樣會被扭曲,通常會被低估,導致統計檢定失效,容易得出錯誤的結論。
    • 解決方法:可使用廣義最小平方法 (Generalized Least Squares, GLS),例如 Cochrane-Orcutt 迭代法,或使用穩健標準誤 (Newey-West standard errors)。
  3. 解釋變數之間存在共線性 (Multicollinearity):

    • 問題:當一個解釋變數可以被其他解釋變數線性組合表示,或者兩個解釋變數之間高度相關時,稱為共線性。
      • 嚴重共線性:OLS 估計量仍然是不偏的,但它們的變異數會非常大。這意味著迴歸係數的估計值會非常不穩定,對數據微小的變動非常敏感。此外,個別解釋變數的 t-檢定可能不顯著,即使它們與依變數 Y 之間有實際的關係。
      • 完全共線性:模型無法估計。
    • 解決方法:移除其中一個高度相關的變數、合併變數、增加樣本數,或使用嶺迴歸 (Ridge Regression) 等方法。

(b) F-value 的計算及其檢定:
在多重迴歸中,F-檢定的目的是檢定所有斜率係數是否同時為零。對於模型 Yi=β0+β1X1i+β2X2i+ϵiY_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + \epsilon_i,F-檢定是用來檢定是否所有斜率係數都顯著不為零。

  • 虛無假設 (Null Hypothesis, H0H_0):所有斜率係數同時為零。
    H0:β1=β2=0H_0: \beta_1 = \beta_2 = 0
  • 對立假設 (Alternative Hypothesis, H1H_1):至少有一個斜率係數不為零。
    H1:at least one of β1,β2 is not zeroH_1: \text{at least one of } \beta_1, \beta_2 \text{ is not zero}
  • F-value 的計算公式:
    F=Explained variationUnexplained variation=SSR/kSSE/(n−k−1)F = \frac{\text{Explained variation}}{\text{Unexplained variation}} = \frac{\text{SSR}/k}{\text{SSE}/(n-k-1)}
    其中:
    • SSRSSR (Sum of Squares due to Regression):迴歸平方和,代表模型解釋的總變異。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題

變異數分析模式可分成固定效果模式 (fixed-effect model) 與隨機效果模式 (random-effect model),請以單因子模式為例,說明兩種模式 (符號自訂) 及用途上的差異?(20%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題主要在考察學生對單因子變異數分析 (One-Way ANOVA) 中固定效果模型 (Fixed Effects Model) 與隨機效果模型 (Random Effects Model) 的區別與應用。

單因子變異數分析 (One-Way ANOVA):用於比較 kk 個群體(處理組)的平均數是否存在顯著差異。假設依變數 YY 受兩個因素影響:群體因子 (treatment factor) 和隨機誤差。

1. 固定效果模式 (Fixed Effects Model)

  • 符號與模型:
    假設我們有 kk 個群體,每個群體有 nin_i 個觀察值,總樣本數為 N=∑i=1kniN = \sum_{i=1}^{k} n_i。
    模型表示為:
    Yij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij}
    其中:

    • YijY_{ij}:第 ii 群體、第 jj 個觀察值。
    • μ\mu:總平均數 (overall mean)。
    • αi\alpha_i:第 ii 群體的「固定」效果 (fixed effect),代表第 ii 群體相對於總平均數的差異。
    • ϵij\epsilon_{ij}:隨機誤差項,假設 ϵij∼N(0,σ2)\epsilon_{ij} \sim N(0, \sigma^2),且各誤差項獨立。

    此模式的關鍵在於 αi\alpha_i 被視為固定的、非隨機的參數。研究者感興趣的是這 kk 個「特定」群體的平均數差異。

  • 假設:

    • αi\alpha_i 是固定的參數。
    • ϵij\epsilon_{ij} 是獨立同分布的常態隨機變數,且 ϵij∼N(0,σ2)\epsilon_{ij} \sim N(0, \sigma^2)。
    • 常見的約束條件是 ∑i=1kαi=0\sum_{i=1}^{k} \alpha_i = 0,這樣 μ\mu 就代表了所有群體平均數的平均值。
    • 如果沒有約束條件,則 μ\mu 是第一個群體的平均數,而 αi\alpha_i 是第 ii 群體相對於第一個群體的差異。
  • 用途與推論:

    • 當研究者關心的是研究中包含的所有特定群體的平均數差異時,應使用固定效果模式。例如,比較三種不同教學方法的學習成效,而這三種方法是研究者事先選定且感興趣的。
    • 推論的範圍僅限於所研究的這 kk 個群體。例如,我們發現三種教學法有顯著差異,結論只能是「這三種教學法之間存在顯著差異」,而不能推論到所有可能的教學法。
    • 檢定重點:檢定 H0:α1=α2=⋯=αk=0H_0: \alpha_1 = \alpha_2 = \dots = \alpha_k = 0 (或 H0:μ1=μ2=⋯=μkH_0: \mu_1 = \mu_2 = \dots = \mu_k)。

2. 隨機效果模式 (Random Effects Model)

  • 符號與模型:
    模型表示為:
    Yij=μ+Ai+ϵijY_{ij} = \mu + A_i + \epsilon_{ij}
    其中:

    • YijY_{ij}:第 ii 群體、第 jj 個觀察值。
    • μ\mu:總平均數 (overall mean)。
    • AiA_i:第 ii 群體的「隨機」效果 (random effect)。AiA_i 被視為一個隨機變數,從一個總體分佈中抽取而來。
    • ϵij\epsilon_{ij}:隨機誤差項,假設 ϵij∼N(0,σ2)\epsilon_{ij} \sim N(0, \sigma^2),且各誤差項獨立。

    此模式的關鍵在於 AiA_i 被視為一個隨機變數,假設 Ai∼N(0,σA2)A_i \sim N(0, \sigma_A^2),且 AiA_i 與 ϵij\epsilon_{ij} 獨立。研究者感興趣的不是特定群體的平均數,而是群體間變異來源。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題

In a city, 100 people were surveyed and 50 thought that climate change was not caused by human pollution.
(1) Find the margin of error for a 95% confidence interval. (10%)
(2) We expect that the margin of error is not greater than 0.02. How many people should be surveyed? (95% confidence interval) (10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題是關於比例的信賴區間估計,包含計算邊際誤差以及根據預期邊際誤差來反推樣本數。

核心觀念:比例的信賴區間、邊際誤差、樣本數決定。

(1) 計算 95% 信賴區間的邊際誤差 (Margin of Error, MOE)

我們有一個比例的樣本數據:

  • 樣本數 n=100n = 100
  • 認為氣候變遷非人為污染的人數 x=50x = 50
  • 樣本比例 p^=x/n=50/100=0.5\hat{p} = x/n = 50/100 = 0.5

比例的信賴區間通常是 p^±MOE\hat{p} \pm MOE。
邊際誤差 (MOE) 的公式為:
MOE=zα/2p^(1−p^)nMOE = z_{\alpha/2} \sqrt{\frac{\hat{p}(1-\hat{p})}{n}}
其中 zα/2z_{\alpha/2} 是對應於信賴水準 (1−α)(1-\alpha) 的標準常態分配臨界值。

對於 95% 的信賴水準,α=0.05\alpha = 0.05,所以 α/2=0.025\alpha/2 = 0.025。
查標準常態分配表可得,z0.025=1.96z_{0.025} = 1.96。

將已知數值代入公式:
MOE=1.960.5(1−0.5)100MOE = 1.96 \sqrt{\frac{0.5(1-0.5)}{100}}
MOE=1.960.5×0.5100MOE = 1.96 \sqrt{\frac{0.5 \times 0.5}{100}}
MOE=1.960.25100MOE = 1.96 \sqrt{\frac{0.25}{100}}
MOE=1.960.0025MOE = 1.96 \sqrt{0.0025}
MOE=1.96×0.05MOE = 1.96 \times 0.05
MOE=0.098MOE = 0.098

所以,95% 信賴區間的邊際誤差是 0.098。

(2) 根據預期邊際誤差反推所需樣本數

我們希望邊際誤差 (MOE) 不大於 0.02,即 MOE≤0.02MOE \le 0.02。
信賴水準仍為 95%,所以 zα/2=1.96z_{\alpha/2} = 1.96。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題

The employee with low productivity in KID company is 5%. For the employee marked as low productivity, the attendance system showed that the probability of personal leave twice in a month is 100%. In contrast, the probability of personal leave twice in a month for other employees is 20%. Mary took the personal leave twice in the last month. What is the probability that Mary is an employee with low productivity? (10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題為貝氏定理 (Bayes' Theorem) 的應用,目的是計算在已知某事件(Mary 請假兩次)發生的情況下,Mary 屬於低生產力員工的機率。

核心觀念:貝氏定理、條件機率。

定義事件:

  • LL: Mary 是低生產力員工 (Low productivity employee)。
  • NLNL: Mary 不是低生產力員工 (Non-low productivity employee)。
  • TT: Mary 上個月請假兩次 (Took personal leave twice last month)。

根據題目給予的資訊:

  • 低生產力員工的比例:P(L)=0.05P(L) = 0.05。
  • 非低生產力員工的比例:P(NL)=1−P(L)=1−0.05=0.95P(NL) = 1 - P(L) = 1 - 0.05 = 0.95。
  • 低生產力員工請假兩次的機率(條件機率):P(T∣L)=1.00P(T|L) = 1.00 (100%)。
  • 非低生產力員工請假兩次的機率(條件機率):P(T∣NL)=0.20P(T|NL) = 0.20 (20%)。

我們要求的是 Mary 請假兩次的情況下,她是低生產力員工的機率,即 P(L∣T)P(L|T)。
根據貝氏定理:
P(L∣T)=P(T∣L)P(L)P(T)P(L|T) = \frac{P(T|L) P(L)}{P(T)}

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題

One survey of education level in Taipei showed that 33 persons are elementary school, 44 persons are junior high school, 89 persons are senior high school, 14 persons are undergraduate and 20 persons are graduate. In Taiwan, the survey of education level showed that 10.2% of population is elementary school, 12.3% of population is junior high school, 57.9% of population is senior high school, 7% of population is undergraduate and 12.6% of population is graduate. Is the education level in Taipei significantly different from the education level in Taiwan? (95% confidence interval) (20%)

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

本題考查「卡方適合度檢定」:

  • 檢定一組樣本的類別比例,是否符合既定母體比例。
  • 北大臺北地區抽樣資料為觀察次數。
  • 臺灣整體教育程度比例為假設比例。
  • 顯著水準為 α=0.05\alpha=0.05,亦即 95% 信賴水準。

設五種教育程度的母體比例為:

(p1,p2,p3,p4,p5)=(0.102,0.123,0.579,0.07,0.126)(p_1,p_2,p_3,p_4,p_5) =(0.102,0.123,0.579,0.07,0.126)

假設為:

H0:臺北教育程度分布與臺灣整體相同H_0:\text{臺北教育程度分布與臺灣整體相同} H1:臺北教育程度分布與臺灣整體不同H_1:\text{臺北教育程度分布與臺灣整體不同}

卡方適合度檢定統計量為:

χ2=∑i=1k(Oi−Ei)2Ei\chi^2=\sum_{i=1}^{k}\frac{(O_i-E_i)^2}{E_i}

其中:

  • OiO_i:第 ii 類的觀察次數
  • EiE_i:第 ii 類在 H0H_0 下的期望次數
  • k=5k=5:教育程度類別數

自由度為:

df=k−1=5−1=4df=k-1=5-1=4

解題方法與計算

樣本總人數為:

n=33+44+89+14+20=200n=33+44+89+14+20=200

各類別的期望次數為:

教育程度觀察次數 OiO_i臺灣比例期望次數 Ei=200piE_i=200p_i
國小330.10220.420.4
國中440.12324.624.6
高中890.579115.8115.8
大學140.07014.014.0
研究所200.12625.225.2

所有期望次數皆大於 5,符合卡方檢定的近似條件。

代入公式:

χ2=(33−20.4)220.4+(44−24.6)224.6+(89−115.8)2115.8+(14−14)214+(20−25.2)225.2\begin{aligned} \chi^2 &=\frac{(33-20.4)^2}{20.4} +\frac{(44-24.6)^2}{24.6} +\frac{(89-115.8)^2}{115.8}\\ &\quad+\frac{(14-14)^2}{14} +\frac{(20-25.2)^2}{25.2} \end{aligned}

各項貢獻值為:

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題