113 年 國立中山大學財務管理學系碩士班甲組《統計學》
注意事項:各題的計分方式與配分不完全相同,請參考各部份開頭說明。
第一部份:複選題(第 1-5 題,總共 70 分,每題 14 分且各有 5 個選項,每錯一選項扣 3.6 分,得分低於零分或所有選項均未作答者,該題以零分計。)
提醒:表格出現(??)或空白是指表格原本有這些文字或符號或數據,作答時若有用到需自行判斷或計算。關於假說檢定的題目,皆設定顯著水準為 5%。
【題組,包括第 1-4 題(不包括第 5 題)】
某金融機構想了解客戶對於金融知識的了解程度,於 75 家分行請客戶填寫問卷並且予以評分,分數範圍介於 0 到 100 之間,分數愈高表示金融知識了解程度愈高。此金融機構的目標在於了解不同區域之間客戶金融知識了解程度的差異,將有效問卷資料進行以下處理。令 為第 個分行受測者金融知識了解程度的平均分數,。依地理位置將這 75 家分行劃分為三區:K 區、L 區、N 區,同時考慮 、、,若第 個分行位於 K 區,則 ,反之 ;若第 個分行位於 L 區,則 ,反之 ;若第 個分行位於 N 區,則 ,反之 。藉由此處理,可得到 75 組資料,每一組皆有完整的 、、、 數據。研究者使用 R 語言進行統計分析,首先使用 summary 指令得到 、、、 的敘述統計結果,得到表一。
表一
| Score | xK | xL | xN | |
|---|---|---|---|---|
| Min. | 39.0 | 0.00 | 0.0 | 0.00 |
| 1st Qu. | 48.0 | 0.00 | 0.0 | 0.00 |
| Median | 54.0 | 0.00 | 1.0 | 0.00 |
| Mean | 56.0 | 0.16 | 0.6 | 0.24 |
| 3rd Qu. | 62.5 | 0.00 | 1.0 | 0.00 |
| Max. | 82.0 | 1.00 | 1.0 | 1.00 |
第 1 題14 分
- 除了表一之外,研究者另外使用 t.test 指令對所有的 數據資料進行分析,得到表二。以下敘述哪些或哪一項正確?
表二
One Sample t-test
data: Score
t = -3.3013, df = (甲), p-value = 0.0007417
alternative hypothesis: true mean is less than 60
95 percent confidence interval:
(乙) 58.02
sample estimates:
mean of x
(??)
(A) 依據現有資訊,無法推斷 資料是否存在離群值。
(B) 依據現有資訊,可以推算在 75 家分行中,位於 K 區的分行家數。
(C) 表二(甲)為 74。
(D) 表二(乙)為 53.98。
(E) 由表二可知,研究者目前執行的假說檢定是左尾檢定。
登入後即可作答並保存紀錄。
核心觀念
-
四分位距與離群值判定(Tukey's Fences):
資料中若欲判定是否存在離群值(Outliers),常用四分位距(Interquartile Range, )建立內籬笆(Inner Fences):- 下界(Lower Inner Fence):
- 上界(Upper Inner Fence):
若所有樣本觀測值皆落在此區間內(即 且 ),則該資料集不存在離群值。
-
虛擬變數(Dummy Variable)的樣本平均數意義:
對於二元指標變數 ,其樣本平均數即為該類別在樣本中所佔的比例:該類別之次數(家數)即為 。
-
單組樣本 檢定(One-sample -test)之自由度:
樣本數為 時,單組樣本母體平均數的 檢定統計量自由度為: -
R 語言
t.test單尾檢定與單邊信賴區間輸出:- 當對立假說為左尾檢定(
alternative = "less",即 )時,R 語言預設輸出對應的單邊 95% 信賴區間(One-sided Confidence Interval),其形式為 ,故左端點輸出值為-Inf。
- 當對立假說為左尾檢定(
解題方法
-
離群值檢驗:
由表一可知 的五數摘要:、、、。- 計算四分位距:
- 計算內籬笆門檻:
- 因 且 ,所有數據皆在 之內,故依現有資訊可明確推斷不存在離群值。
-
計算 K 區分行數:
總分行數 ,由表一可知 的平均數為 。 -
計算自由度 (甲):
本題使用 75 家分行的資料進行單樣本 檢定,:
第 2 題14 分
- 研究者接著使用 K 區與 L 區的 樣本資料進行分析,SK 存放 K 區的 數據、SL 存放 L 區的 數據,使用指令
var.test(SK,SL,alternative="two.sided",conf.level=0.95)得到表三,並且使用 t.test 指令分別得到表四與表五,其中表四對應的指令是t.test(SK,SL, alternative="two.sided", mu=0, paired=F, var.equal=T),表五對應的指令是t.test(SK,SL, alternative="two.sided", mu=0, paired=F, var.equal=F)。以下敘述哪些或哪一項正確?
(A) 如果 var.test 指令中信心水準設定為 0.9,得到的信賴區間上限小於 2.208。
(B) 表三(丙)這格數字大於 1。
(C) 綜合考慮本題組與表一到表五提供的資訊,無法推算得到表四(丁)這格數字。
(D) 表四(戊)為 52。
(E) 表五(己)這格數字的絕對值大於 5.560。
表三
F test to compare two variances
data: SK and SL
F = 0.72511, num df = (??), denom df = (??), p-value = 0.5829
alternative hypothesis: true ratio of variances is not equal to 1
95 percent confidence interval:
(丙) 2.208
sample estimates:
ratio of variances
0.72511
表四
Two Sample t-test
data: SK and SL
t = -0.41595, df = (丁), p-value = (??)
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-5.560 3.648
sample estimates:
mean of x mean of y
(戊) 52.956
表五
Welch Two Sample t-test
data: SK and SL
t = -0.45696, df = (??), p-value = (??)
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
(己) 3.408
sample estimates:
mean of x mean of y
(??) 52.956
登入後即可作答並保存紀錄。
核心觀念
本題考查商管研究所統計學中雙樣本推論(Two-Sample Inference)與 R 軟體報表判讀,核心重點涵蓋:
- 虛擬變數與樣本數計算:二元指示變數(Dummy variable)的樣本平均數即為該類別所佔的樣本比例,由總樣本數即可精確求得各組樣本數:
- 兩母體變異數比之 檢定與信賴區間(
var.test):- 檢定統計量:
- 信心水準 越低(如從 降至 ),信賴區間長度越窄,上限值變小、下限值變大。
- 若 接受(),則雙尾信賴區間必涵蓋 (即下限 上限)。
- 兩獨立母體平均數差之 檢定(Pooled -test vs. Welch's -test):
- 等變異數假設(Pooled -test,
var.equal = TRUE):
自由度為:
且信賴區間為對稱於兩組樣本平均數差 :
其區間中點必等於 。 - 不等變異數假設(Welch's -test,
var.equal = FALSE):
信賴區間同樣以 為中心,即區間中點恆等於兩組樣本平均之差。
- 等變異數假設(Pooled -test,
解題方法與推導
步驟一:由表一還原 K 區與 L 區的樣本數
總分行數 。
- K 區分行數:
- L 區分行數:
- (補充)N 區分行數:。
步驟二:推算表四的自由度(丁)與樣本平均數(戊)
- 表四之自由度(丁):
表四設定var.equal = TRUE,自由度為:
因此可明確推算出表四(丁)為 。 - 表四之樣本平均數(戊):
表四中 信賴區間為 ,其中心點即為兩組樣本平均數差值 :
報表中已知 ,因此:
因此表四(戊)精確為 。
第 3 題14 分
- 研究者接著建立迴歸模型如下:,其中 為誤差項(error term)。使用 R 語言與 75 組資料進行迴歸分析(但不考慮 ),使用 lm 與 summary 指令,部份報表如表六所示。以下敘述哪些或哪一項正確?
(A) 表六(庚)為 66.278。
(B) 表六(辛)約為 2.9(四捨五入至小數點後第一位)。
(C) 表六(壬)小於 0.3081。
(D) 從表六的「p-value: 1.743e-06」可推論得到「、 皆顯著異於 0」。
(E) 如果研究者考慮自變數 ,另建立新迴歸模型 ,這個新迴歸模型有線性重合的問題。
表六
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) (庚) 2.086 (??) < 2e-16 ***
xK (??) (辛) -4.330 4.75e-05 ***
xL -13.322 2.468 (??) 8.22e-07 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 8.849 on (??) degrees of freedom
Multiple R-squared: 0.3081, Adjusted R-squared: (壬)
F-statistic: 16.03 on 2 and (??) DF, p-value: 1.743e-06
登入後即可作答並保存紀錄。
核心觀念
- 虛擬變數(Dummy Variable)與參考組(Reference Group):
若定性變數有 個類別,在包含截距項的迴歸模型中,只能放入 個虛擬變數,否則會發生完全共線性(Dummy Variable Trap)。此時未被納入模型的類別為「基準組(Reference Group)」,截距項 代表基準組的母體平均數;其餘虛擬變數的迴歸係數代表各組相對於基準組的平均數差異。 - 樣本平均數與樣本數的對應關係:
在僅含一組互斥且窮盡的虛擬變數迴歸模型中,OLS 的估計結果本質上等同於單因子變異數分析(One-way ANOVA)。各組在模型中的預測值即為該組的樣本平均數:- 基準組(N 區):
- K 區:
- L 區:
全體樣本平均數 為各組樣本平均數以分行數(或比例)為權數的加權平均:
- 迴歸報表統計量之關係:
- 估計值、標準誤與 檢定統計量:
- 判定係數與調整後判定係數: 其中 為樣本數, 為自變數個數。只要 且 ,必有 。
- 整體模式檢定(Overall -test):
虛無假說為 ;若 ,僅能拒絕 ,推論「 與 至少有一個顯著不為 0」,而非「兩者皆顯著不為 0」。
- 完全多元共線性(Perfect Multicollinearity):
因每家分行必屬於三區之一,故 。若模型同時包含截距項(常數項 )與全部三個虛擬變數,設計矩陣的行向量之間存在嚴格線性關係,將導致完全共線性。
解題方法
1. 計算各區比例與樣本數
由表一可知:
- 全體平均數 ,
- K 區比例 (即 家)
- L 區比例 (即 家)
- N 區比例 (即 家)
2. 計算截距項 (庚)
模型以 N 區為基準組,各區平均數分別為:
又全體平均數為各區平均數之加權總和:
整理後得到:
由 OLS 殘差性質或 OLS 估計式在組間不平衡單因子模型的精確標準誤公式:
基準組平均數估計值的標準誤為 。
驗證表六給定數值:
這完全吻合報表數值。因此:
- 係數之標準誤:
- 則 的估計值 為:
第 4 題14 分
- 另一位研究者主張:在進行推論前,最好先確認誤差項是否滿足某些性質。延續使用迴歸模型 (不考慮 ),就殘差(residual)進行分析,使用 R 語言的幾個指令(shapiro.test、jarque.bera.test、durbinWatsonTest、ncvTest)分別得到報表,整理為表七至表十。以下敘述哪些或哪一項正確?
(A) 無證據支持「誤差項服從常態分配」的說法。
(B) 可推論得到「誤差項相互獨立」。
(C) 可推論得到「誤差項變異數為同質」。
(D) 表八(癸)為 2。
(E) 表八使用的檢定統計量服從之分配具有無記憶性質。
表七
Shapiro-Wilk normality test
W = 0.97383, p-value = 0.1223
表八
Jarque Bera Test
X-squared = 2.8262, df = (癸), p-value = 0.2434
表九
lag Autocorrelation D-W Statistic p-value
1 0.2010495 1.57683 0.032
Alternative hypothesis: rho != 0
表十
Non-constant Variance Score Test
Variance formula: ~ fitted.values
Chisquare = 15.40203, Df = (??), p = 8.6895e-05
登入後即可作答並保存紀錄。
核心觀念
本題考核古典線性迴歸模型(Classical Linear Regression Model, CLRM)的殘差診斷與基本假設檢定,主要涵蓋四大檢定工具之虛無假說、對立假說、檢定統計量分配及其結論判定:
-
常態性檢定(Normality Test):
- Shapiro-Wilk 檢定:檢定殘差是否來自常態母體。
- :誤差項服從常態分配 vs. :誤差項不服從常態分配。
- Jarque-Bera (JB) 檢定:利用樣本偏態係數()與峰態係數()建構檢定統計量:
- 自由度固定為 (限制條件為常態之偏態 與超額峰態 )。
- :誤差項服從常態分配 vs. :誤差項不服從常態分配。
- Shapiro-Wilk 檢定:檢定殘差是否來自常態母體。
-
自我相關檢定(Autocorrelation Test):
- Durbin-Watson (D-W) 檢定:檢定一階自相關(AR(1))。
- (無自相關)vs. (存在一階自相關)。
- Durbin-Watson (D-W) 檢定:檢定一階自相關(AR(1))。
-
同質變異檢定(Heteroscedasticity Test):
- Non-constant Variance Score Test(Cook-Weisberg Score Test / Breusch-Pagan 檢定類型):
- :誤差項變異數為同質(常數)vs. :誤差項變異數具有異質性。
- Non-constant Variance Score Test(Cook-Weisberg Score Test / Breusch-Pagan 檢定類型):
-
機率分配性質:
- 卡方分配 的特例:當自由度 時, 即為參數 之指數分配(Exponential Distribution),具備「無記憶性」(Memoryless Property)。
解題方法
題目設定顯著水準 。決策法則為:
- 若 ,拒絕 (有充分統計證據支持 )。
- 若 ,不拒絕 (無充分證據推翻 )。
1. 常態性檢定判定(表七、表八)
- 表七(Shapiro-Wilk):。
- 表八(Jarque-Bera):。
- 結論:兩者皆不拒絕 ,表示「未有充分證據顯示誤差項不服從常態分配」(即資料與常態分配相符,不能說無證據支持常態性)。
2. 自相關檢定判定(表九)
- 表九(Durbin-Watson):。
- 結論:拒絕 。
第 5 題14 分
5.(本題與第 1-4 題無關)某研究機構針對某議題請 400 位受訪者表達意見,意見可分為贊成、不贊成、沒意見。表十一呈現對應的符號與數據,舉例來說,贊成者佔社會大眾的母體比例為 ,400 位受訪者中有 216 位贊成。
表十一
| 意見 | 贊成 | 不贊成 | 沒意見 |
|---|---|---|---|
| 母體比例 | |||
| 表達該意見的受訪者人數 | 216 | 160 | 24 |
以下敘述哪些或哪一項正確?
(A) 在 95% 信心水準下, 的雙尾信賴區間下限為 。
(B) 令 , 小於 的機率為 0.025。
(C) 研究者可以考慮下列假說檢定:,,經計算後得到「無法拒絕虛無假說」的推論。
(D) 在 95% 信心水準下, 的雙尾信賴區間下限為 。
(E) 研究者可以考慮下列假說檢定:,,檢定統計量的值為 。
登入後即可作答並保存紀錄。
核心觀念
本題主要測驗以下統計學核心觀念:
- 單一母體比例的大樣本信賴區間:利用中央極限定理(CLT),以樣本比例 近似常態分配建立信賴區間。
- 信賴區間的機率詮釋:信賴水準的意義是指「方法」在重複抽樣下涵蓋真實參數的長期比例;當區間上下限已被具體數據計算出來後,該固定區間包含或不包含固定參數的機率只有 0 或 1,不可直接賦予機率值。
- 單一母體比例的大樣本單尾檢定:檢定虛無假說 ,利用標準化檢定統計量 進行決策。
- 多項分配(Multinomial Distribution)下同一樣本內兩個比例之比較:
- 傳統「兩獨立母體比例差」的變異數為 。
- 但若來自同一個多項試驗樣本,各類別樣本比例 與 互不獨立,其共變異數為負相關: 因此 。
解題方法
樣本總人數 。
- 贊成者人數 ,樣本比例 。
- 不贊成者人數 ,樣本比例 。
- 沒意見者人數 ,樣本比例 。
依據上述統計量,逐一檢驗各選項之統計模型、區間估計及假說檢定。
選項分析
-
(A) 正確:
在 95% 信心水準下,。
單一母體比例 的大樣本雙尾信賴區間公式為:代入數值:
因此雙尾信賴區間下限確為 。
-
(B) 錯誤:
在古典統計學(頻率學派)中,母體參數 是一個未知但固定的常數,而算出來的具體數值 也是一個固定的實數。
因此, 這件事要嘛成立、要嘛不成立,其機率非 0 即 1,不能說機率為 0.025。
只有在抽樣前,將端點視為隨機變數的區間涵蓋真實參數之機率為 0.95,單邊未涵蓋的機率為 0.025。 -
(C) 錯誤:
檢定假說為 vs 。
在大樣本下,標準化檢定統計量 為:
第二部份:單選題(第 6-11 題,總共 30 分,每題 5 分,答錯倒扣 1.3 分,至多扣至本部份總分為 0 分;未作答者,該題以零分計。)
【題組,包括第 6-7 題】、、 為三個獨立同態的隨機變數,皆服從常態分配,期望值皆為 0,變異數皆為 。令 ,,。
第 6 題5 分
- 計算 的期望值,答案是以下何者?
(A)
(B)
(C)
(D)
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
本題的核心觀念為常態母體下樣本變異數的抽樣分配與卡方分配的分數階動差(Fractional Moments):
- 樣本變異數之抽樣分配:
若 ,則: 本題樣本數 ,故自由度為 。隨機變數 。 - 卡方分配與 Gamma 分配的關係:
若 ,則等價於 (採尺度參數表示法,機率密度函數中含 )。 - Gamma 分配的一般動差公式:
若 ,對任意滿足 的實數 ,其 階動差為: - Gamma 函數的重要性質:
、、以及遞迴關係式 。
解題方法
步驟一:確認 的機率分配
由題意知,,樣本數 。
樣本變異數為:
因此:
步驟二:利用動差公式求
欲求之期望值為 ,即為卡方分配的 階動差。
卡方分配 即為 。
代入自由度 ,可得 ,。
將 、、 代入 Gamma 動差公式:
利用 Gamma 函數遞迴式:
第 7 題5 分
- 計算 的期望值,答案是以下何者?
(A)
(B)
(C)
(D)
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
-
樣本變異數的抽樣分配:
若隨機樣本 ,則樣本變異數 經標準化後的統計量服從自由度為 的卡方分配:本題中 ,故:
-
卡方分配的分數階動差(Fractional Moments of Chi-Square Distribution):
若隨機變數 ,其一般階動差公式為:其中 為伽瑪函數(Gamma function),具性質 ,且 、。
解題方法
-
將樣本標準差 表示為卡方隨機變數 的函數:
由題目定義:取期望值可得:
-
計算卡方隨機變數的 次方期望值 :
因為 ,代入卡方動差公式(其中自由度 ,):利用伽瑪函數性質:
因此:
-
計算 :
將 代回 的式子中:
【題組,包括第 8-9 題】連續型二元隨機變數 之聯合機率密度函數如下:
第 8 題5 分
- 計算條件機率 ,答案是以下何者?
(A)
(B)
(C)
(D)
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
本題評量重點為「連續型隨機變數之條件機率密度函數(Conditional PDF)」與「條件機率計算」,特別是變數定義域(Support)在給定條件下的幾何邊界限制。
主要涉及的定理與公式如下:
- 邊際機率密度函數(Marginal PDF):
若連續型隨機變數 的聯合機率密度函數為 ,則 的邊際機率密度函數為: - 條件機率密度函數(Conditional PDF):
在給定 (滿足 )的條件下, 的條件機率密度函數定義為: - 條件機率計算與定義域截斷:
條件機率為條件 PDF 在給定事件區間上的積分。特別注意:聯合分配的定義域為 ,當給定 時, 的條件定義域受限於 。因此,任何超出此範圍的區間其機率密度皆為 。
解題方法
步驟一:求 的邊際機率密度函數
題目給定聯合機率密度函數為:
對 進行積分以求得 ,積分上下限由條件 決定(此時 ):
步驟二:求給定 下 的條件機率密度函數
根據條件機率密度函數定義:
將 代入,得條件 PDF 及其有效定義域:
步驟三:計算條件機率
事件區間為 ,但在給定 的前提下, 的取值範圍嚴格限制於 。當 時,。
第 9 題5 分
- 計算條件機率 ,答案是以下何者?
(A)
(B)
(C)
(D)
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
本題評量連續型二元隨機變數的條件機率計算與相依變數之積分區域判斷,涉及以下核心觀念與公式:
-
條件機率定義:
對於兩事件 與 (且 ),條件機率公式為:在本題中,令 、,則:
-
邊際機率密度函數(Marginal PDF)與累積機率:
的邊際密度函數為對 的全範圍積分:進而可求得分母 。
-
不等式限制下的聯合積分區域確定:
隨機變數的支撐集(Support)為 。當加入條件 時,自然隱含 。因此事件中的上界 成為冗餘限制(redundant constraint),交集事件的有效積分區域為:
解題方法
步驟一:計算分母
先求 的邊際機率密度函數 。由於支撐集限制為 :
因此,事件 的機率為:
步驟二:確定分子事件之積分區域並計算
分子事件為 ,配合支撐集條件 ,可得:
(因為 ,故 必然小於 ,條件 自然成立)。
在此區域內對聯合機率密度函數進行雙重積分(先對 積分,再對 積分):
進行逐項定積分:
【題組,包括第 10-11 題】 為一組來自均勻分配 母體之隨機樣本,此分配之機率密度函數如下:
第 10 題5 分
- 令 ,當 是以下何者時可使得 為 的不偏估計元?
(A) 5
(B) 4
(C) 3
(D) 2
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
- 順序統計量(Order Statistics)之機率分配:
設 ,樣本數為 。其最小順序統計量定義為 。- 母體之累積分布函數(CDF)為:
- 母體之存活函數(Survival Function)為:
- 最小值 的存活函數與累積分布函數分別為:
- 微分可得 之機率密度函數(PDF):
- 均勻分配順序統計量的期望值性質:
標準化變數 ,其第 個順序統計量服從貝他分配(Beta Distribution):
因此,其期望值為:
當 (最小值)時:
- 不偏估計元(Unbiased Estimator):
估計元 滿足 ,則稱 為 的不偏估計元。
解題方法
本題給定樣本數 。
步驟一:計算 的期望值
方法一:利用尾端機率積分(Tail Probability Formula,最為迅速)
因為 ,對於非負隨機變數,其期望值可由存活函數積分求得:
帶入 及 :
令變數代換 ,則 ;
第 11 題5 分
- 令 ,當 是以下何者時可使得 為 的不偏估計元?
(A)
(B)
(C)
(D)
(E) 以上皆非
登入後即可作答並保存紀錄。
核心觀念
本題評量**順序統計量(Order Statistics)的機率分配推導及其在不偏估計(Unbiased Estimation)**上的應用:
- 最大順序統計量(Maximum Order Statistic)之分配:
設 為來自連續型母體之獨立且同分配(i.i.d.)隨機樣本,累積分配函數為 。其最大值 之累積分配函數(CDF)為: 微分後可得機率密度函數(PDF): - 不偏估計量(Unbiased Estimator)之定義:
若估計量 滿足 ,則稱 為母體參數 的不偏估計量。若 (其中 為常數),則取常數倍 ,可得修正後的估計量 滿足 。
解題方法
步驟一:求 的累積分配函數(CDF)
由題目給定之均勻分配 ,其機率密度函數為:
在區間 內,累積分配函數為:
步驟二:求最大值 的機率密度函數(PDF)
本題樣本數 ,。
其累積分配函數為:
對 微分求得機率密度函數:
步驟三:計算 的期望值
利用連續型隨機變數期望值定義:
計算積分: