108 年 國立臺灣大學財務金融研究所丙組《商用統計學》
I. 統計個案分析(共 50 分,每題 5 分)
大木博士欲研究皮丘進化成皮卡丘的決定因子;隨機取得 20 隻皮丘和進化與否的資料,整理如下列表格。 為一虛擬變數,若皮丘寶寶進化成皮卡丘,則 ;反之 。 為皮丘和飼主過去一個月的訓練次數,假設 遵循常態分配。
| 編號 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| 進化 () | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| 訓練次數 () | 4 | 5 | 5 | 6 | 6 | 6 | 7 | 7 | 9 | 9 |
| 編號 | 11 | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 |
|---|---|---|---|---|---|---|---|---|---|---|
| 進化 () | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 訓練次數 () | 1 | 2 | 3 | 3 | 3 | 4 | 4 | 4 | 6 | 6 |
請協助大木博士完成以下十個統計問題;如有需要,請檢附簡單的計算過程。
(附錄:標準常態機率表 Standard Normal probabilities,請對照原卷第 4 頁)
第 1 題5 分
- 請問 的勝算率 (odds ratio) 是多少?
登入後即可作答並保存紀錄。
核心觀念
-
勝算(Odds)的定義:
在二元分類問題中,事件發生的機率若為 ,則事件不發生的機率為 。定義該事件的**勝算(Odds)**為事件發生機率與不發生機率之比值:勝算的取值範圍為 。當 時,代表事件發生與不發生的機率完全相等。
-
名詞辨析(Odds vs. Odds Ratio):
- Odds(勝算/賠率/比數):針對「單一事件或單一群體」,計算發生機率與未發生機率之比值(即 )。
- Odds Ratio(勝算比/交叉比,OR):針對「兩個不同群體或條件」,計算兩組勝算的比值(即 )。
- 本題題目敘述為「 的勝算率 (odds ratio)」,且未給定任何分組條件或自變數,屬於商管研究所考題常見的英文中譯混用(將單一變數的勝算 Odds 誤植標註為 odds ratio)。考場上面對此類語病,應精準鎖定核心:求解樣本中 的勝算(Odds)。
解題方法
-
統計樣本頻率:
檢視題幹資料,樣本總數 隻皮丘:- 進化成功()的個體:編號 1 至 10,共 隻。
- 進化失敗()的個體:編號 11 至 20,共 隻。
-
計算邊際機率:
在未給定 的條件下, 的邊際機率估計值為:
第 2 題5 分
- 若 的母體均數為 ,變異數為 ;請完整寫下機率函數 。
登入後即可作答並保存紀錄。
核心觀念
本題考查連續型隨機變數的常態分配(Normal Distribution)之機率密度函數(Probability Density Function, PDF)的標準數學定義。
設隨機變數 服從常態分配,記為 ,其中母體平均數為 、母體變異數為 (母體標準差為 )。一個完整的機率函數(機率密度函數)表示式,除了核心的指數函數型態之外,必須明確標註隨機變數的定義域(Support,即取值範圍)與母體參數之限制範圍,方屬嚴謹完整的數學表達。
解題方法
-
常態分配之機率密度函數基本公式:
對於連續型常態隨機變數 ,其機率密度函數定義為:或等價展開寫作:
-
完整表達要素檢視:
- 常態化常數(Normalizing Constant): 或 ,確保曲線下面積全積分等於 1,即 。
第 3 題5 分
- 給定 、 為常數,請問 為何?
登入後即可作答並保存紀錄。
核心觀念
本題評量隨機變數之線性轉換(Linear Transformation)下的變異數性質。
對於任一隨機變數 與常數 :
- 常數平移不影響變異數:變異數衡量的是資料與其平均數的離散程度。將所有數值加上常數 ,僅代表整體分佈平移,離散程度保持不變,即 。
- 尺度縮放會平方放大:若將數值放大 倍,其離散程度會放大 倍,對應的變異數則放大為 倍,即 。
綜合以上性質,可得通用定理:
解題方法
此題形式上可有兩種呈現方式:
- 代數形式:以 (或記為 )表示通用公式。
- 數值形式:將題幹所給的 20 筆樣本資料計算出 的變異數後代入。
為求嚴謹完整,以下分別給出性質的數學推導,以及樣本數值的代入結果。
1. 變異數性質之嚴謹推導
依變異數之數學期望值定義:
令 。由期望值的線性性質可知:
將此結果代入變異數定義式:
2. 若需結合題幹樣本資料計算
若評分標準要求計算出該組皮丘樣本的特定數值:
- 樣本總數 。
- 觀察值總和 :
- 進化組():
- 未進化組():
第 4 題5 分
- 請畫出 變數的 Normal quintile plot (Q-Q plot);需標記 x 軸和 y 軸數值。請解釋為何 看起來不像常態分配資料。(3+2 分)
登入後即可作答並保存紀錄。
核心觀念
常態分位圖(Normal Quantile-Quantile Plot,簡稱 Normal Q-Q Plot) 是一種用來檢驗單變量樣本資料是否來自常態母體的圖形診斷工具。
-
基本原理:
- 將樣本容量為 的觀測值由小到大排序,得到順序統計量 。
- 計算每一筆觀測值對應的累積機率點(Plotting Position),常見公式為:
- 透過標準常態分配累積分布函數的逆函數(分位數函數)找出對應的理論分位數(Theoretical Quantiles):
- 將點對 (或 )繪製於平面坐標圖上。
-
判讀準則:
- 若資料服從常態分配:散佈點會緊密落在斜率為正的一條直線上(即 )。
- 若資料不服從常態分配:點群會顯著偏離直線,常見形態包括:
- 階梯狀水平橫線:資料為離散型且包含大量重複值(Ties)。
- S 型或倒 S 型曲線:厚尾(Heavy-tailed)或輕尾(Light-tailed)。
- 向下或向上彎曲:右偏(Right-skewed)或左偏(Left-skewed)。
解題方法
步驟一:整理 的順序統計量與理論分位數
將 20 隻皮丘的訓練次數 合併並由小到大排列():
- 原始資料:
- 進化組():
- 未進化組():
- 排序後樣本 :
採用標準連續修正繪圖位置 ,查標準常態表可得對應的理論分位數 :
| 序號 | 樣本值 | 累積機率 | 理論常態分位數 |
|---|---|---|---|
| 1 | 1 | 0.025 | |
| 2 | 2 | 0.075 | |
| 3 | 3 | 0.125 | |
| 4 | 3 | 0.175 | |
| 5 | 3 | 0.225 | |
| 6 | 4 | 0.275 | |
| 7 | 4 | 0.325 | |
| 8 | 4 | 0.375 | |
| 9 | 4 | 0.425 | |
| 10 | 5 | 0.475 | |
| 11 | 5 | 0.525 | |
| 12 | 6 | 0.575 | |
| 13 | 6 | 0.625 | |
| 14 | 6 | 0.675 | |
| 15 | 6 | 0.725 | |
| 16 | 6 | 0.775 | |
| 17 | 7 | 0.825 | |
| 18 | 7 | 0.875 | |
| 19 | 9 | 0.925 | |
| 20 | 9 | 0.975 |
步驟二:繪製 Normal Q-Q Plot
以橫軸(x 軸)表示「理論常態分位數 」,縱軸(y 軸)表示「樣本觀測值 」:
第 5 題5 分
- 大木博士寫下虛無假設 ,試以卡方檢定檢驗該假設。請問檢定統計量卡方值為何?虛無假說在 5% 顯著水準下是否成立?(提示:)
登入後即可作答並保存紀錄。
核心觀念
本題旨在檢定常態母體的「單一母體變異數」(Single Population Variance)。相關核心定理與公式如下:
- 抽樣分配定理:
設隨機樣本 ,則樣本變異數 經標準化後,服從自由度為 的卡方分配:
- 假設檢定架構:
- 虛無假設
- 檢定統計量:
- 拒絕域判定:題目給定臨界值提示為 (右尾面積為 之臨界點)。當檢定統計量大於臨界值時,落在拒絕域,拒絕虛無假設 。
解題方法
步驟一:彙整樣本數據並計算樣本平均數
樣本總數 。將全體 20 隻皮丘的訓練次數 彙整如下:
- 群體(10 筆):
- 群體(10 筆):
計算樣本總和 :
求得樣本平均數:
步驟二:計算離均差平方和與樣本變異數
計算各資料點的離均差平方和 :
- (1 個):
- (1 個):
- (3 個):
- (4 個):
- (2 個):
- (5 個):
- (2 個):
第 6 題5 分
- 大木博士寫下第二個虛無假設 ,試以 檢定檢驗該假設。請問檢定統計量 值為何?虛無假說在 5% 顯著水準下是否成立?(提示:)
登入後即可作答並保存紀錄。
核心觀念
本題評量兩獨立常態母體變異數齊一性之 檢定(Test for Equality of Two Variances)。
-
基本假設:
兩組樣本分別來自獨立常態母體,即 且 ,樣本數分別為 、。 -
假設設定:
- 虛無假設 (兩組變異數相等)
- 對立假設 (兩組變異數不相等)
-
樣本變異數公式:
-
檢定統計量:
在 成立下,檢定統計量服從 分配:
一般商用統計學實務上,為便於查單側 表,通常將較大的樣本變異數置於分子,。
解題方法
步驟一:計算兩組之樣本平均數與樣本變異數
-
進化組(, ):
- 觀測值:
- 總和:
- 樣本平均數:
- 平方和:
- 離差平方和():
- 樣本變異數:
-
未進化組(, ):
- 觀測值:
- 總和:
- 樣本平均數:
- 平方和:
第 7 題5 分
- 大木博士寫下第三個虛無假設 。令 為成功進化樣本的平均訓練次數, 為沒有進化樣本的平均訓練次數。請寫出檢定統計量 之實際分配 (exact distribution);需註記分配自由度的值。
登入後即可作答並保存紀錄。
核心觀念
本題的核心觀念為雙獨立樣本平均數差異的假說檢定(Two-Independent-Sample -test)及其檢定統計量的精確抽樣分配(Exact Sampling Distribution)。
-
基本假設:
- 兩獨立母體皆服從常態分配:
,樣本數 。
,樣本數 。 - 在母體變異數未知但假設相等(齊一性假設,)的條件下,檢定統計量方具有實際精確分配(Exact Distribution)。
- 兩獨立母體皆服從常態分配:
-
合併變異數(Pooled Sample Variance)與標準誤:
- 兩組之樣本變異數分別為 與 ,其合併變異數估計量為:
- 樣本平均數差之估計標準差(即標準誤,題目記為 或常寫作 ):
-
檢定統計量之抽樣分配:
- 在虛無假設 為真的條件下:
- 統計量服從自由度為 之學生氏 分配(Student's -distribution)。
解題方法
- 確認樣本大小:
- 成功進化組():包含編號 1 至 10,樣本數 。
- 未進化組():包含編號 11 至 20,樣本數 。
第 8 題5 分
- 請以 檢定檢驗第三個假設。請問檢定統計量 值為何?虛無假說在 5% 顯著水準下是否成立?
登入後即可作答並保存紀錄。
核心觀念
本題考查**獨立雙樣本 檢定(Independent Two-Sample -test)**之檢定統計量計算與假設檢定決策。
-
基本設定與符號:
- 母體 1(進化組,):樣本數 ,樣本平均數 ,母體平均數 。
- 母體 0(未進化組,):樣本數 ,樣本平均數 ,母體平均數 。
- 題目假設 服從常態分配,且兩群體各自獨立。在同題組前述檢定中,已確認兩母體變異數具同質性()。
-
合併樣本變異數(Pooled Variance):
-
雙樣本差值 檢定統計量:
欲檢驗兩組平均訓練次數差值是否等於或超過特定數值 ( 或 ):
在 成立下, 統計量服從自由度 之 Student's 分配。
解題方法
本題題幹未重複列出前小題所設定之「第三個假設」文字,依原卷題組脈絡,大木博士之第三個假設係檢驗「進化組的平均訓練次數是否比未進化組至少多出 2 次」(即 vs );若原試卷題組第三個假設設定為檢驗兩組平均數是否存在差異(即 ),下文亦一併提供對應之標準計算。
步驟一:計算兩組之樣本統計量
-
進化組():
- 數值:
- 數值:
-
未進化組():
- 數值:
- 數值:
-
平均數差:
步驟二:計算合併樣本變異數與標準誤
- 合併樣本變異數 :
自由度 。
第 9 題5 分
- 大木博士想了解 分配和標準常態分配 之間的關係;請幫他寫出 分配如何由 形成。也請你幫大木博士說明為何隨機樣本變異數未知時,檢定統計量 服從 分配。(3+2 分)
登入後即可作答並保存紀錄。
核心觀念
本題旨在評量統計學中最基礎且核心的抽樣分配理論(Sampling Distribution Theory),主要包含兩大觀念:
- Student's 分配的嚴格數學定義:由相互獨立的「標準常態隨機變數 」與「卡方隨機變數 (除以其自由度後開根號)」之比值所構成。
- 單一樣本 檢定統計量的建構與推導:在常態母體假設下,利用母體變異數 未知時,以不偏估計量 取代 ,並透過 Cochran 定理(或常態樣本下樣本平均數與樣本變異數互相獨立之性質),證明該標準化比值完全符合 分配之結構。
解題方法
第一部分: 分配如何由標準常態分配 形成(3 分)
設有兩個相互獨立的隨機變數 與 :
- (標準常態分配)
- (自由度為 的卡方分配)
定義隨機變數 為 與其自由度調整後的卡方變數平方根之比值:
則隨機變數 服從自由度為 的 Student's 分配,記為 。
第二部分:說明 為何服從 分配(2 分)
題幹假設隨機變數 遵循常態分配,令隨機樣本為 ,樣本數為 。
步驟一:建構標準常態變數
由常態分配的線性組合性質可知,樣本平均數 滿足:
將其標準化,可得標準常態隨機變數:
步驟二:建構卡方隨機變數
令樣本變異數為 。在常態母體假設下,由抽樣分配理論(或 Cochran 定理):
此處自由度 。
步驟三:獨立性檢驗
常態母體下之獨立樣本具有一關鍵性質:樣本平均數 與樣本變異數 彼此統計獨立。因此,由 所構成的 與由 所構成的 亦相互獨立。
步驟四:代入 分配定義式化簡
將 與 代入 分配定義:
第 10 題5 分
- 如果大木博士想用統計軟體做單因子變異數分析 (ANOVA),檢定第三個虛無假設,請寫出對應的統計程式語法(寫出 SAS、Stata、R 任一統計軟體的語法即可,如所用語法為其他統計軟體亦請說明)。
登入後即可作答並保存紀錄。
核心觀念
- 單因子變異數分析(One-way ANOVA):
用於檢定一個具多個水準(分類變數)的自變數,對連續型依變數的母體平均數是否有顯著影響。在本題的情境中:- 依變數(Dependent Variable, Response):訓練次數 (連續型變數,服從常態分配)。
- 因子變數(Factor / Independent Variable):進化與否 (類別變數,有 與 兩組水準)。
- 第三個虛無假設():
在該題組的檢定架構中,第三個虛無假設為檢定「進化組」與「未進化組」的平均訓練次數是否相等: 在兩組獨立樣本且變異數齊一的假設下,單因子變異數分析的 檢定與雙樣本 檢定等價()。 - 統計軟體模型語法規範:
單因子 ANOVA 的模型公式一般表示為依變數 ~ 因子變數(即X ~ Y,注意因果與對應關係不可顛倒),且因子變數必須被宣告為類別型態(Factor/Categorical)。
解題方法
本題要求寫出執行該單因子 ANOVA 的統計軟體語法。題目允許 SAS、Stata、R 任擇其一。以下提供主流三種軟體的標準語法,並以 R 語言 與 SAS 作為主力示範:
方案一:R 語言語法(最推薦、最簡潔)
在 R 中,依變數為 X,分組變數為 Y。必須先確保 Y 轉換為因子向量 as.factor(Y),再使用 aov() 或 lm() 配合 anova():
# 確保 Y 為因子變數,並執行單因子變異數分析
fit <- aov(X ~ as.factor(Y), data = pikachu_data)
summary(fit)
註:亦可使用線性模型語法 summary(anova(lm(X ~ factor(Y), data = pikachu_data)))。
II. 迴歸分析(共 50 分,每題 5 分,本部分為選擇或填充題,作答時請直接寫出題號及答案,<u>不需要</u>附上計算過程。)
假設公司執行長 (CEO) 的薪資(,單位為新台幣元)取對數後受到受教育的年數 (),工作年資(,單位為年),以及天生的能力 () 的影響:
其中 ,,及 皆為正值,且三個解釋變數與 皆無關。由於無法觀察到 CEO 的能力,小光使用古典最小平方法 (ordinary least square, OLS) 估計教育及年資對於 CEO 薪資的影響得到以下結果:
(第 12 題起,小光改以 CEO 的智商 作為能力的代理變數,估計 (3) 式:,後續各題沿用。)
第 11 題5 分
- 請問以下敘述何者正確?注意答案可能不只一個。
(a) 若 ,則 為 的不偏估計式。
(b) 若 ,但 ,則 將傾向高估教育對於薪資的真實影響 ()。
(c) 若 ,但 ,則 將傾向低估教育對於薪資的真實影響。
(d) 若 ,但 ,則 為 的不偏估計式。
登入後即可作答並保存紀錄。
核心觀念
本題的核心為計量經濟學與迴歸分析中的遺漏變數偏誤(Omitted Variable Bias, OVB)。
在古典多元線性迴歸模型中,若真實的資料生成過程(Data Generating Process, DGP)包含未被納入迴歸式的解釋變數,且該遺漏變數與模型中的解釋變數相關,則古典最小平方法(OLS)估計式將失去不偏性(Unbiasedness)與一致性(Consistency)。
設真實模型為:
其中 。若估計時遺漏了 ,只估計簡化模型:
將遺漏變數 對模型中保留的解釋變數 進行輔助迴歸(Auxiliary Regression):
則 OLS 估計式的條件期望值滿足:
其中輔助迴歸係數矩陣為:
偏誤的方向與大小完全取決於真實係數 以及輔助迴歸係數 的符號與數值。
解題方法
令真實模型 (1) 與估計模型 (2) 中的變數對應為:
- 被解釋變數:
- 保留解釋變數:(教育年數)、(工作年資)
- 遺漏變數:(天生能力)
- 題目給定參數條件:、、
將遺漏變數 對 與 作輔助迴歸:
由多元迴歸係數公式,展開兩者之係數:
令分母之行列式值為 (其中 為 與 之相關係數,滿足 )。
根據此推導,對各選項的條件進行偏誤分析:
- 當 且 時:
分子皆為 0,得 且 。
因此: 兩者皆為不偏估計式。
第 12 題5 分
- 承第 11 題,但假設小光使用 CEO 的智商 () 作為 的代理變數 (proxy variable),並以 OLS 估計下式:
假設 ,,。請問以下敘述何者正確?注意答案可能不只一個。
(a) 為 的不偏估計式。
(b) 為 的不偏估計式。
(c) 為 的不偏估計式。
(d) 為 的不偏估計式。
登入後即可作答並保存紀錄。
核心觀念
本題考查計量經濟學中處理不可觀察變數(Unobserved Explanatory Variable)的代理變數法(Proxy Variable Approach)及其 OLS 估計式之不偏性(Unbiasedness)。
-
真實模型(True Model):
其中 為無法直接觀測的潛在變數(Latent Variable)。若直接忽略 會導致遺漏變數偏誤(Omitted Variable Bias, OVB)。
-
代理變數假設(Proxy Variable Assumptions):
小光使用 作為 的代理變數,依計量經濟學標準設定(Wooldridge 代理變數架構):- 與所有解釋變數及代理變數均外生不相關:。
- 給定代理變數 後, 與其餘解釋變數條件獨立,即滿足: 定義誤差項 ,則滿足條件期望值 。
解題方法
將無法觀測的 表為代理變數 與誤差項 的線性關係:
將上式代入真實母體迴歸式 (1):
展開並重新整理同類項,可得實際估計的迴歸模型:
其中複合誤差項為 。
檢驗複合誤差項 的條件期望值:
由於複合誤差項與式中的所有自變數外生獨立,小光以 OLS 估計式 (3):
第 13 題5 分
- 承第 12 題,但假設 ,,,,。請問以下敘述何者正確?注意答案可能不只一個。
(a) 將傾向高估教育對於薪資的影響。
(b) 將傾向低估教育對於薪資的影響。
(c) 將傾向高估年資對於薪資的影響。
(d) 將傾向低估年資對於薪資的影響。
登入後即可作答並保存紀錄。
核心觀念
本題評量計量經濟學中的**代理變數偏誤(Proxy Variable Bias)與遺漏變數偏誤(Omitted Variable Bias, OVB)**之數學推導與方向判定。
-
真實母體迴歸模型(True Model):
其中已知 、、。
-
代理變數的輔助投影關係(Linear Projection):
當無法觀測未知的變數 時,若引入代理變數 ,並假設 對所有納入迴歸的自變數進行條件期望投影:滿足 。
-
估計式期望值與偏誤公式:
將輔助投影式代入真實母體模型,可導出使用 OLS 估計實證模型時各係數估計量的期望值:- 若偏誤項 ,則 ,估計量**高估(Overestimate / Positive Bias)**真實影響。
- 若偏誤項 ,則 ,估計量**低估(Underestimate / Negative Bias)**真實影響。
解題方法
-
代入推導估計方程式:
依題意,第 12 題小光估計的實證模型(3)為:將題幹條件 代回母體模型 (1):
整理同類項:
-
計算各估計量的偏誤方向:
令新誤差項為 ,因 ,對此式進行 OLS 迴歸,估計量
第 14 題5 分
- 承第 13 題,請寫出 。
登入後即可作答並保存紀錄。
核心觀念
本題考查計量經濟學中代理變數(Proxy Variable)之估計式期望值與遺漏變數偏誤(Omitted Variable Bias, OVB)的推廣。
在母體真實模型中,未被觀察到的能力變數 由智商變數 作為代理變數替代。
令真實母體關係為:
設未觀察到的潛在變數 與代理變數 以及其他解釋變數之間的線性投影(Linear Projection)關係為:
(若滿足嚴格的「良質代理變數條件」,即 ,則 ;但一般情況或更廣義的輔助迴歸設定下,將 對迴歸式 (3) 中的全部自變數進行迴歸)。
將 代入式 (1),可得實務上估計之式 (3) 的母體對應關係:
因此,當使用古典最小平方法 (OLS) 估計式 (3) 時:
係數估計量 的期望值即為該複合母體參數:
其中 為控制了 與 之後, 對 之輔助迴歸(Partial Regression)的斜率係數。
解題方法
步驟一:輔助迴歸(Auxiliary Regression)設定
在多元迴歸模型中,遺漏真正的潛在變數 並以 替代後,估計式 (3):
根據 Frisch-Waugh-Lovell 定理(FWL 定理)或 OLS 遺漏變數期望值公式,估計係數 的期望值滿足:
更精確地說,考慮將遺漏之變數 對模型 (3) 中所有的解釋變數 作線性迴歸:
其中 為在控制 與 下, 對 的偏效應(partial effect):
第 15 題5 分
- 若小光在估計 (3) 式時將 的衡量單位由年改為月,請問以下敘述何者正確?注意答案可能不只一個。
(a) 將變大為原來的 12 倍。
(b) 的標準誤 (standard error) 將變大為原來的 12 倍。
(c) 檢定 是否為零的 值將不受影響。
(d) 迴歸的判定係數 () 將不受影響。
登入後即可作答並保存紀錄。
核心觀念
本題考查多元迴歸分析中解釋變數「衡量單位變更(Data Rescaling)」對 OLS 估計結果的影響。
主要涉及以下核心定理與性質:
- 迴歸係數與尺度變換:若將某一解釋變數乘以常數 (即 ),為了維持相同的擬合效果,該變數對應的迴歸係數估計值會縮放為原來的 倍,即 。
- 係數標準誤(Standard Error):。
- 假設檢定之 統計量不變性:檢定係數是否為零的 統計量為係數與標準誤的比值,分子與分母等比例縮放,故 值保持不變。
- 配適度不變性:對解釋變數進行非零常數縮放,屬於線性變換,不改變解釋變數所張成(span)的線性子空間,因此被解釋變數的預測值 、殘差 、殘差平方和(SSE)、總平方和(SST)以及判定係數()皆完全不受影響。
解題方法
-
定義變數單位的數學關係:
原變數 單位為「年」,新變數記為 ,單位為「月」。
因為 1 年等於 12 個月,故有: -
代入估計式 (3) 觀察係數變化:
將 代入原迴歸估計式:整理後可得:
令新迴歸模型中 的係數為 ,則:
即新係數變為原來的 倍(縮小為原來的十二分之一)。
-
推導標準誤與 統計量:
- 標準誤:
第 16 題5 分
- 若小光在估計 (3) 式時將 的衡量單位由新台幣改為美元(假設 1 美元 = 30 新台幣),請問以下敘述何者正確?注意答案可能不只一個。
(a) 將比原來小。
(b) 將縮小為原來的 1/30。
(c) 的標準誤 (standard error) 將縮小為原來的 1/30。
(d) 迴歸的判定係數 () 將不受影響。
登入後即可作答並保存紀錄。
核心觀念
本題的核心觀念為對數轉換模型(Logarithmic Regression Model)的單位變更(Data Scaling)效應。
在古典線性迴歸模型中,當被解釋變數取對數型態(即 )時:
- 變數單位縮放的對數性質:若原始變數 乘以(或除以)一個常數 (令 ),取對數後為: 這相當於被解釋變數整體平移一個常數 ,而非等比例縮放。
- OLS 估計式的不變性(Invariance of Slope Estimators):由於斜率係數由離差 cross-product 決定, 對其樣本平均數的離差滿足: 因此,所有解釋變數的斜率係數估計值、殘差、殘差變異數估計值、斜率估計值的標準誤(Standard Error),以及判定係數()皆完全維持不變。
- 截距項的改變:常數項平移全部由截距項吸收,新截距估計值為 。
解題方法
給定原模型估計式 (3):
其中 單位為新台幣元。
現將薪資單位改為美元,令 (即 1 美元 = 30 新台幣)。
新的被解釋變數為:
為求估計係數的變化,分別檢視截距項、斜率項、殘差與 :
-
斜率估計式 ():
根據 OLS 矩陣公式,斜率向量為 ,其中 為離差變換矩陣。
因 (常數向量的離差為 0),故:所有斜率估計值維持不變。
-
截距估計式 :
第 17 題5 分
- 假設小光估計 (3) 式時想要同時檢測年資對於薪資的影響在男性與女性 CEO 之間是否相同。小光考慮創造兩個虛擬變數: 及 。若 CEO 為男性則 ,;若為女性,則 ,。請問小光可以如何修改迴歸模型及進行檢定?注意答案可能不只一個。
(a) 估計 ,檢定 是否為 0?
(b) 估計 ,檢定 是否為 0?
(c) 估計 ,檢定 是否等於 ?
(d) 估計 ,檢定 是否等於 ?
登入後即可作答並保存紀錄。
核心觀念
- 交互作用項(Interaction Term)與斜率差異:
欲探討某個連續變數(如工作年資 或受教育年數 )對應變數的邊際效果在不同群體(如性別)間是否存在差異,必須在迴歸模型中納入「該連續變數與群體虛擬變數(Dummy Variable)的乘積項」(即交互作用項)。 - 完全共線性(Multicollinearity)與虛擬變數陷阱(Dummy Variable Trap):
當類別為互斥且周延的兩組(男性與女性,滿足 )時:- 若模型中已包含常數項(截距項 ),則不可同時放入兩個群體各自的主效果虛擬變數( 與 ),否則會產生完全共線性(無法估計)。
- 同理,在斜率交互作用項中,若模型已包含未與虛擬變數相乘的連續變數基準主效果(例如 ),則交互作用項只能放入其中一個(例如 或 )。若同時不放基準連續變數,則可分別放入兩組的交互作用項。
- 題意目標變數的辨識:
題幹明確指出檢定目標為「年資()對於薪資的影響在男女之間是否相同」,這要求模型必須探討 的斜率性別差異;若模型修改的是教育年數()的斜率或僅調整截距項(平均薪資水準),皆與題意不符。
解題方法
欲檢測「年資()對薪資的邊際影響()在男女 CEO 間是否相同」,正確的模型建構方式有兩種:
-
基準組法(含基準斜率項):
以女性為基準組,設定模型包含 :此時:
- 女性的年資邊際效果為
- 男性的年資邊際效果為
- 檢定年資效果是否相同,即為檢定 。
-
分組交互項法(不含共同斜率項):
此時檢定 。
然而,檢視題目所給之四個選項:
- 選項 (a)、(b)、(c) 所建構之交互作用項皆為「教育年數與性別」之交乘項( 或 ),測量的是受教育年數()對薪資之邊際影響在男女間的差異,而非年資()。
- 選項 (d) 在模型中同時放入了常數項 、主效果虛擬變數 與 ,不僅落入虛擬變數陷阱(存在完全共線性 與 重合),且其檢定的是「控制其他變數下,男女 CEO 的薪資截距水準(基準薪資)是否有差異」,完全未探討年資的斜率效果。
因此,四個選項皆無法達成題幹所要求「檢測年資對於薪資的影響在男性與女性 CEO 之間是否相同」之目的。
選項分析
- (a) 錯誤:
第 18 題5 分
- 小光想比較 與 何者對於 的影響較大,請問可以使用以下哪種方法?注意答案可能不只一個。
(a) 直接估計 (3) 式,比較 與 的大小。
(b) 直接估計 (3) 式,比較 與 的大小, 代表標準差。
(c) 將 與 分別標準化後(扣除平均數再除以標準差)再估計 (3) 式,比較 與 的大小。
(d) 將 , 與 分別標準化後再估計 (3) 式,比較 與 的大小。
登入後即可作答並保存紀錄。
核心觀念
本題評量標準化迴歸係數(Standardized Coefficients / Beta Coefficients)與變數衡量單位(Units of Measurement)對 OLS 係數的影響。
在多元迴歸模型中:
OLS 估計係數 的經濟意義為「在控制其他變數不變下, 每增加 1 個自身衡量單位時, 的平均變動量」。
- 衡量單位不同導致無法直接比較:
當解釋變數具有不同的測量尺度或單位時(例如 單位為「年」,而 為「智力測驗分數」),直接比較 與 的大小毫無實質意義。 - 消除衡量單位影響的方法(標準化係數):
為了比較不同解釋變數對應變數的「相對重要性/相對影響力」,可將變數變動幅度換算為「變動 1 個標準差」,即計算標準化係數: 其中:- 當僅比較同一個迴歸方程式內不同解釋變數 與 對 的影響時,兩者的 相同。因此,比較 與 ,等價於直接比較 與 。
- 亦可直接在迴歸前將變數標準化為 分數(),估計後的係數即為無單位的標準化係數。
解題方法
欲比較受教育年數()與智商()對薪資()的相對影響大小,必須消除兩者測量單位的差異。
模型 (3) 為:
若 變動 1 個標準差(),對 的影響為:
若 變動 1 個標準差(),對 的影響為:
因此,比較兩者影響大小的正確做法有以下幾種途徑:
- 直接估計原模型後調整尺度:比較 與 。
- 將解釋變數標準化後再迴歸:將 與 分別標準化( 與 ),此時對應的新係數 即代表「 變動 1 個標準差對 的影響」,即 ,因此可直接比較新估計出的係數大小。
第 19 題5 分
- 小光覺得年資對於 CEO 薪資的影響可能為非線性,當年資較低時,年資增加對於薪資的正面幫助較大,但當年資已經很高時,再增加年資對於薪資的正面幫助較小。請問要如何修改 (3) 式來驗證以上的猜想?請同時根據此猜想寫出對於迴歸係數正負符號的預期。
登入後即可作答並保存紀錄。
核心觀念
本題考查多變量迴歸模型中**非線性關係的設定(Nonlinear Relationship)與邊際效益遞減(Diminishing Marginal Returns)**的計量模型建模技術:
- 多項式迴歸(Polynomial Regression):當自變數對應變數的影響呈現非線性彎曲特徵時,最常見且標準的作法是在模型中加入該自變數的二次項(Quadratic Term,即 )。
- 邊際效果與二階導數(Marginal Effect & Second Derivative):
- 年資 () 對對數薪資 () 的邊際效果為一階偏微分:
- 邊際效果隨年資增加而遞減,代表邊際效果對年資的微分為負(即二階偏導小於 0):
解題方法
1. 模型修正方式
題目指出「年資對於 CEO 薪資的影響為非線性」,為了捕捉隨年資增加而產生的邊際效果變化,應在 (3) 式中加入年資的平方項 。
將原 (3) 式修正為:
(若以樣本估計式表達,則為:)
2. 係數預期正負符號之推導
由修正後的模型,計算年資 對 的邊際效果:
根據小光的猜想:
- 年資對薪資整體呈正向幫助:
在年資較低時,增加年資能顯著提升薪資(邊際效果為正),因此要求一次項係數為正值:
第 20 題5 分
- 小光覺得在估計 (3) 式時應該要額外控制到 CEO 的薪資水準在不同產業間的差異。假設在樣本中的產業包括電子業,銀行業,及食品業三個產業,產業代碼分別為 1,2,3。請問小光可以怎麼修改模型以控制產業類別對於薪資水準的效果?注意答案可能不只一個。
(a) 估計 , 為產業代碼。
(b) 估計 ,若 CEO 在電子業服務則 ,否則 。若 CEO 在金融業服務則 ,否則 。
(c) 估計 ,若 CEO 在食品業服務則 ,否則 。
(d) 估計 。
登入後即可作答並保存紀錄。
核心觀念
本題的核心考點為名目尺度(質化變數)在迴歸分析中的處理方式,以及虛擬變數陷阱(Dummy Variable Trap)與完全多元共線性(Strict Multicollinearity)。
-
質化變數(類別變數)的量化原則:
- 產業類別屬於「名目尺度(Nominal Scale)」,各產業代碼(如 )僅代表類別標籤,不具備大小順序(Ordinal)或等距距離(Interval/Ratio)的數值意義。
- 若直接將代碼 作為連續變數納入模型,隱含假設「從電子業到銀行業的薪資差異」等於「從銀行業到食品業的薪資差異」,且產業效果呈現嚴格的等差線性關係,這在經濟學與統計學上完全不合理。
-
虛擬變數(Dummy Variable)設定法則:
- 若一個類別變數有 個互斥且周延的類別(本題 :電子業、銀行業、食品業),在迴歸模型**包含截距項()**的情況下,最多只能加入 個虛擬變數。
- 未被納入模型的那個類別稱為基準組(Reference Group / Base Group)。其餘納入模型的虛擬變數係數,衡量的是該組別相對於基準組的平均薪資差異。
- 若加入全部 個虛擬變數且同時保留截距項,將導致各虛擬變數之和等於常數 (即 ),與截距項對應的常數向量產生線性相依,形成完全共線性(Perfect Multicollinearity),稱為虛擬變數陷阱,此時普通最小平方法(OLS)的常態方程式無唯一解,參數無法估計。
解題方法
給定樣本中共有 3 個產業類別(),且模型中均包含截距項 :
- 為控制產業別對截距項(薪資基準水準)的固定效應,正確做法是建立 個產業虛擬變數。
- 基準組的選擇具有任意性,選取不同類別作為基準組,僅改變係數的經濟意涵(與何者作比較),模型整體的配適度()與預測值完全相同,均為有效且正確的設定方式:
- 以「食品業」為基準組:納入 與 (共 2 個虛擬變數)。
- 以「銀行業」為基準組:納入 與 (共 2 個虛擬變數)。
- 以「電子業」為基準組:納入 與 (共 2 個虛擬變數)。
因此,凡是恰好納入 2 個虛擬變數且保留截距項的模型設定,皆為正確控制產業差異的規格。
選項分析
- (a) 錯誤:
模型直接納入代碼變數 (代碼分別為 1, 2, 3)。名目變數的代碼數字無運算意義,直接代入會強制假定: