115 年 國立中央大學企業管理學系碩士班甲組《統計學》
第 1 題
- The following graph plots GDP per capita and CO2 emission per capita from 192 countries in 2022. The unit of CO2 emissions per capita is tons of CO2. The data of GDP per capita is real gross domestic product per person adjusted for inflation, converted to international dollars using purchasing-power-parity (PPP) rates.
🖼️【此處有附圖,請對照原卷】
a. What do you infer about the relationship between CO2 emissions and GDP based on this graph? Explain. (3分)
b. A researcher estimated a regression of CO2 emissions per capita on GDP per capita using all data and obtained the result of Model A. Use his estimation results to test the conjecture you answered in part (a). Construct your hypothesis and report the test results based on the 1% level of significance. (7分)
c. Another researcher excluded the country with the highest GDP per capita from the data, and re-estimated the regression, and obtained the result of Model B. Please explain why the estimated slope coefficient in Model A is lower than that in Model B. (5分)
| Model A | Model B |
|---|---|
| Variable | Coefficient |
| Constant | 3.077389 |
| GDP per capita | 0.000062 |
| R² | 0.212636 |
| Adjusted R² | 0.208492 |
| Number of observations | 192 |
登入後即可作答並保存紀錄。
這題主要考查散佈圖的判讀、迴歸分析的假設檢定以及離群值對迴歸結果的影響。
a. 散佈圖判讀
從圖中散佈圖的趨勢來看,GDP per capita 與 CO2 emissions per capita 之間呈現正相關關係。隨著 GDP per capita 的增加,CO2 emissions per capita 也傾向於增加。然而,這種關係並非完美的線性關係,存在較大的離散程度,特別是在較高的 GDP per capita 區間。這表示雖然經濟發展通常伴隨較高的碳排放,但不同國家在相同經濟水平下,碳排放量可能存在差異。
b. 迴歸分析假設檢定
核心觀念:迴歸分析中的迴歸係數顯著性檢定,以及如何根據檢定結果判斷關係是否存在。
假設檢定步驟:
-
建立假設:
- 虛無假設 ():GDP per capita 與 CO2 emissions per capita 之間沒有線性關係,即迴歸模型的斜率係數 等於 0。
- 對立假設 ():GDP per capita 與 CO2 emissions per capita 之間存在線性關係,即迴歸模型的斜率係數 不等於 0。
-
選擇檢定統計量:
在此我們進行斜率係數的 t 檢定。檢定統計量為:
其中 是估計的斜率係數, 是虛無假設下的斜率係數值(在此為 0),SE 是斜率係數的標準誤。 -
計算檢定統計量:
根據 Model A 的結果:
SE
-
決定檢定區域:
顯著水準 (1%)。由於是雙尾檢定(),我們需要找到 t 分配在自由度 下的臨界值。
樣本數 ,解釋變數數量 (GDP per capita)。
自由度 。
查詢 t 分配表或使用統計軟體,在 和 雙尾檢定下,臨界值約為 (近似值,因為 190 不一定在標準表中,但遠大於 30,趨近常態分配,或查表時取最接近的值)。 -
做出決策:
計算出的 t 值 大於臨界值 。
因此,我們拒絕虛無假設 。 -
結論:
在 1% 的顯著水準下,我們有足夠的證據支持 GDP per capita 與 CO2 emissions per capita 之間存在顯著的線性關係。
第 2 題
- Suppose we specify the following model to analyze whether the relationship between the aggregate consumption and income changed during the COVID-19 pandemic.
where indicates consumption and indicates income in quarter . is a dummy variable that takes value one during the COVID-19 pandemic and zero for the remaining part of the sample.
a. How can we use this model to test whether the autonomous consumption changed during the COVID-19 pandemic? (5分)
b. How can we modify the above model to test for structural change in both the autonomous consumption and in the marginal propensity to consume during the COVID-19 pandemic? Explain. (10分)
登入後即可作答並保存紀錄。
這題主要考查迴歸模型中 dummy variable 的應用,特別是如何用來檢定結構性改變。
a. 檢定自主性消費的改變
核心觀念:在迴歸模型中,常數項(intercept)代表了自變數為零時的應變數值,即自主性消費。若引入一個 dummy variable 與常數項互動,可以檢定自主性消費是否發生改變。
解釋:
模型為:
-
COVID-19 疫情前 ( ):
模型為
此時的自主性消費(當 時的 )為 。 -
COVID-19 疫情期間 ( ):
模型為
此時的自主性消費(當 時的 )為 。
因此,要檢定 COVID-19 疫情期間自主性消費是否發生改變,我們需要檢定參數 是否顯著。
檢定步驟:
-
建立假設:
- 虛無假設 ():疫情期間自主性消費沒有改變,即 。
- 對立假設 ():疫情期間自主性消費發生改變,即 。
-
進行統計檢定:
使用迴歸分析的結果,對係數 進行 t 檢定。如果 的 t 檢定結果在預設的顯著水準下(例如 5%)是顯著的(即 p-value 小於顯著水準),則拒絕 ,表明自主性消費在疫情期間發生了顯著改變。
b. 修改模型以檢定結構性改變(自主性消費與邊際消費傾向)
核心觀念:檢定結構性改變(structural break)通常涉及引入 dummy variable 的互動項(interaction terms),以允許迴歸模型的常數項和斜率項在不同時期有所不同。
解釋:
原模型 僅允許常數項(自主性消費)因 而改變。要同時檢定自主性消費 () 和邊際消費傾向 () 是否發生結構性改變,我們需要引入 與 的互動項。
修改後的模型:
第 3 題
- Consider the multiple regression model with four independent variables:
How do you test the null hypothesis ? Explain. (10分)
登入後即可作答並保存紀錄。
這題考查如何進行迴歸模型的聯合假設檢定(joint hypothesis testing),特別是當檢定式涉及多個迴歸係數的線性組合時。
核心觀念: 聯合假設檢定,通常使用 F 檢定來檢驗多個迴歸係數的線性組合是否滿足特定條件。
解釋與步驟:
我們需要檢定虛無假設 。這個假設涉及兩個迴歸係數的線性組合。
方法一:重新參數化(Restricted Regression)
-
重寫虛無假設:
我們可以將虛無假設改寫為 。 -
建立受限模型 (Restricted Model):
將這個關係代入原來的迴歸模型中:
重新整理後,這個受限模型可以寫成:
令 ,則模型變為:
這個新的模型有四個參數:。我們可以在這個受限模型下,對 進行迴歸,得到參數的估計值,並計算出其殘差平方和,記為 。 -
建立非受限模型 (Unrestricted Model):
非受限模型就是原始的模型:
在這個模型下進行迴歸,得到參數的估計值,並計算出其殘差平方和,記為 。 -
計算 F 統計量:
F 統計量的計算公式為:
其中:- 是樣本大小。
- 是原模型中解釋變數的個數(在此為 4)。
- 是虛無假設中約束的數量(在此為 1,因為我們約束了 )。
- 是非受限模型的自由度。
-
做出決策:
將計算出的 F 統計量與在顯著水準 下,自由度為 的 F 分配的臨界值 進行比較。- 如果 ,則拒絕虛無假設 。
- 否則,不拒絕虛無假設 。
第 4 題
- A marketing research firm wants to learn about consumers of canned coffee. Interviewers sent to various stores that sell canned coffee ask consumers who have purchased canned coffee the following question: "How many cans of coffee do you buy each week?" The researcher uses the sample average of the responses to estimate the mean of weekly consumption of canned coffee per person. Discuss the potential problems associated with this approach. (10分)
登入後即可作答並保存紀錄。
這題考查抽樣調查方法中可能遇到的潛在問題,特別是針對問卷設計和樣本平均值的解釋。
核心觀念: 抽樣調查的代表性、問卷偏差、量測誤差、樣本平均數作為總體平均數估計值的局限性。
潛在問題分析:
-
抽樣偏差 (Sampling Bias):
- 地點偏差: 訪問地點(販售罐裝咖啡的商店)本身可能就帶有偏差。例如,某些商店的顧客群可能與其他商店不同(例如,便利商店 vs. 大賣場,高檔超市 vs. 傳統市場)。
- 時間偏差: 訪問的時間點(例如,平日白天、週末、特定促銷期間)可能影響受訪者的購買行為。
- 問卷執行者偏差: 訪問員的提問方式、態度、甚至外觀,都可能無意中影響受訪者的回答。
- 受訪者選擇偏差: 誰會願意接受訪問?可能比較外向、有空、或對罐裝咖啡特別有意見的人更容易被訪問到,導致樣本無法代表所有罐裝咖啡的購買者。
-
測量誤差 (Measurement Error) / 回答偏差 (Response Bias):
- 記憶偏差 (Recall Bias): 受訪者可能無法準確回憶起過去一週購買了多少罐咖啡。他們可能會高估或低估。
- 社會期許偏差 (Social Desirability Bias): 受訪者可能傾向於給出他們認為「社會期望」的答案,例如,如果他們覺得自己買太多咖啡「不健康」或「花費過多」,可能會少報購買量。
- 理解偏差: 受訪者可能對「一週」的定義(是過去七天?還是上一個完整的日曆週?)或「罐裝咖啡」的定義(是否包含即溶包?是否包含咖啡飲料?)有不同的理解。
- 問題的引導性: 問題「How many cans of coffee do you buy each week?」相對直接,但如果問卷設計不當(例如,前一個問題在討論咖啡的健康益處),可能會影響回答。
第 5 題
a. Write down the probability mass function of the Poisson distribution. (4分)
b. Derive the moment generating function of this distribution. (6分)
c. Using the moment generating function, derive the expected value of the distribution. (4分)
d. Using the moment generating function, derive the variance of the distribution. (4分)
登入後即可作答並保存紀錄。
這題考查 Poisson 分布的定義、動差生成函數(Moment Generating Function, MGF)的推導及其應用,以求得期望值和變異數。
a. Poisson 分布的機率質量函數 (PMF)
核心觀念:Poisson 分布用於描述在固定時間間隔內或固定空間區域內,某事件獨立發生的次數。
解釋:
若隨機變數 服從參數為 的 Poisson 分布,記為 ,其中 是平均發生次數。則其機率質量函數 (PMF) 為:
其中 是自然對數的底數(約為 2.71828), 是 的階乘。
b. Poisson 分布的動差生成函數 (MGF)
核心觀念:動差生成函數 (MGF) 的定義,以及如何利用級數展開和數學期望的性質來推導。
解釋:
動差生成函數 的定義為 。
對於 Poisson 分布 ,我們有:
將 PMF 代入:
將常數項 提出級數外:
將 寫成 :
我們知道指數函數的 Maclaurin 級數展開為 。
令 ,則級數部分變為:
因此,Poisson 分布的動差生成函數為:
此 MGF 在 使得 收斂的範圍內成立。
c. 利用 MGF 推導期望值
核心觀念:動差生成函數的第 k 階導數在 t=0 時等於隨機變數的 k 階動差 。期望值是第一階動差 。
解釋:
期望值 是 在 的一階導數。
首先,我們對 進行一階導數:
使用鏈式法則(chain rule):
現在,將 代入:
第 一 題
- 某工廠有三台機器獨立運作。已知每月每台機器發生故障的機率為 0.01,則本月最多只有一台機器故障的機率為:
(A) 0.9997
(B) 0.9706
(C) 0.9703
(D) 0.9700
登入後即可作答並保存紀錄。
核心觀念
設本月發生故障的機器台數為 。由於三台機器彼此獨立,且每台機器故障機率均為 ,因此:
題目要求「最多只有一台機器故障」,即:
解題方法
分別計算三台機器皆正常,以及恰有一台故障的機率。
三台機器皆正常:
恰有一台機器故障:
因此:
四捨五入至小數點後四位:
選項分析
第 二 題
- 隨機變數A的期望值為8,變異數為25。隨機變數B的期望值為4,變異數為4。兩變數的相關係數為0.3,則 的變異數為
(A) 23
(B) 27
(C) 31
(D) 35
登入後即可作答並保存紀錄。
這題考查隨機變數和與差的變異數計算,以及相關係數的應用。
核心觀念: 兩個隨機變數和或差的變異數公式,以及變異數和協方差的關係。
解釋:
設隨機變數為 和 (題目中出現了 和 ,但根據題意應為 和 )。
已知:
我們需要計算 。
變異數公式為:
我們已知 和 ,但需要計算協方差 。
協方差與相關係數的關係是:
第 三 題
- 某統計學的考試,如果讀書的話,有90%的機率會及格。如果不讀書,則有60%的機率會及格。某班有70%的同學不讀書,而小黃同學考試及格,則小黃沒讀書的機率約為
(A) 90%
(B) 69%
(C) 61%
(D) 51%
登入後即可作答並保存紀錄。
這題考查貝氏定理 (Bayes' Theorem) 的應用,用來計算條件機率。
核心觀念: 貝氏定理,聯合機率,條件機率。
解釋:
首先,我們定義一些事件:
- : 小黃同學考試及格 (Pass)。
- : 小黃同學有讀書 (Study)。
- : 小黃同學沒有讀書 (Not Study)。
根據題目給的資訊,我們可以列出以下機率:
- 如果讀書,及格的機率:
- 如果不讀書,及格的機率:
- 班級中有 70% 的同學不讀書,所以小黃同學不讀書的機率:
- 從 可知,小黃同學讀書的機率:
我們要求的是「小黃同學考試及格,則小黃沒讀書的機率」,也就是條件機率 。
第 四 題
- 若隨機變數x的機率密度函數為
則常數a的值為
(A) 1/3
(B) 1
(C) 1.5
(D) 3
登入後即可作答並保存紀錄。
這題考查機率密度函數 (Probability Density Function, PDF) 的性質,特別是如何利用 PDF 在整個定義域上的積分等於 1 來求解未知常數。
核心觀念: 機率密度函數的性質,積分計算。
解釋:
一個有效的機率密度函數 必須滿足兩個條件:
- 對所有 。
- 。
對於題目給定的 PDF:
我們假設 以滿足 在 的區間。
第 五 題
- 承上題,以下的四個數字中,最接近x的期望值者為
(A) 0.50
(B) 0.64
(C) 0.75
(D) 0.79
登入後即可作答並保存紀錄。
這題是接續上一題,要求計算機率密度函數為 (當 ) 的隨機變數 的期望值。
核心觀念: 隨機變數期望值的計算,利用機率密度函數。
解釋:
根據上一題的結果,我們知道隨機變數 的機率密度函數 (PDF) 為:
隨機變數 的期望值 可以透過以下公式計算:
由於 在 之外為 0,積分範圍縮小到 :
第 六 題
- 承上題,以下的四個數字中,最接近x的中位數者為
(A) 0.50
(B) 0.64
(C) 0.75
(D) 0.79
登入後即可作答並保存紀錄。
這題是接續前兩題,要求計算機率密度函數為 (當 ) 的隨機變數 的中位數。
核心觀念: 中位數 (Median) 的定義,以及如何利用累積分布函數 (Cumulative Distribution Function, CDF) 來求解。
解釋:
隨機變數 的機率密度函數 (PDF) 為:
中位數 的定義是使得累積機率等於 0.5 的值,即 。
累積分布函數 (CDF) 定義為 。
所以,我們要找一個值 使得 。
第 七 題
- 財金系某課程有50名本系學生與10名外系學生選課。本系學生有42名倚賴生成式AI寫作業,外系則有6名。以齊一式檢定本外系學生使用AI程度的差別,則其統計量
(A) 未達10% 顯著水準
(B) 達10% 但未達5% 顯著水準
(C) 達5% 但未達1% 顯著水準
(D) 達1% 顯著水準
登入後即可作答並保存紀錄。
這題考查獨立性檢定,特別是比較兩組比例差異的檢定,通常使用卡方檢定 (Chi-squared test) 或 Z 檢定。由於題目提到「齊一式檢定」,通常是指標準的統計檢定方法。這裡我們將使用卡方檢定來檢驗本系學生與外系學生在依賴生成式 AI 寫作業的比例上是否存在顯著差異。
核心觀念: 獨立性檢定,卡方檢定 (Chi-squared test for independence),顯著水準。
解釋:
首先,我們整理數據並建立一個 2x2 的列聯表 (Contingency Table):
| 倚賴 AI (AI User) | 不倚賴 AI (Non-AI User) | 總計 | |
|---|---|---|---|
| 本系學生 (Dept.) | 42 | 50 - 42 = 8 | 50 |
| 外系學生 (Other) | 6 | 10 - 6 = 4 | 10 |
| 總計 | 48 | 12 | 60 |
我們要檢定「系別」與「是否倚賴 AI」這兩個變數是否獨立。
虛無假設 ():系別與是否倚賴 AI 是獨立的(即兩組學生使用 AI 的比例沒有差異)。
對立假設 ():系別與是否倚賴 AI 不是獨立的(即兩組學生使用 AI 的比例有差異)。
計算預期次數 (Expected Frequencies):
在虛無假設下,預期次數的計算公式為:
- 預期本系學生倚賴 AI:
- 預期本系學生不倚賴 AI:
- 預期外系學生倚賴 AI:
- 預期外系學生不倚賴 AI:
計算卡方統計量 ():
卡方統計量公式為:,其中 是觀察次數。
- 對於本系倚賴 AI:
- 對於本系不倚賴 AI:
- 對於外系倚賴 AI:
- 對於外系不倚賴 AI:
將這些值加總:
第 八 題
- 以下何值相等於自由度5的t分配第2.5百分位數值的平方,()
(A)
(B)
(C)
(D)
登入後即可作答並保存紀錄。
這題考查 t 分配和 F 分配之間的關係,特別是 t 分配的平方與 F 分配的關係。
核心觀念: t 分配與 F 分配的關係。
解釋:
設 是一個服從自由度為 的 t 分配的隨機變數 ()。
則 服從自由度為 (1, ) 的 F 分配 ()。
題目要求計算 () 的值。
這裡, 是指自由度為 5 的 t 分配,其右尾機率為 0.025 的值。
也就是說,,其中 。
由於 t 分配是對稱的,這也意味著 。
因此,。
根據 t 分配與 F 分配的關係,若 ,則 。
我們要計算 () 的值。
這個值是 F 分配 的第 97.5 百分位數。
為什麼是 97.5 百分位數?
因為 是 t 分配的右尾機率為 0.025 的值。
當我們將其平方時,我們關心的是 的值。