108 年 國立中山大學海洋環境及工程學系碩士班丙組《統計學》
第 1 題10 分
請說明何謂「觀察型的研究」與「實驗型的研究」,並且各自舉一個例子說明。
登入後即可作答並保存紀錄。
此題旨在考察學生對統計學中兩種基本研究設計方法的理解,即觀察型研究與實驗型研究。
觀察型研究 (Observational Study):
在觀察型研究中,研究者僅觀察並測量感興趣的變數,而不對研究對象進行任何干預或控制。研究者被動地收集數據,試圖找出變數之間的關聯性。此類研究的優點是可以在不干預的情況下研究現象,缺點是難以確定因果關係,因為可能存在潛在的混淆變數。
第 2 題10 分
請列出滿足「二項實驗」的四種條件,並且說明「二項分配」與「常態分配」之間的關係。
登入後即可作答並保存紀錄。
此題考查二項實驗的定義與二項分配與常態分配的關係。
二項實驗 (Binomial Experiment) 的四種條件:
一個實驗若要滿足二項實驗的條件,必須符合以下四點:
- 固定試驗次數 (Fixed number of trials):實驗包含一系列固定次數的試驗,通常以 表示。
- 兩種類型的結果 (Two types of outcomes):每次試驗只有兩種可能結果,通常稱為「成功」(success) 和「失敗」(failure)。
- 獨立試驗 (Independent trials):每次試驗的結果與其他試驗的結果是相互獨立的。
- 固定成功機率 (Constant probability of success):每次試驗中「成功」的機率是固定的,通常以 表示,而「失敗」的機率則為 。
第 3 題10 分
請說明為何參數的「區間估計」比「點估計」更加客觀。並且說明「信賴區間」與「假設檢定」之間的關係。
登入後即可作答並保存紀錄。
此題考查區間估計相較於點估計的優勢,以及信賴區間與假設檢定的關聯。
為何參數的「區間估計」比「點估計」更加客觀:
-
點估計 (Point Estimation):點估計是用一個單一的數值來估計母體參數。例如,用樣本平均數 來估計母體平均數 。點估計的優點是簡單直接,但它有一個很大的缺點:幾乎不可能恰好等於真實的母體參數。任何一個單一的數值,都有可能與真實參數有偏差,而且我們無法得知這個偏差的大小。
-
區間估計 (Interval Estimation):區間估計是用一個數值區間來估計母體參數,並給出這個區間包含真實參數的機率(即信賴水準)。例如,我們可以說「我們有 95% 的信心,母體平均數 落在 這個區間內」。
- 客觀性:區間估計比點估計更「客觀」或更「誠實」的原因在於,它承認估計的不確定性。它沒有聲稱一個單一的數值就是真實的參數,而是提供了一個範圍,並量化了我們對這個範圍包含真實參數的信心程度。這比單純給出一個可能不準確的點估計更有信息量,也更能反映真實情況。
- 包含真實值:區間估計的設計目標是,在多次重複抽樣的情況下,有一定比例(即信賴水準)的區間會包含真實的母體參數。這使得區間估計能夠提供一個關於真實參數可能位置的更可靠範圍。
「信賴區間」與「假設檢定」之間的關係:
信賴區間和假設檢定是統計推論的兩種主要方法,它們在概念上是緊密相關的,並且可以相互轉換。
第 4 題10 分
請說明何謂迴歸模型所產生的「總變異」、「可解釋變異」與「無法解釋變異」。並且說明這些變異與相關係數r的關係。
登入後即可作答並保存紀錄。
此題考查學生對迴歸分析中變異數分解的理解,以及變異數與相關係數之間的關係。
迴歸模型中的變異:
在迴歸分析中,我們試圖用一個或多個自變數 (predictors) 來解釋應變數 (response variable) 的變異。總變異是應變數的總體變異量,而迴歸模型則將這個總變異分解為兩個部分:可解釋變異和無法解釋變異。
-
總變異 (Total Variation, SST):
總變異衡量了應變數的觀測值相對於其平均數的總離散程度。它代表了應變數未經模型解釋的總體變異。
數學上,總變異定義為:
其中 是第 個觀測值的應變數, 是應變數的樣本平均數, 是觀測值的數量。 -
可解釋變異 (Explained Variation, SSR 或 SSE):
可解釋變異(也稱為迴歸變異或模型變異)衡量了迴歸模型能夠解釋的應變數的變異量。它代表了自變數的變化所導致的應變數變化的部分。
在簡單線性迴歸中,可解釋變異是迴歸線上的預測值 相對於應變數平均數 的離差平方和。
其中 是迴歸模型預測的第 個應變數值。 -
無法解釋變異 (Unexplained Variation, SSE 或 RSE):
無法解釋變異(也稱為殘差變異或誤差變異)衡量了迴歸模型未能解釋的應變數的變異量。它代表了由於隨機因素、未包含在模型中的其他變數,或模型本身的不完美性而導致的應變數的變異。
第 5 題20 分
有關機率分配
(a) (10%) 某年人口普查資料顯示,在外國出生的美國公民比例是12.2%。隨機挑選60位美國公民,預期會有幾位是在美國出生的?求出在外國出生人數的平均數、與標準差。
(b) (10%) 根據統計已開發國家每人每日生活用水量 123 加侖,假設標準差為21加侖,隨機挑選一組已開發國家15人的樣本,求出他們的平均用水量介於120與126加侖之間的機率。(假設用水量是常態分配)
登入後即可作答並保存紀錄。
此題考查學生對二項分配和常態分配的應用能力。
(a) 二項分配應用
題目要求計算隨機挑選 60 位美國公民時,預期有多少位是在美國出生的,以及在外國出生人數的平均數和標準差。
這是一個典型的二項分配問題,因為:
- 有固定的試驗次數: (挑選 60 位美國公民)。
- 每次試驗有兩種結果:在美國出生 (成功) 或在外國出生 (失敗)。
- 每次試驗是獨立的(假設抽樣是隨機且足夠大的母體)。
- 每次試驗成功的機率是固定的:題目給的是「在外國出生的美國公民比例是 12.2%」。因此,我們需要的是「在美國出生的美國公民比例」。
設 為在美國出生的機率, 為在外國出生的機率。
因此,。
題目實際詢問的是「預期會有幾位是在美國出生的」,以及「在外國出生人數的平均數、與標準差」。
我們需要明確是計算「在美國出生的人數」還是「在外國出生的人數」。
從題意「預期會有幾位是在美國出生的?」來看,我們應以「在美國出生」作為成功。
然而,後續又問「求出在外國出生人數的平均數、與標準差」。這表示我們應該將「在外國出生」定義為成功,因為題目明確要求的是「在外國出生人數」的統計量。
我們重新定義:
Let be the number of US citizens born outside the US among the 60 selected.
The probability of a US citizen being born outside the US is .
The number of trials is .
So, .
-
預期在外國出生的人數 (平均數):
對於二項分配,平均數 (期望值) 為 。
所以,預期會有 7.32 位是在外國出生的。
-
在外國出生人數的標準差:
對於二項分配,標準差為 。
所以,在外國出生人數的標準差約為 2.535。
【答案】
預期在外國出生的人數為 7.32 位。
在外國出生人數的平均數為 7.32。
在外國出生人數的標準差約為 2.535。
(b) 常態分配應用
題目要求計算隨機挑選 15 位已開發國家樣本時,其平均用水量介於 120 到 126 加侖之間的機率。已知母體平均數和標準差,且假設用水量服從常態分配。
第 6 題20 分
有關信賴區間與假設檢定
(a) (10%) 一個研究股票社團隨機挑選15家公司,並且得知它們每一股的價格如下表所示。引用95%的信心水準估計每一股的平均價格。
41.53 19.83 15.18 50.4 29.97 58.42 21.63 121.17 5.49 54.87 13.1 87.78 19.32 54.83 13.89
(b) (10%) 某公司生產一種巴士,號稱速度每小時50哩時,該巴士平均煞車距離為264呎。一群汽車工程師決定進行一項實驗,發現20部相同的巴士速度每小時50哩的平均煞車距離為262.3呎,母體的標準差為3呎。以p值法,在a=0.01的顯著水準下,檢定該公司所生產的巴士平均煞車距離是否小於264呎?
登入後即可作答並保存紀錄。
此題考查學生在已知樣本數據的情況下,計算信賴區間以及進行假設檢定的能力。
(a) 信賴區間計算
題目要求在 95% 的信心水準下,估計 15 家公司平均股價。這是一個關於母體平均數的信賴區間估計問題。
已知資訊:
- 樣本大小
- 樣本資料:41.53, 19.83, 15.18, 50.4, 29.97, 58.42, 21.63, 121.17, 5.49, 54.87, 13.1, 87.78, 19.32, 54.83, 13.89
- 信心水準 = 95%
由於母體標準差 未知,且樣本大小 較小(通常 時視為小樣本),我們應使用 t-分布來構建信賴區間。
步驟 1:計算樣本平均數 () 和樣本標準差 ()
首先,我們需要計算樣本的平均數和標準差。
將所有數據加總:
樣本平均數:
計算樣本標準差 :
首先計算樣本變異數 。
我們可以先計算 :
樣本變異數:
樣本標準差:
步驟 2:確定 t 分配的臨界值
信心水準為 95%,所以 。
由於是雙尾信賴區間,我們需要 的尾機率。
自由度 。
查 t 分配表,在 和尾機率 0.025 下,臨界值 。
步驟 3:計算信賴區間
第 7 題20 分
有關迴歸分析
某大學校友中心想要了解校友畢業幾年與捐款之間的關係。於是該中心隨機抽取一組樣本,結果如下表所示。
| 畢業年數(X) | 1 | 5 | 3 | 10 | 7 | 6 |
|---|---|---|---|---|---|---|
| 捐款金額(Y) | 500 | 100 | 300 | 50 | 75 | 80 |
(a) (6%) 找出相關係數、決定係數、與無決定係數。相關係數r的計算公式為:
, 為成對數據的個數
(b) (5%) 在 之下,請使用相關係數 檢定(公式如下)檢定該組數據是否線性相關。
, 為成對數據的個數, 為相關係數, 分配的自由度為
(c) (9%) 找出該組資料的迴歸線 ,並且預測畢業4年校友的捐款金額。a與b的公式如下:
, 為成對數據的個數
登入後即可作答並保存紀錄。
此題考查學生計算相關係數、進行相關性檢定以及建立迴歸直線並進行預測的能力。
首先,我們需要整理數據並計算所需的總和。
樣本大小 。
數據如下:
X (畢業年數): 1, 5, 3, 10, 7, 6
Y (捐款金額): 500, 100, 300, 50, 75, 80
計算相關的總和:
(a) 相關係數、決定係數與無決定係數
-
相關係數 :
公式:
分子:分母的平方根第一項:
分母的平方根第二項:分母:
-
決定係數 :
決定係數是相關係數的平方。
-
無決定係數 (Unexplained Variation Proportion):
無決定係數是指模型未能解釋的變異比例,它等於 。
無決定係數
【答案】
相關係數 。
決定係數 。
無決定係數 。
(b) 相關性檢定
題目要求在 下,檢定數據是否線性相關。使用 檢定。
- 假設:
- (母體相關係數為 0,即無線性相關)
- (母體相關係數不為 0,即存在線性相關)
這是雙尾檢定。