108 年 國立中山大學海洋環境及工程學系碩士班丙組《統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題10 分

請說明何謂「觀察型的研究」與「實驗型的研究」,並且各自舉一個例子說明。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題旨在考察學生對統計學中兩種基本研究設計方法的理解,即觀察型研究與實驗型研究。

觀察型研究 (Observational Study):
在觀察型研究中,研究者僅觀察並測量感興趣的變數,而不對研究對象進行任何干預或控制。研究者被動地收集數據,試圖找出變數之間的關聯性。此類研究的優點是可以在不干預的情況下研究現象,缺點是難以確定因果關係,因為可能存在潛在的混淆變數。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題10 分

請列出滿足「二項實驗」的四種條件,並且說明「二項分配」與「常態分配」之間的關係。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查二項實驗的定義與二項分配與常態分配的關係。

二項實驗 (Binomial Experiment) 的四種條件:
一個實驗若要滿足二項實驗的條件,必須符合以下四點:

  1. 固定試驗次數 (Fixed number of trials):實驗包含一系列固定次數的試驗,通常以 nn 表示。
  2. 兩種類型的結果 (Two types of outcomes):每次試驗只有兩種可能結果,通常稱為「成功」(success) 和「失敗」(failure)。
  3. 獨立試驗 (Independent trials):每次試驗的結果與其他試驗的結果是相互獨立的。
  4. 固定成功機率 (Constant probability of success):每次試驗中「成功」的機率是固定的,通常以 pp 表示,而「失敗」的機率則為 1−p1-p。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

請說明為何參數的「區間估計」比「點估計」更加客觀。並且說明「信賴區間」與「假設檢定」之間的關係。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查區間估計相較於點估計的優勢,以及信賴區間與假設檢定的關聯。

為何參數的「區間估計」比「點估計」更加客觀:

  • 點估計 (Point Estimation):點估計是用一個單一的數值來估計母體參數。例如,用樣本平均數 Xˉ\bar{X} 來估計母體平均數 μ\mu。點估計的優點是簡單直接,但它有一個很大的缺點:幾乎不可能恰好等於真實的母體參數。任何一個單一的數值,都有可能與真實參數有偏差,而且我們無法得知這個偏差的大小。

  • 區間估計 (Interval Estimation):區間估計是用一個數值區間來估計母體參數,並給出這個區間包含真實參數的機率(即信賴水準)。例如,我們可以說「我們有 95% 的信心,母體平均數 μ\mu 落在 (Xˉ−c,Xˉ+c)(\bar{X}-c, \bar{X}+c) 這個區間內」。

    • 客觀性:區間估計比點估計更「客觀」或更「誠實」的原因在於,它承認估計的不確定性。它沒有聲稱一個單一的數值就是真實的參數,而是提供了一個範圍,並量化了我們對這個範圍包含真實參數的信心程度。這比單純給出一個可能不準確的點估計更有信息量,也更能反映真實情況。
    • 包含真實值:區間估計的設計目標是,在多次重複抽樣的情況下,有一定比例(即信賴水準)的區間會包含真實的母體參數。這使得區間估計能夠提供一個關於真實參數可能位置的更可靠範圍。

「信賴區間」與「假設檢定」之間的關係:
信賴區間和假設檢定是統計推論的兩種主要方法,它們在概念上是緊密相關的,並且可以相互轉換。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題10 分

請說明何謂迴歸模型所產生的「總變異」、「可解釋變異」與「無法解釋變異」。並且說明這些變異與相關係數r的關係。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查學生對迴歸分析中變異數分解的理解,以及變異數與相關係數之間的關係。

迴歸模型中的變異:

在迴歸分析中,我們試圖用一個或多個自變數 (predictors) 來解釋應變數 (response variable) 的變異。總變異是應變數的總體變異量,而迴歸模型則將這個總變異分解為兩個部分:可解釋變異和無法解釋變異。

  1. 總變異 (Total Variation, SST):
    總變異衡量了應變數的觀測值相對於其平均數的總離散程度。它代表了應變數未經模型解釋的總體變異。
    數學上,總變異定義為:
    SST=∑i=1n(Yi−Yˉ)2SST = \sum_{i=1}^{n} (Y_i - \bar{Y})^2
    其中 YiY_i 是第 ii 個觀測值的應變數,Yˉ\bar{Y} 是應變數的樣本平均數,nn 是觀測值的數量。

  2. 可解釋變異 (Explained Variation, SSR 或 SSE):
    可解釋變異(也稱為迴歸變異或模型變異)衡量了迴歸模型能夠解釋的應變數的變異量。它代表了自變數的變化所導致的應變數變化的部分。
    在簡單線性迴歸中,可解釋變異是迴歸線上的預測值 Y^i\hat{Y}_i 相對於應變數平均數 Yˉ\bar{Y} 的離差平方和。
    SSR=∑i=1n(Y^i−Yˉ)2SSR = \sum_{i=1}^{n} (\hat{Y}_i - \bar{Y})^2
    其中 Y^i\hat{Y}_i 是迴歸模型預測的第 ii 個應變數值。

  3. 無法解釋變異 (Unexplained Variation, SSE 或 RSE):
    無法解釋變異(也稱為殘差變異或誤差變異)衡量了迴歸模型未能解釋的應變數的變異量。它代表了由於隨機因素、未包含在模型中的其他變數,或模型本身的不完美性而導致的應變數的變異。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題20 分

有關機率分配
(a) (10%) 某年人口普查資料顯示,在外國出生的美國公民比例是12.2%。隨機挑選60位美國公民,預期會有幾位是在美國出生的?求出在外國出生人數的平均數、與標準差。
(b) (10%) 根據統計已開發國家每人每日生活用水量 123 加侖,假設標準差為21加侖,隨機挑選一組已開發國家15人的樣本,求出他們的平均用水量介於120與126加侖之間的機率。(假設用水量是常態分配)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查學生對二項分配和常態分配的應用能力。

(a) 二項分配應用

題目要求計算隨機挑選 60 位美國公民時,預期有多少位是在美國出生的,以及在外國出生人數的平均數和標準差。

這是一個典型的二項分配問題,因為:

  1. 有固定的試驗次數:n=60n = 60 (挑選 60 位美國公民)。
  2. 每次試驗有兩種結果:在美國出生 (成功) 或在外國出生 (失敗)。
  3. 每次試驗是獨立的(假設抽樣是隨機且足夠大的母體)。
  4. 每次試驗成功的機率是固定的:題目給的是「在外國出生的美國公民比例是 12.2%」。因此,我們需要的是「在美國出生的美國公民比例」。
    設 pinp_{in} 為在美國出生的機率,poutp_{out} 為在外國出生的機率。
    pout=0.122p_{out} = 0.122
    因此,pin=1−pout=1−0.122=0.878p_{in} = 1 - p_{out} = 1 - 0.122 = 0.878。

題目實際詢問的是「預期會有幾位是在美國出生的」,以及「在外國出生人數的平均數、與標準差」。
我們需要明確是計算「在美國出生的人數」還是「在外國出生的人數」。
從題意「預期會有幾位是在美國出生的?」來看,我們應以「在美國出生」作為成功。
然而,後續又問「求出在外國出生人數的平均數、與標準差」。這表示我們應該將「在外國出生」定義為成功,因為題目明確要求的是「在外國出生人數」的統計量。

我們重新定義:
Let XX be the number of US citizens born outside the US among the 60 selected.
The probability of a US citizen being born outside the US is p=0.122p = 0.122.
The number of trials is n=60n = 60.
So, X∼Binomial(n=60,p=0.122)X \sim Binomial(n=60, p=0.122).

  • 預期在外國出生的人數 (平均數):
    對於二項分配,平均數 (期望值) 為 E(X)=npE(X) = np。
    E(X)=60×0.122=7.32E(X) = 60 \times 0.122 = 7.32

    所以,預期會有 7.32 位是在外國出生的。

  • 在外國出生人數的標準差:
    對於二項分配,標準差為 σ=np(1−p)\sigma = \sqrt{np(1-p)}。
    1−p=1−0.122=0.8781-p = 1 - 0.122 = 0.878
    σ=60×0.122×0.878=7.32×0.878=6.4270≈2.535\sigma = \sqrt{60 \times 0.122 \times 0.878} = \sqrt{7.32 \times 0.878} = \sqrt{6.4270} \approx 2.535

    所以,在外國出生人數的標準差約為 2.535。

【答案】
預期在外國出生的人數為 7.32 位。
在外國出生人數的平均數為 7.32。
在外國出生人數的標準差約為 2.535。

(b) 常態分配應用

題目要求計算隨機挑選 15 位已開發國家樣本時,其平均用水量介於 120 到 126 加侖之間的機率。已知母體平均數和標準差,且假設用水量服從常態分配。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 6 題20 分

有關信賴區間與假設檢定
(a) (10%) 一個研究股票社團隨機挑選15家公司,並且得知它們每一股的價格如下表所示。引用95%的信心水準估計每一股的平均價格。
41.53 19.83 15.18 50.4 29.97 58.42 21.63 121.17 5.49 54.87 13.1 87.78 19.32 54.83 13.89
(b) (10%) 某公司生產一種巴士,號稱速度每小時50哩時,該巴士平均煞車距離為264呎。一群汽車工程師決定進行一項實驗,發現20部相同的巴士速度每小時50哩的平均煞車距離為262.3呎,母體的標準差為3呎。以p值法,在a=0.01的顯著水準下,檢定該公司所生產的巴士平均煞車距離是否小於264呎?

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查學生在已知樣本數據的情況下,計算信賴區間以及進行假設檢定的能力。

(a) 信賴區間計算

題目要求在 95% 的信心水準下,估計 15 家公司平均股價。這是一個關於母體平均數的信賴區間估計問題。

已知資訊:

  • 樣本大小 n=15n = 15
  • 樣本資料:41.53, 19.83, 15.18, 50.4, 29.97, 58.42, 21.63, 121.17, 5.49, 54.87, 13.1, 87.78, 19.32, 54.83, 13.89
  • 信心水準 = 95%

由於母體標準差 σ\sigma 未知,且樣本大小 n=15n=15 較小(通常 n<30n < 30 時視為小樣本),我們應使用 t-分布來構建信賴區間。

步驟 1:計算樣本平均數 (xˉ\bar{x}) 和樣本標準差 (ss)

首先,我們需要計算樣本的平均數和標準差。
將所有數據加總:
∑x=41.53+19.83+15.18+50.4+29.97+58.42+21.63+121.17+5.49+54.87+13.1+87.78+19.32+54.83+13.89=587.41\sum x = 41.53 + 19.83 + 15.18 + 50.4 + 29.97 + 58.42 + 21.63 + 121.17 + 5.49 + 54.87 + 13.1 + 87.78 + 19.32 + 54.83 + 13.89 = 587.41

樣本平均數:
xˉ=∑xn=587.4115≈39.1607\bar{x} = \frac{\sum x}{n} = \frac{587.41}{15} \approx 39.1607

計算樣本標準差 ss:
首先計算樣本變異數 s2=∑(xi−xˉ)2n−1s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}。
我們可以先計算 ∑x2\sum x^2:
∑x2=41.532+19.832+15.182+50.42+29.972+58.422+21.632+121.172+5.492+54.872+13.12+87.782+19.322+54.832+13.892\sum x^2 = 41.53^2 + 19.83^2 + 15.18^2 + 50.4^2 + 29.97^2 + 58.42^2 + 21.63^2 + 121.17^2 + 5.49^2 + 54.87^2 + 13.1^2 + 87.78^2 + 19.32^2 + 54.83^2 + 13.89^2
∑x2≈1724.72+393.23+230.43+2540.16+898.20+3412.84+467.86+14681.71+30.14+3010.72+171.61+7705.13+373.26+3006.32+192.93=39749.28\sum x^2 \approx 1724.72 + 393.23 + 230.43 + 2540.16 + 898.20 + 3412.84 + 467.86 + 14681.71 + 30.14 + 3010.72 + 171.61 + 7705.13 + 373.26 + 3006.32 + 192.93 = 39749.28

樣本變異數:
s2=∑x2−nxˉ2n−1=39749.28−15×(39.1607)215−1s^2 = \frac{\sum x^2 - n\bar{x}^2}{n-1} = \frac{39749.28 - 15 \times (39.1607)^2}{15-1}
s2=39749.28−15×1533.5514=39749.28−23003.2514=16746.0314≈1196.145s^2 = \frac{39749.28 - 15 \times 1533.55}{14} = \frac{39749.28 - 23003.25}{14} = \frac{16746.03}{14} \approx 1196.145

樣本標準差:
s=s2≈1196.145≈34.585s = \sqrt{s^2} \approx \sqrt{1196.145} \approx 34.585

步驟 2:確定 t 分配的臨界值

信心水準為 95%,所以 α=1−0.95=0.05\alpha = 1 - 0.95 = 0.05。
由於是雙尾信賴區間,我們需要 α/2=0.025\alpha/2 = 0.025 的尾機率。
自由度 df=n−1=15−1=14df = n-1 = 15-1 = 14。
查 t 分配表,在 df=14df=14 和尾機率 0.025 下,臨界值 tα/2,df=t0.025,14≈2.145t_{\alpha/2, df} = t_{0.025, 14} \approx 2.145。

步驟 3:計算信賴區間

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 7 題20 分

有關迴歸分析
某大學校友中心想要了解校友畢業幾年與捐款之間的關係。於是該中心隨機抽取一組樣本,結果如下表所示。

畢業年數(X)1531076
捐款金額(Y)500100300507580

(a) (6%) 找出相關係數、決定係數、與無決定係數。相關係數r的計算公式為:
r=n(∑XY)−(∑X)(∑Y)[n(∑X2)−(∑X)2][n(∑Y2)−(∑Y)2]r = \frac{n(\sum XY) - (\sum X)(\sum Y)}{\sqrt{[n(\sum X^2) - (\sum X)^2][n(\sum Y^2) - (\sum Y)^2]}} , nn 為成對數據的個數
(b) (5%) 在 α=0.05\alpha=0.05 之下,請使用相關係數 rr 檢定(公式如下)檢定該組數據是否線性相關。
t=rn−21−r2t = r \sqrt{\frac{n-2}{1-r^2}} , nn 為成對數據的個數, rr 為相關係數, tt 分配的自由度為 n−2n-2
(c) (9%) 找出該組資料的迴歸線 Y=a+bXY = a+bX,並且預測畢業4年校友的捐款金額。a與b的公式如下:
∑(Y∑X2)−(X∑XY)\sum(Y\sum X^2) - (X\sum XY)
a=n(∑X2)−(∑X)2∑(X∑XY)−(Y∑X2)a = \frac{n(\sum X^2) - (\sum X)^2}{\sum(X\sum XY) - (Y\sum X^2)}
b=n(∑XY)−(∑X)(∑Y)n(∑X2)−(∑X)2b = \frac{n(\sum XY) - (\sum X)(\sum Y)}{n(\sum X^2) - (\sum X)^2} , nn 為成對數據的個數

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考查學生計算相關係數、進行相關性檢定以及建立迴歸直線並進行預測的能力。

首先,我們需要整理數據並計算所需的總和。
樣本大小 n=6n=6。
數據如下:
X (畢業年數): 1, 5, 3, 10, 7, 6
Y (捐款金額): 500, 100, 300, 50, 75, 80

計算相關的總和:
∑X=1+5+3+10+7+6=32\sum X = 1 + 5 + 3 + 10 + 7 + 6 = 32
∑Y=500+100+300+50+75+80=1105\sum Y = 500 + 100 + 300 + 50 + 75 + 80 = 1105
∑X2=12+52+32+102+72+62=1+25+9+100+49+36=220\sum X^2 = 1^2 + 5^2 + 3^2 + 10^2 + 7^2 + 6^2 = 1 + 25 + 9 + 100 + 49 + 36 = 220
∑Y2=5002+1002+3002+502+752+802=250000+10000+90000+2500+5625+6400=364525\sum Y^2 = 500^2 + 100^2 + 300^2 + 50^2 + 75^2 + 80^2 = 250000 + 10000 + 90000 + 2500 + 5625 + 6400 = 364525
∑XY=(1×500)+(5×100)+(3×300)+(10×50)+(7×75)+(6×80)\sum XY = (1 \times 500) + (5 \times 100) + (3 \times 300) + (10 \times 50) + (7 \times 75) + (6 \times 80)
∑XY=500+500+900+500+525+480=3405\sum XY = 500 + 500 + 900 + 500 + 525 + 480 = 3405

(a) 相關係數、決定係數與無決定係數

  • 相關係數 rr:
    公式:r=n(∑XY)−(∑X)(∑Y)[n(∑X2)−(∑X)2][n(∑Y2)−(∑Y)2]r = \frac{n(\sum XY) - (\sum X)(\sum Y)}{\sqrt{[n(\sum X^2) - (\sum X)^2][n(\sum Y^2) - (\sum Y)^2]}}
    n=6n=6
    分子:n(∑XY)−(∑X)(∑Y)=6(3405)−(32)(1105)=20430−35360=−14930n(\sum XY) - (\sum X)(\sum Y) = 6(3405) - (32)(1105) = 20430 - 35360 = -14930

    分母的平方根第一項:n(∑X2)−(∑X)2=6(220)−(32)2=1320−1024=296n(\sum X^2) - (\sum X)^2 = 6(220) - (32)^2 = 1320 - 1024 = 296
    分母的平方根第二項:n(∑Y2)−(∑Y)2=6(364525)−(1105)2=2187150−1221025=966125n(\sum Y^2) - (\sum Y)^2 = 6(364525) - (1105)^2 = 2187150 - 1221025 = 966125

    分母:296×966125=286173000≈16916.65\sqrt{296 \times 966125} = \sqrt{286173000} \approx 16916.65

    r=−1493016916.65≈−0.8826r = \frac{-14930}{16916.65} \approx -0.8826

  • 決定係數 R2R^2:
    決定係數是相關係數的平方。
    R2=r2=(−0.8826)2≈0.7790R^2 = r^2 = (-0.8826)^2 \approx 0.7790

  • 無決定係數 (Unexplained Variation Proportion):
    無決定係數是指模型未能解釋的變異比例,它等於 1−R21 - R^2。
    無決定係數 =1−R2=1−0.7790=0.2210= 1 - R^2 = 1 - 0.7790 = 0.2210

【答案】
相關係數 r≈−0.8826r \approx -0.8826。
決定係數 R2≈0.7790R^2 \approx 0.7790。
無決定係數 ≈0.2210\approx 0.2210。

(b) 相關性檢定

題目要求在 α=0.05\alpha = 0.05 下,檢定數據是否線性相關。使用 tt 檢定。

  • 假設:
    • H0:ρ=0H_0: \rho = 0 (母體相關係數為 0,即無線性相關)
    • H1:ρ≠0H_1: \rho \ne 0 (母體相關係數不為 0,即存在線性相關)
      這是雙尾檢定。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題