109 年 國立中山大學海洋環境及工程學系碩士班丙組《統計學》
第 1 題20 分
- (20%) 請舉一個你所了解的環境相關案例,例如一些汙染問題等,該案例可以利用敘述統計學
的方法 (descriptive statistics) 來分析該案例。請盡量詳細地描述你的答案,例如需要蒐集那些資
料、採用的分析方法、分析的結果、以及結果將如何解決問題等,不需要提供數字。
登入後即可作答並保存紀錄。
本題考查敘述統計學的應用。敘述統計學主要用於整理、描述和呈現資料的特性,例如集中趨勢、離散程度、分佈形狀等,而不涉及推論。
解題思路:
首先,需要選擇一個具體的環境污染案例。例如,某地區的空氣品質監測數據。
接著,說明需要蒐集哪些資料,例如:PM2.5濃度、SO2濃度、NO2濃度、O3濃度、氣象數據(溫度、濕度、風速)等,並說明資料的來源(如環保局監測站)。
然後,闡述可以採用的敘述統計分析方法,例如:
- 集中趨勢測量:計算每日、每月、每年的平均濃度(均值)、中位數(中位數),以及眾數(眾數),以了解污染物的典型水平。
- 離散程度測量:計算標準差(標準差)、變異數(變異數)、極差(極差),以了解污染濃度的波動程度。例如,標準差大表示污染變化劇烈。
- 分佈形狀測量:繪製直方圖(直方圖)或盒狀圖(盒狀圖),觀察污染濃度的分佈是接近常態分佈(常態分佈)、偏態分佈(偏態分佈),還是呈現多峰(多峰)現象。計算偏度(偏度)和峰度(峰度)等統計量。
- 資料呈現:製作趨勢圖(趨勢圖),顯示污染物濃度隨時間的變化;製作散佈圖(散佈圖),探討不同污染物之間或污染物與氣象因素之間的關係。
最後,說明這些敘述統計分析結果如何幫助解決問題。例如:
- 平均濃度和中位數可以作為評估空氣品質是否符合國家標準的依據。
- 標準差和極差可以幫助識別污染事件的高峰期和低谷期,以便制定相應的應對措施。
- 分佈圖可以揭示污染物的排放特徵,例如,如果PM2.5濃度呈現右偏態分佈,可能意味著偶爾會出現非常高的污染峰值。
- 趨勢分析可以監測長期的污染變化趨勢,評估環保政策的效果。
- 污染物之間的關係分析,可以幫助找出主要的污染源。
不需要提供具體的數字計算,重點在於概念的闡述和方法的應用。
第 2 題20 分
- (20%) 請舉一個你所了解的環境相關案例,例如一些汙染問題等,該案例可以利用推論統計學
的方法 (inferential statistics) 來分析該案例。請盡量詳細地描述你的答案,例如需要蒐集那些資
料、採用的分析方法、分析的結果、以及結果將如何解決問題等,不需要提供數字。
登入後即可作答並保存紀錄。
本題考查推論統計學的應用。推論統計學是利用樣本數據來推斷母體(母體)特徵的學科,常用於假設檢定(假設檢定)和信賴區間估計(信賴區間估計)。
解題思路:
首先,同樣需要選擇一個具體的環境污染案例。例如,評估某種新型環保材料對降低土壤污染物(如重金屬鉛)的影響。
接著,說明需要蒐集哪些資料,並強調樣本(樣本)和母體的概念。例如:
- 母體:所有使用該新型環保材料處理過的土壤,以及未處理過的土壤。
- 樣本:隨機抽取一定數量的土壤樣本,一部分經過處理,一部分未處理。
- 蒐集資料:測量處理過的樣本和未處理的樣本中鉛的平均含量(或比例)。
然後,闡述可以採用的推論統計分析方法,例如:
-
假設檢定:
- 目的:檢定新型環保材料是否顯著降低了土壤中鉛的含量。
- 設定假設:
- 虛無假設 ():新型環保材料對土壤鉛含量沒有影響(或平均含量相同)。
- 對立假設 ():新型環保材料顯著降低了土壤鉛含量(或平均含量較低)。
- 採用的檢定方法:
- 如果比較兩組獨立樣本的平均值,可以使用獨立樣本 t 檢定 (independent samples t-test)。
- 如果比較兩組配對樣本(例如,同一地點處理前後的土壤),則使用配對樣本 t 檢定 (paired samples t-test)。
- 如果樣本量很大,或數據服從常態分佈,也可以考慮 Z 檢定。
- 分析步驟:計算檢定統計量(檢定統計量),並與臨界值(臨界值)比較,或計算 p 值(p-value)。
- 結論:根據顯著水準(顯著水準, ),決定是否拒絕虛無假設。
-
信賴區間估計:
- 目的:估計新型環保材料處理後,土壤鉛含量降低的平均幅度。
- 方法:計算樣本均值差的信賴區間(confidence interval)。
- 解釋:例如,計算出95%信賴區間為 (0.5 mg/kg, 1.2 mg/kg),表示我們有95%的信心認為,該材料能夠使土壤鉛含量平均降低0.5到1.2 mg/kg。
最後,說明這些推論統計分析結果如何幫助解決問題:
- 決策依據:假設檢定的結果(例如,拒絕 )可以提供科學依據,證明新型環保材料的有效性,進而決定是否推廣使用。
- 效果量評估:信賴區間提供了對環保材料效果的量化估計,可以評估其經濟效益和實際應用價值。
- 風險評估:通過信賴區間,可以了解效果的變動範圍,進而評估推廣應用可能帶來的風險。
- 科學驗證:推論統計方法能夠提供統計上的證據,支持環保技術的科學性和可靠性。
同樣,不需要提供具體的數字計算,重點在於概念的闡述和方法的應用。
第 3 題15 分
第二部份:計算題60分,本試題附有標準常態分配表以及t分配表可供查詢
3.(15%)研究機構想要了解含酒精飲料是否對造成胃潰瘍的細菌有影響,該機構對100位民眾進
行調查,結果如下表,請回答下列問題:
每天飲用次數胃潰瘍 無胃潰瘍
0
1
22
1
3
19
2
3
32
超過2
4
16
(a) (3%)民眾有胃潰瘍的比例?
(b) (4%)已知某人患有胃潰瘍,但是他不喝酒的機率為何?
(c) (8%)每天飲用次數對應沒有胃潰瘍的機率為何?從答案可以看出什麼結論嗎?
登入後即可作答並保存紀錄。
本題考查機率的基本概念,包含邊際機率、條件機率以及聯合機率的計算與應用。
首先,我們整理一下題目給出的數據。總人數為 100 位民眾。
表格數據如下:
| 每天飲用次數 (X) | 胃潰瘍 (Y=1) | 無胃潰瘍 (Y=0) | 小計 |
|---|---|---|---|
| 0 | 1 | 22 | 23 |
| 1 | 3 | 19 | 22 |
| 2 | 3 | 32 | 35 |
| >2 | 4 | 16 | 20 |
| 總計 | 11 | 89 | 100 |
注意: 題目中的「胃潰瘍」人數加總為 1+3+3+4 = 11 人。
「無胃潰瘍」人數加總為 22+19+32+16 = 89 人。
總人數為 11 + 89 = 100 人。
(a) (3%) 民眾有胃潰瘍的比例?
這是計算母體的比例,直接從總計列可以得到。
有胃潰瘍的人數為 11 人。
總人數為 100 人。
比例 = (有胃潰瘍人數) / (總人數)
計算:
比例 =
【答案】0.11 (或 11%)
(b) (4%) 已知某人患有胃潰瘍,但是他不喝酒的機率為何?
這是一個條件機率問題。我們已知某人患有胃潰瘍 (Y=1),要求他在這種情況下,每天飲用次數為 0 的機率。
我們需要計算 。
根據條件機率的定義:。
在這裡, 是事件「每天飲用次數為 0」(X=0), 是事件「患有胃潰瘍」(Y=1)。
。
- 是民眾有胃潰瘍的機率,我們在 (a) 小題已經計算出來,為 0.11。
- 是「每天飲用次數為 0」且「患有胃潰瘍」的聯合機率。從表格中,符合這個條件的人數是 1 人。
所以,。
計算:
【答案】 或約 0.0909
(c) (8%) 每天飲用次數對應沒有胃潰瘍的機率為何?從答案可以看出什麼結論嗎?
這題要求計算不同飲酒次數下,沒有胃潰瘍的機率。這實際上是計算 對於不同的 值。
這裡的 是「每天飲用次數」。
我們要計算:
根據條件機率的定義:。
或者,更直接地,根據表格中的小計(列),我們可以計算:
第 4 題15 分
4.(15%)大雄修一門課,期中考時他只想靠運氣來考試,因為測驗題為10題選擇題,每一題有
五個選項,只有一個是正確的,請回答下列問題:
(a) (3%)每一題大雄猜中正確答案的機率為何?
(b) (4%)大雄答對兩題的機率為何?
(c) (4%)大雄都沒有答對一題的機率為何?
(d) (4%) 大雄此次考試答對題數的期望值與變異數為何?
登入後即可作答並保存紀錄。
本題考查二項分佈 (Binomial Distribution) 的概念與應用。二項分佈適用於描述獨立的、只有兩種結果(成功/失敗)的重複試驗。
此情境符合二項分佈的條件:
- 有固定的試驗次數:共 10 題選擇題,即 。
- 每次試驗有兩種結果:答對(成功)或答錯(失敗)。
- 每次試驗成功的機率是獨立且相同的。
- 我們關心的是成功的次數。
(a) (3%) 每一題大雄猜中正確答案的機率為何?
每一題有 5 個選項,只有 1 個是正確的。因此,隨機猜中正確答案的機率是:
答錯的機率為 。
【答案】0.2
(b) (4%) 大雄答對兩題的機率為何?
這是在 10 次獨立試驗中,成功(答對)2 次的機率。
使用二項分佈的機率質量函數 (PMF):
其中:
- (試驗次數)
- (成功的次數)
- (成功的機率)
- (失敗的機率)
計算:
首先計算組合數 :
第 5 題15 分
5.(15%)一種葉菜類植物原先的葉子長度為4公分,母體標準差是0.6公分,在使用新肥料後,
一組20片該植物的葉子樣本,量得平均長度為4.2公分。農夫有理由相信,新肥料造成葉子
成長改變嗎?
(a) (10%)請使用顯著水準a=0.01與P值法進行檢定。
(b) (5%) 求出99%信賴區間來驗證檢定結果。
登入後即可作答並保存紀錄。
本題考查假設檢定與信賴區間的應用,涉及單一樣本平均值檢定。題目已知母體標準差,因此應使用 Z 檢定。
核心觀念:
- 假設檢定:用於判斷樣本數據是否足以支持對母體參數的某種聲明(假設)。
- 信賴區間:提供母體參數可能範圍的估計。
已知資訊:
- 原先葉子長度母體平均值 公分。
- 原先葉子長度母體標準差 公分。
- 新肥料處理後,樣本大小 片葉子。
- 樣本平均長度 公分。
- 顯著水準 。
檢定問題: 農夫「有理由相信,新肥料造成葉子成長改變嗎?」
這句話意味著我們需要檢定母體平均值是否與原先不同,即平均值是否發生了變化,而不是僅僅增加或減少。因此,這是一個雙尾檢定 (two-tailed test)。
虛無假設 () 與對立假設 ():
- (新肥料對葉子平均長度沒有改變)
- (新肥料對葉子平均長度有改變)
(a) (10%) 請使用顯著水準 與 P 值法進行檢定。
步驟 1:計算檢定統計量 (Z 統計量)
由於母體標準差 已知,我們使用 Z 檢定。
檢定統計量公式為:
計算:
首先計算 :
然後計算標準誤 (Standard Error, SE):
現在計算 Z 值:
步驟 2:計算 P 值
P 值是觀察到樣本統計量(或更極端)的機率,假設虛無假設為真。
由於是雙尾檢定,
我們的觀察值是 。
我們要計算 。
查閱標準常態分配表 (Z-table)。標準常態分配表通常給出 或 。
查表可得 。
因此,。
(更精確的查表或使用軟體,對於 Z=1.4907, )
第 6 題15 分
6.(15%)一組學生經過調查,得知他們平日與周末的睡覺時間,如下表所示。在a=0.05的顯著
水準之下,有充分證據支持這組學生平均睡覺時間有差別嗎?
學生
1
2
3
4
5
6
7
8
平日睡覺時間 8
5.5 7.5
8
7
6
6
8
周末睡覺時間
4
7
10.5
12
11
9 6
9
登入後即可作答並保存紀錄。
本題考查配對樣本 t 檢定 (Paired t-test)。由於是同一組學生比較平日與週末的睡覺時間,這兩組數據是相關的(配對的),因此應使用配對樣本 t 檢定來判斷兩者平均值是否有顯著差異。
核心觀念:
配對樣本 t 檢定用於比較兩組相關樣本的平均值是否有顯著差異。
已知資訊:
- 樣本數 (共 8 位學生)。
- 顯著水準 。
數據整理:
首先,計算每位學生平日與週末睡覺時間的差值 ( 或 )。我們選擇計算 。
| 學生 | 平日 (X) | 周末 (Y) | 差值 |
|---|---|---|---|
| 1 | 8 | 4 | 4 |
| 2 | 5.5 | 7 | -1.5 |
| 3 | 7.5 | 10.5 | -3 |
| 4 | 8 | 12 | -4 |
| 5 | 7 | 11 | -4 |
| 6 | 6 | 9 | -3 |
| 7 | 6 | 6 | 0 |
| 8 | 8 | 9 | -1 |
虛無假設 () 與對立假設 ():
我們想知道「平均睡覺時間是否有差別」。這意味著我們檢定平日平均睡眠時間與週末平均睡眠時間是否相等。
令 為平日與週末睡覺時間差值的母體平均數。
- (平日與週末的平均睡覺時間沒有差異)
- (平日與週末的平均睡覺時間有差異)
這是一個雙尾檢定。
步驟 1:計算差值的樣本平均數 () 和樣本標準差 ()
計算差值 的平均數:
計算差值 的樣本標準差 :
首先計算差值的平方和 。
:
4 - (-1.5625) = 5.5625
-1.5 - (-1.5625) = 0.0625
-3 - (-1.5625) = -1.4375
-4 - (-1.5625) = -2.4375
-4 - (-1.5625) = -2.4375
-3 - (-1.5625) = -1.4375
0 - (-1.5625) = 1.5625
-1 - (-1.5625) = 0.5625
: