110 年 國立中正大學心理學系碩士班《心理與教育統計學》
第 1 題10 分
某市調公司欲瞭解政黨與萊豬進口態度是否有關係,隨機抽樣了100位路人進行調查,調查資料如下表。請進行合適的資料分析且設定顯著水準alpha=0.05。(10%)
| A政黨 | B政黨 | C政黨 | |
|---|---|---|---|
| 贊成 | 30 | 10 | 5 |
| 反對 | 15 | 15 | 5 |
| 無意見 | 10 | 5 | 5 |
登入後即可作答並保存紀錄。
本題考驗對卡方檢定(Chi-square test)的應用。當我們想探討兩個類別變項之間是否存在關聯性時,卡方檢定是一個常用的統計方法。在此題中,兩個類別變項分別是「政黨」(A、B、C)與「萊豬進口態度」(贊成、反對、無意見)。
步驟一:設定虛無假設與對立假設
- :政黨與萊豬進口態度之間沒有關聯性。
- :政黨與萊豬進口態度之間有關聯性。
步驟二:計算預期次數 (Expected Frequencies)
首先,我們需要計算各類別的總計人數,以及欄位與列的總計。
| A政黨 | B政黨 | C政黨 | 列總計 | |
|---|---|---|---|---|
| 贊成 | 30 | 10 | 5 | 45 |
| 反對 | 15 | 15 | 5 | 35 |
| 無意見 | 10 | 5 | 5 | 20 |
| 欄總計 | 55 | 30 | 15 | 100 |
接著,計算預期次數。預期次數的公式為:
- 預期贊成A政黨:
- 預期贊成B政黨:
- 預期贊成C政黨:
- 預期反對A政黨:
- 預期反對B政黨:
- 預期反對C政黨:
- 預期無意見A政黨:
- 預期無意見B政黨:
- 預期無意見C政黨:
步驟三:計算卡方統計量 ()
卡方統計量的公式為:
其中 是觀察次數, 是預期次數。
- 贊成A:
第 2 題4 分
某教師欲瞭解期中考試成績與該科是否及格的關係,隨機抽取10位班上同學,資料如下表。
| 期中考 | 50 | 60 | 60 | 70 | 100 | 80 | 90 | 80 | 70 | 90 |
|---|---|---|---|---|---|---|---|---|---|---|
| 及格 | 0 | 0 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
(1) 兩變項間相關係數(correlation coefficient)為多少?(4%)
(2) 欲以期中考試成績預測該科是否及格的簡單線性迴歸(simple linear regression),求方程式?(8%)
(3) 呈(2),若以統計軟體進行資料分析,得到下列ANOVA 報表,試完成下列表格。(8%)
| 自由度 | SS | MS | F | 臨界值 | |
|---|---|---|---|---|---|
| 迴歸 | |||||
| 殘差 | |||||
| 總和 |
登入後即可作答並保存紀錄。
本題考驗計算 Pearson 相關係數、建立簡單線性迴歸方程式,以及解讀迴歸分析的 ANOVA 表。
首先,我們需要整理數據。
自變項 (X):期中考成績 (連續變項)
依變項 (Y):是否及格 (0=不及格, 1=及格) (類別變項,但在此迴歸分析中視為連續變項處理)
數據:
X: [50, 60, 60, 70, 100, 80, 90, 80, 70, 90]
Y: [0, 0, 1, 1, 1, 1, 1, 1, 1, 1]
樣本數
步驟一:計算平均數、標準差、SSX、SSY、SPxy
為了計算相關係數和迴歸方程式,我們需要計算 , , 和 。
計算各項:
| 50 | 0 | -25 | -0.8 | 625 | 0.64 | 20 |
| 60 | 0 | -15 | -0.8 | 225 | 0.64 | 12 |
| 60 | 1 | -15 | 0.2 | 225 | 0.04 | -3 |
| 70 | 1 | -5 | 0.2 | 25 | 0.04 | -1 |
| 100 | 1 | 25 | 0.2 | 625 | 0.04 | 5 |
| 80 | 1 | 5 | 0.2 | 25 | 0.04 | 1 |
| 90 | 1 | 15 | 0.2 | 225 | 0.04 | 3 |
| 80 | 1 | 5 | 0.2 | 25 | 0.04 | 1 |
| 70 | 1 | -5 | 0.2 | 25 | 0.04 | -1 |
| 90 | 1 | 15 | 0.2 | 225 | 0.04 | 3 |
| 總計 | 2250 | 0.8 | 40 |
(1) 兩變項間相關係數(correlation coefficient)為多少?(4%)
Pearson 相關係數 的計算公式為:
【答案】(1) 相關係數約為 0.9428。
第 3 題8 分
某學者研究新冠疫苗對於冠狀病毒的效果,隨機選取15位受試者參加實驗,受試者被隨機分配至三組接受不同疫苗注射,每位受試者須接受每周一次共測四次檢測體內病毒數量。已先取得各項離均差平方和(sum of squares),包括總(total)的離均差平方和為300、疫苗的離均差平方和為16、時間的離均差平方和為60、疫苗與時間交互作用(interaction)的離均差平方和為30、受試者內(within subjects)的離均差平方和為260。
(1)根據實驗描述,請列出 ANOVA表(須包含自由度、SS、MS、F、臨界值)且設定顯著水準 alpha=0.05。(8%)
(2)若欲改為兩因子均為受試者間(between subjects)因子、水準數相同、細格人數相同,問該如何重新設計實驗?相較於先前實驗有何優缺點?(4%)
(3)呈(2),若因子離均差平方和與題目先前取得相同,請列出ANOVA表(須包含自由度、SS、MS、F、臨界值)且設定顯著水準 alpha=0.05。(8%)
登入後即可作答並保存紀錄。
核心觀念
本題是 的混合設計 ANOVA:
- 疫苗:3 組,為受試者間因子(between-subjects factor)。
- 時間:每週測量 4 次,為受試者內因子(within-subjects factor)。
- 每組有 位受試者。
- 總受試者數 ,總觀察值為 。
混合設計的平方和分解為:
題目給定:
其中受試者內平方和包含:
因此:
受試者間的誤差平方和為:
解題方法
設:
- :疫苗,水準數
- :時間,水準數
- 每個疫苗組受試者數
自由度公式如下:
均方為:
混合設計中,不同效果使用不同誤差項:
- 疫苗效果以 為誤差項。
- 時間與交互作用以 為誤差項。
(1)混合設計 ANOVA 表
先計算各均方與 值:
在 下,臨界值為:
| 變異來源 | 臨界值 | ||||
|---|---|---|---|---|---|
| 疫苗 | 2 | 16 | 8.000 | 4.000 | |
| 受試者(疫苗內) | 12 | 24 | 2.000 | — | — |
| 時間 | 3 | 60 | 20.000 | 4.235 | |
| 疫苗 時間 | 6 | 30 | 5.000 | 1.059 | |
| 誤差 | 36 | 170 | 4.722 | — | — |
| 總和 | 59 | 300 | — | — | — |
統計判斷
疫苗效果:
因此拒絕疫苗效果為零的虛無假設,表示三種疫苗的平均病毒數量存在顯著差異。
時間效果:
因此拒絕虛無假設,表示四個時間點的平均病毒數量存在顯著差異。
交互作用:
因此不拒絕虛無假設,表示沒有足夠證據認為不同疫苗的效果會隨時間而改變。
(2)改為兩因子皆為受試者間因子
實驗重新設計
仍採用:
- 疫苗因子:3 個水準。
- 時間因子:4 個水準。
- 每一個細格維持 5 位受試者。
因此需要建立 個細格:
共需 60 位受試者。
每位受試者只被隨機分配到一種疫苗與一個時間條件,並且只接受一次病毒數量測量。例如:
第 4 題10 分
以第1題市調研究為例,請說明:
(1) 定義 alpha。該研究的p值範圍?(10%)
(2) 若該研究的統計檢定力(power)設定為0.5,你將如何看待市調研究結果?(10%)
登入後即可作答並保存紀錄。
本題考驗對統計學中重要概念 alpha (顯著水準)、p 值,以及統計檢力 (Power) 的理解。
核心觀念:
- Alpha (): 顯著水準,代表我們願意接受的型一錯誤 (Type I error) 的機率。型一錯誤是指當虛無假設 (Null Hypothesis, ) 為真時,卻拒絕了它。
- p 值: 在虛無假設為真的情況下,觀察到現有數據或更極端數據的機率。p 值越小,越有證據支持拒絕虛無假設。
- 統計檢力 (Power): 代表當對立假設 (Alternative Hypothesis, ) 為真時,正確拒絕虛無假設的機率,即 。 是型二錯誤 (Type II error) 的機率,指當對立假設為真時,卻未能拒絕虛無假設。
- 型一錯誤 (Type I Error): 誤判為有顯著差異或關聯,而實際上沒有。
- 型二錯誤 (Type II Error): 誤判為沒有顯著差異或關聯,而實際上存在。
第 1 題市調研究背景:
研究目的:瞭解政黨與萊豬進口態度是否有關係。
檢定方法:卡方檢定 ()。
顯著水準:。
計算結果:, , 臨界值 = 9.488。
結論:,無法拒絕 (政黨與萊豬進口態度沒有關聯)。
(1) 定義 alpha。該研究的p值範圍?(10%)
定義 alpha:
Alpha () 是統計學中預設的顯著水準 (Significance Level)。它代表了研究者願意承擔的「型一錯誤」的風險機率。換句話說,如果虛無假設 () 實際上是真的,但我們因為樣本結果而錯誤地拒絕了它,這種錯誤的機率就是 。在科學研究中,常見的 值有 0.05 (5%)、0.01 (1%) 或 0.10 (10%)。題目中已設定 。
該研究的 p 值範圍:
在第 1 題的卡方檢定中,我們計算出的卡方統計量 ,自由度 。
我們需要找到對應於 和 的 p 值。
p 值是指在 為真時,得到當前樣本結果或更極端結果的機率。
我們知道,當 (臨界值) 時,p 值等於 。
由於我們計算出的卡方統計量 小於 臨界值 9.488,這表示我們的 p 值會 大於 0.05。
也就是說,如果 為真,我們觀察到 或更極端(即更大的 值)的機率,大於 0.05。
第 5 題10 分
請以第3題新冠疫苗研究為例,說明:
(1) 若參與研究的15位受試者包括9位女性、6位男性,年齡介於25-40歲,請說明該研究結果的應用限制。(10%)
(2) 當研究者先完成了A疫苗和C疫苗實驗後,獲得病毒樣本平均量(sample mean)各為3.6單位和6.1單位,且病毒樣本變異數(variance)各為1.5和2,即先進行兩疫苗組的病毒平均值差異統計分析。請完成此統計分析並說明結果。(10%)
(3) 呈(2),當研究者等三種疫苗實驗完成後才進行統計分析,並獲得第3題(1)的ANOVA分析結果,以及三組疫苗的病毒樣本平均量分別為A疫苗3.6單位、B疫苗4.5單位、C疫苗6.1單位,且病毒樣本變異數(variance)各為1.5,2.5,2。若欲評估A疫苗和C疫苗的病毒平均值差異,該如何進行?請完成此統計分析並說明其和(2)結果意義的異同。(10%)
登入後即可作答並保存紀錄。
本題考驗對實驗設計限制、獨立樣本 t 檢定,以及事後檢定 (Post-hoc tests) 的理解。
第 3 題實驗背景:
- 研究主題:新冠疫苗對冠狀病毒效果。
- 設計:混合設計 (Mixed Design),疫苗 (Vaccine) 是受試者間因子 (Between-Subjects, 3 水準:A, B, C),時間 (Time) 是受試者內因子 (Within-Subjects, 4 次測量)。
- 總受試者數:。
- (根據前一題的推論) 假設每組疫苗有 人。
(1) 若參與研究的15位受試者包括9位女性、6位男性,年齡介於25-40歲,請說明該研究結果的應用限制。(10%)
限制的來源:
研究結果的推論效度 (External Validity) 會受到樣本代表性 (Representativeness) 的影響。如果樣本特徵與目標母群體 (Target Population) 之間存在顯著差異,則研究結果的推論範圍就會受到限制。
分析樣本特徵:
- 性別比例: 9 位女性,6 位男性。女性比例較高 (60%)。
- 年齡範圍: 25-40 歲。這是一個相對年輕且健康的成年人群體。
限制說明:
- 性別代表性不足: 樣本中女性佔比較高。因此,該研究結果可能更適用於女性族群。對於男性族群,疫苗的效果可能有所不同,研究結果的推論到男性母群體時應謹慎。如果目標母群體是男女比例相當的成人,則此樣本的性別分佈會限制推論的普適性。
- 年齡代表性限制: 樣本年齡集中在 25-40 歲,屬於青壯年。這意味著研究結果可能無法直接推論到其他年齡層,特別是:
- 老年人: 老年人免疫系統功能可能較弱,對疫苗的反應可能與年輕人不同。
- 兒童/青少年: 疫苗在兒童和青少年身上的效果和安全性可能與成人不同。
- 其他未知的樣本特徵: 題幹中未提及其他可能影響疫苗效果的因素,例如:
- 健康狀況: 是否有慢性病史?免疫力高低?
- 種族/族裔: 不同族裔對疫苗的反應可能存在差異。
- 地理區域: 實驗地點的病毒流行情況、生活習慣等。
- 疫苗接種史: 是否曾接種過其他疫苗?
結論:
由於樣本在性別比例和年齡分佈上存在偏頗,且未提及其他可能影響結果的因素,因此該研究結果的應用範圍受到限制。研究結果可能更準確地反映了 25-40 歲女性對該疫苗的反應,而對於男性、老年人、兒童或具有特定健康狀況的族群,其推論效度會降低。
【答案】(1) 研究結果的應用限制包括:樣本性別比例偏向女性,可能導致結果對男性族群的推論效度降低;樣本年齡集中於 25-40 歲,研究結果可能無法直接推論至老年人、兒童或青少年族群;未提及其他可能影響疫苗效果的因素(如健康狀況、種族等),也限制了研究結果的普適性。
(2) 當研究者先完成了A疫苗和C疫苗實驗後,獲得病毒樣本平均量(sample mean)各為3.6單位和6.1單位,且病毒樣本變異數(variance)各為1.5和2,即先進行兩疫苗組的病毒平均值差異統計分析。請完成此統計分析並說明結果。(10%)
分析方法:
由於是比較兩組獨立樣本 (A 疫苗組 vs. C 疫苗組) 的平均數差異,且題目提供了樣本平均數、變異數,我們可以使用獨立樣本 t 檢定 (Independent Samples t-test)。
已知資訊:
- A 疫苗組:,
- C 疫苗組:,
- 根據第 3 題描述,總受試者 15 人,分三組,每組 5 人。因此,兩組的樣本數皆為 , 。
步驟一:設定虛無假設與對立假設
- : (A 疫苗組與 C 疫苗組的平均病毒量沒有差異)
- : (A 疫苗組與 C 疫苗組的平均病毒量有差異)
步驟二:計算統計量
首先,計算合併變異數 (pooled variance, ),因為兩組樣本數相同,此步驟可簡化。
合併變異數公式:
t 統計量公式:
步驟三:決定自由度 (df)
步驟四:判斷統計顯著性
假設顯著水準 (題目未給定,通常預設)。
查 t 分配表,自由度為 8,雙尾檢定 的臨界值約為 。
將計算出的 t 值與臨界值比較:
由於 (2.9877 > 2.306),我們拒絕虛無假設 。
結論:
在顯著水準 下,A 疫苗組與 C 疫苗組的平均病毒量有統計上顯著的差異。具體來說,C 疫苗組 (平均 6.1 單位) 的病毒量顯著高於 A 疫苗組 (平均 3.6 單位)。這初步顯示 C 疫苗的效果可能不如 A 疫苗。
【答案】(2) 統計分析方法為獨立樣本 t 檢定。
虛無假設 ,對立假設 。
合併變異數 。
t 統計量 。
自由度 。
在 下,臨界值為 。
由於 ,拒絕 。
結果:A 疫苗組與 C 疫苗組的平均病毒量有顯著差異,C 疫苗組的平均病毒量顯著高於 A 疫苗組。
(3) 呈(2),當研究者等三種疫苗實驗完成後才進行統計分析,並獲得第3題(1)的ANOVA分析結果,以及三組疫苗的病毒樣本平均量分別為A疫苗3.6單位、B疫苗4.5單位、C疫苗6.1單位,且病毒樣本變異數(variance)各為1.5,2.5,2。若欲評估A疫苗和C疫苗的病毒平均值差異,該如何進行?請完成此統計分析並說明其和(2)結果意義的異同。(10%)
分析方法:
當有多於兩組進行比較時,我們首先進行變異數分析 (ANOVA) 來檢定整體是否有顯著差異。如果 ANOVA 結果顯著,則進行事後檢定 (Post-hoc tests) 來找出具體哪些組別之間存在差異。
題目已經提供了第 3 題 (1) 的 ANOVA 分析結果(假設其是顯著的),並且給出了三組的平均數和變異數。現在要比較 A 和 C 兩組的差異。
已知資訊:
- A 疫苗組:, ,
- B 疫苗組:, ,
- C 疫苗組:, ,
- 假設 ANOVA 總檢定是顯著的。
評估 A 和 C 疫苗差異的兩種方式:
- 僅比較 A 和 C: 採用獨立樣本 t 檢定,如同問題 (2) 的方法。
- 利用 ANOVA 的事後檢定: 在 ANOVA 框架下,進行事後檢定來比較 A 和 C。
方法一:獨立樣本 t 檢定 (同問題 (2) 的計算)
- ,
- ,
- ,
- 合併變異數
- 臨界值 (, 雙尾)
- 結果:,拒絕 。A 和 C 兩組平均病毒量有顯著差異。
方法二:事後檢定 (Post-hoc Test)
在 ANOVA 框架下,進行事後檢定(例如 Tukey's HSD, Bonferroni 校正等)來比較 A 和 C。
由於我們已經知道 A 和 C 的平均數和變異數,並且樣本數相同,事後檢定的計算通常會基於 ANOVA 的誤差項 (Mean Square Error, MSE)。
在 ANOVA 中,MSE 是所有誤差項的合併平均數。