111 年 國立政治大學心理學系碩士班《心理與教育統計學、心理測驗學、心理實驗法》
第 1 題
假設兩常態分配 (normal distribution) 具有相同的變異數 (variance), 其平均數 (mean) 差異對應之 Cohen's d 為 0.5。
(1) 請將此兩分配繪製於同一張圖上, x 軸表變項數值, y 軸表機率強度, 並標示清楚 Cohen's d 表徵的差異為何。
(2) 請問此兩分配之重疊比例約為多少? (請概估此比例, 誤差在 10% 內可獲得分數)
登入後即可作答並保存紀錄。
核心觀念
本題考察兩個變異數相同的常態分配,其平均數差異以 Cohen’s 標準化表示:
其中 為兩分配的平均數, 為共同標準差。已知 ,代表兩分配的平均數相差半個標準差。
令共同標準差 ,則可設定:
因此:
解題方法
(1)繪製兩個常態分配
兩分配具有相同變異數,因此鐘形曲線的寬度與高度相同,只是中心位置不同。兩曲線的交點位於兩平均數的中點:
示意圖如下:
機率密度
y
↑
│ ╭────╮
│ ╭──╯ ╰──╮
│ ╭─╯ ╰─╮
│ ╭─╯ ╰─╮
│ ╭─╯ ╰─╮
│ ╭─╯ │ ╰─╮
│ ╭─╯ │ ╰─╮
│ ╭─╯ │ ╰─╮
└────────────────────┼────────────────────→ x
μ₁=-0.25 μ₂=0.25
↑
兩平均數差異 = 0.5σ
d = 0.5
更完整地表示:
第 2 題
關於假設檢定之型一錯誤率 (Type I error rate), 請回答以下問題。
(1) 何謂型一錯誤率?
(2) 在配對樣本 (paired sample) 下, 若使用獨立樣本 t 檢定 (independent sample t-test) 進行平均數差異檢定, 會對檢定之型一錯誤率帶來怎樣的影響?
登入後即可作答並保存紀錄。
此題旨在檢驗考生對假設檢定的基本概念,特別是型一錯誤及其在不同檢定情境下的影響。
核心觀念:
- 型一錯誤 (Type I error): 在虛無假說 (Null Hypothesis, ) 為真時,錯誤地拒絕 的情況。
- 型一錯誤率 (Alpha level, ): 虛無假說為真時,拒絕 的機率。在檢定時,我們通常設定一個顯著水準 ,例如 0.05。
- 配對樣本: 指兩組樣本資料是來自同一組對象,或經過配對的兩組對象,例如前後測資料,或實驗組與對照組的配對對象。其資料間存在相關性。
- 獨立樣本 t 檢定: 用於比較兩組獨立樣本的平均數差異。假設兩組樣本是獨立抽取的,彼此之間沒有相關性。
解題步驟:
(1) 何謂型一錯誤率?
- 定義: 型一錯誤率,通常以希臘字母 (alpha) 表示,是指在統計檢定中,當虛無假說 () 實際上為真時,我們卻做出拒絕該虛無假說的決策的機率。
- 意涵: 簡而言之,就是「誤報」的機率。例如,在醫學檢驗中,虛無假說可能是「病患沒有生病」,若檢定結果拒絕了這個虛無假說,但實際上病患並未生病,這就是一次型一錯誤。
- 顯著水準: 在進行假設檢定前,研究者會預先設定一個顯著水準 (例如 ),這個值就是我們願意接受的型一錯誤發生的最大機率。
【答案】
型一錯誤率 () 是指當虛無假說 () 為真時,卻錯誤地拒絕 的機率。
(2) 在配對樣本下, 若使用獨立樣本 t 檢定進行平均數差異檢定, 會對檢定之型一錯誤率帶來怎樣的影響?
- 問題核心: 獨立樣本 t 檢定的基本假設是兩組樣本是獨立的。然而,配對樣本資料具有相關性,不符合獨立樣本 t 檢定的獨立性假設。
- 影響分析:
- 配對樣本 t 檢定: 這種檢定方法會利用配對資料中的相關性來進行分析。
第 3 題
關於多重檢定 (multiple testing), 或稱多重比較 (multiple comparison), 請回答以下問題。
(1) 多重檢定關注的議題為何?
(2) Bonferroni 方法之理論基礎為何?
(3) Bonferroni 方法的主要缺點為何?
登入後即可作答並保存紀錄。
此題主要在測試考生對多重比較 (Multiple Comparisons) 概念的理解,特別是其必要性、Bonferroni 校正法的原理與限制。
核心觀念:
- 多重檢定 (Multiple Testing) / 多重比較 (Multiple Comparisons): 指在同一個研究中,對多個虛無假說進行統計檢定。
- 族群錯誤率 (Family-wise Error Rate, FWER): 在所有檢定中,至少發生一次型一錯誤 (拒絕一個真實的 ) 的機率。
- Bonferroni 校正法 (Bonferroni Correction): 一種簡單但保守的多重比較校正方法。
解題步驟:
(1) 多重檢定關注的議題為何?
- 核心問題: 當我們在同一個研究中進行多次統計檢定時,即使每次檢定都設定了 作為顯著水準,但由於進行了多次檢定,至少有一次犯下型一錯誤 (即在所有真實為零的 中,至少拒絕一個) 的總機率會顯著高於 。
- 具體來說:
- 族群錯誤率的膨脹 (Inflation of Family-wise Error Rate): 這是多重檢定最核心的議題。進行 次檢定,每次的顯著水準為 。若這些檢定是獨立的,則至少犯一次型一錯誤的機率為 。例如,若進行 5 次檢定,每次 ,則至少犯一次型一錯誤的機率為 ,遠高於 0.05。
- 維持族群錯誤率: 研究者希望控制整個研究的總體型一錯誤率,使其不超過預設的顯著水準 (如 0.05)。
- 尋找真實差異: 在探索性研究中,當有多個變項或多組比較時,需要一種方法來判斷哪些結果是真實存在的差異,而不是由隨機性造成的。
- 總結: 多重檢定關注的主要議題是如何在進行多次統計檢定時,有效控制 族群錯誤率 (FWER),避免因多次檢定而導致過高的型一錯誤機率,從而更可靠地識別出真實的統計顯著結果。
【答案】
多重檢定關注的主要議題是如何在同一個研究中進行多次統計檢定時,控制 族群錯誤率 (Family-wise Error Rate, FWER),避免因多次檢定而導致型一錯誤機率顯著膨脹,確保發現的統計顯著結果更可能是真實的差異,而非隨機誤差所致。
(2) Bonferroni 方法之理論基礎為何?
- 基本原理: Bonferroni 校正法的理論基礎非常直觀且保守。它利用了機率論中的一個基本不等式:布恩的概率不等式 (Boole's Inequality),或更常見地,是 Bonferroni 不等式。
- 不等式內容: 若 是 個事件,則 。
- 應用於多重檢定:
- 令 為第 個檢定中犯下型一錯誤的事件。
- 我們希望控制 。
- 根據 Bonferroni 不等式,這個機率小於或等於 。
第 4 題
關於推論統計 (inferential statistics), 請判斷以下說法之真偽。若說法有誤, 則請更正之。
(1) 某民調公司收集了資料, 並對某候選人之支持率建立了一個 95% 水準信賴區間 (level 95% confidence interval), 該區間之下上界為 [39%, 43%], 則 [39%, 43%] 此區間包含真實支持率的機率為 95%。
(2) 中央極限定理 (central limit theorem) 不僅可用於論證樣本平均數之抽樣分配 (sampling distribution) 為常態, 亦可用於論證樣本變異數之抽樣分配為常態。
(3) 給定樣本數, p 值 (p-value) 越小表示效果量 (effect size) 越大。
登入後即可作答並保存紀錄。
核心觀念
本題考查三個推論統計的重要觀念:
- 信賴區間的頻率學派解釋:信賴水準描述的是建構區間的方法,而不是某一個已經算出的區間包含參數的機率。
- 中央極限定理與抽樣分配:中央極限定理主要說明樣本平均數等樣本統計量在適當條件下的漸近常態性,不能無條件套用於樣本變異數。
- 值與效果量的區別: 值衡量資料對虛無假設的反證程度;效果量衡量差異或關係的實質大小,兩者不是同一概念。
解題方法
逐一檢查每個敘述中的統計定義是否正確,並區分:
- 「參數是否落在某個已觀察到的區間內」
- 「某種區間建構方法在長期重複抽樣下的涵蓋比例」
- 「有限樣本的確切分配」
- 「漸近分配」
- 「統計顯著性」與「實質重要性」
選項分析
(1)錯誤
題目宣稱:已建立 信賴區間 ,則此區間包含真實支持率的機率為 。
這是頻率學派對信賴區間的典型誤解。
設真實支持率為固定但未知的參數 ,由樣本計算出的區間為
在重複抽樣下, 信賴區間的定義是
這表示:如果反覆抽取許多組樣本,並且每次都用同一種方法建立信賴區間,長期而言約有 的區間會包含真實參數。
但是,當本次樣本已經觀察完畢,區間已經確定為 。在頻率學派中,真實支持率 是固定值,並非隨機變數,因此該區間「包含」或「不包含」真實支持率,不能再以機率 表示。
正確說法:
使用此信賴區間建構方法,在重複抽樣下所建立的區間,有 的比例會包含真實支持率;對於已得到的 ,真實支持率不是在區間內,就是不在區間內。
若採用貝氏統計並明確使用適當的先驗分配,則可以討論「在給定資料與模型下,參數落在區間內的後驗機率為 」,但那是可信區間的解釋,不是傳統頻率學派信賴區間的解釋。
(2)錯誤
題目宣稱:中央極限定理不僅可用於論證樣本平均數的抽樣分配為常態,也可用於論證樣本變異數的抽樣分配為常態。
此敘述有兩個問題。
樣本平均數的情況
若 為獨立同分配,母體平均數為 、變異數為 ,中央極限定理指出:
因此,當樣本數夠大時,樣本平均數的抽樣分配可近似為
這是中央極限定理最典型的應用。
樣本變異數的情況
樣本變異數定義為
一般而言, 的抽樣分配不是直接由中央極限定理保證為常態,也不能無條件宣稱為常態。
若母體本身為常態分配,則有一個更精確的結果:
第 5 題
關於簡單線性迴歸 (simple linear regression) 之假設 (assumption), 請判斷以下說法之真偽。若說法有誤, 則請更正之。
(1) 我們可以透過 x 與 y 各自的直方圖 (histogram) 來檢視迴歸分析要求之常態假設。
(2) 在大樣本之下, 即使常態假設違反, 統計報表所提供的參數檢定結果仍是可靠的。
(3) 當斜率 (slope) 不顯著時, 可推論 x 與 y 兩者為獨立的隨機變數。
登入後即可作答並保存紀錄。
核心觀念
簡單線性迴歸模型為
其中:
- :截距
- :母體斜率
- :誤差項
迴歸分析常見的基本假設包括:
- 線性關係:。
- 誤差項平均數為零:。
- 等變異性:。
- 觀察值或誤差彼此獨立。
- 誤差項常態性:。
其中,常態假設是針對「給定 之後的 」或「迴歸殘差」而言,而不是要求 與 各自的邊際分配必須常態。
迴歸斜率的假設檢定通常為:
檢定統計量為
其中 是樣本斜率。若未達顯著,正確解釋是「沒有足夠證據拒絕 」,而不是證明變項之間完全沒有關係。
解題方法
本題的三個敘述分別涉及:
- 常態假設究竟是針對哪些變數;
- 大樣本對非常態資料的影響;
- 「斜率不顯著」與「統計獨立」的差異。
判斷時應特別區分:
以及:
選項分析
(1)錯誤
我們可以透過 與 各自的直方圖來檢視迴歸分析要求之常態假設。
迴歸分析中的常態假設是:
也就是在控制或給定 之後, 的條件分配為常態;實務上通常透過檢查迴歸殘差來評估。
因此,適當的方法包括:
- 殘差直方圖;
- 殘差常態機率圖(Q-Q plot);
- 殘差與預測值圖;
- 殘差與自變項圖。
單獨觀察 與 各自的直方圖,無法判斷誤差項是否常態。原因如下:
- 不需要服從常態分配。若 被視為固定設計值,甚至不涉及其機率分配。
- 的邊際分配不一定常態,即使誤差項條件常態。因為不同的 值會造成不同的條件平均數。
- 與 各自看似常態,也不能保證殘差常態。
正確說法:
應透過迴歸殘差的分布,例如殘差直方圖或 Q-Q plot,來檢視誤差項的常態假設,而不是僅檢查 與 各自的直方圖。
(2)正確,但須附帶條件
在大樣本之下,即使常態假設違反,統計報表所提供的參數檢定結果仍是可靠的。
在其他重要假設大致成立時,大樣本通常可依賴中央極限定理,使估計量具有近似常態的抽樣分配。因此,即使誤差項不是常態分配,最小平方法估計量仍可能具有良好的大樣本近似:
第 1 題
說明和比較 Spearman 和 Thurstone 提出的智力理論內容。(6%)
登入後即可作答並保存紀錄。
此題主要在考察考生對智力多元理論發展歷程中,Spearman 的二因素論與 Thurstone 的多元心智能力論的理解與比較。
核心觀念:
-
Spearman 的二因素論 (Two-Factor Theory):
- 由 Charles Spearman 在 20 世紀初提出。
- 認為智力由兩種因素組成:
- 一般因素 (General Factor, g): 這是所有智力活動共有的核心因素,是影響所有認知能力的關鍵。g 因素的強度因人而異,是智力的主要決定因素。
- 特殊因素 (Specific Factor, s): 每種特定的智力活動 (如數學、語言、空間) 獨有的因素。每個特殊因素只對該特定活動有影響。
- 理論基礎: Spearman 透過因素分析 (Factor Analysis) 的方法,觀察到不同智力測驗分數之間存在正相關,他推論這種相關性源於一個共同的、一般的因素 (g)。
- 觀點: 偏向單一因素 (unifactorial) 的觀點,強調智力的普遍性。
-
Thurstone 的多元心智能力論 (Theory of Primary Mental Abilities, PMA):
- 由 Louis L. Thurstone 在 1930 年代提出,是對 Spearman 理論的一種回應與擴展。
- 他認為智力是由一系列相對獨立的 主要心智能力 (Primary Mental Abilities, PMAs) 組成的,而不是由單一的 g 因素主導。
- Thurstone 透過因素分析,識別出七種主要的心智能力:
- 語文理解 (Verbal Comprehension, V): 理解詞語的意義。
- 語文流暢 (Verbal Fluency, W): 快速產生詞語的能力。
- 數的運算 (Number Facility, N): 進行算術計算的能力。
- 空間關係 (Spatial Relations, S): 在空間中進行想像和推理的能力。
- 聯想記憶 (Associative Memory, M): 記憶配對的能力。
- 知覺速度 (Perceptual Speed, P): 快速準確地感知細節的能力。
- 推理 (Reasoning, R): 進行邏輯推理和問題解決的能力。
- 觀點: 偏向多元因素 (multifactorial) 的觀點,強調智力的多樣性與獨立性。
比較與對照:
| 特徵 | Spearman 的二因素論 (g + s) | Thurstone 的多元心智能力論 (PMA) |
|---|
第 2 題
說明如何以「多特質多方法矩陣」(Multi-Trait Multi-Method, MTMM) 中的相關係數檢驗一個測驗的效度 (Validity)。(6%)
登入後即可作答並保存紀錄。
此題旨在考察考生對 MTMM (Multi-Trait Multi-Method) 矩陣在測量效度檢驗中的應用,特別是如何透過分析相關係數來評估測驗的收斂效度 (convergent validity) 和區辨效度 (discriminant validity)。
核心觀念:
- 效度 (Validity): 指測驗測量其意圖測量的特質的程度。
- 多特質多方法矩陣 (MTMM): 由 Campbell & Fiske (1959) 提出,是一種用於評估測驗效度的方法。它透過同時測量多種不同的特質 (Traits),並對每種特質使用多種不同的測量方法 (Methods),來系統地分析測量結果之間的相關。
- 收斂效度 (Convergent Validity): 指的是用不同方法測量同一個特質時,其結果應該高度相關。例如,用問卷和訪談測量同一種人格特質,兩者的分數應該是高度正相關的。
- 區辨效度 (Discriminant Validity): 指的是用相同方法測量不同特質時,其結果應該低度相關;或者用不同方法測量不同特質時,其結果也應該低度相關。例如,用問卷測量「外向性」和「神經質」,這兩個特質分數之間的相關應該相對較低。
MTMM 矩陣的結構:
假設我們想評估特質 A 和特質 B 的效度,並使用了方法 1 (如問卷) 和方法 2 (如投射測驗)。則我們會得到以下測量:
- Trait A, Method 1 (A1)
- Trait A, Method 2 (A2)
- Trait B, Method 1 (B1)
- Trait B, Method 2 (B2)
將這些測量結果兩兩計算相關係數,會形成一個矩陣,其結構如下:
| A1 (Trait A, Method 1) | A2 (Trait A, Method 2) | B1 (Trait B, Method 1) | B2 (Trait B, Method 2) | |
|---|---|---|---|---|
| A1 | (Reliability) | |||
| A2 | Divergent | (Reliability) | ||
| B1 | Convergent | Divergent | (Reliability) | |
| B2 | Convergent | Convergent | Divergent | (Reliability) |
- 對角線上的值 (Reliability): 這些是同一個測量 (特質 A 用方法 1, A1) 與其自身相關的值,實際上通常是該測量的信度 (Reliability)。信度越高越好。
- 對角線下方 (或上方) 的值:
- 收斂效度相關 (Convergent Validity Correlations): 這些值是 用不同方法測量相同特質 的相關係數。例如,A1 與 B2 的相關,以及 A2 與 B1 的相關。這些相關係數應該是顯著且足夠高的,以證明我們確實測量到了相同的特質。
第 3 題
說明如何以題目特徵曲線 (Item-Characteristic Curve, ICC) 進行項目分析 (Item Analysis)。(6%)
登入後即可作答並保存紀錄。
此題主要在考察考生對題目特徵曲線 (ICC) 的理解及其在項目分析 (Item Analysis) 中的應用。
核心觀念:
- 項目分析 (Item Analysis): 指對測驗中的個別題目 (item) 進行統計分析,以評估題目的品質、難度、鑑別度等,進而判斷題目是否適合納入測驗。
- 題目特徵曲線 (Item-Characteristic Curve, ICC): 是一種圖形化的方法,用來描繪某一個題目在不同潛在特質分數 (latent trait score) 水平上的通過機率 (probability of a correct response)。
- ICC 的橫軸通常代表潛在特質的水平 (如能力、知識水準),通常標準化為平均數為 0,標準差為 1 的常態分配。
- ICC 的縱軸代表受試者在該題目上答對的機率。
如何利用 ICC 進行項目分析:
透過觀察 ICC 的形狀、位置和斜率,我們可以分析題目的特性:
-
題目難度 (Item Difficulty):
- 定義: 指答對該題目的難易程度,通常以答對率 (proportion correct) 表示。在 ICC 上,難度與曲線與橫軸的交點有關。
- ICC 上的表現:
- 位置: 曲線越靠右,表示答對該題目的潛在特質分數越高,題目越難。曲線越靠左,表示題目越容易。
- 參數模型 (如 Rasch Model): 在單參數模型 (Rasch model) 中,ICC 的位置完全由難度參數 (b) 決定。
- 分析: 檢查 ICC 的位置,判斷題目難度是否符合預期,是否適合目標施測對象。例如,若題目太難 (曲線太靠右),可能導致大部分人都答錯,不利於區分能力較高的學生。
-
題目鑑別度 (Item Discrimination):
- 定義: 指題目區分不同能力水準受試者的能力。能力高的受試者答對該題目的機率應顯著高於能力低的受試者。
- ICC 上的表現:
- 斜率: 曲線的斜率代表鑑別度。斜率越大,表示在潛在特質分數較高的範圍內,答對機率上升得越快,鑑別度越高。斜率越平緩,鑑別度越低。
- 參數模型 (如 2PL, 3PL): 在雙參數模型 (2PL) 或三參數模型 (3PL) 中,鑑別度由參數 a (slope parameter) 決定。a 值越大,曲線越陡峭,鑑別度越高。
- 分析: 檢查 ICC 的斜率。陡峭的曲線表示題目能有效地區分高低能力者。
第 4 題
說明因素分析 (Factor Analysis) 為何? 在發展一個新測驗的過程, 說明因素分析技術可能的適用時機和其功用。(6%)
登入後即可作答並保存紀錄。
此題主要在考察考生對因素分析 (Factor Analysis) 的基本概念、目的,以及其在測驗發展中的應用時機與功用。
核心觀念:
- 因素分析 (Factor Analysis):
- 是一種 統計技術,用於識別一組可觀察變數 (如測驗題目、問卷題目) 中潛藏的 潛在結構 (latent structure)。
- 其基本思想是,觀察到的變數之間的 共變異 (covariance) 或 相關 (correlation),是由一些更少的、共同的 潛在因素 (latent factors) 所解釋的。
- 目的在於 簡化資料,透過少數幾個潛在因素來解釋眾多變數之間的關係。
因素分析的目的 (為何):
- 識別潛在結構: 找出觀察變數背後所代表的潛在構念 (constructs) 或因素。例如,一組語文測驗分數的相關性,可能暗示著一個潛在的「語文能力」因素。
- 資料簡化 (Data Reduction): 將大量的變數壓縮成少數幾個因素,使資料更易於理解和處理。
- 建構理論: 幫助研究者發展或驗證關於變數之間關係的理論模型。
- 測驗發展: 協助建構測驗的結構效度 (construct validity),確定測驗是否測量了預期的潛在構念。
在發展一個新測驗時,因素分析的適用時機與功用:
發展一個新的心理測驗,特別是測量複雜心理構念 (如智力、人格、態度) 的測驗時,因素分析是一個重要的工具。
1. 適用時機 (When to use):
- 初期構念發展階段 (Early Stage of Construct Development): 當研究者對欲測量的構念有初步的概念,並已編擬了較多的題目 (item pool) 時,可以使用因素分析來探索這些題目是否能形成預期的潛在因素。
- 驗證測驗結構階段 (Validation Stage): 在測驗初步形成後,需要驗證其結構效度時,進行因素分析是標準程序。這通常是測驗發展中的一個關鍵步驟。
- 題目篩選與精煉階段 (Item Selection and Refinement): 透過因素分析的結果,可以判斷哪些題目與預期的潛在因素負荷 (factor loading) 高,哪些題目負荷低或負荷在多個因素上,從而決定哪些題目應該保留、修改或刪除。
2. 功用 (What it does):
- 確定潛在構念 (Identifying Latent Constructs):
- 探索性因素分析 (Exploratory Factor Analysis, EFA): 在測驗發展的早期,當對潛在結構不確定時,EFA 可以幫助識別題目所聚集成的因素群組。例如,可能發現編擬的 50 個題目,在因素分析後,能被歸納為「語文理解」、「邏輯推理」、「空間想像」三個潛在因素。
第 5 題
說明建立一個測驗的「標準化常模」(Standardized Norm) 之方法和步驟。(6%)
登入後即可作答並保存紀錄。
此題主要在考察考生對測驗標準化 (Standardization) 概念的理解,特別是建立常模 (Norming) 的過程與方法。
核心觀念:
- 標準化 (Standardization): 指在測驗發展過程中,建立一套標準化的施測、計分和結果解釋程序。
- 常模 (Norm): 指在一個特定、有代表性的參照團體 (reference group) 上,測驗分數的分佈情況。常模提供了一個比較基準,讓個別受試者的分數可以與該參照團體的平均表現進行比較。
- 標準化常模 (Standardized Norm): 指在標準化施測與計分後,將測驗分數轉換成基於標準化參照團體分數分佈的標準分數 (如 Z 分數、T 分數、百分等級等)。
建立標準化常模的方法與步驟:
建立一個標準化的常模,通常需要以下幾個關鍵步驟:
-
定義目標施測對象 (Define the Target Population):
- 首先要明確測驗是為哪些人設計的 (例如,國小三年級學生、大學生、某特定職業群體)。
- 明確目標對象的特徵,例如年齡、教育程度、地區、語言等。
-
選取代表性的參照團體 (Select a Representative Norm Group):
- 這是建立有效常模的 最關鍵步驟。參照團體必須能 代表 目標施測對象。
- 抽樣方法:
- 隨機抽樣 (Random Sampling): 理論上最佳,但實際操作困難。
- 分層隨機抽樣 (Stratified Random Sampling): 更為常用且有效。根據目標對象的關鍵特徵 (如年齡、性別、地區、社經地位、學校類型等) 將總體分層,然後從每一層中隨機抽取樣本。這樣可以確保樣本在關鍵特徵上與總體一致。
- 配額抽樣 (Quota Sampling): 根據預設的比例來選擇樣本,例如確保樣本中有 50% 的男性,50% 的女性。
- 樣本大小: 樣本必須足夠大,以確保統計結果的穩定性和代表性。具體大小取決於測驗的複雜性、總體的大小以及所需的精確度。
-
標準化施測程序 (Standardize the Testing Procedure):
- 統一說明: 制定標準化的測驗指導語,確保所有受試者都能獲得相同的指示。
- 統一計時: 若測驗有時間限制,必須嚴格控制時間,確保所有人在相同時間內完成。
- 統一環境: 盡量提供相似的施測環境 (如安靜、光線充足),避免外部干擾。
- 標準化計分: 制定清晰、客觀的計分規則,確保不同施測者或不同時間計分結果一致。對於主觀題,需要有明確的評分標準。
-
收集與分析數據 (Collect and Analyze Data):
- 按照標準化程序施測並收集所有樣本的測驗分數。
- 計算基本統計量: 計算樣本的平均數 ()、標準差 ()、中位數、眾數等。
- 分析分數分佈: 繪製分數的分佈圖 (如直方圖),檢查分數是否大致呈常態分配 (如果目標是建立常態化常模)。
- 計算信度與效度: 檢驗測驗的信度 (如內部一致性信度、再測信度) 和效度 (如內容效度、結構效度),確保測驗品質。
-
建立常模分數 (Develop Norm Scores):
- 分數轉換: 將原始分數 (raw scores) 轉換成標準分數,以便於解釋和比較。常見的標準分數包括:
- 百分等級 (Percentile Rank, PR): 表示某個原始分數在參照團體中,低於該分數的受試者比例。例如,PR=80 表示該分數高於 80% 的參照團體成員。
- 標準分數 (Standard Scores):
- 分數轉換: 將原始分數 (raw scores) 轉換成標準分數,以便於解釋和比較。常見的標準分數包括:
第 6 題
說明「測量標準誤」(Standard Error of Measurement) 在測驗分數解釋和應用上所扮演的角色和功能。(5%)
登入後即可作答並保存紀錄。
此題旨在考察考生對測量標準誤 (SEM) 的理解,以及它在解釋測驗分數時的重要性。
核心觀念:
- 測量標準誤 (Standard Error of Measurement, SEM):
- SEM 是指一個測驗分數的 變異性 (variability),也就是說,如果同一個受試者在相同條件下,被重複施測多次,其分數的標準差是多少。
- 它反映了測驗分數的 可靠性 (reliability),SEM 越小,表示測驗分數越穩定、越可靠。
- SEM 的計算公式通常為:,其中 是樣本分數的標準差, 是測驗的信度係數。
SEM 在測驗分數解釋和應用上的角色與功能:
-
估計真實分數的範圍 (Estimating the Range of True Score):
- 功能: 任何一個測驗分數都包含真實分數 (true score) 和測量誤差 (measurement error)。SEM 提供了一個方法來估計受試者真實分數可能存在的範圍。
- 解釋: 我們可以根據 SEM,為受試者的觀察分數建立一個「真實分數信賴區間」(True Score Confidence Interval)。例如,一個 95% 的真實分數信賴區間通常估計為:觀察分數 。這表示我們有 95% 的信心認為,受試者的真實分數落在這個區間內。
- 重要性: 這比只看單一的觀察分數更有意義,因為它承認了測量誤差的存在,提供了一個更審慎的解讀。
-
評估測驗的可靠性 (Assessing Test Reliability):
- 功能: SEM 是信度的一種直接指標。SEM 越小,表示測驗分數的變異性越小,即測驗的可靠性越高。
- 解釋: 如果一個測驗的 SEM 很大,意味著即使受試者的真實能力沒有改變,其測驗分數也可能因為測量誤差而有很大的波動。這樣的測驗就不可靠。
- 應用: 在比較不同測驗的可靠性時,SEM 提供了一個比信度係數更直觀的指標,因為它直接以原始分數的單位來表示誤差的大小。
-
判斷分數差異的意義 (Determining the Significance of Score Differences):
- 功能: SEM 可以用來判斷兩個分數之間的差異是否具有統計上的顯著性。
- 解釋:
- 兩個分數的差異: 如果我們要比較同一個受試者在不同時間點的分數,或者比較兩個不同受試者的分數,我們可以計算這兩個分數的差異,並與 SEM 進行比較。
第 1 題
If there is in fact a small, but real, difference between treatment conditions, which design is the most likely to detect that difference?
A. random-groups design
B. between-groups design
C. split-litter design
D. within-subjects design
登入後即可作答並保存紀錄。
核心觀念
本題在考察不同實驗設計的 統計檢驗力 (statistical power):在真實效應很小的情況下,哪種設計最容易偵測出差異?檢驗力受到 誤差變異 (error variance) 的影響,誤差變異越小,對小效應的偵測力就越大。
解題過程
-
誤差變異的來源
- 在 between‑groups(獨立樣本) 設計中,誤差變異主要來自 個體差異,即每一個受試者的水平差異。
- random‑groups 只是隨機抽樣的 between‑groups,誤差來源同上。
- split‑litter 設計把同一窩(或同一胎)的個體分到不同處理組,以減少 窩(litter)效應,屬於 blocked 設計,仍以 獨立樣本 為基礎,只是把一部份變異從誤差項中移除。
-
within‑subjects(重複測量)設計
- 同一受試者在所有處理條件下皆接受測驗,個體間的差異 被個體本身控制,只留下 受試者內部的變異(即處理間的差異)。
- 這等於在統計模型中加入 受試者作為隨機因子 (random effect),使誤差變異 大幅縮減。
-
檢驗力公式(簡化版)
第 2 題
Failure of an independent variable to produce changes in a dependent variable is called a
A. null result.
B. statistical error.
C. confound.
D. failure to replicate.
登入後即可作答並保存紀錄。
核心觀念
本題在測驗 實驗設計與統計推論 中,尤其是對「自變項 (independent variable)」與「依變項 (dependent variable)」之關係的理解。當自變項未能在統計上產生任何可觀測的變化,即觀測到 無效應,在實驗報告中稱為 null result(虛無結果),即「未拒絕虛無假設」。
解題步驟
-
釐清題目敘述
- 「Failure of an independent variable to produce changes in a dependent variable」意指實驗中自變項的操弄未導致依變項的任何顯著變化。
- 這種情況屬於 「未觀測到預期效應」,不是統計錯誤或研究設計的缺陷,而是實驗結果本身的描述。
-
逐項分析選項
選項 含意 為何不符合題意
第 3 題
In order to avoid scale attenuation effects, an experiment should be constructed in which
A. pilot subjects score near the bottom of the scale when there is no experimental manipulation so that positive effects on scores can be observed.
B. pilot subjects score near the top of the scale when there is no experimental manipulation so that negative effects on scores can be observed.
C. pilot subjects score near the middle range of the scale when there is no experimental manipulation so that any effect on scores, whether positive or negative, can be observed.
D. pilot subjects are not aware of the experimental manipulation.
登入後即可作答並保存紀錄。
核心觀念
本題檢驗的是 量表衰減(scale attenuation) 的概念。當受測者的起始分數已接近量表的上限或下限時,實驗操作所產生的正向或負向變化容易被「天花板效應」或「地板效應」所掩蓋,造成效應無法觀測。為避免此問題,實驗前應先以先導測試(pilot study) 確認受測者的基線分數落在量表的中間區間,使得任何方向的變化都能被測量到。
解題步驟與理由
-
了解量表衰減的機制
- 量表的測量範圍有限,若受測者的分數已靠近上限()或下限(),則即使實驗處理產生正向或負向變化,實際觀測分數仍可能卡在上限或下限,形成 天花板效應 或 地板效應。
- 這種情況會導致處理效應的 衰減,即實際效果被低估或完全「看不見」。
-
先導測試的目的
- 在正式實驗前,以少量受試者進行先導測試,觀察「無實驗操弄」時的基線分數分布。
第 4 題
Which of the following is not a property of measurement scales?
A. subjective equality
B. difference
C. magnitude of attributes
D. equal intervals
登入後即可作答並保存紀錄。
1. 本題核心概念
測量尺度(measurement scales)在心理與教育統計學中,用來描述變項能否被量化及可執行何種運算。常見的四大尺度屬性依序為:
- 等同性(subjective equality):能判斷兩個觀測值是否相同。
- 秩序性(difference/order):能判斷哪一個較大或較小。
- 等距性(equal intervals):相同的差異在尺度上具有相同的量值(可進行加減運算)。
- 比例性(absolute zero / equal ratios):具備真實的零點,可進行乘除運算。
題目要求找出 「不是」測量尺度的屬性,因此必須比對選項與上述四項正式屬性。
2. 解題步驟與說明
| 選項 | 與正式屬性的對照 | 為何屬於或不屬於測量尺度的屬性 |
|---|
第 5 題
_____ means that the investigator explains the general purposes of the research and answers any questions of the participant at the end of the experiment.
A. Debriefing
B. Informed consent
C. Freedom to withdraw
D. Confidentiality
登入後即可作答並保存紀錄。
核心概念
本題在測試受試者保護(research ethics)中「事後說明(debriefing)」的定義。研究者在實驗結束後向參與者說明研究的整體目的並解答疑問,即屬於 Debriefing,而非取得同意、退出自由或保密等概念。
解題過程
- 了解每個選項的意義
- Debracking(事後說明):在實驗結束後,研究者向參與者說明研究的真正目的、程序及可能的欺騙,並回答參與者的任何問題。此程序用於減少因實驗設計(尤其是欺騙)所造成的心理不適。
- Informed consent(知情同意):在實驗開始前,受試者被告知研究目的、程序、風險、利益與保密等資訊,並自願簽署同意書。
- Freedom to withdraw(退出自由):受試者在任何時點都有權自行停止參與,而不會受到任何懲罰。
- Confidentiality(保密):研究者對受試者的個人資料與回應負有保密義務,確保資料不被未授權者取得。
第 6 題
For which of the following situations would a within-subjects design be the more appropriate design?
A. we want to know whether training rats to learn one maze will aid learning a second, different maze.
B. we want to know whether ingesting alcohol will increase rats' preference for an alcoholic drink over a non-alcoholic drink.
C. we want to know whether a particular brain lesion will affect a rat's preference for a sweet solution.
D. we want to know whether rats prefer a solution sweetened with sugar more than a solution sweetened with saccharin.
登入後即可作答並保存紀錄。
核心觀念
本題在考核「重複測量(within‑subjects)設計」的適用情境。重複測量設計的要點是:同一個受試者必須接受所有實驗條件,藉此消除個體差異帶來的變異,適合條件之間不會產生長期或不可逆的影響,且可以在同一次測驗內直接比較。
解題步驟
- 釐清每個選項的實驗變項與受試者狀態
- A:比較「先訓練迷宮 1 再訓練迷宮 2」的效應。若使用同一批大鼠,第一個迷宮的訓練可能會永久改變學習策略,產生 搬移效應(carry‑over effect),不適合重複測量;較適合以 兩組(訓練 vs 未訓練)進行 between‑subjects 設計。
- B:比較「酒精攝取」前後對「酒精飲料 vs 非酒精飲料」偏好的變化。受試者在兩個狀態(酒精 vs 清醒)下測量,同一隻大鼠可以在兩次實驗間經過清洗期(wash‑out),理論上可採用重複測量,但酒精的持續效應可能導致 順序效應,需要謹慎控制。
- C:檢測「腦部病變」對偏好的影響。病變為一次性且不可逆的處理,同一隻大鼠不可能同時保持「有病變」與「無病變」兩種狀態,必須使用 between‑subjects 設計。
- D:比較「糖」與 「糖精」 兩種甜味劑的偏好。兩種溶液可同時或交替呈現於同一隻大鼠,且不會產生持續性或不可逆的生理改變,完美符合 within‑subjects 的條件。
第 7 題
Masking is used
A. to prime a participant prior to the onset of a target stimulus.
B. to bias an observer to perceive a stimulus in a particular way.
C. to manipulate the extent to which an observer is aware of a stimulus.
D. to prevent a participant from using visual cues in an experiment on auditory perception.
登入後即可作答並保存紀錄。
題目核心觀念
本題在測驗「掩蔽 (masking)」的概念。掩蔽是指在目標刺激前後或同時呈現另一個刺激(mask),以改變或降低受測者對目標刺激的意識程度。它的主要功能是 控制受測者的感知意識,而非單純提供提示或阻斷特定感官線索。
解題步驟
-
釐清「masking」的定義
- 在認知與感覺心理學中,masking 最常被用來 調節受測者對某個刺激的覺察程度。
- 常見的類型包括前向掩蔽 (forward masking)、後向掩蔽 (backward masking)、以及同時掩蔽 (simultaneous masking),這些手法皆是透過額外的刺激干擾,使目標刺激在意識層面上被「遮蔽」或「減弱」。(參考教科書《心理與教育統計學》、《認知心理學》)
-
逐一檢視選項
選項 含意 是否符合 mask 的核心功能 A: to prime a participant prior to the onset of a target stimulus. 「在目標刺激出現前先給予受測者預設」→ 這是 priming 的概念,不屬於掩蔽。 ❌
第 8 題
In signal detection theory, moving the criterion to the left will
A. decrease the false alarm rate.
B. increase the hit rate.
C. increase d'.
D. have no effect on the false alarm rate.
登入後即可作答並保存紀錄。
核心觀念
在訊號偵測理論(Signal Detection Theory, SDT)中,**決策標準(criterion)**決定受測者在「有訊號」與「無訊號」的情況下,何時回應「是」(Y)。
- 標準往左移(即變得較寬鬆/liberal),相當於把 c(criterion)值降低。
- 這會同時提升命中率(hit rate)與錯誤警報率(false‑alarm rate),但不影響感度指標 d'(它只由兩分布的距離決定,與 c 無關)。
解題過程
-
SDT 基本公式
- 命中率:
- 錯誤警報率:
其中 為標準常態分布的累積分布函數, 為決策標準, 為感度,(常設為 1)為噪聲與訊號分布的標準差。
-
標準向左移動的意義
- 「向左」=把 的數值變小(更負),即 。
第 9 題
The method section of an experiment report should contain enough information for
A. someone to know exactly what statistical analyses were performed in the experiment.
B. the reader to have a vague idea of how the study was done.
C. another experimenter to replicate the study.
D. the reader to have a general understanding of how the study was done.
登入後即可作答並保存紀錄。
核心觀念
本題在測驗對實驗報告「方法 (Method)」章節的寫作目的的理解。方法章節必須提供足夠、具體的細節,使其他研究者可以完全依照描述重新執行實驗,從而確保研究的可重複性(replicability)。
解題步驟
- 閱讀選項與題幹
-
題幹問:「方法章節 (Method section) 應包含足夠資訊以讓…」
-
四個選項分別描述四種可能的資訊需求程度:
- A:僅讓人知道「到底用了哪些統計分析」
- B:讓讀者「大概」了解實驗是怎麼做的(模糊)
- C:讓「另一位實驗者」能夠完全復刻此研究
- D:讓讀者「大致」了解實驗的執行方式(概括)
-
第 10 題
Which of the following independent variables would NOT be used in instrumental conditioning?
A. reinforcement schedules
B. magnitude of the reinforcement
C. delay of time between response and reinforcement
D. interval of time between the conditioned stimulus and the unconditioned stimulus
登入後即可作答並保存紀錄。
核心概念
本題測驗的是 工具化制約(instrumental conditioning) 與 古典制約(classical conditioning) 的差異。
在工具化制約中,研究者關注的是 行為(response)與增強(reinforcement)之間的因果關係,因此可操作的自變項多與 增強的時機、頻率與強度 相關;而 條件刺激(CS)與非條件刺激(US)之間的時間間隔 則屬於古典制約的範疇,與工具化制約無關。
解題過程
| 選項 | 是否屬於工具化制約的自變項 | 說明 |
|---|---|---|
| A. reinforcement schedules | ✅ | 增強排程(如固定比率、變比率、固定間隔、變間隔)直接決定增強出現的頻率,是工具化制約常用的自變項。 |
| B. magnitude of the reinforcement | ✅ | 增強的大小(例如食物量、金錢獎勵的多少)影響行為的強度,也屬於工具化制約的自變項。 |
第 11 題
(9%) A period that additional cognitive activities are difficult to manage while involving the current activity is known as (a) _____. The key manipulation of the experiment to demonstrate such phenomenon is the (b) _____ between the stimulus onsets of the two tasks, which would show an (c) _____ relationship with the speed of making response of the second task. The _____ model is preferred according to the evidence of (e) _____.
登入後即可作答並保存紀錄。
核心概念
本題在測驗雙任務(dual‑task)研究中最重要的現象——心理阻斷期(Psychological Refractory Period, PRP)。在同時執行兩項認知活動時,第二項的處理必須等到第一項的中央資源(決策/回應選擇階段)釋放,因而在兩個刺激的起始時差(Stimulus Onset Asynchrony, SOA)不同時,第二項的反應時間會呈遞減(負向)關係。實驗證據最符合中央瓶頸模型(central‑bottleneck model),其支持依據是加法因子法(additive‑factor method)顯示兩任務的處理階段在 PRP 時期不產生交互作用。
解題過程與說明
| 小題 | 內容說明 | 為何這樣填 |
|---|---|---|
| (a) | 心理阻斷期(Psychological Refractory Period, PRP) | PRP 被定義為當前認知活動仍在進行時,額外的認知活動難以同時處理的時間段。此概念正對應題目描述的「period that additional cognitive activities are difficult to manage while involving the current activity」。 |
| (b) | 刺激起始時差(Stimulus Onset Asynchrony, SOA) | 在雙任務實驗中,最常操控的變項是兩個刺激呈現的時間差,藉此改變第二任務開始的時間點,以觀察 PRP 效應。 |
第 12 題
(6%) In the memory experiment reported by Craik and Tulving (1975), they used words as the stimuli and asked the participants to do three different tasks requiring different depth of processing these words. The results showed that the recognition performance of the following memory test was the best when the task involve the (a) _____ processing of the words. Their findings support the theory of (b) _____, which proposed that (c) _____.
登入後即可作答並保存紀錄。
此題考的核心觀念
本題測驗加工深度(Depth of Processing)理論,亦稱層次加工(Levels of Processing)模型。它說明記憶效果取決於對刺激資訊的加工深度:表層(如字形或音韻)加工較淺,意義(semantic)加工較深,深層加工會產生較佳的記憶表現。Craik & Tulving (1975) 的實驗正是以此為依據,安排三種不同深度的字詞任務,觀察受試者的辨識表現。
解題過程
| 步驟 | 說明 |
|---|---|
| 1. 了解實驗設計 | 受試者閱讀單詞,分別完成 (1) 形狀加工(判斷字母是否全為大寫)、(2) 音韻加工(判斷字詞的發音是否含有「r」音)、(3) 意義加工(判斷字詞是否屬於動物)。這三項任務分別代表 淺層加工、中層加工、深層加工。 |
| 2. 觀察結果 | 記憶測驗採用**辨識(recognition)**方式。結果顯示:深層(語意)加工的單詞辨識率最高,其次是音韻加工,最後是形狀加工。 |
| 3. 連結理論 | Craik & Tulving 提出的 層次加工理論(Levels of Processing Theory) 主張:<br><br>即資訊被加工得越「意義化」或「語意化」,其在長時記憶中的痕跡就越牢固。 |