111 年 國立成功大學心理學系碩士班《方法學》
第 一 題50 分
一、統計學(50%)
- 請舉例說明何為調節效果 (moderation effect)。 (10%)
- 請說明何為邦佛洛尼校正 (Bonferroni correction)。 (10%)
- 執行簡單迴歸前,宜先繪製 X-Y 散佈圖 (scatter plot)。請由簡單迴歸假設中舉出兩個,並分別說明符合這兩個假設時, X-Y 散佈圖預期看到的樣子。 (15%)
- 假設原有 1000 筆成大同學身高之資料,今隨機將其中 200 筆抹除視為遺漏,再以剩餘 800 筆的平均數填補之,仍有 1000 筆。請問在填補前後,平均數的變化方向為何?變異數的變化方向為何?並請說明原因。 (15%)
登入後即可作答並保存紀錄。
本部分考驗統計學的基礎概念,涵蓋調節效果、多重比較校正、迴歸分析的假設檢定,以及資料填補對統計量的影響。
1. 調節效果 (Moderation Effect)
調節效果是指第三個變項(調節變項)會影響自變項與依變項之間的關係強度或方向。換句話說,調節變項的「存在」或「程度」會改變自變項對依變項的影響。
-
核心觀念: 變項之間的關係不是固定的,而是會受到另一個變項的影響。
-
舉例:
假設我們想研究「讀書時間」對「學業成績」的影響。- 自變項 (Independent Variable, IV): 讀書時間
- 依變項 (Dependent Variable, DV): 學業成績
- 調節變項 (Moderator Variable, MV): 學習動機
如果「學習動機」是「讀書時間」影響「學業成績」的調節變項,則表示: - 對於學習動機高的人來說,讀書時間越多,學業成績顯著提升。
- 對於學習動機低的人來說,即使讀書時間很多,學業成績的提升幅度可能不大,甚至可能因為枯燥而下降。
在這個例子中,「學習動機」調節了「讀書時間」與「學業成績」之間的關係。
-
答案: 調節效果是指第三個變項(調節變項)會改變自變項與依變項之間的關係強度或方向。例如,研究「運動量」對「體重減輕」的影響時,「飲食習慣」可能是一個調節變項。對於飲食習慣健康的人來說,運動量越大,體重減輕的效果越明顯;但對於飲食習慣不健康的人來說,即使運動量很大,體重減輕的效果可能不如預期,甚至因為攝取過多高熱量食物而效果不彰。
2. 邦佛洛尼校正 (Bonferroni Correction)
邦佛洛尼校正是用於處理多重比較(multiple comparisons)時,控制整體第一類錯誤率(family-wise error rate, FWER)的一種方法。當我們進行多次統計檢定時,即使每次檢定的顯著水準(alpha, )設定為 0.05,累計犯下至少一次第一類錯誤(拒絕了真實的虛無假設)的機率會大於 0.05。邦佛洛尼校正通過在每次檢定中降低顯著水準來應對這個問題。
-
核心觀念: 在多次檢定中,為了維持整體犯錯機率不超過預設值,需要對個別檢定的顯著水準進行調整。
-
計算方法:
假設我們要進行 次獨立的統計檢定,希望將整體第一類錯誤率控制在 。邦佛洛尼校正會將每個獨立檢定的顯著水準調整為 。
例如,若整體顯著水準 ,進行了 5 次檢定 (),則每次檢定的新顯著水準應為 。只有當個別檢定的 p 值小於 0.01 時,才被認為是統計上顯著的。 -
優點: 簡單易懂,適用於任何數量的比較。
-
缺點: 較為保守,容易增加第二類錯誤(未能拒絕錯誤的虛無假設),尤其是在進行大量比較時。
-
答案: 邦佛洛尼校正是一種用於在進行多次統計檢定時,控制整體第一類錯誤率(family-wise error rate, FWER)的方法。若總共進行 次檢定,並希望將整體第一類錯誤率控制在 ,則邦佛洛尼校正會將每次檢定的顯著水準調整為 。例如,若進行 5 次檢定,整體顯著水準為 0.05,則每次檢定的 p 值需小於 才能被判定為統計上顯著。此方法會增加第二類錯誤的機率,因為它對顯著性要求較為嚴格。
3. 簡單迴歸假設與散佈圖的預期樣子
執行簡單線性迴歸(simple linear regression)時,有幾個重要的假設。若這些假設成立,X-Y 散佈圖會呈現特定的視覺特徵。
-
核心觀念: 迴歸分析的有效性依賴於幾個關鍵假設,散佈圖是初步檢視這些假設的重要工具。
-
簡單迴歸的關鍵假設:
- 線性關係 (Linearity): 自變項 (X) 與依變項 (Y) 之間存在線性關係。
- 獨立性 (Independence of errors): 殘差(observed Y - predicted Y)之間相互獨立。
- 同質性/恆定變異數 (Homoscedasticity): 殘差的變異數在自變項的各個值上是恆定的。
- 常態性 (Normality of errors): 殘差服從常態分配(通常是為了推論統計,如信賴區間和假設檢定)。
-
舉出兩個假設並說明散佈圖的預期樣子:
-
假設一:線性關係 (Linearity)
- 說明: 這個假設要求自變項 X 和依變項 Y 之間存在一條直線關係。如果這項假設成立,當我們在散佈圖上繪製所有觀察點後,這些點應該大致分佈在某條直線的周圍。
- 散佈圖預期樣子: 散佈圖上的點會呈現一種「趨勢」,從左下到右上(正相關)或從左上到右下(負相關),並且看起來像是一條直線的模糊化版本。點不會明顯地聚集在曲線(如 U 形或 S 形)周圍,也不會呈現完全隨機、毫無趨勢的狀態。
-
假設二:同質性/恆定變異數 (Homoscedasticity)
- 說明: 這個假設要求殘差的變異數(即數據點相對於迴歸線的離散程度)在自變項 X 的所有值上都大致相同。換句話說,無論 X 是高是低,Y 對 X 的預測誤差的散佈程度應該是一致的。
- 散佈圖預期樣子: 在散佈圖上,當我們觀察 X 的不同範圍時,Y 點相對於預測線(或數據點的整體趨勢線)的散佈範圍應該是相似的。圖形看起來不會像一個「喇叭」或「扇形」,即 X 值增加時,Y 點的散佈範圍也隨之擴大(異質變異數,heteroscedasticity),也不會是 X 值增加時,散佈範圍縮小。點的散佈帶應該是大致等寬的。
-
-
答案:
- 線性關係 (Linearity): 此假設要求自變項 (X) 與依變項 (Y) 之間存在直線關係。若此假設成立,X-Y 散佈圖上的點會大致沿著一條直線(正相關或負相關)分佈,顯示出一個清晰的線性趨勢。
第 二 題50 分
二、心理測驗(50%)
- 請舉例說明,何為常模參照測驗(norm-referenced Test),何為效標參照測驗(criterion-referenced test)。(10%)
- 請舉出一個避免或偵測「假裝完美」(faking good)的措施,並說明此措施為何可避免或偵測「假裝完美」。(15%)
- 某測驗的平均數為 100、標準差為 20。若希望測量標準誤 (standard error of measurement) 小於 4,則符合條件的信度係數最小值為多少?(10%)
- 甲、乙為符合二參數題目反應理論(item response theory),測量相同能力的兩個題目。甲、乙兩個題目的難度都是 .5,但乙的區辨度為甲的兩倍。能力值為 1 時,甲的答對率為 .75,請說明能力值為何,可在乙上有 .75 的答對率。(15%)
登入後即可作答並保存紀錄。
本部分主要測試心理測驗的理論與應用,包括測驗參照標準、測驗偏差的處理、測量標準誤的計算,以及項目反應理論(IRT)的應用。
1. 常模參照測驗 (Norm-Referenced Test) 與效標參照測驗 (Criterion-Referenced Test)
這兩種測驗參照標準的取向,決定了分數的解釋方式。
-
核心觀念: 測驗分數的解釋是相對於「一群人」(常模)還是相對於「特定標準」(效標)。
-
常模參照測驗 (Norm-Referenced Test):
- 定義: 測驗分數的解釋是與一個參照團體(常模)的表現進行比較。分數代表個體相對於該參照團體的相對位置(例如,百分位數、標準分數)。
- 目的: 區分個體之間的差異,例如在選拔性考試(如 SAT、GRE)或智力測驗中。
- 舉例:
- 智力測驗 (Intelligence Test): 您的 IQ 分數是與同齡人的平均智力水平進行比較得出的。例如,IQ 130 表示您的智力表現優於 98% 的同齡人。
- 學業成就測驗 (Standardized Achievement Test): 考試成績報告您的分數是「百分位數 85」,表示您的表現比 85% 的考生好。
-
效標參照測驗 (Criterion-Referenced Test):
- 定義: 測驗分數的解釋是與預設的特定標準或技能領域(效標)進行比較。分數代表個體是否達到了某項特定的知識、技能或能力水平。
- 目的: 評估個體是否掌握了特定的內容或達到了特定的學習目標,例如在教學評量或技能認證中。
- 舉例:
- 駕照考試 (Driving License Test): 您的分數是根據您是否正確回答了所有考題(或達到某個通過分數線)來判斷您是否合格,而不是與其他考生比較。
- 技能認證考試 (Skill Certification Exam): 例如,電腦操作認證考試,要求您能執行特定軟體的一系列功能,通過即表示您具備該技能,與其他人表現無關。
- 教學評量 (Instructional Assessment): 老師給學生的期末考,如果老師說「分數 70 分以上即為及格」,這就是效標參照。
-
答案:
- 常模參照測驗: 測驗分數是與一個代表性的參照團體(常模)的表現進行比較,以確定個體在團體中的相對位置。例如,標準化智力測驗的分數,如 IQ 分數,會與同齡人的平均表現進行比較。
- 效標參照測驗: 測驗分數是與預設的特定標準或技能領域(效標)進行比較,以評估個體是否達到了該標準。例如,駕照考試的通過與否,是基於是否達到一定的交通規則和駕駛技能標準,而非與其他考生比較。
2. 避免或偵測「假裝完美」(Faking Good) 的措施
「假裝完美」是指受試者在測驗中故意呈現比實際情況更好的形象,尤其常見於人格測驗或臨床評估中,受試者可能為了獲得某種結果(如錄取、獲得幫助)而隱藏真實的缺點或誇大優點。
-
核心觀念: 設計測驗或分析結果時,要考慮到受試者可能存在的故意偏差。
-
避免或偵測措施:
一種常見且有效的方法是編制「社會期許量表」(Social Desirability Scale, SDS) 或「虛偽量表」(Lie Scale),並將其與主要測驗內容結合。 -
說明此措施為何可避免或偵測「假裝完美」:
-
偵測 (Detection):
- 原理: 社會期許量表通常包含一系列問題,這些問題描述了非常理想化、但對大多數人來說實際上難以完全達到的行為或特質(例如,「我從來沒有對任何人說過謊」、「我總是樂於助人」)。
- 運作方式: 如果受試者在這些社會期許問題上給出了非常「正面」或「理想化」的回答,則表明他可能在盡量呈現一個完美的形象。
- 判讀: 如果受試者在主要測驗(如人格測驗)上的得分很高,同時在社會期許量表上的得分也非常高,那麼研究者就可以懷疑其主要測驗結果可能受到「假裝完美」的影響,其真實性需要打折扣。這提供了一個警示信號,表明受試者的報告可能不完全誠實。
-
避免 (Prevention):
- 原理: 當受試者知道測驗中包含一個社會期許量表時,他們可能會意識到自己的回答會被評估誠實度。
- 運作方式: 這種意識可能會促使他們更誠實地回答其他問題,因為他們知道虛假或過度理想化的回答可能會被偵測出來,從而影響測驗的整體結果。
- 效果: 雖然不能完全阻止「假裝完美」,但它增加了受試者「被發現」的風險,從而可能起到一定的預防作用。
-
-
答案:
一種常見的措施是編制「社會期許量表」(Social Desirability Scale, SDS) 或「虛偽量表」(Lie Scale),並將其納入測驗中。- 偵測方面: 該量表包含一些描述極度理想化、但對大多數人而言難以完全做到的行為或特質(例如:「我從未批評過任何人」)。如果受試者在這些題目上給予了高度認同的回答,同時在主要測驗的結果也顯得過於完美,這就可能表明受試者有「假裝完美」的傾向,其主要測驗結果的可信度會受到質疑。
- 避免方面: 當受試者知道測驗中包含一個評估誠實度的量表時,他們可能會因此而更加謹慎,嘗試更誠實地回答問題,以免被偵測出虛假反應,從而可能降低「假裝完美」的程度。
3. 計算測量標準誤 (Standard Error of Measurement, SEM) 所需的最低信度係數
測量標準誤 (SEM) 是衡量測驗分數隨機誤差大小的指標。它表示一個人在多次重複測驗中,其真實分數預期會落在測量分數周圍的範圍。
-
核心觀念: 信度(reliability)越高,測量的隨機誤差越小,SEM 也越小。
-
公式:
測量標準誤 (SEM) 的公式為:
其中:- 是測量標準誤。
- 是測驗分數的標準差 (standard deviation)。
- 是測驗的信度係數 (reliability coefficient)。
-
題目資訊:
- 測驗平均數 () = 100 (此值對 SEM 計算無直接影響)
- 測驗標準差 () = 20
- 希望 SEM < 4