115 年 國立臺灣大學流行病學與預防醫學研究所甲:流行病組《生物醫學統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題

將一組共 800 人的收縮壓資料 XX (單位: mmHg), 對每個人做轉換 Y=(X−5)/2Y = (X-5)/2。下列敘述何者錯誤?
(A) YY 的平均值為 (原平均值-5)/2
(B) YY 的標準差 (standard deviation) 為原標準差的一半
(C) YY 的變異數 (variance) 為原變異數的四分之一
(D) YY 的四分位差 (interquartile range) 為原四分位差的一半
(E) YY 的變異係數 (coefficient of variation) 比原先小

登入後即可作答並保存紀錄。

這一題的完整詳解

此題主要考驗線性轉換對機率分佈統計量(平均值、標準差、變異數、四分位差、變異係數)的影響。

設原始資料為 XX,其統計量為 μX\mu_X (平均值)、σX\sigma_X (標準差)、σX2\sigma_X^2 (變異數)、IQRXIQR_X (四分位差)、CVX=σX/μXCV_X = \sigma_X / \mu_X (變異係數)。
轉換後的資料為 Y=aX+bY = aX + b,其中 a=1/2a = 1/2 且 b=−5/2b = -5/2。

線性轉換對統計量的影響規則如下:

  1. 平均值:E(aX+b)=aE(X)+bE(aX+b) = aE(X) + b
  2. 標準差:SD(aX+b)=∣a∣SD(X)SD(aX+b) = |a| SD(X)
  3. 變異數:Var(aX+b)=a2Var(X)Var(aX+b) = a^2 Var(X)
  4. 四分位差:IQR(aX+b)=∣a∣IQR(X)IQR(aX+b) = |a| IQR(X)
  5. 變異係數:CV(aX+b)=SD(aX+b)E(aX+b)=∣a∣SD(X)aE(X)+bCV(aX+b) = \frac{SD(aX+b)}{E(aX+b)} = \frac{|a| SD(X)}{aE(X)+b}

現在我們逐一檢視選項:

(A) YY 的平均值為 (原平均值-5)/2
根據規則 1, E(Y)=E(12X−52)=12E(X)−52=μX−52E(Y) = E(\frac{1}{2}X - \frac{5}{2}) = \frac{1}{2}E(X) - \frac{5}{2} = \frac{\mu_X - 5}{2}。此敘述正確。

(B) YY 的標準差 (standard deviation) 為原標準差的一半
根據規則 2, SD(Y)=SD(12X−52)=∣12∣SD(X)=12σXSD(Y) = SD(\frac{1}{2}X - \frac{5}{2}) = |\frac{1}{2}| SD(X) = \frac{1}{2}\sigma_X。此敘述正確。

(C) YY 的變異數 (variance) 為原變異數的四分之一

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題

在固定樣本數與效應量 (effect size) 不變的情況下,若將顯著水準 α\alpha 由 0.05 改為 0.01,且仍以「p<αp < \alpha 即拒絕虛無假說」為規則,下列敘述何者錯誤?
(A) 拒絕虛無假說會變得更困難 (門檻更嚴格)
(B) 在虛無假說為真時,拒絕虛無假說的機率會下降
(C) 檢力 (power) 通常會下降
(D) 犯型二誤差 (β\beta) 的機率通常會上升
(E) pp 值會因為改變而改變

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗顯著水準 α\alpha 變動對統計檢定的影響,特別是與第一型錯誤、第二型錯誤、檢力、p 值及檢定難度的關係。

核心觀念:

  • 顯著水準 α\alpha:在虛無假說為真時,拒絕虛無假說的機率,即第一型錯誤 (Type I error) 的機率。
  • 檢力 (Power):在對立假設為真時,正確地拒絕虛無假說的機率,Power = 1−β1 - \beta。
  • 型二錯誤 (β\beta):在對立假設為假時 (即虛無假設為真時),未能拒絕虛無假說的機率。

當顯著水準 α\alpha 由 0.05 降低到 0.01 時,代表我們對拒絕虛無假說的要求變得更高、更嚴格。

逐一檢視選項:
(A) 拒絕虛無假說會變得更困難 (門檻更嚴格)
α\alpha 變小,意味著我們需要更強的證據 (更小的 p 值) 才能拒絕虛無假說。因此,拒絕虛無假說的門檻確實變得更嚴格。此敘述正確。

(B) 在虛無假說為真時,拒絕虛無假說的機率會下降
在虛無假說為真時,拒絕虛無假說的機率就是第一型錯誤的機率,也就是 α\alpha。當 α\alpha 由 0.05 降至 0.01 時,此機率自然下降。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題

令 X,YX, Y 為隨機變數, a,ba, b 為常數, E(⋅)E(\cdot) 為期望值 (expected value), Var(⋅)Var(\cdot) 為變異數 (variance), Cov(⋅,⋅)Cov(\cdot, \cdot) 為共變異數 (covariance)。下列等式何者錯誤?
(A) E(aX+bY)=aE(X)+bE(Y)E(aX+bY) = aE(X) + bE(Y)
(B) Var(a+bX)=b2Var(X)Var(a+bX) = b^2 Var(X)
(C) E(XY)=E(X)E(Y)E(XY) = E(X)E(Y)
(D) Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)Var(X+Y) = Var(X) + Var(Y) + 2Cov(X, Y)
(E) Cov(X,a)=0Cov(X, a) = 0

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗機率論中關於期望值、變異數與共變異數的基本性質。

逐一檢視選項:
(A) E(aX+bY)=aE(X)+bE(Y)E(aX+bY) = aE(X) + bE(Y)
這是期望值 (期望值) 的線性性質,對於任意常數 a,ba, b 和隨機變數 X,YX, Y 均成立。此敘述正確。

(B) Var(a+bX)=b2Var(X)Var(a+bX) = b^2 Var(X)
這是變異數 (variance) 的性質。對於常數 aa 和隨機變數 XX, Var(a+bX)=Var(bX)=b2Var(X)Var(a+bX) = Var(bX) = b^2 Var(X)。此敘述正確。

(C) E(XY)=E(X)E(Y)E(XY) = E(X)E(Y)
此等式僅在 XX 和 YY 獨立 (independent) 時成立。題目並未說明 XX 和 YY 獨立,因此此等式不一定成立。例如,若 XX 與 YY 是相關的,則此等式通常錯誤。例如,令 XX 為一個丟硬幣的結果 (正面=1, 反面=0), Y=XY=X。則 E(X)=0.5E(X)=0.5, E(Y)=0.5E(Y)=0.5。 E(XY)=E(X2)=1×0.5+0×0.5=0.5E(XY) = E(X^2) = 1 \times 0.5 + 0 \times 0.5 = 0.5。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題

某母體的平均數為 μ\mu、變異數為 σ2\sigma^2。研究者從此母體以相同方式、彼此獨立地重複抽取許多次大小皆為 nn 的樣本,每次計算樣本平均數。下列何者最能正確描述樣本平均數的抽樣分佈 (sampling distribution) 之概念?
(A) 單一次抽樣得到的 nn 個原始觀測值
(B) 單一次抽樣得到的樣本平均數
(C) 母體參數 μ\mu 在不同樣本中的變動分佈
(D) 在固定 nn 下,重複抽樣所得到的樣本平均數之機率分佈
(E) 針對 nn 個原始觀測值取後放回抽樣 (sampling with replacement),重新抽取

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對「抽樣分佈」(sampling distribution) 概念的理解。

抽樣分佈是指「統計量」(statistic) 的分佈。在許多情況下,我們關心的是樣本平均數 (Xˉ\bar{X}) 的分佈。

  • 單一次抽樣得到的 nn 個原始觀測值:這是樣本本身,而不是統計量的分佈。
  • 單一次抽樣得到的樣本平均數:這是樣本平均數的一個具體數值,是抽樣分佈中的一個點,但不是分佈本身。
  • 母體參數 μ\mu 在不同樣本中的變動分佈:母體參數 μ\mu 是固定的,它本身沒有分佈。我們關心的是從母體中抽取樣本所得到的統計量(如樣本平均數)的分佈。
  • 在固定 nn 下,重複抽樣所得到的樣本平均數之機率分佈:這是抽樣分佈的正確定義。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題

急診室某類外傷到診人數可近似服從布阿松 (Poisson) 分佈,平均每小時到診數為 λ=3\lambda=3。在任一小時內,外傷到診人數「至少 1 人」的機率為何?
(A) e−3e^{-3}
(B) 1−e−31-e^{-3}
(C) 1−e−11-e^{-1}
(D) e−1e^{-1}
(E) 1−e−3−3e−31-e^{-3} - 3e^{-3}

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對 Poisson 分佈的理解及其應用。

Poisson 分佈的機率質量函數 (probability mass function, PMF) 為:
P(X=k)=e−λλkk!P(X=k) = \frac{e^{-\lambda} \lambda^k}{k!}, 其中 k=0,1,2,…k = 0, 1, 2, \dots 是事件發生的次數,λ\lambda 是平均發生率。

題目已知:

  • 到診人數 XX 服從 Poisson 分佈。
  • 平均每小時到診數 λ=3\lambda = 3。

要求計算在任一小時內,外傷到診人數「至少 1 人」的機率。
「至少 1 人」表示到診人數 XX 可以是 1,2,3,…1, 2, 3, \dots。
計算 P(X≥1)P(X \ge 1) 的最簡單方法是利用補集法則:
P(X≥1)=1−P(X<1)P(X \ge 1) = 1 - P(X < 1)
在 Poisson 分佈中,事件次數 kk 只能是 0,1,2,…0, 1, 2, \dots。因此,X<1X < 1 相當於 X=0X = 0。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 6 題

下列何者最正確描述伯努利 (Bernoulli) 分佈、二項分佈 (binomial) 與布阿松分佈 (Poisson) 之間的關係?
(A) 二項分佈是多次獨立伯努利試驗成功次數的分佈;且當 n→∞n \to \infty、p→0p \to 0、並使 np→λnp \to \lambda 時, Binomial(n,p) 可近似為 Poisson(λ\lambda)
(B) 伯努利分佈可視為布阿松分佈在 λ=1\lambda=1 時的特例;二項分佈則是多個布阿松隨機變數的和
(C) 布阿松分佈可視為二項分佈在 p=0.5p=0.5 時的近似;伯努利分佈則是二項分佈在 n=2n=2 的特例
(D) 伯努利分佈描述每次試驗的失敗次數;二項分佈描述第一次成功前的失敗次數;布阿松分佈描述固定次數試驗中的成功次數
(E) 若 X∼Binomial(n,p)X \sim \text{Binomial}(n, p), 則 XX 必可表示為 nn 個相互獨立、參數皆為 λ=p\lambda=p 的布阿松隨機變數之和

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對 Bernoulli, Binomial, Poisson 這三個重要離散機率分佈之間關係的理解。

我們逐一分析各個選項:

(A) 二項分佈是多次獨立伯努利試驗成功次數的分佈;且當 n→∞n \to \infty、p→0p \to 0、並使 np→λnp \to \lambda 時, Binomial(n,p) 可近似為 Poisson(λ\lambda)
- 前半句: 二項分佈 (Binomial) 是指進行 nn 次獨立的伯努利試驗 (Bernoulli trials),每次試驗成功的機率為 pp,成功次數的隨機變數服從二項分佈 B(n,p)B(n, p)。這句話是正確的。
- 後半句: 當二項分佈的試驗次數 nn 非常大,而單次成功的機率 pp 非常小,使得 npnp 的期望值趨近於一個常數 λ\lambda 時,二項分佈 B(n,p)B(n, p) 可以用 Poisson 分佈 Poisson(λ)Poisson(\lambda) 來近似。這個近似條件和結論是正確的。
因此,選項 (A) 是正確的。

(B) 伯努利分佈可視為布阿松分佈在 λ=1\lambda=1 時的特例;二項分佈則是多個布阿松隨機變數的和
- 前半句: 伯努利分佈描述一次獨立試驗的成功 (1) 或失敗 (0)。Poisson 分佈描述在一個時間段或空間中事件發生的次數,其參數為平均發生率 λ\lambda。Poisson 分佈的 k=0k=0 時機率為 e−λe^{-\lambda},k=1k=1 時機率為 λe−λ\lambda e^{-\lambda}。伯努利分佈的 k=0k=0 時機率為 1−p1-p,k=1k=1 時機率為 pp。這兩者不直接是特例關係,除非在非常特殊的參數設定下。例如,如果我們考慮一個 Poisson 分佈,其 λ\lambda 非常小,且我們只關心 k=0k=0 或 k=1k=1 的情況,並且進行某種轉換,或許可以近似。但一般而言,伯努利分佈不是 Poisson 分佈的特例。
- 後半句: 兩個或多個獨立的 Poisson 隨機變數的和仍然服從 Poisson 分佈,其參數為各參數之和。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 7 題

在進行單樣本平均數的假說檢定時,若將顯著水準 (Significance level, α\alpha) 從 0.05 縮減為 0.01,在其他條件不變的情況下,下列敘述何者正確?
(A) 型一錯誤 (Type I error) 的風險增加
(B) 檢力 (Statistical power) 會增加
(C) 拒絕虛無假設 (H0H_0) 的難度增加
(D) 信賴區間 (confidence interval) 的寬度會變窄

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗顯著水準 α\alpha 變動對假說檢定和信賴區間的影響。

核心觀念:

  • 顯著水準 α\alpha:在虛無假說為真時,拒絕虛無假說的機率 (Type I error)。
  • 檢力 (Power):在對立假設為真時,正確地拒絕虛無假說的機率 (1−β1 - \beta)。
  • 型二錯誤 (β\beta):在對立假設為假時 (即虛無假說為真時),未能拒絕虛無假說的機率。

當顯著水準 α\alpha 從 0.05 縮減為 0.01 時,表示我們設定的拒絕區域變小,對拒絕虛無假說的要求變得更嚴格。

逐一檢視選項:
(A) 型一錯誤 (Type I error) 的風險增加
型一錯誤的風險就是顯著水準 α\alpha。當 α\alpha 從 0.05 縮減到 0.01 時,型一錯誤的風險實際上是「降低」了,而不是增加。此敘述錯誤。

(B) 檢力 (Statistical power) 會增加
檢力是 1−β1 - \beta。當 α\alpha 降低時,拒絕區域變小。如果對立假設為真,我們就更難拒絕虛無假說,這意味著 β\beta (型二錯誤的機率) 會增加。由於 Power = 1−β1 - \beta,當 β\beta 增加時,Power 會下降。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 8 題

某研究探討新型降血壓藥物的效果,得到 95% 信賴區間為 [−2 mmHg,15 mmHg][-2 \text{ mmHg}, 15 \text{ mmHg}]。關於此結果,下列詮釋何者最為精確?
(A) 有 95% 的把握該藥物具有顯著降壓效果
(B) 若虛無假設為「效果=0」,則在 α=0.05\alpha = 0.05 下無法拒絕虛無假設
(C) 該研究有 95% 的機率涵蓋了樣本平均數
(D) 該藥物在 95% 的受試者身上都有療效

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對 95% 信賴區間 (Confidence Interval, CI) 的正確詮釋。

信賴區間的正確定義是:
「我們有 95% 的信心,母體參數 (在此案例中是藥物對血壓的平均影響) 落在這個區間內。」
或者更嚴謹地說:
「如果我們重複進行多次抽樣並計算信賴區間,那麼大約 95% 的這些信賴區間會包含真實的母體參數。」

讓我們逐一分析選項:

(A) 有 95% 的把握該藥物具有顯著降壓效果
- 「顯著降壓效果」通常是指統計檢定上的顯著性。在假說檢定中,我們通常檢定虛無假設 H0H_0: 藥物效果 = 0。如果 95% 的信賴區間不包含 0,則在 α=0.05\alpha=0.05 的顯著水準下,我們可以拒絕 H0H_0,得出藥物效果顯著的結論。
- 然而,這個區間 [−2,15][-2, 15] 包含 0。這意味著藥物效果為 0 是這個區間內的一個可能值。因此,我們不能有 95% 的把握說它「具有顯著降壓效果」(即效果不等於 0)。此敘述不精確,甚至可能錯誤,因為區間包含 0。

(B) 若虛無假設為「效果=0」,則在 α=0.05\alpha = 0.05 下無法拒絕虛無假設
- 這是信賴區間與假說檢定之間關係的正確應用。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 9 題

下列有關迴歸分析 (regression analysis) 的描述,何者有誤?
(A) 若解釋變數 (explanatory variable) X1X_1 的迴歸係數為正,代表 X1X_1 與反應變數 (response variable) YY 有正相關。
(B) 只要建立好迴歸模型,就可以說明解釋變數 (explanatory variable) 與反應變數 (response variable) 之間有因果關係。
(C) 迴歸模型可以用來說明解釋變數 (explanatory variable) 與反應變數 (response variable) 之間變化的線性相關性。
(D) 判定係數 (coefficient of determination) R2R^2 是用來測量模型的解釋能力,越接近 1 代表模型的解釋能力越佳。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗迴歸分析的基本概念,包括迴歸係數的解釋、相關性與因果關係的區別、迴歸模型的用途以及判定係數 R2R^2 的意義。

我們逐一檢視選項:

(A) 若解釋變數 (explanatory variable) X1X_1 的迴歸係數為正,代表 X1X_1 與反應變數 (response variable) YY 有正相關。
- 在簡單線性迴歸模型 Y=β0+β1X1+ϵY = \beta_0 + \beta_1 X_1 + \epsilon 中,迴歸係數 β1\beta_1 代表當 X1X_1 增加一個單位時,在控制其他解釋變數 (如果有的話) 的情況下,YY 的平均值預期會改變 β1\beta_1 個單位。
- 如果 β1>0\beta_1 > 0,則 X1X_1 增加時,YY 的平均值也預期增加,這與正相關的定義一致。
- 在多元迴歸中,若其他變數固定,此解釋依然成立。
- 此敘述正確。

(B) 只要建立好迴歸模型,就可以說明解釋變數 (explanatory variable) 與反應變數 (response variable) 之間有因果關係。
- 迴歸分析主要描述變數之間的「關聯性」或「預測性」,但它本身無法證明「因果關係」。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 10 題

請問,在解釋迴歸分析的結果時,下列敘述何者有誤?
(A) t 檢定 (t test) 可以檢驗特定迴歸係數是否為 0,若檢定結果推翻虛無假說 (null hypothesis),就可以說此係數所代表的解釋變數 (explanatory variable) 與反應變數 (response variable) 具有因果關係。
(B) F 檢定 (F test) 可以檢定迴歸模型中的所有迴歸係數是否同時為 0,用以推論此迴歸模型是否有用,若檢定結果推翻虛無假說 (null hypothesis),就可以說模型中的所有解釋變數 (explanatory variable) 與反應變數 (response variable) 之間皆存在相關性。
(C) 若迴歸模型中放入性別 (男性為 0,女性為 1),所估計的迴歸係數 βsex\beta_{\text{sex}} ,解釋意義為男性相較與女性,反應變數 (response variable) 的期望值會多 βsex\beta_{\text{sex}}。
(D) 若模型中放入體重 (以每一公斤為單位),此變數前的迴歸係數 βwt\beta_{\text{wt}} 所代表的意義是,解釋變數 (explanatory variable) 每增加一公斤,反應變數 (response variable) 會增加 βwt\beta_{\text{wt}}。

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

本題考查迴歸分析中三個重要概念:

  1. tt 檢定:檢定單一迴歸係數是否為 00。
  2. FF 檢定:檢定所有斜率係數是否同時為 00。
  3. 類別變數與連續變數迴歸係數的解釋。

考慮迴歸模型:

E(Y∣X)=β0+β1X1+⋯+βpXpE(Y\mid X)=\beta_0+\beta_1X_1+\cdots+\beta_pX_p

其中迴歸係數的解釋,原則上是「在其他變數固定下,反應變數條件期望值的改變」,不能直接推論因果關係。


解題方法

逐一檢查各選項是否符合:

  • 檢定所能推論的範圍;
  • 迴歸係數的正確解釋;
  • 類別變數編碼後的比較方向。

本題依題目原文判斷,並非只有一個錯誤選項;AA、BB、CC 均有統計解釋上的錯誤,DD 在一般教科書的簡化說法下正確。


選項分析

(A)錯誤

tt 檢定可檢定特定迴歸係數是否為 00:

H0:βj=0vs.H1:βj≠0H_0:\beta_j=0 \qquad\text{vs.}\qquad H_1:\beta_j\neq 0

若拒絕虛無假說,只能表示在控制模型中其他變數後,XjX_j 與 YY 之間具有統計上的條件關聯,不能直接表示兩者具有因果關係。

因果推論還必須考慮研究設計、時間先後順序、混雜因子、選擇偏差及測量誤差等因素。因此,選項中「就可以說具有因果關係」的說法錯誤。


(B)錯誤

整體迴歸模型的 FF 檢定通常檢定:

H0:β1=β2=⋯=βp=0H_0:\beta_1=\beta_2=\cdots=\beta_p=0 H1:至少有一個 βj≠0H_1:\text{至少有一個 }\beta_j\neq 0

若拒絕 H0H_0,只能表示模型中至少有一個解釋變數與反應變數具有條件關聯,或表示整體模型相較於只有截距的模型具有解釋力。

不能據此推論模型中的「所有」解釋變數都與反應變數存在相關性。因此,本選項錯誤。


(C)錯誤

令男性為 00、女性為 11,模型可寫成:

E(Y∣sex,X)=β0+βsexsex+⋯E(Y\mid \text{sex},X) = \beta_0+\beta_{\text{sex}}\text{sex}+\cdots

男性的條件期望值為:

E(Y∣男性,X)=β0+⋯E(Y\mid \text{男性},X)=\beta_0+\cdots
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 11 題

下列有關線性迴歸 (linear regression) 的建構,何者有誤?
(A) 模型需假設解釋變數 (explanatory variable) 服從常態分配 (normal distribution), 意即 X∼N(μX,σX2)X \sim N(\mu_X, \sigma_X^2)。
(B) 模型有變異數同質 (homoscedasticity) 的假設,也就是說每筆觀察值要有相同的變異數 σ2\sigma^2。
(C) 線性迴歸分析 (linear regression analysis) 沒有樣本數與變數個數的限制,所以即便變數個數多於樣本數,也可以使用一般的線性迴歸模型。
(D) 線性迴歸模型 (linear regression model) 中迴歸係數,可以利用最小平方法 (least squared estimates, LSE) 進行估計。

登入後即可作答並保存紀錄。

這一題的完整詳解

核心觀念

線性迴歸模型通常寫成:

Yi=β0+β1Xi1+⋯+βpXip+εiY_i=\beta_0+\beta_1X_{i1}+\cdots+\beta_pX_{ip}+\varepsilon_i

矩陣形式為:

Y=Xβ+ε\mathbf{Y}=\mathbf{X}\boldsymbol{\beta}+\boldsymbol{\varepsilon}

其主要假設包括:

  1. 條件平均數呈線性:E(Y∣X)E(Y\mid X) 可由解釋變數的線性組合表示。
  2. 誤差項平均數為 0:E(εi∣X)=0E(\varepsilon_i\mid X)=0。
  3. 變異數同質:Var(εi∣X)=σ2Var(\varepsilon_i\mid X)=\sigma^2。
  4. 觀察值獨立。
  5. 若要進行小樣本的精確推論,常再假設誤差項服從常態分配: εi∣X∼N(0,σ2)\varepsilon_i\mid X\sim N(0,\sigma^2)

值得注意的是,常態性通常是對「誤差項」或「應變數在給定解釋變數下的條件分布」所作的假設,不是要求解釋變數本身服從常態分配。

迴歸係數可用最小平方法估計:

β^=(XTX)−1XTY\hat{\boldsymbol{\beta}} =(\mathbf{X}^{\mathsf T}\mathbf{X})^{-1} \mathbf{X}^{\mathsf T}\mathbf{Y}

但此公式成立的前提是 XTX\mathbf{X}^{\mathsf T}\mathbf{X} 可逆,通常要求樣本數大於參數個數,且解釋變數之間沒有完全共線性。

解題方法

本題直接逐一檢查各選項是否符合標準線性迴歸模型的假設與最小平方法的使用條件:

  • 先判斷常態分配究竟是針對解釋變數還是誤差項。
  • 再檢查變異數同質性。
  • 接著檢查樣本數與變數個數對普通最小平方法的限制。
  • 最後確認迴歸係數是否可用最小平方法估計。

選項分析

(A) 錯誤

線性迴歸模型不要求解釋變數 XX 必須服從常態分配。解釋變數可以是連續變數、類別變數,甚至在實驗設計中由研究者固定指定。

若採用常態線性模型,常見的假設是:

Yi∣Xi∼N(β0+β1Xi,σ2)Y_i\mid X_i\sim N(\beta_0+\beta_1X_i,\sigma^2)

等價地表示為:

εi∣Xi∼N(0,σ2)\varepsilon_i\mid X_i\sim N(0,\sigma^2)

因此,常態性主要是誤差項的條件分布假設,而不是 XX 必須符合:

X∼N(μX,σX2)X\sim N(\mu_X,\sigma_X^2)

即使 XX 不服從常態分配,只要模型的其他條件合理,仍可進行線性迴歸分析。

(B) 正確

變異數同質性是線性迴歸的重要假設之一,表示在不同解釋變數水準下,誤差項的變異數相同:

Var(εi∣Xi)=σ2Var(\varepsilon_i\mid X_i)=\sigma^2

也就是每筆觀察值的誤差變異數相同。若變異數隨著 XX 改變,便稱為變異數異質性,會影響標準誤、信賴區間與假設檢定的正確性。

(C) 錯誤

普通線性迴歸並非沒有樣本數與變數個數的限制。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 12 題

下列不同的研究設計或研究問題中,哪些不應該使用線性迴歸分析 (linear regression analysis)?
(A) 某長照研究者,分析政府長照服務使用資料庫的資料,想探討政府提供的五種喘息服務的對減輕照顧者的照顧負荷 (為一透過量表測量的負荷壓力分數) (Y) 的影響程度為何 (註:資料為歸人檔,一位被照顧者會化整為一筆紀錄)。
(B) 某研究者針對懷孕婦女進行一前瞻性世代研究 (prospective cohort study),想探討懷孕婦女的飲食習慣、運動習慣、健康行為對懷孕期間血糖 (Y) 變化的影響,血糖會透過儀器進行連續性血糖監測 (Continuous Glucose Monitoring, CGM),為一連續數值,會透過特殊的統計模型將懷孕 10 個月的血糖數值轉為一個分數,解釋變數 (explanatory variable) 也都轉為一個代表數值,因此每一位孕婦只有一筆資料。
(C) 某研究者想探討某藥物治療 (X) 對疾病復發與否 (Y) 是否有影響,從醫院的資料庫撈取病人的臨床資訊 (如:年齡、性別、治療處置、生化檢查值等) 進行研究分析。
(D) 某研究者進行一配對病例對照研究 (matched case-control studies) 設計,想探討憂鬱症患者發病時與健康對照組的人,每週平均的生理活動量 (此為一連續數值) (Y) 是否有差異,此差異會受哪些因素影響。

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對線性迴歸分析適用條件的理解,特別是反應變數 (Y) 的類型以及研究設計的特點。線性迴歸分析通常適用於反應變數為連續變數的情況。

我們逐一檢視選項:

(A) 探討五種喘息服務對「照顧負荷 (負荷壓力分數)」的影響。
- 反應變數 YY 是「照顧負荷 (負荷壓力分數)」。量表的得分通常是連續或接近連續的數值,可以視為連續變數。
- 解釋變數是五種喘息服務,這可以透過編碼 (例如虛擬變數) 來處理。
- 這種情況下,使用線性迴歸分析來估計不同服務對照顧負荷的影響程度是適當的。
- 因此,此情況「可以」使用線性迴歸。

(B) 探討飲食、運動、健康行為對「懷孕期間血糖變化 (分數)」的影響。
- 反應變數 YY 是「血糖變化的分數」。題目說明血糖是連續數值,並透過統計模型轉為一個分數,這表示 YY 是一個連續變數。
- 解釋變數是飲食習慣、運動習慣、健康行為等,這些可以透過編碼或轉換為數值變數。
- 此情況下,使用線性迴歸分析來探討這些因素對血糖變化的影響是適當的。
- 因此,此情況「可以」使用線性迴歸。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 13 題15 分

某研究想了解睡眠時間長短 (小時) 與身高 (公分) 的關係,現搜集 40 筆資料進行簡單線性迴歸分析,下表為迴歸分析中 ANOVA 的表。
ANOVA

自由度SSMSF顯著值
迴歸14114.3284114.32828.270
殘差385530.360145.536
總和399644.688

迴歸分析的另一部分結果見下表。
係數

係數標準誤95% 信賴區間t 統計P-值
截距106.19011.026(83.87, 128.51)9.631<0.0001
睡眠時間8.2081.544(5.08, 11.33)5.317<0.0001

(1) 請寫出迴歸模型並用迴歸分析的結果解釋睡眠時間長短與身高的關係。(5分)
(2) 請問睡眠時間長短與身高的相關係數是多少?(5分)
(3) 請解釋睡眠時間的迴歸係數的 95% 信賴區間的意義。(5分)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題為簡單線性迴歸分析應用題,包含模型建立、係數解釋、相關係數計算及信賴區間解釋。

核心概念:

  • 簡單線性迴歸模型:Y=β0+β1X+ϵY = \beta_0 + \beta_1 X + \epsilon
  • ANOVA 表:用於檢定迴歸模型的整體顯著性,提供 SS (Sum of Squares), MS (Mean Square), F 統計量。
  • 係數表:提供截距 (β0\beta_0) 和斜率 (β1\beta_1) 的估計值 (β^0,β^1\hat{\beta}_0, \hat{\beta}_1)、標準誤、信賴區間、t 統計量和 p 值。
  • 相關係數 (Pearson's r):衡量兩個連續變數之間線性關聯的強度和方向。
  • 信賴區間:對母體參數的估計範圍。

解題步驟:

(1) 請寫出迴歸模型並用迴歸分析的結果解釋睡眠時間長短與身高的關係。(5分)

  • 迴歸模型:
    根據係數表,我們得到:

    • 截距 (Intercept) 的估計值 β^0=106.190\hat{\beta}_0 = 106.190
    • 睡眠時間 (解釋變數, XX) 的迴歸係數 (斜率) β^1=8.208\hat{\beta}_1 = 8.208
    • 反應變數 YY 是身高 (cm)。
    • 簡單線性迴歸模型為:Y^=β^0+β^1X\hat{Y} = \hat{\beta}_0 + \hat{\beta}_1 X
      因此,迴歸模型為:
      身高^=106.190+8.208×(睡眠時間)\hat{\text{身高}} = 106.190 + 8.208 \times (\text{睡眠時間})
  • 解釋關係:

    • 截距 (β^0=106.190\hat{\beta}_0 = 106.190): 當睡眠時間為 0 小時時,預測的身高為 106.190 公分。然而,由於睡眠時間為 0 通常不在資料的範圍內 (外插),此截距的實際解釋意義可能有限。
    • 斜率 (β^1=8.208\hat{\beta}_1 = 8.208): 睡眠時間每增加 1 小時,預測的身高會增加 8.208 公分。這表示睡眠時間與身高之間存在正向的線性關係。
    • 統計顯著性: 從係數表來看,睡眠時間的 t 統計量為 5.317,p 值 < 0.0001。這表示在統計上,睡眠時間對身高的影響是顯著的 (p < 0.05),並且我們有很強的證據拒絕虛無假設 (即睡眠時間的迴歸係數為 0)。
    • 模型整體顯著性: 從 ANOVA 表來看,F 統計量為 28.270,p 值 < 0.0001。這表示整個迴歸模型是統計上顯著的,即至少有一個解釋變數 (在此只有睡眠時間) 對身高有顯著的預測能力。
    • 判定係數 (R2R^2): 我們可以從 ANOVA 表計算 R2R^2:
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 14 題

在一項關於某種新興傳染病疫苗效果的世代研究 (Cohort Study) 中,研究人員追蹤了兩組參與者:
• 疫苗組 (Vaccinated): 200 人,追蹤期間有 10 人感染。
• 對照組 (Unvaccinated): 200 人,追蹤期間有 40 人感染。
(1) 請進行假說檢定,設定虛無假設 (H0H_0) 與對立假設 (H1H_1),使用常態逼近法 (Z-test for two proportions) 計算檢定統計量,並判斷在 α=0.05\alpha = 0.05 下,兩組感染率是否有顯著差異? (5分)
(2) 請計算疫苗組對相比於對照組的相對風險 (RR) 與其 95% 信賴區間 (已知 z0.975≈1.96z_{0.975} \approx 1.96)(5分)
(3) 根據假說檢定與信賴區間的結果,請問兩者結果是否一致,並請判斷疫苗是否具有顯著的保護效果? (2分)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對兩比例檢定 (two-proportion Z-test) 和相對風險 (Relative Risk, RR) 的計算與解釋,以及假說檢定與信賴區間結果的一致性。

核心概念:

  • 世代研究 (Cohort Study):追蹤暴露組和未暴露組,比較結果發生的頻率。
  • 比例 (Proportion):某事件在總體中發生的頻率。
  • Z-test for two proportions:用於比較兩獨立樣本比例是否有顯著差異。
  • 相對風險 (RR):暴露組結果發生率與未暴露組結果發生率之比。
  • 信賴區間 (Confidence Interval, CI):對參數 (如 RR) 的估計範圍。
  • 假說檢定與信賴區間的關係:若信賴區間不包含虛無假設中的參數值,則在對應的顯著水準下,可以拒絕虛無假設。

數據整理:

  • 疫苗組 (Vaccinated): n1=200n_1 = 200, 感染人數 x1=10x_1 = 10。感染率 p^1=x1/n1=10/200=0.05\hat{p}_1 = x_1/n_1 = 10/200 = 0.05。
  • 對照組 (Unvaccinated): n2=200n_2 = 200, 感染人數 x2=40x_2 = 40。感染率 p^2=x2/n2=40/200=0.20\hat{p}_2 = x_2/n_2 = 40/200 = 0.20。
  • 顯著水準 α=0.05\alpha = 0.05。
  • z0.975≈1.96z_{0.975} \approx 1.96 (用於計算 95% CI)。

(1) 請進行假說檢定,設定虛無假設 (H0H_0) 與對立假設 (H1H_1),使用常態逼近法 (Z-test for two proportions) 計算檢定統計量,並判斷在 α=0.05\alpha = 0.05 下,兩組感染率是否有顯著差異? (5分)

  • 設定假設:

    • 虛無假設 H0H_0: 兩組的感染率相等,即 p1=p2p_1 = p_2 (或 p1−p2=0p_1 - p_2 = 0)。
    • 對立假設 H1H_1: 兩組的感染率不相等,即 p1≠p2p_1 \neq p_2 (雙側檢定)。
  • 計算合併比例 (Pooled Proportion):
    在 H0H_0 為真時,我們使用合併比例作為估計值:
    p^pooled=x1+x2n1+n2=10+40200+200=50400=0.125\hat{p}_{\text{pooled}} = \frac{x_1 + x_2}{n_1 + n_2} = \frac{10 + 40}{200 + 200} = \frac{50}{400} = 0.125
    合併標準誤 (standard error of the difference):
    SE(p^1−p^2)=p^pooled(1−p^pooled)(1n1+1n2)SE(\hat{p}_1 - \hat{p}_2) = \sqrt{\hat{p}_{\text{pooled}}(1-\hat{p}_{\text{pooled}})(\frac{1}{n_1} + \frac{1}{n_2})}
    SE=0.125(1−0.125)(1200+1200)=0.125×0.875×2200SE = \sqrt{0.125(1-0.125)(\frac{1}{200} + \frac{1}{200})} = \sqrt{0.125 \times 0.875 \times \frac{2}{200}}
    SE=0.109375×0.01=0.00109375≈0.03307SE = \sqrt{0.109375 \times 0.01} = \sqrt{0.00109375} \approx 0.03307

  • 計算 Z 檢定統計量:
    Z=(p^1−p^2)−(p1−p2)0SE(p^1−p^2)Z = \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)_0}{SE(\hat{p}_1 - \hat{p}_2)}
    Z=(0.05−0.20)−00.03307=−0.150.03307≈−4.536Z = \frac{(0.05 - 0.20) - 0}{0.03307} = \frac{-0.15}{0.03307} \approx -4.536

  • 判斷顯著性:
    在 α=0.05\alpha = 0.05 的顯著水準下,雙側檢定的臨界值為 z0.025≈±1.96z_{0.025} \approx \pm 1.96。
    由於 ∣Z∣=∣−4.536∣=4.536>1.96|Z| = |-4.536| = 4.536 > 1.96,我們的檢定統計量落在拒絕區域。
    因此,我們拒絕虛無假設 H0H_0。

  • 結論: 在 α=0.05\alpha = 0.05 下,兩組的感染率有顯著差異。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 15 題

某流行病學調查使用一種快速篩檢試劑檢測 100 名已知患有 A 疾病的患者,結果有 80 人呈現陽性。
(1) 請計算該試劑的敏感度 (Sensitivity) 及其 95% 信賴區間 (提示: 使用常態逼近法)。(4分)
(2) 若此疾病在社區中的盛行率 (Prevalence) 極低,即使該試劑的敏感度與特異度都很高,其陽性預測值 (PPV) 通常會偏高還是偏低?這對公共衛生篩檢政策有何啟示?(3分)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題考驗對敏感度 (Sensitivity) 計算與信賴區間,以及陽性預測值 (PPV) 與盛行率 (Prevalence) 關係的理解。

核心概念:

  • 敏感度 (Sensitivity):在真正患病者中,檢測結果為陽性的比例。 Sensitivity=P(Test+ | Disease+)Sensitivity = P(\text{Test+ | Disease+})
  • 特異度 (Specificity):在真正未患病者中,檢測結果為陰性的比例。 Specificity=P(Test- | Disease-)Specificity = P(\text{Test- | Disease-})
  • 陽性預測值 (PPV):在檢測結果為陽性者中,真正患病者的比例。 PPV=P(Disease+ | Test+)PPV = P(\text{Disease+ | Test+})
  • 陰性預測值 (NPV):在檢測結果為陰性者中,真正未患病者的比例。 NPV=P(Disease- | Test-)NPV = P(\text{Disease- | Test-})
  • 盛行率 (Prevalence):在總人口中,患有某疾病的比例。 Prevalence=P(Disease+)Prevalence = P(\text{Disease+})
  • 常態逼近法 (Normal approximation):用於計算比例的信賴區間。

數據整理:

  • 檢測對象:100 名已知患有 A 疾病的患者 (即已知是疾病陽性者)。
  • 檢測結果:80 人呈現陽性。
  • 這裡的 100 位患者是「已知患病」的,所以我們是在一個疾病陽性的群體中評估檢測的表現。

(1) 請計算該試劑的敏感度 (Sensitivity) 及其 95% 信賴區間 (提示: 使用常態逼近法)。(4分)

  • 計算敏感度:
    敏感度是真正患病者中檢測為陽性的比例。
    在此情境下,100 位患者都是確診的病人 (Disease+)。
    檢測陽性的人數是 80。
    敏感度 (Sensitivity) = (檢測陽性人數) / (總患病人數) = 80 / 100 = 0.80。

  • 計算 95% 信賴區間 (常態逼近法):
    比例的 95% 信賴區間公式為:p^±zα/2p^(1−p^)n\hat{p} \pm z_{\alpha/2} \sqrt{\frac{\hat{p}(1-\hat{p})}{n}}
    在這裡,p^=0.80\hat{p} = 0.80 (敏感度), n=100n = 100 (總患病人數)。
    對於 95% 信賴區間,α=0.05\alpha = 0.05, zα/2=z0.025≈1.96z_{\alpha/2} = z_{0.025} \approx 1.96。
    標準誤 SE=0.80(1−0.80)100=0.80×0.20100=0.16100=0.0016=0.04SE = \sqrt{\frac{0.80(1-0.80)}{100}} = \sqrt{\frac{0.80 \times 0.20}{100}} = \sqrt{\frac{0.16}{100}} = \sqrt{0.0016} = 0.04。
    信賴區間的計算:
    0.80±1.96×0.040.80 \pm 1.96 \times 0.04
    0.80±0.07840.80 \pm 0.0784
    下限: 0.80−0.0784=0.72160.80 - 0.0784 = 0.7216
    上限: 0.80+0.0784=0.87840.80 + 0.0784 = 0.8784

    95% 信賴區間為 (0.7216, 0.8784)。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 16 題

在一項參與者多達 10 萬人的大型世代研究 (Cohort study) 中,發現某種飲食習慣會降低 0.5% 的糖尿病風險,統計檢定結果為 p-value < 0.001。請討論:
(1) 為什麼在極大樣本下容易出現「統計上顯著 (Statistically significant)」但「臨床上不重要 (Clinically insignificant)」的現象?(4分)
(2) 作為流行病學家,你會如何整合信賴區間來解讀此結果?(2分)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題探討統計顯著性與臨床重要性之間的差異,以及如何利用信賴區間來解讀研究結果。

核心概念:

  • 統計顯著性 (Statistical Significance):由 p 值衡量,表示觀察到的結果(或更極端的結果)在虛無假設為真時發生的機率。p 值小 (通常 < 0.05) 表示結果統計上顯著。
  • 臨床重要性 (Clinical Significance):指研究結果在實際臨床應用或對個體健康方面是否具有實際意義或影響。
  • 樣本大小 (Sample Size):對統計檢定的 p 值有很大影響。樣本越大,即使是很小的效應量也可能達到統計顯著。
  • 信賴區間 (Confidence Interval, CI):提供效應量 (effect size) 的可能範圍,比單一的 p 值更能反映效應的大小和不確定性。
  • 效應量 (Effect Size):衡量變數之間關係的強度或差異的大小。

(1) 為什麼在極大樣本下容易出現「統計上顯著 (Statistically significant)」但「臨床上不重要 (Clinically insignificant)」的現象?(4分)

  • p 值與樣本大小的關係:
    統計檢定的 p 值,尤其是對於檢定「無效應」的虛無假設(如 β=0\beta = 0 或 p1=p2p_1 = p_2),其計算通常包含樣本大小 nn (或其平方根 n\sqrt{n}) 在分母或影響檢定統計量的計算。
    例如,在簡單線性迴歸中,t 統計量約為 β^/SE(β^)\hat{\beta}/\text{SE}(\hat{\beta}),而 SE(β^)\text{SE}(\hat{\beta}) 通常與 1/n1/\sqrt{n} 成正比。因此,當樣本大小 nn 變得非常大時,即使效應量 β^\hat{\beta} 很小,SE 也會變得非常小,使得 t 統計量變得很大,進而使得 p 值非常小,達到統計顯著。
    換句話說,隨著樣本量的增加,統計檢定越來越容易偵測到微小的差異或關聯,即使這些差異或關聯在實際應用中微不足道。

  • 臨床重要性 vs. 統計顯著性:

    • 統計顯著性 關注的是觀察到的結果是否「不太可能」僅由隨機變異引起。它只告訴我們是否存在一個效應。
    • 臨床重要性 關注的是效應的「大小」和「實際影響」。例如,一個飲食習慣能將糖尿病風險降低 0.5%,這在統計上可能是顯著的 (因為樣本很大),但對於個人而言,降低 0.5% 的風險可能不足以改變其行為或產生明顯的健康益處,因此在臨床上可能不重要。臨床上的重要性通常需要結合效應量的大小、潛在的治療成本、副作用、患者的價值觀等因素來判斷。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題