108 年 國立成功大學數據科學研究所《統計學》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題

針對以下描述,請以統計學的角度說明對與錯,並提供您的意見。
(1) 為了說明跨領域之重要性,某名人言道:「若有人在甲領域排名前 20% 且在乙領域排名前 20%,則此人在甲、乙共同領域中排名前 4%。」(5%)
(2) 某流行歌歌詞如下:「十個男人七個傻、八個呆、九個壞」,所以歌詞中表示至少有一人不傻、不呆且不壞。(5%)
(3) 某電影評論家陳述:「奧斯卡最佳男演員平均要被提名九次才會得獎,A演員之前已經被提名八次了,這次得獎的機率很大!」(5%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題主要在檢驗對機率基本概念的理解。

(1) 關於跨領域重要性的敘述:
此敘述是正確的。假設甲領域的表現為事件 AA,乙領域的表現為事件 BB。
已知 P(A)=0.20P(A) = 0.20 且 P(B)=0.20P(B) = 0.20。
若我們假設在甲領域的表現與在乙領域的表現是獨立事件,那麼兩者同時排名前 20% 的機率為 P(A∩B)=P(A)P(B)=0.20×0.20=0.04P(A \cap B) = P(A)P(B) = 0.20 \times 0.20 = 0.04。
這表示此人在兩個領域都排名前 20% 的機率是 4%,也就是說,在甲、乙兩個領域都排名前 20% 的人,在甲、乙共同領域中也排名前 4%。
然而,現實生活中,兩個領域的表現可能並非完全獨立,例如某些技能可能同時對兩個領域都有幫助。但從機率獨立性的角度來看,此敘述的推論是符合機率計算的。

(2) 關於流行歌歌詞的敘述:
此敘述是錯誤的。
假設事件 SS 為「男人是傻的」,事件 DD 為「男人是呆的」,事件 BB 為「男人是壞的」。
歌詞給了我們以下資訊:
P(S)≥0.7P(S) \ge 0.7 (至少七個是傻的,表示傻的比例至少為 7/10)
P(D)≥0.8P(D) \ge 0.8 (至少八個是呆的,表示呆的比例至少為 8/10)
P(B)≥0.9P(B) \ge 0.9 (至少九個是壞的,表示壞的比例至少為 9/10)

我們要判斷的是「至少有一人不傻、不呆且不壞」的機率。這等價於判斷「存在一個男人,他不是傻的,也不是呆的,也不是壞的」的機率。
令 ScS^c 為「不傻」,DcD^c 為「不呆」,BcB^c 為「不壞」。
我們想知道 P(Sc∩Dc∩Bc)>0P(S^c \cap D^c \cap B^c) > 0 是否為真。
根據德摩根定律, Sc∩Dc∩Bc=(S∪D∪B)cS^c \cap D^c \cap B^c = (S \cup D \cup B)^c。
所以,P(Sc∩Dc∩Bc)=1−P(S∪D∪B)P(S^c \cap D^c \cap B^c) = 1 - P(S \cup D \cup B)。
根據機率的加法法則, P(S∪D∪B)≤P(S)+P(D)+P(B)P(S \cup D \cup B) \le P(S) + P(D) + P(B)。
在最極端的情況下,如果這三個事件是互斥的,那麼 P(S∪D∪B)=P(S)+P(D)+P(B)≥0.7+0.8+0.9=2.4P(S \cup D \cup B) = P(S) + P(D) + P(B) \ge 0.7 + 0.8 + 0.9 = 2.4。
然而,機率值不可能大於 1。這表示這三個事件不可能互斥,一定有重疊。
更精確地說,我們知道 P(S)≤1P(S) \le 1, P(D)≤1P(D) \le 1, P(B)≤1P(B) \le 1。
我們也可以知道 P(S∪D∪B)≤1P(S \cup D \cup B) \le 1。
從 P(S)≥0.7P(S) \ge 0.7, P(D)≥0.8P(D) \ge 0.8, P(B)≥0.9P(B) \ge 0.9 可知:
P(Sc)=1−P(S)≤1−0.7=0.3P(S^c) = 1 - P(S) \le 1 - 0.7 = 0.3
P(Dc)=1−P(D)≤1−0.8=0.2P(D^c) = 1 - P(D) \le 1 - 0.8 = 0.2
P(Bc)=1−P(B)≤1−0.9=0.1P(B^c) = 1 - P(B) \le 1 - 0.9 = 0.1

我們想知道 P(Sc∩Dc∩Bc)P(S^c \cap D^c \cap B^c) 是否大於 0。
根據機率的乘法法則, P(Sc∩Dc∩Bc)≤P(Sc)≤0.3P(S^c \cap D^c \cap B^c) \le P(S^c) \le 0.3。
同時, P(Sc∩Dc∩Bc)≤P(Dc)≤0.2P(S^c \cap D^c \cap B^c) \le P(D^c) \le 0.2。
並且,P(Sc∩Dc∩Bc)≤P(Bc)≤0.1P(S^c \cap D^c \cap B^c) \le P(B^c) \le 0.1。
因此,P(Sc∩Dc∩Bc)≤min⁡(0.3,0.2,0.1)=0.1P(S^c \cap D^c \cap B^c) \le \min(0.3, 0.2, 0.1) = 0.1。
這表示「不傻、不呆、也不壞」的男人比例最多只有 10%。
然而,這並不代表「至少有一人不傻、不呆且不壞」這個陳述是錯誤的。
重點在於,歌詞說的是「十個男人」,這是一個樣本。從樣本的描述推論到整體人口的機率,或是反之,都需要嚴謹的定義。
如果我們將歌詞理解為「在一個有10個人的群體中,有至少7個傻的,至少8個呆的,至少9個壞的」,那麼這10個人中,
傻的至少有 7 人。
呆的至少有 8 人。
壞的至少有 9 人。
我們最多可以有 10−7=310 - 7 = 3 人不是傻的。
我們最多可以有 10−8=210 - 8 = 2 人不是呆的。
我們最多可以有 10−9=110 - 9 = 1 人不是壞的。
所以,能夠同時「不是傻的」且「不是呆的」且「不是壞的」的人數,最多為 min⁡(3,2,1)=1\min(3, 2, 1) = 1 人。
這意味著,在10個人中,最多有1個人符合「不傻、不呆、也不壞」。
這並不排除「至少有一人不傻、不呆、也不壞」的可能性。
例如,如果這 10 個人是:
S1, S2, S3, S4, S5, S6, S7 (7個傻的)
D1, D2, D3, D4, D5, D6, D7, D8 (8個呆的)
B1, B2, B3, B4, B5, B6, B7, B8, B9 (9個壞的)
假設這 10 個人分別是 A, B, C, D, E, F, G, H, I, J。
如果 A, B, C, D, E, F, G 是傻的。
如果 A, B, C, D, E, F, G, H 是呆的。
如果 A, B, C, D, E, F, G, H, I 是壞的。
那麼 J 就不傻、不呆、也不壞。
所以,這個敘述「至少有一人不傻、不呆且不壞」是可能的。
但是,歌詞的敘述「十個男人七個傻、八個呆、九個壞」更像是在描述比例,而非精確人數。
如果理解為機率,那麼 P(S)≥0.7,P(D)≥0.8,P(B)≥0.9P(S) \ge 0.7, P(D) \ge 0.8, P(B) \ge 0.9。
我們想知道 P(至少有一人不傻、不呆且不壞)=P(Sc∪Dc∪Bc)P(\text{至少有一人不傻、不呆且不壞}) = P(S^c \cup D^c \cup B^c)。
根據德摩根定律,P(Sc∪Dc∪Bc)=1−P(S∩D∩B)P(S^c \cup D^c \cup B^c) = 1 - P(S \cap D \cap B)。
我們知道 P(S∪D∪B)≤1P(S \cup D \cup B) \le 1。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題

某人力資源公司調查結果發現:某大公司的高階經理人中有40%擅長使用統計方法,而非高階經理人中有10%擅長使用統計方法。假設您正好在此公司進行面試,而您的面試官一直問統計問題,似乎對統計方法很熟悉。
(1) 請問您會猜這位面試官是高階經理人嗎?為什麼?(5%)
(2) 若額外知道此公司高階經理人佔全公司職員的5%,請問您的面試官是高階經理人的機率為何?(10%)
(3) 若現在您的面前坐著三位面試官,已知他們都不是高階經理人,請問他們三位最少有一位擅長使用統計方法的機率為何?請說明您計算的方法與所需的假設。(10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗貝氏定理、條件機率以及獨立事件機率的應用。

首先,我們定義一些事件:
HH: 面試官是高階經理人 (High-level manager)
NHNH: 面試官不是高階經理人 (Not High-level manager)
SS: 面試官擅長使用統計方法 (Skilled in statistics)
NSNS: 面試官不擅長使用統計方法 (Not Skilled in statistics)

根據題目給的資訊:
P(S∣H)=0.40P(S|H) = 0.40 (高階經理人擅長統計的機率)
P(S∣NH)=0.10P(S|NH) = 0.10 (非高階經理人擅長統計的機率)

(1) 請問您會猜這位面試官是高階經理人嗎?為什麼?
這個問題是基於直覺的判斷。面試官一直問統計問題,似乎對統計方法很熟悉,這暗示了面試官擅長統計方法 (SS)。
我們知道高階經理人擅長統計的機率是 0.40,而非高階經理人擅長統計的機率是 0.10。
由於 P(S∣H)=0.40>P(S∣NH)=0.10P(S|H) = 0.40 > P(S|NH) = 0.10,當我們觀察到面試官擅長統計 (SS) 時,我們有理由認為他更可能是高階經理人 (HH)。
所以,直覺上會猜他是高階經理人。

(2) 若額外知道此公司高階經理人佔全公司職員的5%,請問您的面試官是高階經理人的機率為何?
這個問題需要使用貝氏定理來計算後驗機率 P(H∣S)P(H|S)。
我們已知:
P(H)=0.05P(H) = 0.05 (高階經理人佔全公司職員的比例)
P(NH)=1−P(H)=1−0.05=0.95P(NH) = 1 - P(H) = 1 - 0.05 = 0.95 (非高階經理人佔全公司職員的比例)
P(S∣H)=0.40P(S|H) = 0.40
P(S∣NH)=0.10P(S|NH) = 0.10

根據貝氏定理:
P(H∣S)=P(S∣H)P(H)P(S)P(H|S) = \frac{P(S|H)P(H)}{P(S)}
首先,我們需要計算 P(S)P(S),即一個隨機選擇的員工擅長統計的總機率。根據全機率法則:
P(S)=P(S∣H)P(H)+P(S∣NH)P(NH)P(S) = P(S|H)P(H) + P(S|NH)P(NH)
P(S)=(0.40)(0.05)+(0.10)(0.95)P(S) = (0.40)(0.05) + (0.10)(0.95)
P(S)=0.020+0.095P(S) = 0.020 + 0.095
P(S)=0.115P(S) = 0.115
現在,我們可以計算 P(H∣S)P(H|S):
P(H∣S)=(0.40)(0.05)0.115P(H|S) = \frac{(0.40)(0.05)}{0.115}
P(H∣S)=0.0200.115P(H|S) = \frac{0.020}{0.115}
P(H∣S)=20115=423P(H|S) = \frac{20}{115} = \frac{4}{23}

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題

最近有位鄉民在 PPT 上詢問:”沒有裝任何資料的隨身碟”與“裝滿資料的隨身碟”是否有相同
的重量?有三位好事者分別提出了做實驗來驗證此問題的方法,他們的方法分別是:
(a) 買十個不同品牌的隨身碟,其中五個原封不動,另外五個將之裝滿資料。最後檢測二組重量平均數有無差異。
(b) 買十個不同品牌的隨身碟,其中五個原封不動,另外五個將之裝滿資料。最後檢測二組重量變異數有無差異。
(c) 買十個不同品牌的隨身碟,在未裝資料前將所有隨身碟都秤重,然後在裝滿資料後再秤一次
重。最後檢測裝滿資料之前與之後的重量平均是否有差異。
請以統計的角度評價此三人實驗方法之正確與否及其優劣。(10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題主要在檢驗對實驗設計、統計檢定適當性以及因果關係判斷的理解。

研究問題:隨身碟「沒有裝任何資料」與「裝滿資料」的重量是否相同?
這裡的關鍵在於比較兩種狀態(空載 vs. 滿載)下隨身碟的重量。

我們來逐一分析三位好事者的方法:

(a) 方法 (a) 的實驗設計:

  • 樣本:買 10 個不同品牌的隨身碟。
  • 分組:分成兩組,各 5 個。一組「原封不動」(空載),另一組「裝滿資料」(滿載)。
  • 測量:分別測量這兩組的平均重量。
  • 檢定:檢測兩組平均數有無差異。

統計評價:

  • 正確性:此方法試圖比較兩組平均重量,直接針對「重量是否有差異」這個核心問題。
  • 優點:
    • 比較直接,使用平均數來代表各組的中心趨勢。
    • 這是檢定兩組平均值差異的標準方法,例如使用獨立樣本 t 檢定 (Independent samples t-test)。
  • 缺點/潛在問題:
    • 未進行配對 (Pairing):隨身碟是「不同品牌」的,這意味著品牌本身的重量差異可能很大。將 10 個隨身碟隨機分成兩組(各 5 個),可能導致各組的品牌構成不同,例如一組剛好都是較重的品牌,另一組都是較輕的品牌。這種品牌差異會引入額外的變異性,使得檢定結果的準確性降低,甚至可能導致無法檢測到真實的重量差異(因為品牌差異的雜訊太大)。
    • 樣本量小:總共只有 10 個隨身碟,分成兩組各 5 個,樣本量偏小,會降低統計檢定的檢力 (power)。
    • 「裝滿資料」的定義:什麼叫做「裝滿資料」?資料的類型(文字、圖片、影片)和壓縮方式都會影響實際佔用的空間和可能的重量。這個定義不夠明確。

(b) 方法 (b) 的實驗設計:

  • 樣本:買 10 個不同品牌的隨身碟。
  • 分組:分成兩組,各 5 個。一組「原封不動」(空載),另一組「裝滿資料」(滿載)。
  • 測量:分別測量這兩組的重量變異數。
  • 檢定:檢測兩組變異數有無差異。

統計評價:

  • 正確性:此方法檢測的是重量的「變異數」,而不是「平均數」。這個方法與研究問題「重量是否有差異」的關聯性較弱。重量變異數的差異可能與資料的重量無關,也可能與資料的類型、壓縮方式、隨身碟本身的品質(例如讀寫穩定性)有關。
  • 優點:
    • 如果研究的目的是想探討「裝滿資料」是否會增加重量的「不確定性」(即變異性),這個方法是有意義的。例如,某些資料格式可能導致隨身碟讀寫時重量有波動。
  • 缺點/潛在問題:
    • 不直接回答問題:研究問題是「重量是否有差異」,而變異數檢定(例如 F 檢定)關注的是離散程度,而非中心位置。即使變異數有顯著差異,也無法直接說明平均重量是否有差異。
    • 同 (a) 的問題:同樣存在品牌差異引入的雜訊問題,以及樣本量偏小。
    • 「裝滿資料」的定義不明確。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題

某分析師想要知道飲料中糖份多寡和飲料種類是否獨立,於是從母體機抽取330個樣本,每個人
只能選擇一種飲料型能及一種糖份。結果如下表。請問要用何種統計方法檢定此問題?該方法的
假設及檢定統計量為何?請問在無法查表的情況之下,檢定的結果為何?(10%)
汽泡飲料 紅茶 綠茶 咖啡 加總
無糖 55 32 47 21 155
正常糖 60 43 35 37 175
加總 115 75 82 58 330

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對獨立性檢定(卡方檢定)的理解,包括其適用條件、假設、檢定統計量以及如何判斷結果。

研究問題:飲料中糖份多寡和飲料種類是否獨立?
這是一個典型的分類變數之間的獨立性檢定問題。我們有兩個分類變數:

  1. 飲料種類 (Categorical Variable 1):汽泡飲料, 紅茶, 綠茶, 咖啡 (4類)
  2. 糖份多寡 (Categorical Variable 2):無糖, 正常糖 (2類)

數據是以列聯表 (Contingency Table) 的形式給出,總樣本數 N=330N = 330。

1. 應使用的統計方法:
應使用 卡方獨立性檢定 (Chi-squared test of independence)。

2. 該方法的假設:

  • 虛無假設 (H0H_0):飲料種類與糖份多寡是獨立的。
    (H0H_0: The type of beverage and the amount of sugar are independent.)
  • 對立假設 (H1H_1):飲料種類與糖份多寡不是獨立的(即存在關聯性)。
    (H1H_1: The type of beverage and the amount of sugar are not independent.)

3. 該方法的檢定統計量:
卡方檢定統計量 χ2\chi^2 的計算公式為:
χ2=∑i=1r∑j=1c(Oij−Eij)2Eij\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij} - E_{ij})^2}{E_{ij}}
其中:

  • rr 是列的數量(在此為 2:無糖, 正常糖)。
  • cc 是欄的數量(在此為 4:汽泡飲料, 紅茶, 綠茶, 咖啡)。
  • OijO_{ij} 是實際觀察到的次數 (Observed frequency),即列聯表中的各單元格值。
  • EijE_{ij} 是在虛無假設成立下,預期 (Expected frequency) 的次數。
    預期次數 EijE_{ij} 的計算公式為:
    Eij=(第 i 列的總計)×(第 j 欄的總計)總樣本數 NE_{ij} = \frac{(\text{第 } i \text{ 列的總計}) \times (\text{第 } j \text{ 欄的總計})}{\text{總樣本數 } N}

計算步驟:
首先,我們需要計算預期次數矩陣。

飲料種類無糖 (O)正常糖 (O)加總 (O)
汽泡飲料5560115
紅茶324375
綠茶473582
咖啡213758
加總155175330

計算預期次數 EijE_{ij}:
E11E_{11} (無糖, 汽泡飲料) = (155×115)/330≈53.94(155 \times 115) / 330 \approx 53.94
E12E_{12} (正常糖, 汽泡飲料) = (175×115)/330≈61.06(175 \times 115) / 330 \approx 61.06
E21E_{21} (無糖, 紅茶) = (155×75)/330≈35.23(155 \times 75) / 330 \approx 35.23
E22E_{22} (正常糖, 紅茶) = (175×75)/330≈39.77(175 \times 75) / 330 \approx 39.77
E31E_{31} (無糖, 綠茶) = (155×82)/330≈38.48(155 \times 82) / 330 \approx 38.48
E32E_{32} (正常糖, 綠茶) = (175×82)/330≈43.52(175 \times 82) / 330 \approx 43.52
E41E_{41} (無糖, 咖啡) = (155×58)/330≈27.15(155 \times 58) / 330 \approx 27.15
E42E_{42} (正常糖, 咖啡) = (175×58)/330≈30.85(175 \times 58) / 330 \approx 30.85

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題

為預測某工業產品的投入(X)與產出(Y)的關係,透過實驗得到以下數據:投入的樣本平均數為3、樣本變異數為1.44;產出的樣本平均數為10、樣本變異數為4;投入與產出的樣本共變異數為1.2。若該實驗的統計分析師欲以簡單線性迴歸 Y=β0+β1X+ϵY = \beta_0 + \beta_1X + \epsilon 解釋投入與產出的關係
(1) 請問二個迴歸參數的最小平方法估計為何?(10%)
(2) 請問最小平方法所計算出之判定係數(coefficient of determination, R²)為何? (10%)
(3) 若分析結果的殘差圖如下(X-軸是投入、Y-軸是殘差),請問簡單線性迴歸的假設哪裡有問題?又該如何調整(10%)
🖼️【此處有附圖,請對照原卷】

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗簡單線性迴歸模型的參數估計、判定係數計算以及對模型假設的理解與診斷。

已知資訊:
投入 (X) 的樣本統計量:
Xˉ=3\bar{X} = 3
sX2=1.44  ⟹  sX=1.44=1.2s_X^2 = 1.44 \implies s_X = \sqrt{1.44} = 1.2
產出 (Y) 的樣本統計量:
Yˉ=10\bar{Y} = 10
sY2=4  ⟹  sY=4=2s_Y^2 = 4 \implies s_Y = \sqrt{4} = 2
投入與產出的樣本共變異數:
sXY=1.2s_{XY} = 1.2

簡單線性迴歸模型:Y=β0+β1X+ϵY = \beta_0 + \beta_1X + \epsilon

(1) 請問二個迴歸參數的最小平方法估計為何?

最小平方法 (Ordinary Least Squares, OLS) 對迴歸參數 β0\beta_0 和 β1\beta_1 的估計值 (β^0,β^1\hat{\beta}_0, \hat{\beta}_1) 分別為:

迴歸係數 β1\beta_1 的估計值:
β^1=sXYsX2\hat{\beta}_1 = \frac{s_{XY}}{s_X^2}
將已知數值代入:
β^1=1.21.44=120144=1012=56\hat{\beta}_1 = \frac{1.2}{1.44} = \frac{120}{144} = \frac{10}{12} = \frac{5}{6}
β^1≈0.8333\hat{\beta}_1 \approx 0.8333

截距 β0\beta_0 的估計值:
β^0=Yˉ−β^1Xˉ\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}
將已知數值代入:
β^0=10−(56)(3)\hat{\beta}_0 = 10 - \left(\frac{5}{6}\right)(3)
β^0=10−156\hat{\beta}_0 = 10 - \frac{15}{6}
β^0=10−52\hat{\beta}_0 = 10 - \frac{5}{2}
β^0=10−2.5\hat{\beta}_0 = 10 - 2.5
β^0=7.5\hat{\beta}_0 = 7.5

所以,迴歸參數的最小平方法估計值為 β^1=56\hat{\beta}_1 = \frac{5}{6} (或約 0.8333) 且 β^0=7.5\hat{\beta}_0 = 7.5。

(2) 請問最小平方法所計算出之判定係數(coefficient of determination, R²)為何?

判定係數 R2R^2 表示因變數 (Y) 的總變異中,有多少比例可以被自變數 (X) 的迴歸模型所解釋。
對於簡單線性迴歸, R2R^2 可以透過以下公式計算:
R2=(sXYsXsY)2R^2 = \left( \frac{s_{XY}}{s_X s_Y} \right)^2
其中 sXs_X 和 sYs_Y 分別是 X 和 Y 的樣本標準差。

我們已知:
sXY=1.2s_{XY} = 1.2
sX=1.2s_X = 1.2 (從 sX2=1.44s_X^2 = 1.44 計算得到)
sY=2s_Y = 2 (從 sY2=4s_Y^2 = 4 計算得到)

代入公式:
R2=(1.2(1.2)(2))2R^2 = \left( \frac{1.2}{(1.2)(2)} \right)^2
R2=(1.22.4)2R^2 = \left( \frac{1.2}{2.4} \right)^2
R2=(12)2R^2 = \left( \frac{1}{2} \right)^2
R2=14=0.25R^2 = \frac{1}{4} = 0.25

另一種計算 R2R^2 的方法是:
R2=SSRSST=1−SSESSTR^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}
其中 SST=∑(Yi−Yˉ)2=(n−1)sY2SST = \sum(Y_i - \bar{Y})^2 = (n-1)s_Y^2 且 SSE=∑(Yi−Y^i)2=∑ϵi2SSE = \sum(Y_i - \hat{Y}_i)^2 = \sum \epsilon_i^2。
在簡單線性迴歸中, SSR=∑(Y^i−Yˉ)2=β^12sX2n−11SSR = \sum(\hat{Y}_i - \bar{Y})^2 = \hat{\beta}_1^2 s_X^2 \frac{n-1}{1} (這個公式有點複雜,不如直接用相關係數的平方)。
由於 R2R^2 是自變數和因變數之間相關係數的平方,所以我們也可以先計算相關係數 rXYr_{XY}:
rXY=sXYsXsY=1.2(1.2)(2)=12=0.5r_{XY} = \frac{s_{XY}}{s_X s_Y} = \frac{1.2}{(1.2)(2)} = \frac{1}{2} = 0.5
因此,
R2=rXY2=(0.5)2=0.25R^2 = r_{XY}^2 = (0.5)^2 = 0.25

所以,判定係數 R2R^2 為 0.25。這表示投入 (X) 只能解釋產出 (Y) 總變異的 25%。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 6 題

若某一資料擁有許多自變量,請簡述如何挑選自變量進入迴歸模型使得此模型俱有良好的預測
力。(10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

此題考驗對多重迴歸模型中自變數篩選方法的理解。當資料擁有許多自變量時,選擇哪些變量進入模型以獲得最佳預測力,是模型建立中的重要步驟。

挑選自變量進入迴歸模型以獲得良好預測力的常用方法包括:

  1. 基於理論或領域知識的選擇 (Theory-based Selection):
    這是最理想也是最常用的方法。在建立模型之前,根據研究目的、相關領域的理論或專家知識,預先判斷哪些自變量可能對應變數有預測能力。這種方法可以避免過度擬合 (overfitting) 和不必要的模型複雜度。

  2. 基於統計顯著性的方法 (Statistical Significance-based Methods):
    這些方法利用統計檢定來評估每個自變量的顯著性。

    • 逐步迴歸 (Stepwise Regression):

      • 向前選擇 (Forward Selection):從一個只有截距項的模型開始,逐步將統計上最顯著的變量加入模型,直到沒有變量能夠顯著提升模型時停止。
      • 向後剔除 (Backward Elimination):從包含所有潛在自變量的模型開始,逐步剔除統計上最不顯著的變量,直到所有剩餘變量都顯著時停止。
      • 雙向選擇 (Bidirectional Elimination / Stepwise Regression):結合向前選擇和向後剔除,在每一步都考慮加入或剔除變量。
      • 優點:自動化,易於操作。
      • 缺點:可能陷入局部最优解,有時會剔除對預測有幫助但單獨檢定不顯著的變量,或者加入不具預測力的變量。對變量之間的共線性 (multicollinearity) 較敏感。
    • 基於 P 值的方法:設定一個顯著水準 α\alpha(例如 0.05),只保留 P 值小於 α\alpha 的變量。

  3. 基於模型效能指標的方法 (Model Performance Metrics):
    這些方法直接優化模型的預測效能指標,而不是僅僅依賴 P 值。

    • 調整後的 R2R^2 (Adjusted R2R^2):在多重迴歸中, R2R^2 隨著加入更多變量(即使是不顯著的)而增加。Adjusted R2R^2 考慮了模型複雜度,當新增的變量對模型解釋能力的貢獻不足以彌補自由度的損失時,Adjusted R2R^2 會下降。選擇 Adjusted R2R^2 最大的模型。
    • 資訊準則 (Information Criteria):
      • 赤池資訊準則 (Akaike Information Criterion, AIC):衡量模型擬合優度與模型複雜度之間的權衡。AIC 值越小,模型越優。
      • 貝氏資訊準則 (Bayesian Information Criterion, BIC):與 AIC 類似,但對模型複雜度給予更嚴格的懲罰。BIC 值越小,模型越優。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題

108 年成功大學的其他科目

成功大學《統計學》其他年度