108 年 國立成功大學數據科學研究所《統計學》
第 1 題
針對以下描述,請以統計學的角度說明對與錯,並提供您的意見。
(1) 為了說明跨領域之重要性,某名人言道:「若有人在甲領域排名前 20% 且在乙領域排名前 20%,則此人在甲、乙共同領域中排名前 4%。」(5%)
(2) 某流行歌歌詞如下:「十個男人七個傻、八個呆、九個壞」,所以歌詞中表示至少有一人不傻、不呆且不壞。(5%)
(3) 某電影評論家陳述:「奧斯卡最佳男演員平均要被提名九次才會得獎,A演員之前已經被提名八次了,這次得獎的機率很大!」(5%)
登入後即可作答並保存紀錄。
此題主要在檢驗對機率基本概念的理解。
(1) 關於跨領域重要性的敘述:
此敘述是正確的。假設甲領域的表現為事件 ,乙領域的表現為事件 。
已知 且 。
若我們假設在甲領域的表現與在乙領域的表現是獨立事件,那麼兩者同時排名前 20% 的機率為 。
這表示此人在兩個領域都排名前 20% 的機率是 4%,也就是說,在甲、乙兩個領域都排名前 20% 的人,在甲、乙共同領域中也排名前 4%。
然而,現實生活中,兩個領域的表現可能並非完全獨立,例如某些技能可能同時對兩個領域都有幫助。但從機率獨立性的角度來看,此敘述的推論是符合機率計算的。
(2) 關於流行歌歌詞的敘述:
此敘述是錯誤的。
假設事件 為「男人是傻的」,事件 為「男人是呆的」,事件 為「男人是壞的」。
歌詞給了我們以下資訊:
(至少七個是傻的,表示傻的比例至少為 7/10)
(至少八個是呆的,表示呆的比例至少為 8/10)
(至少九個是壞的,表示壞的比例至少為 9/10)
我們要判斷的是「至少有一人不傻、不呆且不壞」的機率。這等價於判斷「存在一個男人,他不是傻的,也不是呆的,也不是壞的」的機率。
令 為「不傻」, 為「不呆」, 為「不壞」。
我們想知道 是否為真。
根據德摩根定律, 。
所以,。
根據機率的加法法則, 。
在最極端的情況下,如果這三個事件是互斥的,那麼 。
然而,機率值不可能大於 1。這表示這三個事件不可能互斥,一定有重疊。
更精確地說,我們知道 , , 。
我們也可以知道 。
從 , , 可知:
我們想知道 是否大於 0。
根據機率的乘法法則, 。
同時, 。
並且,。
因此,。
這表示「不傻、不呆、也不壞」的男人比例最多只有 10%。
然而,這並不代表「至少有一人不傻、不呆且不壞」這個陳述是錯誤的。
重點在於,歌詞說的是「十個男人」,這是一個樣本。從樣本的描述推論到整體人口的機率,或是反之,都需要嚴謹的定義。
如果我們將歌詞理解為「在一個有10個人的群體中,有至少7個傻的,至少8個呆的,至少9個壞的」,那麼這10個人中,
傻的至少有 7 人。
呆的至少有 8 人。
壞的至少有 9 人。
我們最多可以有 人不是傻的。
我們最多可以有 人不是呆的。
我們最多可以有 人不是壞的。
所以,能夠同時「不是傻的」且「不是呆的」且「不是壞的」的人數,最多為 人。
這意味著,在10個人中,最多有1個人符合「不傻、不呆、也不壞」。
這並不排除「至少有一人不傻、不呆、也不壞」的可能性。
例如,如果這 10 個人是:
S1, S2, S3, S4, S5, S6, S7 (7個傻的)
D1, D2, D3, D4, D5, D6, D7, D8 (8個呆的)
B1, B2, B3, B4, B5, B6, B7, B8, B9 (9個壞的)
假設這 10 個人分別是 A, B, C, D, E, F, G, H, I, J。
如果 A, B, C, D, E, F, G 是傻的。
如果 A, B, C, D, E, F, G, H 是呆的。
如果 A, B, C, D, E, F, G, H, I 是壞的。
那麼 J 就不傻、不呆、也不壞。
所以,這個敘述「至少有一人不傻、不呆且不壞」是可能的。
但是,歌詞的敘述「十個男人七個傻、八個呆、九個壞」更像是在描述比例,而非精確人數。
如果理解為機率,那麼 。
我們想知道 。
根據德摩根定律,。
我們知道 。
第 2 題
某人力資源公司調查結果發現:某大公司的高階經理人中有40%擅長使用統計方法,而非高階經理人中有10%擅長使用統計方法。假設您正好在此公司進行面試,而您的面試官一直問統計問題,似乎對統計方法很熟悉。
(1) 請問您會猜這位面試官是高階經理人嗎?為什麼?(5%)
(2) 若額外知道此公司高階經理人佔全公司職員的5%,請問您的面試官是高階經理人的機率為何?(10%)
(3) 若現在您的面前坐著三位面試官,已知他們都不是高階經理人,請問他們三位最少有一位擅長使用統計方法的機率為何?請說明您計算的方法與所需的假設。(10%)
登入後即可作答並保存紀錄。
此題考驗貝氏定理、條件機率以及獨立事件機率的應用。
首先,我們定義一些事件:
: 面試官是高階經理人 (High-level manager)
: 面試官不是高階經理人 (Not High-level manager)
: 面試官擅長使用統計方法 (Skilled in statistics)
: 面試官不擅長使用統計方法 (Not Skilled in statistics)
根據題目給的資訊:
(高階經理人擅長統計的機率)
(非高階經理人擅長統計的機率)
(1) 請問您會猜這位面試官是高階經理人嗎?為什麼?
這個問題是基於直覺的判斷。面試官一直問統計問題,似乎對統計方法很熟悉,這暗示了面試官擅長統計方法 ()。
我們知道高階經理人擅長統計的機率是 0.40,而非高階經理人擅長統計的機率是 0.10。
由於 ,當我們觀察到面試官擅長統計 () 時,我們有理由認為他更可能是高階經理人 ()。
所以,直覺上會猜他是高階經理人。
(2) 若額外知道此公司高階經理人佔全公司職員的5%,請問您的面試官是高階經理人的機率為何?
這個問題需要使用貝氏定理來計算後驗機率 。
我們已知:
(高階經理人佔全公司職員的比例)
(非高階經理人佔全公司職員的比例)
根據貝氏定理:
首先,我們需要計算 ,即一個隨機選擇的員工擅長統計的總機率。根據全機率法則:
現在,我們可以計算 :
第 3 題
最近有位鄉民在 PPT 上詢問:”沒有裝任何資料的隨身碟”與“裝滿資料的隨身碟”是否有相同
的重量?有三位好事者分別提出了做實驗來驗證此問題的方法,他們的方法分別是:
(a) 買十個不同品牌的隨身碟,其中五個原封不動,另外五個將之裝滿資料。最後檢測二組重量平均數有無差異。
(b) 買十個不同品牌的隨身碟,其中五個原封不動,另外五個將之裝滿資料。最後檢測二組重量變異數有無差異。
(c) 買十個不同品牌的隨身碟,在未裝資料前將所有隨身碟都秤重,然後在裝滿資料後再秤一次
重。最後檢測裝滿資料之前與之後的重量平均是否有差異。
請以統計的角度評價此三人實驗方法之正確與否及其優劣。(10%)
登入後即可作答並保存紀錄。
此題主要在檢驗對實驗設計、統計檢定適當性以及因果關係判斷的理解。
研究問題:隨身碟「沒有裝任何資料」與「裝滿資料」的重量是否相同?
這裡的關鍵在於比較兩種狀態(空載 vs. 滿載)下隨身碟的重量。
我們來逐一分析三位好事者的方法:
(a) 方法 (a) 的實驗設計:
- 樣本:買 10 個不同品牌的隨身碟。
- 分組:分成兩組,各 5 個。一組「原封不動」(空載),另一組「裝滿資料」(滿載)。
- 測量:分別測量這兩組的平均重量。
- 檢定:檢測兩組平均數有無差異。
統計評價:
- 正確性:此方法試圖比較兩組平均重量,直接針對「重量是否有差異」這個核心問題。
- 優點:
- 比較直接,使用平均數來代表各組的中心趨勢。
- 這是檢定兩組平均值差異的標準方法,例如使用獨立樣本 t 檢定 (Independent samples t-test)。
- 缺點/潛在問題:
- 未進行配對 (Pairing):隨身碟是「不同品牌」的,這意味著品牌本身的重量差異可能很大。將 10 個隨身碟隨機分成兩組(各 5 個),可能導致各組的品牌構成不同,例如一組剛好都是較重的品牌,另一組都是較輕的品牌。這種品牌差異會引入額外的變異性,使得檢定結果的準確性降低,甚至可能導致無法檢測到真實的重量差異(因為品牌差異的雜訊太大)。
- 樣本量小:總共只有 10 個隨身碟,分成兩組各 5 個,樣本量偏小,會降低統計檢定的檢力 (power)。
- 「裝滿資料」的定義:什麼叫做「裝滿資料」?資料的類型(文字、圖片、影片)和壓縮方式都會影響實際佔用的空間和可能的重量。這個定義不夠明確。
(b) 方法 (b) 的實驗設計:
- 樣本:買 10 個不同品牌的隨身碟。
- 分組:分成兩組,各 5 個。一組「原封不動」(空載),另一組「裝滿資料」(滿載)。
- 測量:分別測量這兩組的重量變異數。
- 檢定:檢測兩組變異數有無差異。
統計評價:
- 正確性:此方法檢測的是重量的「變異數」,而不是「平均數」。這個方法與研究問題「重量是否有差異」的關聯性較弱。重量變異數的差異可能與資料的重量無關,也可能與資料的類型、壓縮方式、隨身碟本身的品質(例如讀寫穩定性)有關。
- 優點:
- 如果研究的目的是想探討「裝滿資料」是否會增加重量的「不確定性」(即變異性),這個方法是有意義的。例如,某些資料格式可能導致隨身碟讀寫時重量有波動。
- 缺點/潛在問題:
- 不直接回答問題:研究問題是「重量是否有差異」,而變異數檢定(例如 F 檢定)關注的是離散程度,而非中心位置。即使變異數有顯著差異,也無法直接說明平均重量是否有差異。
- 同 (a) 的問題:同樣存在品牌差異引入的雜訊問題,以及樣本量偏小。
- 「裝滿資料」的定義不明確。
第 4 題
某分析師想要知道飲料中糖份多寡和飲料種類是否獨立,於是從母體機抽取330個樣本,每個人
只能選擇一種飲料型能及一種糖份。結果如下表。請問要用何種統計方法檢定此問題?該方法的
假設及檢定統計量為何?請問在無法查表的情況之下,檢定的結果為何?(10%)
汽泡飲料 紅茶 綠茶 咖啡 加總
無糖 55 32 47 21 155
正常糖 60 43 35 37 175
加總 115 75 82 58 330
登入後即可作答並保存紀錄。
此題考驗對獨立性檢定(卡方檢定)的理解,包括其適用條件、假設、檢定統計量以及如何判斷結果。
研究問題:飲料中糖份多寡和飲料種類是否獨立?
這是一個典型的分類變數之間的獨立性檢定問題。我們有兩個分類變數:
- 飲料種類 (Categorical Variable 1):汽泡飲料, 紅茶, 綠茶, 咖啡 (4類)
- 糖份多寡 (Categorical Variable 2):無糖, 正常糖 (2類)
數據是以列聯表 (Contingency Table) 的形式給出,總樣本數 。
1. 應使用的統計方法:
應使用 卡方獨立性檢定 (Chi-squared test of independence)。
2. 該方法的假設:
- 虛無假設 ():飲料種類與糖份多寡是獨立的。
(: The type of beverage and the amount of sugar are independent.) - 對立假設 ():飲料種類與糖份多寡不是獨立的(即存在關聯性)。
(: The type of beverage and the amount of sugar are not independent.)
3. 該方法的檢定統計量:
卡方檢定統計量 的計算公式為:
其中:
- 是列的數量(在此為 2:無糖, 正常糖)。
- 是欄的數量(在此為 4:汽泡飲料, 紅茶, 綠茶, 咖啡)。
- 是實際觀察到的次數 (Observed frequency),即列聯表中的各單元格值。
- 是在虛無假設成立下,預期 (Expected frequency) 的次數。
預期次數 的計算公式為:
計算步驟:
首先,我們需要計算預期次數矩陣。
| 飲料種類 | 無糖 (O) | 正常糖 (O) | 加總 (O) |
|---|---|---|---|
| 汽泡飲料 | 55 | 60 | 115 |
| 紅茶 | 32 | 43 | 75 |
| 綠茶 | 47 | 35 | 82 |
| 咖啡 | 21 | 37 | 58 |
| 加總 | 155 | 175 | 330 |
計算預期次數 :
(無糖, 汽泡飲料) =
(正常糖, 汽泡飲料) =
(無糖, 紅茶) =
(正常糖, 紅茶) =
(無糖, 綠茶) =
(正常糖, 綠茶) =
(無糖, 咖啡) =
(正常糖, 咖啡) =
第 5 題
為預測某工業產品的投入(X)與產出(Y)的關係,透過實驗得到以下數據:投入的樣本平均數為3、樣本變異數為1.44;產出的樣本平均數為10、樣本變異數為4;投入與產出的樣本共變異數為1.2。若該實驗的統計分析師欲以簡單線性迴歸 解釋投入與產出的關係
(1) 請問二個迴歸參數的最小平方法估計為何?(10%)
(2) 請問最小平方法所計算出之判定係數(coefficient of determination, R²)為何? (10%)
(3) 若分析結果的殘差圖如下(X-軸是投入、Y-軸是殘差),請問簡單線性迴歸的假設哪裡有問題?又該如何調整(10%)
🖼️【此處有附圖,請對照原卷】
登入後即可作答並保存紀錄。
此題考驗簡單線性迴歸模型的參數估計、判定係數計算以及對模型假設的理解與診斷。
已知資訊:
投入 (X) 的樣本統計量:
產出 (Y) 的樣本統計量:
投入與產出的樣本共變異數:
簡單線性迴歸模型:
(1) 請問二個迴歸參數的最小平方法估計為何?
最小平方法 (Ordinary Least Squares, OLS) 對迴歸參數 和 的估計值 () 分別為:
迴歸係數 的估計值:
將已知數值代入:
截距 的估計值:
將已知數值代入:
所以,迴歸參數的最小平方法估計值為 (或約 0.8333) 且 。
(2) 請問最小平方法所計算出之判定係數(coefficient of determination, R²)為何?
判定係數 表示因變數 (Y) 的總變異中,有多少比例可以被自變數 (X) 的迴歸模型所解釋。
對於簡單線性迴歸, 可以透過以下公式計算:
其中 和 分別是 X 和 Y 的樣本標準差。
我們已知:
(從 計算得到)
(從 計算得到)
代入公式:
另一種計算 的方法是:
其中 且 。
在簡單線性迴歸中, (這個公式有點複雜,不如直接用相關係數的平方)。
由於 是自變數和因變數之間相關係數的平方,所以我們也可以先計算相關係數 :
因此,
所以,判定係數 為 0.25。這表示投入 (X) 只能解釋產出 (Y) 總變異的 25%。
第 6 題
若某一資料擁有許多自變量,請簡述如何挑選自變量進入迴歸模型使得此模型俱有良好的預測
力。(10%)
登入後即可作答並保存紀錄。
此題考驗對多重迴歸模型中自變數篩選方法的理解。當資料擁有許多自變量時,選擇哪些變量進入模型以獲得最佳預測力,是模型建立中的重要步驟。
挑選自變量進入迴歸模型以獲得良好預測力的常用方法包括:
-
基於理論或領域知識的選擇 (Theory-based Selection):
這是最理想也是最常用的方法。在建立模型之前,根據研究目的、相關領域的理論或專家知識,預先判斷哪些自變量可能對應變數有預測能力。這種方法可以避免過度擬合 (overfitting) 和不必要的模型複雜度。 -
基於統計顯著性的方法 (Statistical Significance-based Methods):
這些方法利用統計檢定來評估每個自變量的顯著性。-
逐步迴歸 (Stepwise Regression):
- 向前選擇 (Forward Selection):從一個只有截距項的模型開始,逐步將統計上最顯著的變量加入模型,直到沒有變量能夠顯著提升模型時停止。
- 向後剔除 (Backward Elimination):從包含所有潛在自變量的模型開始,逐步剔除統計上最不顯著的變量,直到所有剩餘變量都顯著時停止。
- 雙向選擇 (Bidirectional Elimination / Stepwise Regression):結合向前選擇和向後剔除,在每一步都考慮加入或剔除變量。
- 優點:自動化,易於操作。
- 缺點:可能陷入局部最优解,有時會剔除對預測有幫助但單獨檢定不顯著的變量,或者加入不具預測力的變量。對變量之間的共線性 (multicollinearity) 較敏感。
-
基於 P 值的方法:設定一個顯著水準 (例如 0.05),只保留 P 值小於 的變量。
-
-
基於模型效能指標的方法 (Model Performance Metrics):
這些方法直接優化模型的預測效能指標,而不是僅僅依賴 P 值。- 調整後的 (Adjusted ):在多重迴歸中, 隨著加入更多變量(即使是不顯著的)而增加。Adjusted 考慮了模型複雜度,當新增的變量對模型解釋能力的貢獻不足以彌補自由度的損失時,Adjusted 會下降。選擇 Adjusted 最大的模型。
- 資訊準則 (Information Criteria):
- 赤池資訊準則 (Akaike Information Criterion, AIC):衡量模型擬合優度與模型複雜度之間的權衡。AIC 值越小,模型越優。
- 貝氏資訊準則 (Bayesian Information Criterion, BIC):與 AIC 類似,但對模型複雜度給予更嚴格的懲罰。BIC 值越小,模型越優。