115 年 國立臺北大學統計學系碩士班《統計學》
第 1 題10 分
根據調查, 72%的家庭擁有智慧型手機。若隨機抽取180戶家庭,求擁有智慧型手機的家庭數量多於115戶,但少於125戶的機率。
登入後即可作答並保存紀錄。
此題為一典型的二項分配近似常態分配問題。
首先,我們定義隨機變數 為抽取 180 戶家庭中,擁有智慧型手機的家庭數量。
根據題意,每一次抽樣可以視為獨立的伯努利試驗,成功機率 。
因此, 服從二項分配 ,其中 且 。
我們要求的是 。
由於 很大,我們可以利用常態分配來近似二項分配。
計算二項分配的平均數與變異數:
標準差
由於我們使用常態分配來近似二項分配,需要進行連續性修正 (continuity correction)。
,其中 為服從常態分配 的隨機變數。
將 的值轉換為標準常態分配 的值:
第 2 題10 分
在最近一年中,德拉瓦州的人均年所得為51,803美元,為全美最高。若母體標準差為美元,求下列機率:
(a) 從德拉瓦州隨機抽取34位居民,其平均所得高於50,000美元的機率為何?
(b) 從德拉瓦州隨機抽取34位居民,其平均所得低於48,000美元的機率為何?
登入後即可作答並保存紀錄。
此題考驗對抽樣分配的理解,特別是當母體標準差已知時,樣本平均數的抽樣分配。
我們已知母體標準差 。
抽樣的樣本數為 。
由於 ,根據中央極限定理,樣本平均數 的抽樣分配近似於常態分配,其平均數為母體平均數 ,標準差為母體標準差除以樣本數的平方根(標準誤, standard error)。
然而,題目中僅給出德拉瓦州「人均年所得」為 51,803 美元,這裡應將其視為母體平均數 。
(a) 計算從德拉瓦州隨機抽取34位居民,其平均所得高於50,000美元的機率。
樣本平均數 的抽樣分配近似為 。
平均數
標準誤
我們要求 。
將 轉換為 值:
第 3 題10 分
某一組老鼠學會通過迷宮所需的嘗試次數,其樣本平均數為12次,標準差為3次。利用 Chebyshev's theorem,求至少有多少百分比的資料會落在4次到20次嘗試之間。
登入後即可作答並保存紀錄。
此題考驗對 Chebyshev's theorem 的應用。Chebyshev's theorem 提供了一個不依賴於資料分配的機率下限。
給定的樣本平均數 ,樣本標準差 。
我們要求資料落在區間 的百分比。
首先,計算該區間與樣本平均數的距離:
區間的下限 與平均數 的差距為 。
區間的上限 與平均數 的差距為 。
這個區間可以表示為 。
Chebyshev's theorem 指出,對於任何一個隨機變數 及其平均數 和標準差 ,對於任意常數 ,
或者,其補集為
第 4 題10 分
檢查下列每一組資料是否存在離群值(outliers):
(a) 46, 28, 32, 21, 25, 29, 34, 19
(b) 82, 100, 97, 93, 89, 90, 65, 94, 101
登入後即可作答並保存紀錄。
核心觀念
本題使用箱形圖常見的 離群值判定法。先將資料由小到大排列,再求第一四分位數 與第三四分位數 ,並計算四分位距:
下界與上界分別為:
小於下界或大於上界的資料,判定為離群值。以下依「奇數筆資料取中位數後,將中位數排除,再分上下兩半求四分位數」的慣例計算。
解題方法
(a) 將資料排序:
共有 8 筆資料,分成上下兩半:
- 下半部:,所以 。
- 上半部:,所以 。
因此:
第 5 題10 分
下列資料顯示南卡羅來納州(South Carolina)某近期年度,部分城市的人口數(單位:千人)。資料如下:
29 26 15 13 17 58 14 25 37 19 40 67 23 10 97
12 129 27 20 18 120 35 66 21 11 43 22
請找出各百分位數所對應的資料值或找出下列資料值所對應的百分位數:
(a) 第40百分位數
(b) 第75百分位數
(c) 第90百分位數
(d) 27
(e) 58
登入後即可作答並保存紀錄。
核心觀念
百分位數是將資料由小到大排列後,用位置找出指定百分比所對應的資料值。令樣本數為 ,第 百分位數的位置為
若 不是整數,將位置進位至下一個整數,取該位置的資料值;若 是整數,則取第 與第 個資料值的平均。
反過來,求某個資料值所對應的百分位數時,採用「低於該值的資料個數除以總資料個數,再乘以 」的定義。
解題方法
本題共有 筆資料。由小到大排列如下:
依序求百分位數:
-
(a) 第 百分位數
進位取第 個資料值,因此第 百分位數為 。
-
(b) 第 百分位數
第 6 題10 分
某研究者隨機抽樣 n=36位受試者,測量其某項指標 X,假設 ,其中 。已知樣本平均為 。
(a) 請建構一95%信賴區間。
(b) 請問要是重覆做另一次實驗,得到新的樣本平均是否會有95%的機率落在(a)的答案所給出的區間中,請簡易地解釋您的答案。
登入後即可作答並保存紀錄。
此題考驗對信賴區間的建構與解釋。
已知樣本數 ,樣本平均數 ,母體變異數 。
由於母體變異數已知,我們使用 分配來建構信賴區間。
標準差 。
(a) 建構 95% 信賴區間。
信賴區間的公式為:
對於 95% 的信賴水準,。
。
查閱標準常態分配表,對應 的 值為 。
標準誤 (Standard Error) 。
信賴區間的邊界為:
信賴區間為 。
【答案】(a) 95% 信賴區間為 (四捨五入)。
(b) 解釋重複實驗的樣本平均數落在信賴區間的機率。
這個問題在於理解信賴區間的意義。
信賴區間是針對母體平均數 而言,我們有 95% 的信心認為母體平均數 落在建構出來的區間內。
然而,信賴區間本身是隨機的,因為它依賴於樣本平均數 。
如果我們重複抽樣,得到新的樣本平均數 ,這個新的樣本平均數 來自於母體 。
根據中央極限定理,新的樣本平均數 的抽樣分配是 。
因此,新的樣本平均數 落在我們第一次建構的信賴區間 中的機率,並不是 95%。
實際上,這個機率是 ,其中 。
這個機率值取決於真實的母體平均數 。
第 7 題10 分
某靈學大師宣稱經過他的加持之後,您就能和指定的成功人士產生量子糾纏,於是該成功人士想買什麼股票,您會冥冥之中也想買那張股票,因此您就有了發財致富的可能。請設計一個實驗驗證這位大師的宣稱是否屬實。並請用統計學課本裡教過的方法來做實驗,標明您使用的方法(越簡單越好),要用什麼統計量去檢定?需要多少的樣本數?(所需參數,如果型一過誤,型二過誤等請自定。)
登入後即可作答並保存紀錄。
核心觀念
這題考的是實驗設計、假設檢定與樣本數規劃。要檢驗「加持後,受試者更常選中成功人士想買的股票」,需先把宣稱轉成可觀察的結果:每次試驗中,受試者的選擇是否與目標人士的選擇相同。
只測加持組的命中率,可能把一般的選股相似性誤認為加持效果。因此設置加持組與假加持對照組,以兩組命中率差異作為檢定依據。
實驗設計
每次試驗提供受試者與目標人士相同的四檔股票。目標人士先獨立選出自己想買的一檔並密封記錄;受試者看不到目標人士的選擇,再依自己的意願選出自己想買的一檔。(宣稱是「您會冥冥之中也想買那張股票」,所以要測的是受試者自己的購買意願,而不是猜別人會買什麼。)
將受試者隨機分派至兩組:
- 加持組:接受大師的加持。
- 對照組:接受時間、流程相同的假加持,但不接受大師所宣稱的加持。
受試者與記錄結果的人員都不知道組別安排;每位受試者只參加一次試驗,避免重複作答造成依賴。每次試驗都使用新的受試者與目標人士選擇。
定義命中指標 :
四檔股票下,若受試者只是隨機猜測,命中率為 。實際上,一般人可能也會偏好某些股票,因此對照組可估計沒有加持時的命中率;隨機分組則使兩組可公平比較。
假設與檢定方法
令 為加持組的命中率, 為對照組的命中率。檢定:
採用兩獨立樣本比例檢定。令加持組命中 次、樣本數為 ,對照組命中 次、樣本數為 ,則:
在虛無假設下,合併比例估計為:
檢定統計量為:
第 8 題15 分
在哈利波特的世界中,霍格華茲的新生會被分派到四個學院:Gryffindor(葛來分多)、Hufflepuff(赫夫帕夫)、Ravenclaw(雷文克勞)、Slytherin (史萊哲林)。若今年霍格華茲共有240位新生,得到以下表格:
| Gryffindor | Hufflepuff | Ravenclaw | Slytherin | Total | |
|---|---|---|---|---|---|
| Male | 40 | 20 | 30 | 30 | 120 |
| Female | 30 | 40 | 30 | 20 | 120 |
| Total | 70 | 60 | 60 | 50 | 240 |
| 根據上表,統計學家想研究「性別是否與被分派的學院有關」。請問要用什麼檢定方法回答問題? | |||||
| (a) 您提出的檢定方法名稱以及它使用的虛無假設和對立假設。 | |||||
| (b) 檢定統計量在虛無假設成立之下所服從的分配,並給出該分配的平均數及變異數。 | |||||
| (c) 因為沒有規定您用哪種方法,所以無法給您表格,請用 Chebyshev's inequality 做決策。假設型一過誤為0.01。 |
登入後即可作答並保存紀錄。
此題考驗對卡方獨立性檢定的應用,以及在特定條件下如何使用 Chebyshev's inequality。
(a) 檢定方法名稱、虛無假設與對立假設。
- 檢定方法名稱:卡方獨立性檢定 (Chi-squared test of independence)。
- 虛無假設 ():性別與被分派的學院是獨立的。換句話說,新生被分派到哪個學院與他們的性別無關。
- 對立假設 ():性別與被分派的學院不是獨立的。換句話說,新生被分派到哪個學院與他們的性別有關。
(b) 檢定統計量在虛無假設成立之下的分配、平均數及變異數。
在虛無假設成立之下,卡方獨立性檢定統計量 服從自由度為 的卡方分配 ( distribution)。
自由度的計算公式為 ,其中 是列數, 是欄數。
在此表中,有 2 列 (Male, Female) 和 4 欄 (Gryffindor, Hufflepuff, Ravenclaw, Slytherin)。
所以,,。
。
因此,檢定統計量在 下服從自由度為 3 的卡方分配 ()。
卡方分配的性質:
- 平均數 (Mean):對於自由度為 的卡方分配,其平均數為 。
所以,平均數 = 3。 - 變異數 (Variance):對於自由度為 的卡方分配,其變異數為 。
所以,變異數 = 。
【答案】(a) 方法:卡方獨立性檢定。: 性別與學院獨立。: 性別與學院不獨立。
(b) 分配:自由度為 3 的卡方分配 ()。平均數:3。變異數:6。
(c) 使用 Chebyshev's inequality 做決策。
首先,我們需要計算卡方統計量的值。
計算每個單元的期望次數 (Expected count) 。
| 學院 | 性別 | 實際次數 () | 列總計 | 欄總計 | 總計 | 期望次數 () | |
|---|---|---|---|---|---|---|---|
| Gryffindor | Male | 40 | 120 | 70 | 240 | ||
| Hufflepuff | Male | 20 | 120 | 60 | 240 | ||
| Ravenclaw | Male | 30 | 120 | 60 | 240 | ||
| Slytherin | Male | 30 | 120 | 50 | 240 | ||
| Gryffindor | Female | 30 | 120 | 70 | 240 | ||
| Hufflepuff | Female | 40 | 120 | 60 | 240 | ||
| Ravenclaw | Female | 30 | 120 | 60 | 240 |
第 9 題15 分
隨機抽樣 10 位葛來分多(Gryffindor)學生,記錄他們在期末考前一週的「每日平均讀書時間(小時)」X,以及「魔法學期末考成績」Y(分數上限未知,魔法世界沒有我們想得那麼理所當然),得到下表資料:
| 學生編號 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| 讀書時間 X | 1 | 2 | 2 | 3 | 3 | 4 | 4 | 5 | 5 | 6 |
| 成績 Y | 55 | 60 | 63 | 68 | 70 | 75 | 78 | 82 | 85 | 90 |
| 某魔法教授想了解「學生讀書時間是否能解釋其魔法考試成績?」假設簡單線性迴歸模型為 | ||||||||||
| 假設利用最小平方法(least squares)估計後,得到 : | ||||||||||
| (a) 請解釋斜率估計值 的實際意義。 | ||||||||||
| (b) 若有一位未被抽中的學生每天讀書8小時,請利用上述最小平方法的結果預測其成績。請問您會推薦使用這個估計值嗎?為什麼? | ||||||||||
| (c) 請給出的不偏估計。(請注意:本題為考卷上最後一題,但題目敘述與標準常態分配表的位置互換,請注意不要看錯) |
登入後即可作答並保存紀錄。
核心觀念
本題考查簡單線性迴歸的斜率解釋、樣本範圍外預測,以及誤差變異數 的不偏估計。迴歸係數的最小平方法估計量為
在誤差項獨立且變異數相同的簡單線性迴歸模型中, 的不偏估計量為殘差平方和除以自由度 :
題目 (c) 沒有寫出要估計的參數;以下依簡單線性迴歸常見問法,將其解讀為「求 的不偏估計」。
(a) 斜率的實際意義
斜率估計值 表示:在此線性迴歸模型下,每日平均讀書時間每增加 1 小時,預測的期末考平均成績增加約 7.16 分。
這是根據樣本資料得到的平均關聯,不代表讀書時間每增加 1 小時,每位學生的實際成績都必定增加 7.16 分,也不能單憑迴歸結果斷定因果關係。
(b) 預測與使用上的考量
依題目指定的迴歸式,代入 :
因此,預測成績為 105.84 分。
樣本中的讀書時間介於 1 至 6 小時,8 小時超出觀察範圍,這屬於外插。線性關係在已觀察範圍外未必仍成立,因此不宜把 105.84 分當成可靠的實際預測。題目已說明成績上限未知,不能只因預測值超過 100 分就判定它不合理;主要限制是預測超出樣本涵蓋的讀書時間範圍。
(c) 的不偏估計
先由資料計算最小平方法的迴歸線。樣本數為 ,且
所以