111 年 國立成功大學統計學研究所《統計學》
第 1 題
A statistic is a function of the data.
登入後即可作答並保存紀錄。
此題考驗對「統計量 (Statistic)」基本定義的理解。
第 2 題
Bar chart is an appropriate tool to describe the household income.
登入後即可作答並保存紀錄。
此題考驗對長條圖 (Bar chart) 適用性的理解,以及對「家戶所得 (household income)」資料類型的認識。
家戶所得通常是連續性的數值資料,而且分佈範圍可能較廣。長條圖主要用於呈現類別資料 (categorical data) 的頻率分佈,例如不同產品的銷售量、不同地區的人口數等。
第 3 題
The lower and upper bound of a confidence interval are parameters.
登入後即可作答並保存紀錄。
此題考驗對信賴區間 (Confidence Interval) 的組成要素及其與母體參數 (parameter) 之間關係的理解。
第 4 題
The intersection of two independent sets is the empty set.
登入後即可作答並保存紀錄。
此題考驗對「集合 (set)」基本概念的理解,與「獨立 (independent)」一詞的用法。
「獨立」在這裡的語境與機率或統計中的獨立事件 (independent events) 不同,而是指集合之間的關係。兩個集合的交集 (intersection) 是指同時存在於兩個集合中的元素所形成的集合。
第 5 題
The assumption of normality is not required to estimate the slope with least-square method in linear regression.
登入後即可作答並保存紀錄。
此題考驗對最小平方法 (least-square method) 在線性迴歸 (linear regression) 中假設條件的理解。
在簡單線性迴歸中,使用最小平方法來估計迴歸係數(包括斜率 和截距 )時,基本的假設是誤差項(或稱殘差)服從獨立且期望值為零的常態分佈,即 。這個假設對於進行參數估計的推論(如假設檢定和信賴區間的建構)是必要的。
然而,最小平方法本身作為一種優化方法,其核心目標是最小化殘差平方和,從而找到最佳擬合直線。在純粹的參數估計層面,即使誤差項不服從常態分佈,最小平方法仍然可以得到無偏估計量(在某些條件下),但統計推論的有效性(例如 t 檢定或 F 檢定的 P
第 6 題
The data would be left-skewed if the median is less than the mean.
登入後即可作答並保存紀錄。
此題考驗對偏態 (skewness) 與平均數 (mean) 和中位數 (median) 之間關係的理解。
偏態描述的是資料分佈的不對稱性。
- 右偏態 (Right-skewed / Positively skewed):分佈的尾部較長在右側。此時,平均數會被右側的極端值拉高,因此通常有 平均數 > 中位數。
第 7 題
The central limit theorem guarantee that the sample would be approximately normally distributed when the sample size is large enough given the population variance is finite.
登入後即可作答並保存紀錄。
此題考驗對中央極限定理 (Central Limit Theorem, CLT) 的理解。
中央極限定理指出,對於一個具有有限變異數 () 的母體,不論其原始分佈為何,當樣本大小 (n) 足夠大時,從該母體抽取的樣本平均數 () 的抽樣分佈將近似於常態分佈。
定理的關鍵在於「樣本平均數的抽樣分佈」近似於常態,而不是「樣本本身」近似於常態。樣本本身的分佈特性取決於母體分佈。只有當母體本身就是常態分佈時,樣本的平均數抽樣分佈才是精確的常態分佈,且樣本本身也近似常態。
第 8 題
The primary purpose of the cluster sampling design is to save the sampling cost.
登入後即可作答並保存紀錄。
此題考驗對叢集抽樣 (cluster sampling) 主要目的的理解。
叢集抽樣是一種抽樣方法,將母體分成若干個稱為「叢集」的群組,然後隨機抽取部分叢集,並對被抽中的叢集內的所有單位或隨機抽取的單位進行調查。
叢集抽樣的主要優點和目的是:
- 節省成本 (Cost-saving):將地理位置相近的單位分在同一個叢集,可以減少調查員在地理上的移動成本。
- 便利性 (Convenience):對於地理分佈廣泛的母體,叢集抽樣可以使抽樣工作更易於管理和執行。
第 9 題
If X is a discrete random variable, then the value of its density function cannot be greater than 1.
登入後即可作答並保存紀錄。
此題考驗對離散型隨機變數 (discrete random variable) 的機率質量函數 (probability mass function, PMF) 的理解。
離散型隨機變數的機率分佈是由機率質量函數 (PMF) 來描述,通常用 或 表示。PMF 的值表示隨機變數取特定離散值的機率。根據機率的定義,任何事件的機率都必須介於 0 和 1 之間(包含 0 和 1)。
第 10 題
The median of a distribution is unique.
登入後即可作答並保存紀錄。
此題考驗對「中位數 (median)」定義的理解。
中位數是指將一組資料或一個機率分佈按大小順序排列後,位於最中間的值。
- 對於一組有限的數值資料:
- 如果資料點的個數是奇數,中位數就是最中間那個數。
- 如果資料點的個數是偶數,中位數通常定義為中間兩個數的平均值。
- 對於一個連續機率分佈 :中位數 是滿足 的值。
第 11 題
The one-sample t-test to examine the population mean µ can be used even if the population is not normally distributed as long as the sample size n is large enough, so can the one-sample test for population variance based on , where S² is the sample variance,
登入後即可作答並保存紀錄。
此題考驗對單一樣本 t 檢定 (one-sample t-test) 和母體變異數檢定的假設條件,以及樣本大小對這些檢定方法的影響。
關於單一樣本 t 檢定:
當母體變異數 未知時,我們使用樣本標準差 來估計它,並進行 t 檢定。t 檢定的理論基礎是假設母體 服從常態分佈 。然而,根據中央極限定理 (CLT),當樣本大小 足夠大時(通常認為 ),即使母體不服從常態分佈,樣本平均數 的抽樣分佈也會近似於常態分佈。因此,t 檢定在 足夠大時對母體非常態的條件是具有一定穩健性 (robustness) 的。所以,敘述中關於 t 檢定的部分是正確的。
第 12 題
Let be the upper quantile, that is . Suppose that , then , where .
登入後即可作答並保存紀錄。
此題考驗對 F 分佈的分位數 (quantile) 及其反轉性質的理解。
首先,定義 表示隨機變數 服從自由度為 (分子)和 (分母)的 F 分佈。
通常表示 F 分佈的 分位數,即 。
題目中給定的 是 upper quantile,即 。這意味著 是 分佈的 分位數,即 。
我們需要驗證 ,其中 。
這裡的 應理解為 的 分位數,即 。
反過來,。
F 分佈有一個重要的性質:如果 ,那麼 。
令 ,則 。
我們知道 。
第 13 題
The geometric distribution in the Bernoulli process is an analogy of the Exponential distribution in the Poisson process.
登入後即可作答並保存紀錄。
此題考驗對離散型分佈(幾何分佈)與連續型分佈(指數分佈)在各自過程中的對應關係的理解。
- 伯努利過程 (Bernoulli Process):由一系列獨立的伯努利試驗組成,每次試驗只有兩種結果(成功或失敗),且成功的機率 保持恆定。
- 幾何分佈 (Geometric Distribution):描述在伯努利過程中,首次成功出現前所經歷的失敗次數,或達到首次成功所需的試驗總次數。這是離散型的。
- 例如:擲硬幣直到第一次出現正面為止,需要擲幾次?
第 14 題
The nonparametric version of the parametric one-sample t-test is the Mann-Whitney test.
登入後即可作答並保存紀錄。
此題考驗對參數檢定 (parametric test) 與非參數檢定 (nonparametric test) 的對應關係的理解。
-
參數檢定:通常假設母體來自某種特定的機率分佈(如常態分佈),並且檢定是關於母體參數(如平均數、變異數)的。
-
非參數檢定:對母體分佈的假設較少或沒有假設,通常檢定的是關於母體分佈位置、尺度或形狀的性質。
-
單一樣本 t 檢定 (One-sample t-test):這是一個參數檢定,用於檢定單一樣本的平均數是否等於某個已知值。其主要假設是母體來自常態分佈。
第 15 題
The daily temperature is an example of interval-scale variable.
登入後即可作答並保存紀錄。
此題考驗對測量尺度 (scale of measurement) 的理解,特別是區間尺度 (interval scale)。
測量尺度有四種:
- 名目尺度 (Nominal scale):只能用於分類,變數值沒有順序意義。例如:性別(男/女)、血型(A/B/AB/O)。
- 順序尺度 (Ordinal scale):變數值有順序意義,但相鄰數值之間的差距沒有固定意義。例如:學歷(國小/國中/高中/大學)、滿意度(非常不滿意/不滿意/普通/滿意/非常滿意)。
- 區間尺度 (Interval scale):變數值有順序意義,且相鄰數值之間的差距有固定意義,但沒有真正的零點。零點是人為定義的。例如:攝氏溫度 (Celsius, °C)、華氏溫度 (Fahrenheit, °F)、智商 (IQ)。
第 16 題
The independence between two events A and B cannot be guaranteed by neither the independence between A and B, nor the independence between A and Bᶜ.
登入後即可作答並保存紀錄。
此題考驗對事件獨立性 (independence of events) 的定義和性質的理解。
兩個事件 A 和 B 獨立的定義是 。
等價的條件還有:
- (如果 )
- (如果 )
如果 A 和 B 獨立,那麼 A 和 B 的補集 也獨立。
證明:
(根據集合性質)
因為 A 和 B 獨立,所以 。
這證明了 A 和 也是獨立的。
同理,如果 A 和 B 獨立,那麼 和 B 也獨立,且 和 也獨立。
題目敘述:「The independence between two events A and B cannot be guaranteed by neither the independence between A and B, nor the independence between A and Bᶜ。」
第 17 題
If random variables X, Y are independently and identically distributed as the standard normal distribution, then the median of is zero.
登入後即可作答並保存紀錄。
此題考驗對標準常態分佈 (standard normal distribution) 的性質,以及兩個獨立標準常態隨機變數比值的分佈和中位數的理解。
設 且 ,且 和 獨立。
我們考慮隨機變數 。
首先,需要注意 的值可能為 0,這會導致 無法定義。標準常態分佈是連續分佈,隨機變數取特定值的機率為 0。因此,。所以,在大多數情況下, 是有定義的。
的分佈是柯西分佈 (Cauchy distribution)。
標準柯西分佈的機率密度函數 (PDF) 為:
,其中 。
第 18 題
The household income data is often heavily right-skewed, hence a better location measurement of the center of the data would be the median.
登入後即可作答並保存紀錄。
此題考驗對偏態分佈 (skewed distribution) 下集中趨勢度量 (measure of central tendency) 選擇的理解。
- 右偏態 (Right-skewed):分佈的尾部較長在右側。這意味著存在一些較大的極端值。
- 集中趨勢度量:
- 平均數 (Mean):受極端值影響很大。
- 中位數 (Median):不受極端值影響,它只與資料的排序有關。
- 眾數 (Mode):代表最常出現的值。
第 19 題
At least about 89% of the data would be located within 4 standard deviations of the sample mean is guaranteed by the Chebyshev's Theorem.
登入後即可作答並保存紀錄。
此題考驗對柴比雪夫定理 (Chebyshev's Theorem) 的理解及其應用。
柴比雪夫定理提供了一個不論母體分佈為何,都可以保證的數據比例範圍。
定理內容:對於任何具有有限期望值 和有限非零變異數 的隨機變數 ,對於任意常數 ,數據落在距離期望值 的 個標準差範圍內的比例至少為 。
即:。
題目中提到「within 4 standard deviations of the sample mean」。
第 20 題
If the correlation coefficient between random variables X, Y is 1, then X can be expressed as , for sure, where a and b are arbitrary constants.
登入後即可作答並保存紀錄。
此題考驗對皮爾森相關係數 (Pearson correlation coefficient) 為 1 的意義及其線性關係的理解。
皮爾森相關係數 的值介於 -1 和 1 之間。當 時,表示兩個隨機變數 和 之間存在完全的線性正相關。這意味著 可以表示為 的線性函數,且斜率為正。
具體來說,如果 和 之間的相關係數為 1,則 和 之間存在一個線性關係 ,其中:
- 是斜率,表示 相對於 的變化率。
- 是截距。
第 B.1.i 題
A factory would like to evaluate the efficiency of three different production methods, denoted as A, B, and C. Each of these three methods are used to produce the products for 10 production periods. The amounts of products produced are recorded, the data is
Amount Method
1
500
B
2
300
C
3
200
A
4
100
A
5
400
C
6
400
A
... (30 items of data in total)
30 200
B
The sum of squares is 441667 of the 30 items of data. One would like to evaluate if there are significant difference among these three methods, and simple linear regression with dummy coding is used. The coding system is:
Method
X1
X2
X3
A
1
0
0
B
0
1
0
C
0
0
0
The followings are the results of the regression analysis and the associated ANOVA table, with a few missings:
Coefficients: Estimate Std. Error t value Pr(>|t|)
(Intercept) 350.00 34.69 10.088 1.18e-10 ***
X1 -150.00 49.07 -3.057 0.00499 **
X2 -50.00 49.07 -1.019 0.31722
Residual standard error: 109.7 on 27 degrees of freedom
Multiple R-squared: 0.2642, Adjusted R-squared: (A)
Analysis of Variance Table
Response: Amount
Df Sum Sq Mean Sq F value Pr(>F)
X1 1 104167 104167 8.6538 0.006625 **
X2 1 12500 12500 1.0385 0.317224
Residuals 27 12037
Please fill in the missing items (A) and (B) of the results above.
i. Please fill in the missing items (A) and (B) of the results above.
登入後即可作答並保存紀錄。
此題為迴歸分析與變異數分析的應用,需要填寫缺漏的數值。
核心觀念:
- 調整後決定係數 (Adjusted R-squared):用於衡量模型擬合優度,考慮了預測變數的數量。
- 變異數分析表 (ANOVA table):將總變異分解為迴歸變異和殘差變異,用於檢定模型整體顯著性。
- 決定係數 (R-squared) 與 總平方和 (Total Sum of Squares, TSS)、迴歸平方和 (Regression Sum of Squares, RSS)、殘差平方和 (Residual Sum of Squares, ESS) 之間的關係。
計算 (A) - Adjusted R-squared:
調整後決定係數的計算公式為:
其中:
- 是樣本大小。
- 是預測變數的數量。
- 是殘差平方和 (Error Sum of Squares)。
- 是總平方和 (Total Sum of Squares)。
從題目資訊中,我們可以得知:
- 樣本大小 (30 items of data)。
- 預測變數的數量 (X1 和 X2,因為 X3 是參照組)。
- (殘差自由度,與題目給的 Residuals Df 27 相符)。
- (總平方和自由度)。
我們已知:
- Multiple R-squared = 0.2642。
- Residual standard error = 109.7。
- Residuals Sum of Squares (ESS) = 12037。
首先,我們需要計算總平方和 (TSS)。
殘差標準誤 (Residual standard error) 的定義是 。
第 B.1.ii 題
ii. The estimated average amount of products produced by method C is (C)____ and the estimated overall average amount produced by these three methods is (D)____.
登入後即可作答並保存紀錄。
這題的核心觀念在於單因子變異數分析(One-Way ANOVA)中的點估計量計算。考生必須理解在平衡或不平衡設計下,如何利用樣本平均數(Sample Mean)來估計特定處理組(Treatment Group)的母體平均數,以及如何計算總平均數(Grand Mean)。關鍵在於釐清「組內平均」與「整體平均」的加權關係,特別是要注意當各組樣本數不同時,整體平均並非單純將三組平均數相加除以三,而必須考慮樣本數的權重。
由於您提供的文字 prompt 中未包含具体的數據表格或前一小題(B.1.i)的計算結果,以下詳解將基於標準 ANOVA 考古題的邏輯架構,假設題目給定了三組方法(A, B, C)的樣本數 與樣本總和 (或樣本平均 )進行推導。請您對照手邊考卷的實際數字代入下列公式即可得到最終數值。
解題過程與邏輯分析
在單因子變異數分析的模型中,我們假設第 組的觀察值 服從常態分佈 ,其中 為第 種方法的母體平均生產量。
1. 估計方法 C 的平均生產量 (C)
根據點估計的無偏性原則,特定組別母體平均數 的最佳不偏估計量(Best Unbiased Estimator)即為該組的樣本平均數 。
若設方法 C 為第 3 組(通常順序為 A, B, C),其樣本數為 ,該組所有觀察值之總和為 。
則方法 C 的估計平均量 計算公式為:
邏輯說明:
這裡不需要考慮其他組別的數據,因為在 ANOVA 模型假設下,各組之間的誤差項是獨立且同質變異的,對特定組別平均數的估計僅依賴該組內的數據。若考卷前一小題已算出 ,則直接填入該數值。
2. 估計三種方法的整體平均生產量 (D)
整體平均數(Grand Mean),記為 或 ,代表所有處理組混合後的母體平均。其最佳不偏估計量為總樣本平均數 。
計算時必須注意加權平均的概念。設總共有 組(方法 A, B, C),第 組的樣本數為 ,總樣本數 。
Analysis of Variance Table
Response: Amount
| Source | Df | Sum Sq | Mean Sq | F value | |
|---|---|---|---|---|---|
| ** | |||||
| Residuals | (B) ____ |
Please answer the following questions. For the non-integer answers, please round to the second digit after the decimal point.
第 B.1.iii 題
The value of the test statistic to examine if these is any different among these methods is (E) ____, and it should be compared to the (F) ____ distribution for a proper conclusion.
登入後即可作答並保存紀錄。
核心觀念
這題考三種方法的平均產量是否全都相同,屬於單因子變異數分析的整體 檢定。虛無假設為
對立假設為至少有一種方法的平均產量不同。
解題方法
原圖的變異數分析表顯示: 與 各有 個自由度,殘差自由度為 ,殘差均方為 。由於三種方法的整體差異由兩個自由度描述,整體檢定的分子平方和為 、 平方和的總和:
因此方法的均方為 ,整體檢定統計量為
第 B.1.iv 題
If one would like to further examine if any pair of two methods are significantly different with the procedure of Fisher's least significant distance, the Least Significant Distance is (G) ____. (The exact number is not required, a proper expression would be good enough.)
If the significant level is set to be for each pairwise comparison, the overall type-I error rate would be (H) ____.
登入後即可作答並保存紀錄。
One would like to study if the beer preference is independent of gender, and data of beer drinkers are collected. The data yields:
| Gender () | Beer Preference (): Light, | Beer Preference (): Dark, |
|---|---|---|
| Female, | ||
| Male, |
A test to examine
against
is performed, and the value of the test statistic is
which gives a p-value of .
Suppose we reevaluate this data with the goodness-of-fit test to examine if beer preference is independent of gender. Please answer the following questions:
第 B.2.i 題
The expected counts of the female beer drinkers who prefer light beer under is (I) ____.
登入後即可作答並保存紀錄。
核心觀念
在「性別與啤酒偏好互相獨立」的虛無假設下,列聯表中每一格的期望次數為:
解題方法
第 B.2.ii 題
The value of the Pearson residual of the female beer drinkers who prefer dark beer under is (J) ____.
登入後即可作答並保存紀錄。
核心觀念
在獨立性檢定中,虛無假設 表示性別與啤酒偏好獨立。每一格的期望次數為
Pearson 殘差則是觀察次數與期望次數之差,除以期望次數的平方根:
解題方法
從原卷表格讀得:女性偏好淡啤酒與深啤酒的人數分別為 與 ;女性總數為 。深啤酒的總人數為 ,總樣本數為 。
在 下,女性偏好深啤酒的期望次數為
第 B.2.iii 題
The value of the test statistic of this goodness-of-fit test is (K) ____.
登入後即可作答並保存紀錄。
核心觀念
檢定性別與啤酒偏好是否獨立,可使用列聯表的 Pearson 卡方統計量。若兩變數獨立,各格的期望次數為「該列合計 × 該欄合計 ÷ 總人數」,再計算各格觀察次數與期望次數的差異。
解題方法
圖中第 4 頁的第 B.2 題依序詢問 Pearson 殘差、檢定統計量 與 值;本小題要計算的是檢定統計量。依題幹列出的交叉表,女性、男性合計分別為 、 人,偏好淺啤酒、深啤酒合計分別為 、 人,總人數為 。
在「性別與啤酒偏好獨立」的假設下,期望次數如下:
第 B.2.iv 題
The p-value of the test statistic of this goodness-of-fit test is (L) ____.
登入後即可作答並保存紀錄。
核心觀念
本題考查列聯表的卡方獨立性檢定。虛無假設 為啤酒偏好與性別互相獨立;在虛無假設成立時,各格的期望次數為「列合計乘以欄合計,再除以總樣本數」。卡方統計量為觀察次數與期望次數差異的加權平方和,自由度為 。
解題方法
原卷圖中 B.2.iv 詢問的是此適合度檢定統計量的 值。題幹資料為女性偏好淺啤酒、深啤酒各 、 人;男性各 、 人,總樣本數為 。
列合計為女性 人、男性 人;欄合計為淺啤酒 人、深啤酒 人。因此期望次數如下:
| 性別 | 淺啤酒 | 深啤酒 |
|---|---|---|
| 女性 | ||
| 男性 |
卡方統計量為
第 C.1 題8 分
For the two hypothesis testing methods in Question 2, Part B, please explain the reason why you get the same or different conclusions.
登入後即可作答並保存紀錄。
題目資訊
題目沒有附上第 2 題 B 部分的兩種檢定方法、檢定統計量與顯著水準,因此無法判定該題實際得到相同或不同的結論。以下依常見考法,假設兩種方法是「臨界值法」與「 值法」。
核心觀念
在同一個假設檢定中,若兩種方法使用相同的虛無假設與對立假設、檢定統計量、分配假設及顯著水準 ,臨界值法與 值法是等價的判斷程序,結論必須相同。
臨界值法比較檢定統計量是否落入拒絕域; 值法比較觀察到的 值是否小於或等於 。兩者都是在判斷資料是否提供足夠證據拒絕 。
解題方法
以右尾檢定為例,設檢定統計量為 ,其虛無假設下的分配為 。
臨界值法的拒絕規則為:
值法則計算:
並在 時拒絕 。
第 C.2 題8 分
Please explain why the width of the prediction band is wider than which of the confidence band in linear regression model without using any formula.
登入後即可作答並保存紀錄。
核心觀念
這題考的是線性迴歸中「信賴帶」與「預測帶」的差別。
信賴帶描述的是:在某個自變數位置,母體的平均反應值落在哪個範圍。它反映迴歸線估計的不確定性。
預測帶描述的是:在同一個自變數位置,一筆新的個別觀測值落在哪個範圍。除了迴歸線估計的不確定性,還要納入個別觀測值本身相對於母體平均值的隨機波動。
解題方法
比較兩種範圍所涵蓋的不確定性:
- 信賴帶只需考慮估計母體平均反應值時的誤差。
- 預測帶除了考慮上述估計誤差,還須考慮新觀測值自身的隨機誤差。
第 C.3 題8 分
Based on the data collected from her department, Jane obtained the confidence interval of the daily expenditure of the students in her department as NTD to NTD based on the sampling distribution of the sample mean.
Please interpret the meaning of this confidence interval.
登入後即可作答並保存紀錄。
核心觀念
這題考的是母體平均數信賴區間的正確解讀。題目是根據樣本平均數的抽樣分配,為該系學生的「每日平均支出」建立 信賴區間。
信賴區間的 信賴水準描述的是區間估計方法的長期涵蓋率:若在相同條件下反覆抽取樣本,並每次都用同一方法建立區間,長期而言約有 的區間會包含母體平均數。
解題方法
珍妮由樣本得到的區間是 250 元至 500 元。正確解讀是:依照所使用的抽樣與區間估計方法,這是一個具有 信賴水準、用來估計該系學生每日平均支出的區間。