112 年 國立成功大學會計學研究所乙組《統計學》
第 1 題
- The test for the equality of two population variances assumes:
(a) that the population variances are known.
(b) that the population variances are equal.
(c) that each of the two populations are normally distributed.
(d) that the means of the two populations are equal.
登入後即可作答並保存紀錄。
此題考驗對變異數相等檢定(F檢定)的假設條件。
進行兩獨立樣本變異數相等的 F 檢定時,其中一個重要的前提假設是兩個母體都必須服從常態分配。雖然 F 檢定對於違反常態分配的條件具有一定的穩健性(robustness),但嚴格來說,常態分配是其理論基礎。
第 2 題
- In the stock market has a 5-day work per week. If we want to measure the impact of the day of the week on stock market
performance we would need ____ indicator variables.
(a) 7
(b) 6
(c) 5
(d) 4
登入後即可作答並保存紀錄。
此題考驗虛擬變數(dummy variables)的應用,特別是在處理類別型變數時。
在迴歸分析中,當我們需要將一個具有 個類別的類別型變數納入模型時,我們通常需要引入 個虛擬變數。這是因為如果引入 個虛擬變數,則會產生完全共線性(perfect multicollinearity),導致模型無法估計。
第 3 題
- One hundred students took a test on which the mean score was 73 with a variance of 64. A grade of A was given to all who
scored 85 or better. Approximately how many A's were there, assuming scores were normally distributed? (Choose the
closest)
(a) 42
(b) 7
(c) 58
(d) 22
登入後即可作答並保存紀錄。
此題考驗常態分配的應用,特別是計算機率以及根據機率估計人數。
已知:
總學生數
平均分數
變異數
標準差
A 級分數標準:分數
由於假設分數服從常態分配,我們可以使用標準常態分配(Z 分配)來計算分數高於 85 的機率。
首先,計算 Z 分數:
第 4 題
- If the coefficient of correlation equals 0.61, it indicates that the proportion of the variation in the dependent variable
explained by the variation in the independent variables is:
(a) 37%
(b) 61%
(c) 98%
(d) cannot be determined.
登入後即可作答並保存紀錄。
此題考驗相關係數(coefficient of correlation, )與判定係數(coefficient of determination, )的關係。
相關係數 衡量兩個變數之間線性的相關程度,其值介於 -1 和 1 之間。
判定係數 則衡量迴歸模型能夠解釋因變數變異的比例,其值介於 0 和 1 之間。
第 5 題
- The average starting salary for graduates at a university is 2000. How many of the
graduates would have a starting salary between 29000 ?
(a) At least 75%
(b) at least 89%
(c) at least 68%
(d) at least 95%
登入後即可作答並保存紀錄。
核心觀念
本題考查敘述統計學中資料分散度與數值落點比例的估計定理——柴比雪夫不等式(Chebyshev's Inequality)。
- 柴比雪夫不等式(Chebyshev's Inequality):
適用於任何形式的機率分配(不論分配為對稱、單峰、偏態或未知)。若隨機變數 的平均數為 、標準差為 ,則對任意常數 ,落在平均數加減 個標準差區間內的資料比例至少為: - 與經驗法則(Empirical Rule)之區分:
- 經驗法則:僅適用於對稱鐘形(常態)分配,落在 、、 的比例分別「大約」為 、、。
- 柴比雪夫不等式:適用於任意分配,結論為「至少」(At least)一個保證的最低比例下限。
解題方法
-
整理題目已知條件:
- 平均數 $25000
- 標準差 $2000
- 目標薪資區間:$21000, $
-
計算倍數 :
觀察目標區間與平均數的距離:區間即為 $[\mu - 2\sigma, \mu + 2\sigma]
第 6 題
- Autocorrelation in a regression forecasting model be detected by the
(a) F test
(b) Mann-Whitney test
(c) Durbin-Watson test
(d) Kruskal-Wallis test
登入後即可作答並保存紀錄。
此題考驗在迴歸模型中,用來檢測殘差自相關性的統計檢定方法。
自相關(Autocorrelation)是指時間序列中,某個觀測值與其過去的觀測值之間存在的相關性。在迴歸分析中,如果殘差(observed value - predicted value)存在自相關,這違反了迴歸分析的獨立性假設,可能導致估計的標準誤偏誤,進而影響推論的正確性。
- (a) F test: 通常用於檢定迴歸模型的整體顯著性(即所有自變數的係數是否同時為零),或用於比較巢狀迴歸模型。
第 7 題
- In a telephone survey, respondents are asked to provide the level of satisfaction about a policy using a scale of 0 to 100.
What is the level of measurement about satisfaction?
(a) Nominal
(b) Ordinal
(c) Interval
(d) Ratio.
登入後即可作答並保存紀錄。
核心觀念
本題考的是測量尺度的判定。判斷重點在於分數所代表的意義,而非是否使用數字表示。
四種測量尺度的性質如下:
| 測量尺度 | 可判別的關係 | 必要條件 |
|---|---|---|
| 名目尺度(Nominal) | 類別是否相同 | 能區分類別,不具有高低順序 |
| 順序尺度(Ordinal) | 高低、大小順序 | 能排序,但不保證相鄰數值的差距具有相同意義 |
| 等距尺度(Interval) | 順序與差距 | 相等的數值差距代表相等的受測特質差異 |
| 比例尺度(Ratio) | 順序、差距與倍數 | 具有等距性,且零點代表受測特質完全不存在 |
解題方法
題目讓受訪者以 至 分表示政策滿意度,可依序檢查「能否排序」、「是否等距」與「是否具有絕對零點」。
一、分數具有高低順序。
較高的分數表示較高的滿意度,因此可以比較受訪者的滿意程度,符合順序尺度的條件。
二、題目未建立等距性。
例如, 分到 分與 分到 分,在數字上都相差 分,但題目沒有保證這兩段分數差距代表相同的滿意度差異。
第 8 題
- Let and be observations of a random sample from a distribution with p. d. f. , zero
elsewhere. Evaluate the conditional probability .
(a) 3/8
(b) 8/17
(c) 4/7
(d) 3/11
登入後即可作答並保存紀錄。
核心觀念
本題考查:
- 條件機率公式
- 隨機樣本的聯合機率密度函數
- 二重積分計算事件機率
- 由事件包含關係簡化條件機率
因為 為來自同一分布的隨機樣本,所以兩者獨立,聯合機率密度函數為
其中 。
令
由於 必然推出 ,因此 ,故
解題方法
1. 計算
在單位正方形 中,事件 位於直線 上方,因此
先對 積分:
2. 計算
事件邊界為
由於 最大為 ,需要依照 分段:
- 當 時,;
- 當 時,,因此整個 都符合條件。
所以
第一部分為
第 9 題
- In time series analysis
(a) the sequencing of measurements is usually at discrete, regular intervals
(b)one should remember that analysis is always multivariate as opposed to univariate analysis
(c) autocorrelation of the values of the series is unacceptable
(d)observations are nearly always measured at the end of some period of time
登入後即可作答並保存紀錄。
此題考驗時間序列分析(time series analysis)的基本特性。
-
(a) the sequencing of measurements is usually at discrete, regular intervals: 這是時間序列分析的核心特徵。時間序列資料是指在不同時間點上觀測到的數據,這些時間點通常是離散且具有規律間隔的,例如每天、每月、每季、每年。這個選項是正確的。
-
(b) one should remember that analysis is always multivariate as opposed to univariate analysis: 時間序列分析既可以是單變量(univariate)的,也可以是多變量(multivariate)的。例如,ARIMA 模型是單變量的,而 VAR 模型是多變量的。
第 10 題
- One way to remove seasonality from a series is to
(a) take a moving average of 3 periods.
(b) take a moving average equal to twice the seasonal length.
(c) take a moving average of 12 periods.
(d) take a moving average equal to the seasonal length.
登入後即可作答並保存紀錄。
此題考驗時間序列分析中,去除季節性(seasonality)的方法。
季節性是指時間序列數據中,在固定時間間隔內重複出現的週期性模式,通常與日曆上的時間(如月份、季度)有關。
去除季節性的常用方法之一是移動平均法(moving average)。當季節性週期為 期時,我們通常取一個長度為 的移動平均來平滑數據。這個移動平均會將季節性成分平均掉。
例如,如果一個序列有季度性(),我們計算一個 4 期移動平均。
如果一個序列有月度性(),我們計算一個 12 期移動平均。
第 二、1. (8%) 題
二、非選擇題50分
- (8%)設台大男生參加各種運動的比例如下:
羽球 桌球 網球 羽球及桌球 羽球及網球 桌球及網球 三者皆有
30% 20% 20% 5% 10% 5% 2%
今隨意抽取一名男生,請計算以下機率:
① 至少參加一種運動。
② 僅為羽球員。
③ 若將至少參加一種運動的稱為運動員,則該名男生,已知其為運動員,而他參加羽球的機率為何?
④ 該名男生已知其為桌球員,而他三項都參加的機率為何?
登入後即可作答並保存紀錄。
核心觀念
本題考查集合的聯集、交集、排容原理,以及條件機率。
令:
- :參加羽球
- :參加桌球
- :參加網球
題目給定:
其中「羽球及桌球」等交集包含三項皆參加者,因此使用排容原理時,三者皆參加的部分需加回一次。
解題方法與計算
① 至少參加一種運動
「至少參加一種」代表參加羽球、桌球或網球,也就是事件聯集:
依三集合排容原理:
代入數值:
因此,至少參加一種運動的機率為:
② 僅為羽球員
「僅為羽球員」表示參加羽球,但沒有參加桌球與網球:
從所有羽球員中扣除同時參加桌球者與網球者。由於三項皆參加者在兩個交集中各被扣除一次,因此必須加回一次:
代入數值:
因此,僅參加羽球的機率為:
③ 已知為運動員,參加羽球的機率
運動員定義為「至少參加一種運動」,因此:
要求的是在已知為運動員的條件下參加羽球的機率:
因為事件 本身必然包含在 中,所以:
第 二、2. (10%) 題
- (10%)若有一均勻分配,
(a) (6%)試求其累積機率分配函數 。(以 表示)
(b) (4%)以期望值及變異數之定義,導出其期望值 與變異數
登入後即可作答並保存紀錄。
此題考驗均勻分佈(Uniform Distribution)的機率密度函數(p.d.f.)、累積分佈函數(c.d.f.)以及期望值和變異數的計算。
均勻分佈 的機率密度函數為:
a) 累積機率分配函數
累積機率分配函數 。我們需要分段討論:
情況 1:
此時, 在分佈區間的左側,所以 。
for 。
情況 2:
此時, 在分佈區間內。累積機率是從 到 對 p.d.f. 進行積分。
for 。
情況 3:
此時, 在分佈區間的右側,所以 涵蓋了整個分佈區間,機率為 1。
for 。
綜合以上三種情況,累積機率分配函數為:
b) 期望值 與變異數
期望值
根據期望值的定義:。
由於 p.d.f. 只在 區間內非零,所以積分範圍變為:
第 二、3. (12%) 題
- (12%)離散型隨機變數 之機率分配如下表,試求
| y | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| p(y) | 0.1 | 0.2 | 0.3 | 0.4 |
(a) ,
(b) ,
(c)
登入後即可作答並保存紀錄。
此題考驗離散型隨機變數的期望值、變異數以及函數轉換的期望值計算。
給定離散型隨機變數 的機率分配:
首先檢查機率總和是否為 1:。
a) ,
期望值
根據期望值的定義:。
根據期望值的線性性質,對於任意函數 ,有 。
在這裡,。
我們需要計算 對於每個 值:
現在計算期望值:
或者,也可以使用期望值的線性性質:。
我們已經知道 。
需要計算 :
第 二、4. (10%) 題
- (10%)假設美代爾公司所生產的CPU,其運作時間恰為一連續型隨機變數 (單位:年),機率密度
函數為
(a)美代爾公司所生產的CPU,期望使用時間為幾年?
(b)一天,李先生買了一顆此品牌之CPU,試問此顆CPU使用時
至少超過一年的機率為何?
登入後即可作答並保存紀錄。
此題考驗連續型隨機變數的機率密度函數(p.d.f.)、期望值和機率計算。
給定機率密度函數:
首先,我們需要驗證這是否是一個有效的機率密度函數,即在整個定義域上的積分是否為 1。
。
該 p.d.f. 是有效的。
a) 美代爾公司所生產的CPU,期望使用時間為幾年?
期望使用時間即為期望值 。
所以,期望使用時間為 年。
b) 李先生買了一顆此品牌之CPU,試問此顆CPU使用時至少超過一年的機率為何?
這表示計算 。
。
第 二、5. (10%) 題
- (10%)自一成功率為 的幾何分配抽取一組樣本 , 試求 的最大概似估計式。
登入後即可作答並保存紀錄。
此題考驗幾何分佈(Geometric Distribution)的最大概似估計(Maximum Likelihood Estimation, MLE)。
幾何分佈描述的是在伯努利試驗中,第一次成功所需的試驗次數。
若我們定義成功是指「第一次成功」,則機率為 。
則隨機變數 (第一次成功所需的試驗次數)的機率質量函數(p.m.f.)為:
, for
我們從此分佈抽取一個樣本 。
樣本的聯合機率質量函數(似然函數, Likelihood function)為:
為了求最大概似估計式,我們通常取對數似然函數(log-likelihood function)來簡化計算。
接下來,我們對 對 求偏導數,並令其等於零,以找到極值點。
令導數等於零:
解出 :
這個結果是 的最大概似估計式,通常記為 。
我們需要檢查這個估計式是否為最大值(而不是最小值)。通常通過二階導數來檢驗,或者觀察似然函數的形狀。
二階導數:
在 處,我們有 。
代入二階導數: