114 年 國立中央大學土木工程學系碩士班己:運輸工程組一般生《統計學》
第 1 題20 分
- 機率之名詞解釋與證明。(20分)
(1) 先驗機率(prior probability)
(2) 後驗機率(posterior probability)
(3) 聯合機率(joint probability)
(4) 請證明 ,其中:、 為事件 與 發生的機率,、 為事件 與 發生的條件機率。
登入後即可作答並保存紀錄。
本題主要在考驗學生對機率基本概念的理解,包含先驗機率、後驗機率、聯合機率的定義,以及貝氏定理的證明。
核心觀念: 機率論中的基本定義與貝氏定理。
(1) 先驗機率 (Prior Probability)
先驗機率是指在考慮任何新的證據或觀察結果之前,我們對某個事件發生的機率的初始信念或估計。它通常是基於過去的經驗、統計資料或主觀判斷。
【答案】 在獲得新資訊前,對某事件發生機率的初始評估。
(2) 後驗機率 (Posterior Probability)
後驗機率是指在考慮了新的證據或觀察結果之後,我們對某個事件發生的機率所更新的信念。它通常是通過貝氏定理來計算的,將先驗機率與新證據的似然度結合起來。
【答案】 在考慮新證據後,對某事件發生機率的更新評估。
(3) 聯合機率 (Joint Probability)
第 2 題20 分
- 何謂顯示性偏好調查(revealed preference)?何謂描述性偏好調查(stated preference)?又網路調查(web survey)的方式(例如 SurveyMonkey 調查平台)日益普遍,請問其優點與缺點為何?如何改善其信度(reliability)與效度(validity)? (20分)
登入後即可作答並保存紀錄。
本題主要在探討兩種不同的偏好調查方法,並針對網路調查的優缺點及其信效度問題進行分析。
核心觀念: 偏好調查方法、網路調查的特性、信度與效度。
顯示性偏好調查 (Revealed Preference)
顯示性偏好調查是透過觀察人們在實際的決策過程中所做出的選擇來推斷其偏好。這種方法假設人們的實際行為能夠真實地反映他們的偏好。例如,觀察消費者在不同價格下購買不同商品的情況,來推斷他們對商品價格的敏感度或對商品的喜好程度。在運輸工程領域,可以透過觀察人們實際使用的交通工具、路線選擇等來了解其偏好。
【答案】 透過觀察人們在實際決策中的行為來推斷其偏好。
描述性偏好調查 (Stated Preference)
描述性偏好調查是透過直接詢問人們的偏好來獲取資訊。這通常透過問卷、訪談等方式進行,讓受訪者表達他們在假設情境下的選擇或意願。例如,詢問受訪者對於不同票價、通勤時間、交通方式組合的偏好程度。
【答案】 透過直接詢問受訪者來了解其偏好。
網路調查 (Web Survey) 的優點與缺點
隨著科技發展,網路調查日益普遍。
優點:
- 成本效益高: 相較於傳統的面訪或電話訪問,網路調查可以大幅降低人力、交通和時間成本。
- 效率高: 調查可以同時發送給大量受訪者,資料收集速度快。
- 地理範圍廣: 可以接觸到地理位置分散的受訪者,不受地域限制。
- 資料處理便利: 資料通常自動化輸入系統,便於後續的統計分析。
- 彈性設計: 可以設計互動式問卷,利用跳題邏輯,提高問卷的針對性。
- 隱匿性: 受訪者在填答時可能感覺較有隱私,尤其對於敏感性問題。
缺點:
- 樣本代表性問題: 網路使用者可能無法代表整體人口,存在數位落差 (digital divide) 問題,例如老年人、低收入族群可能較少接觸網路。
- 抽樣偏差: 難以進行嚴謹的隨機抽樣,可能導致樣本不具代表性。
- 填答品質不確定: 受訪者可能隨意填答、重複填答、或未仔細閱讀題目,影響資料品質。
- 技術門檻: 部分受訪者可能不熟悉網路操作。
- 回應率低: 網路郵件容易被視為垃圾郵件,或受訪者主動忽略。
- 無法深入追問: 相較於面訪,難以進行即時、深入的追問,釐清受訪者的回答。
【答案】 優點包括成本效益高、效率高、地理範圍廣、資料處理便利、彈性設計、隱匿性。缺點包括樣本代表性問題、抽樣偏差、填答品質不確定、技術門檻、回應率低、無法深入追問。
第 3 題20 分
- 何謂生態謬誤(biological fallacy)?何謂原子謬誤(atomistic fallacy)?利用手機信令資料進行運輸需求預測屬於哪一種謬誤?如何補正?(20分)
登入後即可作答並保存紀錄。
本題旨在探討兩種常見的邏輯謬誤,並將其應用於運輸需求預測的案例分析。
核心觀念: 生態謬誤、原子謬誤、資料分析中的謬誤。
生態謬誤 (Ecological Fallacy)
生態謬誤是指從群體層次的資料(例如地區、國家、群體)推論到個體層次的結論是錯誤的。即使群體層次的數據顯示兩個變數之間存在關聯,也不能直接推斷出在個體層次上,這兩個變數也存在相同的關聯。
例如: 如果發現一個地區的平均收入與這個地區的犯罪率呈正相關,則不能推斷出在這個地區,收入較高的人比收入較低的人更容易犯罪。因為可能的情況是,該地區的整體高收入推高了平均收入,而犯罪率的上升是由於其他群體(例如低收入群體)的行為所致。
【答案】 從群體層次的數據推論至個體層次的結論是錯誤的。
原子謬誤 (Atomistic Fallacy)
原子謬誤是生態謬誤的相反,是指從個體層次的資料推論到群體層次的結論是錯誤的。即使在個體層次上觀察到某種關係,也不能直接將其推論至整個群體。
例如: 如果發現每一個單獨的學生在考試中都作弊,則不能推斷出整個班級的學生都作弊。可能的情況是,每一個學生都以為只有自己一人作弊,或者他們是獨立作弊的。
【答案】 從個體層次的數據推論至群體層次的結論是錯誤的。
利用手機信令資料進行運輸需求預測屬於哪一種謬誤?如何補正?
手機信令資料(如手機定位、通話記錄、上網行為等)通常是針對個體用戶收集的,然後會被聚合、統計,形成群體層次的數據,用於分析交通模式、人流分佈等,進而預測運輸需求。
如果研究者僅僅分析這些聚合後的群體數據,並直接推斷個體行為的模式,則可能犯下原子謬誤。例如,如果統計顯示某個區域在特定時段人流密集,且多數人使用某種交通方式,研究者不能直接斷定「在這個時段,在這個區域的每一個人」都會採取這種交通方式。
然而,在運輸需求預測的實際應用中,手機信令資料的運用往往是複雜的。通常,研究者會將個體數據聚合後,分析的是群體行為的趨勢。如果研究者在分析群體數據的基礎上,試圖推斷個體層面的精確決策,則可能觸及原子謬誤。
第 4 題20 分
- 請說明最小誤差平方法(least squares method)與最大概似法(maximum likelihood method)之內容、優劣點以及適用時機。(20分)
登入後即可作答並保存紀錄。
本題旨在比較兩種重要的參數估計方法:最小平方差法 (OLS) 和最大概似法 (MLE),並分析其內容、優劣點及適用時機。
核心觀念: 參數估計方法、最小平方差法、最大概似法。
最小誤差平方法 (Least Squares Method)
內容:
最小誤差平方法,通常指普通最小平方差法 (Ordinary Least Squares, OLS),是一種用於估計線性回歸模型中未知參數的方法。其核心思想是,尋找一組參數估計值,使得觀測值與模型預測值之間的殘差平方和最小。
對於一個線性模型:,其中 是因變數向量, 是自變數矩陣, 是待估參數向量, 是誤差項向量。
OLS 方法尋找 ,使得殘差向量 的平方和最小,即最小化 。
透過矩陣求導並令其為零,可以得到 OLS 估計量的解析解:。
優點:
- 計算簡單且直觀: OLS 方法的計算相對簡單,且其目標(最小化殘差平方和)具有直觀的幾何意義。
- 高斯-馬可夫定理 (Gauss-Markov Theorem): 在一系列假設下(誤差項均值為零、方差相等且不相關、自變數非隨機),OLS 估計量是最佳線性不偏估計量 (Best Linear Unbiased Estimator, BLUE)。
- 應用廣泛: 在線性模型中應用極為廣泛,是許多統計軟體預設的迴歸方法。
缺點:
- 對異常值敏感: 由於是平方和,殘差中的異常值會對估計結果產生較大的影響。
- 對模型假設敏感: 其最佳性依賴於高斯-馬可夫定理的假設,如果這些假設不滿足(例如,誤差項異方差、自變數與誤差項相關),OLS 估計量可能不再是最佳的,甚至是不偏的。
- 不適用於非線性模型: 對於非線性模型,通常需要迭代方法來求解。
適用時機:
- 當模型可以合理地近似為線性模型時。
- 當對參數估計量的無偏性和最小方差性有較高要求,且模型的假設條件(如誤差項獨立同分布、同方差)大致滿足時。
- 作為其他更複雜模型的基準或初始估計值。
【答案】 OLS 尋找使殘差平方和最小的參數估計量,優點是計算簡單、BLUE 屬性,缺點是敏感於異常值和模型假設。適用於線性模型且假設條件大致滿足時。
最大概似法 (Maximum Likelihood Method)
內容:
最大概似法是一種通用的參數估計方法,其核心思想是:在給定的參數值下,觀測到當前樣本數據的機率(或機率密度)最大。
假設我們有一個參數 的模型,給定樣本數據 ,其聯合機率密度函數 (或機率質量函數) 為 。
概似函數 (Likelihood Function) 。
最大概似估計量 (Maximum Likelihood Estimator, MLE) 是使 達到最大值的 值。
通常,為了計算方便,我們最大化對數概似函數 (Log-Likelihood Function),即 。
第 5 題20 分
- SPSS AMOS 之名詞解釋(20分)
(1) 直接效果(direct effect)
(2) 中介效果(mediation effect)
(3) 調節效果(moderation effect)
(4) 調節中介(moderated mediation)效果
(5) 中介調節(mediated moderation)效果
登入後即可作答並保存紀錄。
本題主要考驗學生對結構方程模型 (Structural Equation Modeling, SEM) 中常見概念的理解,特別是與 SPSS AMOS 這類軟體相關的術語。這些概念在路徑分析 (Path Analysis) 和潛在變數模型 (Latent Variable Models) 中非常重要。
核心觀念: 結構方程模型中的路徑分析、中介與調節效應。
(1) 直接效果 (Direct Effect)
在結構方程模型中,直接效果是指自變數對依變數的影響,而沒有經過任何中間變數的傳遞。它描述的是自變數與依變數之間最直接的關係。在結構圖中,這通常表示為從自變數指向依變數的單向箭頭。
【答案】 自變數對依變數的、未經中間變數傳遞的直接影響。
(2) 中介效果 (Mediation Effect)
中介效果是指一個自變數對依變數的影響,是透過一個或多個中間變數(中介變數)來傳遞的。也就是說,自變數首先影響中介變數,然後中介變數再影響依變數。這種效應也被稱為間接效果 (indirect effect)。
若自變數 影響中介變數 ,而 影響依變數 ,則 的路徑就代表了中介效果。總效果 (total effect) 通常是直接效果與間接效果之和。
【答案】 自變數對依變數的影響,是透過一個或多個中間變數傳遞的效應。
(3) 調節效果 (Moderation Effect)
調節效果是指一個變數(調節變數,Moderator)的強度或存在與否,會影響另一個變數(自變數)對依變數影響的強度或方向。換句話說,調節變數改變了自變數與依變數之間的關係。
例如,自變數 對依變數 的影響,可能因調節變數 的不同而有所差異。若 較高時, 對 的影響較強;若 較低時, 對 的影響較弱。在迴歸模型中,這通常通過引入自變數和調節變數的交互項來檢驗。
【答案】 一個變數(調節變數)的強度或存在,影響了另一個變數(自變數)對依變數影響的強度或方向。