108 年 國立中央大學土木工程學系碩士班己:運輸工程組在職生《統計學》
第 1 題20 分
統計抽樣方法有幾種?請個別說明其詳細內容與優缺點。
登入後即可作答並保存紀錄。
本題主要在考察統計學中常見的抽樣方法。抽樣方法是從母體中選取一部分樣本進行觀測,以推論母體特徵的技術。主要可分為機率抽樣與非機率抽樣兩大類。
一、機率抽樣 (Probability Sampling)
機率抽樣是指母體中的每一個元素都有一個已知的、非零的機率被選入樣本。這類抽樣方法確保了樣本的代表性,並能進行統計推論。
-
簡單隨機抽樣 (Simple Random Sampling, SRS)
- 內容: 母體中的每一個元素都有相同的機率被選入樣本。抽取樣本時,可以想像將所有母體元素編號,然後透過亂數表或亂數產生器來隨機抽取。
- 優點:
- 最簡單、最基礎的機率抽樣方法。
- 理論基礎穩固,易於進行統計推論。
- 抽樣誤差容易估計。
- 缺點:
- 當母體龐大時,可能難以取得所有元素的完整名冊。
- 可能無法保證各子群體在樣本中的比例。
- 抽樣成本可能較高。
-
系統抽樣 (Systematic Sampling)
- 內容: 先將母體元素按一定順序排列,然後從第一個元素開始,以固定的間隔(抽樣間距 )抽取樣本。抽樣間距 通常等於母體大小 除以樣本大小 ()。
- 優點:
- 操作簡便,尤其適用於母體名冊不完整或難以隨機抽取時。
- 若排序與樣本特徵無關,則與簡單隨機抽樣效果類似。
- 樣本在母體中分布較為均勻。
- 缺點:
- 若排序與某種週期性特徵相關,可能導致樣本偏差。
- 一旦起始點選定,後續樣本就固定了,缺乏隨機性。
-
分層抽樣 (Stratified Sampling)
- 內容: 先將母體依據某種特徵(如年齡、性別、地區)劃分為若干互斥的子群體(層),然後在每一層內進行簡單隨機抽樣或系統抽樣。
- 優點:
- 能確保各重要子群體在樣本中都得到適當的代表。
- 若層內變異小於層間變異,則抽樣誤差較小,估計更精確。
- 可以對每一層分別進行分析。
- 缺點:
- 需要事先了解母體的結構,並對母體進行分層。
- 分層的劃分需要專業知識。
- 操作相對複雜。
第 2 題20 分
運輸學會想知道目前用路人對於交通設施的滿意程度,並進行了抽樣調查,
收回了81份有效問卷,其中平均數為80分,標準差為18,試問用路人滿意
度在95%的信賴區間為何?
登入後即可作答並保存紀錄。
本題考驗的是點估計與區間估計的概念,特別是當母體標準差未知時,如何利用樣本資料建構信賴區間。
核心觀念:
當母體標準差 未知,且樣本數 較小時,我們使用樣本標準差 來估計母體標準差,此時應使用 分配建構信賴區間。然而,題目中給定的樣本數 相當大,根據中央極限定理 (Central Limit Theorem, CLT),樣本平均數 的抽樣分配近似於常態分配,且當樣本數足夠大(通常 )時,即使母體分配未知,我們也可以近似地使用 分配來建構信賴區間,或者直接使用 分配,此時 分配的自由度很高,其值會非常接近 值。在此,我們採用較為嚴謹的 分配來計算。
已知資訊:
- 樣本大小
- 樣本平均數
- 樣本標準差
- 信賴水準 = 95%
步驟:
-
計算標準誤 (Standard Error, SE):
標準誤是樣本平均數抽樣分配的標準差,用來衡量樣本平均數的變異程度。
代入數值:
-
確定 值:
由於母體標準差未知,我們使用 分配。信賴水準為 95% 表示 。對於雙尾檢定,我們需要找到 分配上,使得兩尾機率各為 的 值。
自由度 (degrees of freedom, df) 為 。
查 分配表或使用統計軟體,尋找自由度為 80,右尾機率為 0.025 的 值。
第 3 題20 分
某家玩具業者宣稱新上市之輕巧玩具平均重量不超過78公克,今假設母體服
從常態分配,隨機抽取此款玩具10個,得其平均重80公克,標準差s=4公
克,請以顯著水準=0.05來檢定此業者之宣傳是否為真?
登入後即可作答並保存紀錄。
核心觀念
本題考查:
- 單一母體平均數的假設檢定
- 母體服從常態分配
- 母體變異數未知,使用單一樣本 檢定
- 右尾檢定
- 假設檢定中「不拒絕虛無假設」不等於證明虛無假設為真
業者宣稱平均重量不超過 公克,即
其中 表示此款玩具的母體平均重量。
由於樣本數 且母體標準差未知,應使用統計量
其自由度為
解題方法
1. 建立假設
本題要檢定業者的宣傳是否有被樣本資料推翻。
虛無假設代表業者宣稱成立:
對立假設代表平均重量超過 公克,因此宣傳不成立:
這是右尾檢定。計算檢定統計量時,使用虛無假設的邊界值 。
2. 計算檢定統計量
已知
因此
整理得
其自由度為 。
3. 決定拒絕域
顯著水準為
右尾檢定、自由度 時,臨界值為
因此拒絕域為
本題檢定統計量為
第 4 題30 分
某重型機車製造廠商為了解重型機車性能,由所生產的重型機車中任選十輛
做測試,在不同的行駛速度中緊急煞車,分別量測它們煞車後的滑行距離,
其資料如下:
行駛速度x₁(公里/小時) 30 40 40 50 50 60 70 80 80 90
滑行距離y(公寸)
1.6 2.1 2.6 3.6 4.2 4.3 4.9 5.5 5.3 6.2
(1) 請估計其線性迴歸方程式。(15分)
(2)並計算其迴歸與誤差之變異量。(15分)
登入後即可作答並保存紀錄。
核心觀念
本題考一元線性迴歸模型:
其中:
- :截距
- :迴歸斜率
- :隨機誤差
以最小平方法估計迴歸係數:
變異分解為:
其中:
- :總平方和
- :迴歸平方和
- :誤差平方和
迴歸平方和與誤差平方和的平均平方分別為:
解題方法
令行駛速度為 ,煞車後滑行距離為 ,建立模型:
先計算必要統計量:
另外:
(1)估計線性迴歸方程式
計算 :
計算 :
因此斜率估計值為:
截距估計值為:
所以估計迴歸方程式為:
第 5 題10 分
請問統計技術中與大數據分析有關的方法有哪些?請說明其內容與應用範圍。
登入後即可作答並保存紀錄。
本題考查統計學在現今大數據分析領域的應用。大數據分析依賴於強大的統計學理論和方法來處理、分析和解釋海量、多樣化的數據。
核心觀念:
大數據分析涉及從龐大且複雜的數據集中提取有價值資訊的過程。統計技術是其基石,提供了從數據中學習、建模、預測和決策的工具。
與大數據分析相關的統計技術:
-
機器學習 (Machine Learning, ML)
- 內容: 機器學習是人工智能的一個分支,它使計算機系統能夠從數據中「學習」並改進其性能,而無需進行顯式編程。它包含監督式學習(如迴歸、分類)、非監督式學習(如聚類、降維)和強化學習。
- 統計基礎: 許多機器學習演算法都基於統計模型,例如線性迴歸、邏輯迴歸、樸素貝葉斯、支持向量機 (SVM)、決策樹、隨機森林、梯度提升等。這些方法利用概率論、數理統計來構建模型、評估模型性能和進行預測。
- 應用範圍:
- 預測分析: 股票市場預測、銷售預測、客戶流失預測。
- 分類: 垃圾郵件過濾、圖像識別、醫療診斷(例如,判斷腫瘤良惡性)。
- 推薦系統: 電商平台(Netflix, Amazon)的商品推薦、社交媒體的內容推薦。
- 異常檢測: 詐欺偵測、網路安全入侵檢測。
- 自然語言處理 (NLP): 文本情感分析、機器翻譯、聊天機器人。
-
數據挖掘 (Data Mining)
- 內容: 數據挖掘是從大量數據中發現模式、關聯、趨勢和異常的過程。它通常與機器學習和統計學緊密結合。
- 統計基礎: 關聯規則挖掘(如 Apriori 演算法)、聚類分析(如 K-Means)、分類(如決策樹)等都屬於統計學的範疇。統計檢驗用於評估發現的模式的顯著性。
- 應用範圍:
- 市場籃子分析: 發現顧客購買行為中的關聯性(例如,「購買麵包的顧客也常購買牛奶」)。
- 客戶細分: 將顧客分為不同的群體,以便進行精準行銷。
- 異常檢測: 識別數據中的異常點。
-
假設檢定與推論統計 (Hypothesis Testing and Inferential Statistics)
- 內容: 儘管大數據的規模巨大,但從樣本推論母體的統計原理仍然重要。在進行 A/B 測試、效果評估時,統計檢定(如 -檢定、卡方檢定、ANOVA)用於判斷觀察到的差異是否顯著,還是僅由隨機性造成。
- 應用範圍: