113 年 國立成功大學電腦與通信工程研究所丁組《人工智慧概論》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題10 分

In the current stage, what is the primary goal of AI?
(a) To automate tasks
(b) To improve decision-making
(c) To enhance human abilities
(d) To replace human intelligence

登入後即可作答並保存紀錄。

這一題的完整詳解

好的,這是一題關於人工智慧(AI)當前發展階段主要目標的觀念題。它旨在測試你對 AI 領域現況的理解,以及 AI 技術的應用方向。

解題過程

這題的關鍵在於理解「當前階段」(current stage)的 AI 發展重點。AI 的發展歷程中,其目標一直在演變。從早期追求「強人工智慧」(Artificial General Intelligence, AGI),即創造出具有與人類同等甚至超越人類智慧的通用型 AI,到現今更為務實的發展方向。

我們來分析各個選項:

  • (a) To automate tasks (自動化任務):自動化是 AI 的一個重要應用,例如自動駕駛、自動化生產線、聊天機器人處理客服等。許多 AI 的發展確實是為了讓重複性或複雜的任務能夠自動完成,提高效率。
  • (b) To improve decision-making (改善決策):AI 在分析大量數據、識別模式、預測趨勢方面具有強大能力,這能極大地輔助人類做出更明智、更快速的決策。例如,在醫療診斷、金融投資、商業策略等方面,AI 都能提供關鍵的決策支持。
  • (c) To enhance human abilities (增強人類能力):這與選項 (b) 有些重疊,但更強調 AI 作為一種輔助工具,幫助人類突破自身能力的限制。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題10 分

What is the process of teaching a machine to learn without being explicitly programmed called?
(a) Supervised learning
(b) Reinforcement learning
(c) Unsupervised learning
(d) Deep learning

登入後即可作答並保存紀錄。

這一題的完整詳解

這題主要在考驗你對機器學習基本分類的理解,特別是「無明確程式指令」學習的定義。

解題過程:

題目詢問的是「在沒有被明確編程(explicitly programmed)的情況下,教導機器學習的過程」稱為什麼。這句話的關鍵在於「沒有被明確編程」。我們來分析各個選項:

  • (a) Supervised learning (監督式學習):在監督式學習中,我們提供給機器帶有標籤的訓練資料(輸入與對應的正確輸出)。機器透過比較預測輸出與真實標籤的差異來學習,這可以被視為一種「明確」的學習目標和回饋機制,雖然不是直接寫死規則,但學習方向是明確的。
  • (b) Reinforcement learning (強化學習):在強化學習中,機器(稱為 agent)透過與環境互動,根據其行為獲得獎勵(reward)或懲罰(penalty),並學習如何最大化累積獎勵。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題10 分

Which of the following is not a popular machine learning algorithm?
(a) LightGBM
(b) Random Forest
(c) K-Nearest Neighbors
(d) HP Boosting.

登入後即可作答並保存紀錄。

這一題的完整詳解

這題考驗你對常見機器學習演算法的認識。你需要辨別選項中哪些是廣泛使用且知名的機器學習演算法,哪些則不是。

解題過程:

這題的目標是找出一個不是熱門機器學習演算法的選項。我們逐一檢視:

  • (a) LightGBM (Light Gradient Boosting Machine):這是一個非常流行的梯度提升框架,以其速度和效率聞名,特別是在處理大型數據集時。它在 Kaggle 等機器學習競賽中經常被使用,並且在業界有廣泛的應用。
  • (b) Random Forest:隨機森林是一種非常經典且強大的集成學習方法,基於決策樹。它通過構建多個決策樹並對其結果進行平均或投票來提高模型的準確性和魯棒性,是目前最受歡迎的機器學習演算法之一。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題10 分

What is the process of teaching a machine to predict future outcomes based on historical data called?
(a) Predictive modeling
(b) Regression analysis
(c) Time series prediction
(d) Future computing

登入後即可作答並保存紀錄。

這一題的完整詳解

好的,這是一題關於機器學習基本概念的題目,主要在考驗你對「預測未來結果」這個任務的理解。

這題的核心觀念是,機器學習中有許多不同的方法,而其中一類方法專門用於從過去的數據中學習模式,以便預測未來可能發生的情況。我們要辨識出哪個選項最精確地描述了這個過程。

解題過程:

題目問的是「教導機器根據歷史數據預測未來結果的過程」。我們來分析一下各個選項:

  • (a) Predictive modeling (預測模型建立):這個詞彙本身就包含了「預測」的意思,並且「模型」代表了從數據中學習到的模式。預測模型建立的目標就是利用歷史數據來建立一個模型,進而預測未來事件的發生機率或數值。這與題目描述的過程非常吻合。

  • (b) Regression analysis (迴歸分析):迴歸分析是預測模型建立的一種具體方法,特別是用於預測一個連續的數值輸出。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 5 題10 分

What is the process of training a machine to make decisions and determine a course of action based on input data and available information called
(a) Reinforcement learning
(b) Decision making
(c) Incremental learning
(d) Predictive modeling

登入後即可作答並保存紀錄。

這一題的完整詳解

這題主要在考驗你對機器學習中不同學習範式的理解,特別是關於如何訓練機器進行決策和行動。題目描述的「根據輸入資料和可用資訊來訓練機器做出決策並決定行動方案」的過程,是某一種特定的機器學習方法的核心特徵。

解題過程:

題目問的是「根據輸入資料和可用資訊來訓練機器做出決策並決定行動方案」的過程。我們來分析各個選項:

  • (a) Reinforcement learning (強化學習):強化學習的核心思想是讓一個代理 (agent) 在一個環境 (environment) 中透過與環境互動來學習。代理會根據當前的狀態 (state) 採取一個行動 (action),然後環境會給予一個獎勵 (reward) 或懲罰 (penalty),代理的目標是最大化長期累積的獎勵。這個過程正是「根據輸入資料(狀態)和可用資訊(獎勵訊號)來訓練機器做出決策(行動)並決定行動方案」。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 6 題10 分

The process of allowing machines to continuously learn from input data and improve their performance over time is called _______.

登入後即可作答並保存紀錄。

這一題的完整詳解

這題考的是機器學習中,模型如何透過持續的資料輸入來精進自身效能的核心概念。

解題過程:

題目描述了一個過程:「機器能夠持續地從輸入資料中學習,並隨著時間推移而改善其效能」。這個描述精確地指向了機器學習中的一個重要學習範式。我們逐一檢視選項:

  • (a) Online learning (線上學習):線上學習是指模型一次只處理一個訓練樣本,並在處理完後立即更新模型參數。這確實是一種持續學習的方式,但「線上學習」更側重於資料處理的批次大小(一次一個樣本),而題目強調的是「持續學習」和「改善效能」。
  • (b) Incremental learning (增量學習):增量學習與線上學習非常相似,它允許模型在不重新訓練整個模型的情況下,從新的資料中學習。這也符合「持續學習」和「改善效能」的描述。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 7 題10 分

Which of the following statements are true for k-NN classifiers
(a) The classification accuracy is better with larger values of k.
(b) k-NN does not require an explicit training step.
(c) The decision boundary is linear.
(d) The decision boundary is smoother with smaller values of k.

登入後即可作答並保存紀錄。

這一題的完整詳解

這題主要在考驗你對 k-Nearest Neighbors (k-NN) 分類器的基本理解,包含其參數選擇對模型性能的影響、訓練過程的特性,以及決策邊界的性質。

解題過程

k-NN 是一種基於實例的學習算法,它根據訓練集中與新樣本最相似的 k 個鄰居的類別來預測新樣本的類別。

(a) The classification accuracy is better with larger values of k.

  • 說明: k 的值會影響分類器的複雜度。當 k 值較小時,模型對訓練數據中的雜訊或離群值較為敏感,容易產生過擬合 (overfitting)。反之,當 k 值較大時,模型會考慮更多的鄰居,這有助於平滑決策邊界,降低過擬合的風險,但可能導致欠擬合 (underfitting),尤其是在數據集邊界複雜的情況下。因此,並非 k 值越大,準確度就一定越好,存在一個最佳的 k 值,需要透過驗證集來尋找。
  • 結論: 此敘述不一定為真。

(b) k-NN does not require an explicit training step.

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 8 題10 分

For a neural network, which one of these structural assumptions is the one that most affects the trade-off between underfitting (i.e. a high bias model) and overfitting (i.e. a high variance model)
(a) The number of hidden nodes
(b) The learning rate
(c) The initial choice of weights
(d) The use of a constant-term unit input

登入後即可作答並保存紀錄。

這一題的完整詳解

這題考的是神經網路模型中,影響偏差-變異數權衡 (bias-variance tradeoff) 的關鍵結構性假設。偏差-變異數權衡是機器學習中一個核心的概念,它描述了模型複雜度與其在訓練資料和未見資料上表現之間的關係。

解題過程:

神經網路的訓練目標是找到一個模型,使其在未見過的資料上也能有良好的泛化能力。然而,模型過於簡單可能導致偏差過高 (high bias),即模型無法捕捉資料中的複雜模式,產生欠擬合 (underfitting);模型過於複雜則可能導致變異數過高 (high variance),即模型過度學習訓練資料中的雜訊和特徵,對訓練資料的微小變動非常敏感,產生過擬合 (overfitting)。

我們來分析各選項:

  • (a) The number of hidden nodes: 隱藏層的節點數量直接決定了神經網路的容量 (capacity)。

    • 節點數過少: 模型容量不足,難以學習複雜的特徵,容易導致高偏差(欠擬合)。
    • 節點數過多: 模型容量過大,可能學習到訓練資料中的雜訊,導致高變異數(過擬合)。
      因此,隱藏節點數量的多寡是影響模型複雜度,進而直接影響偏差-變異數權衡的關鍵因素。
  • (b) The learning rate: 學習率 (learning rate) 是在梯度下降等優化演算法中,控制每次參數更新步長大小的超參數。

    • 學習率過大: 可能導致優化過程不穩定,無法收斂到最佳解,甚至在最佳解附近震盪。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 9 題10 分

Suppose you have a CNN model for image classification, with multiple Conv, Max pooling, ReLU activation layers, and a final Softmax output. Ignoring the bias and numerical precision issues, which of the statements below are true?
(a) Multiplying the weights by a factor of 10 during inference does not affect the prediction accuracy.
(b) Multiplying the weights by a factor of 10 during training does not affect training convergence.
(c) Subtracting the input data by its mean per channel during inference does not affect the prediction accuracy
(d) In general, CNN can get better prediction results than GNN (graph neural network)

登入後即可作答並保存紀錄。

這一題的完整詳解

這題主要在考察卷積神經網路 (CNN) 在推論 (inference) 和訓練 (training) 階段的權重 (weights) 和輸入資料 (input data) 的特性,以及 CNN 與圖神經網路 (GNN) 的比較。

(a) Multiplying the weights by a factor of 10 during inference does not affect the prediction accuracy.

在卷積神經網路中,權重是模型學習到的參數,它們與輸入資料進行卷積運算,然後經過激活函數、池化等層。最終的輸出是透過 Softmax 函數計算的機率分佈。

假設一個卷積層的輸出可以表示為:
Z=W∗X+bZ = W * X + b
其中 WW 是權重,XX 是輸入,bb 是偏置。
如果將權重 WW 乘以一個常數 cc(在這裡 c=10c=10),則新的輸出 Z′Z' 為:
Z′=(cW)∗X+b=c(W∗X)+bZ' = (cW) * X + b = c(W * X) + b

接著經過 ReLU 激活函數:
A=max⁡(0,Z)A = \max(0, Z)
A′=max⁡(0,Z′)=max⁡(0,c(W∗X)+b)A' = \max(0, Z') = \max(0, c(W * X) + b)

最後經過 Softmax 函數,其輸出為類別的機率。Softmax 函數的定義為:
P(y=i∣x)=ezi∑j=1KezjP(y=i | x) = \frac{e^{z_i}}{\sum_{j=1}^{K} e^{z_j}}
其中 ziz_i 是最後一層的輸出(logit)。

如果我們將所有權重都乘以一個常數 cc,那麼所有的 logit ziz_i 也會被乘以 cc(假設偏置 bb 不變,或者也乘以 cc)。
令新的 logit 為 zi′=c⋅ziz'_i = c \cdot z_i。
則新的 Softmax 輸出為:
P′(y=i∣x)=ezi′∑j=1Kezj′=ec⋅zi∑j=1Kec⋅zjP'(y=i | x) = \frac{e^{z'_i}}{\sum_{j=1}^{K} e^{z'_j}} = \frac{e^{c \cdot z_i}}{\sum_{j=1}^{K} e^{c \cdot z_j}}

我們可以觀察到,如果 c>0c > 0,則 ec⋅zi∑j=1Kec⋅zj=(ezi)c∑j=1K(ezj)c\frac{e^{c \cdot z_i}}{\sum_{j=1}^{K} e^{c \cdot z_j}} = \frac{(e^{z_i})^c}{\sum_{j=1}^{K} (e^{z_j})^c}。
這與原始的 Softmax 輸出 ezi∑j=1Kezj\frac{e^{z_i}}{\sum_{j=1}^{K} e^{z_j}} 不同。

然而,題目中提到「Ignoring the bias and numerical precision issues」。如果我們忽略偏置項 bb,並且假設權重 WW 和輸入 XX 的乘積 W∗XW*X 經過一系列運算後,最終的 logit ziz_i 變成了 c⋅zic \cdot z_i。
那麼 Softmax 輸出會變成 ec⋅zi∑j=1Kec⋅zj\frac{e^{c \cdot z_i}}{\sum_{j=1}^{K} e^{c \cdot z_j}}。
這與原始的 ezi∑j=1Kezj\frac{e^{z_i}}{\sum_{j=1}^{K} e^{z_j}} 是不同的。

但是,如果我們考慮的是模型的「預測結果」,也就是機率最大的那個類別,那麼情況可能有所不同。
對於 Softmax 函數,如果 c>1c > 1,則 ec⋅zie^{c \cdot z_i} 相對於 ezie^{z_i} 會被拉伸得更開,使得較大的 ziz_i 變得更大,較小的 ziz_i 變得更小。這會使得機率分佈的差異更加明顯。
例如,如果 z1=2,z2=1z_1 = 2, z_2 = 1,則原始機率為 e2e2+e1≈7.397.39+2.72≈0.73\frac{e^2}{e^2+e^1} \approx \frac{7.39}{7.39+2.72} \approx 0.73 和 e1e2+e1≈0.27\frac{e^1}{e^2+e^1} \approx 0.27。
如果 c=10c=10,則 z1′=20,z2′=10z'_1 = 20, z'_2 = 10。新的機率為 e20e20+e10≈1\frac{e^{20}}{e^{20}+e^{10}} \approx 1 和 e10e20+e10≈0\frac{e^{10}}{e^{20}+e^{10}} \approx 0。
雖然機率值改變了,但預測的類別(機率最大的那個)可能保持不變。

更嚴謹地說,如果我們將所有權重都乘以一個正的常數 cc,則 logit ziz_i 變為 c⋅zic \cdot z_i。
Softmax 函數的輸出是 P(y=i∣x)=ezi∑j=1KezjP(y=i | x) = \frac{e^{z_i}}{\sum_{j=1}^{K} e^{z_j}}。
如果 c>0c > 0,則 ec⋅zie^{c \cdot z_i} 的相對大小關係與 ezie^{z_i} 的相對大小關係是一致的,也就是說,如果 za>zbz_a > z_b,則 c⋅za>c⋅zbc \cdot z_a > c \cdot z_b。
因此,argmax 的結果(即預測的類別)不會改變。
所以,在忽略偏置和數值精度問題的情況下,將權重乘以一個正的常數 cc(例如 10)在推論時,不會改變模型的預測結果(即預測的類別)。

【答案】(a) 成立

(b) Multiplying the weights by a factor of 10 during training does not affect training convergence.

在訓練過程中,我們使用梯度下降法來更新權重。權重的更新方向由損失函數對權重的梯度決定。
假設損失函數為 LL。
在標準的梯度下降中,權重的更新規則為:
Wnew=Wold−η∂L∂WW_{new} = W_{old} - \eta \frac{\partial L}{\partial W}
其中 η\eta 是學習率。

如果我們在訓練開始前,將所有權重都乘以一個常數 c=10c=10,那麼模型中的權重變成了 W′=cWW' = cW。
在計算梯度時,損失函數 LL 會依賴於 W′W'。
∂L∂W′=∂L∂W⋅∂W∂W′\frac{\partial L}{\partial W'} = \frac{\partial L}{\partial W} \cdot \frac{\partial W}{\partial W'}
由於 W=W′/cW = W'/c,所以 ∂W∂W′=1c\frac{\partial W}{\partial W'} = \frac{1}{c}。
因此,梯度變為 ∂L∂W′=1c∂L∂W\frac{\partial L}{\partial W'} = \frac{1}{c} \frac{\partial L}{\partial W}。

更新規則變為:
Wnew′=Wold′−η∂L∂W′W'_{new} = W'_{old} - \eta \frac{\partial L}{\partial W'}
Wnew′=Wold′−η(1c∂L∂W)W'_{new} = W'_{old} - \eta \left( \frac{1}{c} \frac{\partial L}{\partial W} \right)

如果我們將原始權重 WW 乘以 cc 後,再進行訓練,相當於我們在訓練一個新的模型,其權重是原始模型的 cc 倍。
這會影響梯度的大小,進而影響訓練的收斂速度和路徑。
例如,如果梯度變小了 cc 倍,那麼在相同的學習率下,權重的更新步長也會變小,收斂速度會變慢。

🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 10 題10 分

Which of the following are true for early stopping during training
(a) It may reduce the necessity to tune the hyperparameter for the number of training epochs
(b) It increases model variance
(c) When accuracy reaches a trough on the validation set, we invoke early stopping
(d) Early stopping cannot be treated as a kind of Regularization

登入後即可作答並保存紀錄。

這一題的完整詳解

這題主要在考驗考生對於「Early Stopping」(早期停止)這個模型訓練技巧的理解,包含其目的、運作機制以及與正規化(Regularization)的關係。


詳解:

Early Stopping 是一種用於防止模型過度擬合(overfitting)的訓練技巧。在訓練過程中,我們通常會監控模型在驗證集(validation set)上的表現。當模型在訓練集上的誤差持續下降,但在驗證集上的誤差開始上升時,就表示模型可能開始過度擬合訓練資料,而無法泛化到未見過的資料。Early Stopping 的做法就是在驗證集表現開始惡化時,提前停止訓練,以保留模型在驗證集上表現最佳的那個點。

現在我們逐一分析各選項:

(a) It may reduce the necessity to tune the hyperparameter for the number of training epochs

  • 說明: 訓練的輪數(epochs)是一個重要的超參數。如果我們設定一個固定的、非常大的輪數,模型可能會過度擬合。如果設定太少,則可能無法充分訓練。Early Stopping 的機制是根據驗證集的表現來自動決定何時停止,而不是預先設定一個固定的輪數。因此,它能夠在一定程度上減少我們手動調整訓練輪數的需求,因為訓練會自動在最佳點停止。
  • 判斷: 此敘述為真。

(b) It increases model variance

  • 說明: 過度擬合(overfitting)通常與高變異性(high variance)有關,意即模型對訓練資料中的雜訊或特定樣本過於敏感,導致在不同訓練集上表現差異很大。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題