114 年 國立政治大學圖書資訊與檔案學研究所圖書資訊學組《計算機概論》
第 1 題5 分
2024年諾貝爾物理獎頒給什麼樣的技術?
登入後即可作答並保存紀錄。
本題考查對近年諾貝爾獎項的了解,特別是與科技發展相關的物理學獎。2024年的諾貝爾物理學獎頒發給了阿尼·阿霍寧(Anne L'Huillier)、皮埃爾·阿戈斯蒂尼(Pierre Agostini)和費倫茨·克勞斯(Ferenc Krausz),以表彰他們「為研究物質中的電子動力學而產生阿秒光脈
第 2 題5 分
2024年諾貝爾化學獎頒給什麼樣的技術?
登入後即可作答並保存紀錄。
本題考查對近年諾貝爾獎項的了解,特別是與科技發展相關的化學獎。2024年的諾貝爾化學獎頒發給了蒙吉·巴文迪(Moungi G. Bawendi)、路易斯·E·布魯斯(Louis E. Brus)和阿列克謝·葉基莫夫(Alexei I. Ekimov),以表彰他們「發現和合成量子點」。
第 3 題5 分
傳統的人工智慧利用什麼分類影像?可以區分貓狗為例,或其他分類。
登入後即可作答並保存紀錄。
本題考查傳統影像分類的方法。在深度學習興起之前,傳統的人工智慧(AI)方法主要依賴於「特徵工程」和「機器學習分類器」。
- 特徵提取 (Feature Extraction):
- 首先,需要手動設計或選擇能夠代表影像內容的特徵。這些特徵通常是人為定義的,例如:
- 邊緣檢測 (Edge Detection):如 Sobel、Canny 算子,用於提取影像中的邊緣線條。
- 角點檢測 (Corner Detection):如 Harris 角點檢測,用於尋找影像中具有顯著變化的點。
- 紋理特徵 (Texture Features):如灰度共生矩陣 (GLCM)、局部二值模式 (LBP),用於描述影像的紋理特性。
- 顏色特徵 (Color Features):如顏色直方圖、顏色矩,用於描述影像的顏色分佈。
- 形狀特徵 (Shape Features):如輪廓、傅立葉描述子,用於描述物體的形狀。
- 對於貓狗分類的例子,可以嘗試提取貓和狗的耳朵形狀、鼻子輪廓、毛髮紋理、眼睛大小和形狀等特徵。
- 首先,需要手動設計或選擇能夠代表影像內容的特徵。這些特徵通常是人為定義的,例如:
第 4 題5 分
現今的深度學習如何分類影像?可以區分貓狗為例,或其他分類。
登入後即可作答並保存紀錄。
本題考查深度學習在影像分類中的應用。與傳統方法不同,深度學習(特別是卷積神經網路 Convolutional Neural Networks, CNNs)能夠自動學習影像的特徵,無需人工設計。
深度學習分類影像的關鍵在於卷積神經網路 (CNNs)。CNN 的核心思想是模擬人類視覺皮層的結構和處理方式,通過多層的卷積、池化和全連接層來提取影像的多層次特徵。
CNN 的工作流程:
- 輸入層 (Input Layer):接收原始影像像素數據。
- 卷積層 (Convolutional Layers):
- 使用可學習的「濾波器」(或稱為「卷積核」)掃描輸入影像。
- 每個濾波器旨在檢測影像中的特定模式,例如邊緣、角落、紋理等。
- 通過卷積操作,生成「特徵圖」(Feature Maps),這些特徵圖可以被視為影像中特定模式的響應。
- 隨著網路層數的加深,卷積層會學習到越來越抽象、越來越高級的特徵。例如,淺層可能檢測到線條和圓圈,深層則可能組合這些基本特徵來識別眼睛、鼻子,甚至整個貓臉或狗臉。
- 激活函數 (Activation Function):
- 通常在卷積層之後應用非線性激活函數(如 ReLU, Rectified Linear Unit),這使得網路能夠學習更複雜的模式。
- 池化層 (Pooling Layers):
- 用於降低特徵圖的空間維度(寬度和高度),減少參數數量,提高計算效率,並使網路對影像中的微小平移或變形具有一定的魯棒性。
第 5 題5 分
什麼是生成式 AI?
登入後即可作答並保存紀錄。
本題考查生成式 AI (Generative AI) 的概念。
生成式 AI 是一種人工智能(AI)的子領域,其核心目標是創建新的、原創的內容,而不是僅僅分析或分類現有數據。這些內容可以是文本、圖像、音頻、視頻、代碼,甚至是數據集。
關鍵特點:
- 內容生成 (Content Generation):與判別式 AI (Discriminative AI) 主要用於分類、預測不同,生成式 AI 的任務是「生成」。它從學習到的數據分佈中,創造出新的、與訓練數據相似但又不完全相同的樣本。
- 學習數據分佈 (Learning Data Distribution):生成式模型首先會學習訓練數據的底層分佈和模式。例如,一個用於生成人臉的生成式模型會學習人臉的各種特徵、結構和變化。
- 創造力與多樣性 (Creativity and Diversity):好的生成式模型能夠產生多樣化且有創意的內容,而不是簡單地複製訓練數據。
- 應用廣泛 (Wide Applications):
- 文本生成:撰寫文章、詩歌、劇本、郵件、程式碼(如 GPT-3, GPT-4, Bard)。
- 圖像生成:創建逼真的圖片、藝術作品、風格轉換(如 DALL-E 2, Midjourney, Stable Diffusion)。
第 6 題5 分
舉出一個生成文字的技術,並說明如何產生的過程。
登入後即可作答並保存紀錄。
本題考查生成式 AI 在文字生成方面的技術。
技術名稱: 大型語言模型 (Large Language Models, LLMs),例如 GPT 系列(如 GPT-3, GPT-4)、BERT、LLaMA 等。
產生過程說明 (以基於 Transformer 架構的自迴歸模型為例,如 GPT):
-
訓練階段 (Training Phase):
- 數據收集:模型在海量的文本數據上進行訓練,這些數據來自網際網路、書籍、文章等,涵蓋了極其廣泛的知識和語言風格。
- 模型架構:最常見的架構是 Transformer,它利用「自注意力機制 (Self-Attention Mechanism)」來捕捉文本序列中單詞之間的長距離依賴關係。
- 訓練目標:最常見的訓練目標是「預測下一個詞 (Next Token Prediction)」。模型被要求根據前面給定的詞序列,預測下一個最有可能出現的詞。例如,給定「今天天氣很____」,模型需要預測「好」、「晴朗」、「糟糕」等詞。
- 學習過程:通過反覆的預測和與實際數據的比較,模型不斷調整其內部參數(權重和偏置),以最小化預測誤差。這個過程使模型學會了語言的語法、語義、事實知識、推理能力以及不同語言風格。
-
生成階段 (Generation Phase):
- Prompt (提示):使用者提供一段起始文本,稱為 Prompt。Prompt 可以是一個問題、一個指令、一段開頭,或者任何希望模型基於此進行創作的內容。
- 輸入處理:Prompt 被轉換成模型能夠理解的數值表示(Token Embeddings)。
- 逐詞生成 (Autoregressive Generation):
- 模型接收 Prompt 作為輸入,並根據其訓練學到的知識,計算出詞彙表中每個詞作為下一個詞的概率分佈。
- 採樣策略 (Sampling Strategy):從這個概率分佈中選擇下一個詞。
第 7 題5 分
舉出一個生成影像的技術,並說明如何產生的過程。
登入後即可作答並保存紀錄。
本題考查生成式 AI 在影像生成方面的技術。
技術名稱:
目前最流行的影像生成技術包括:
- 擴散模型 (Diffusion Models):如 Stable Diffusion, DALL-E 2 (部分基於擴散模型)。
- 生成對抗網路 (Generative Adversarial Networks, GANs):如 StyleGAN, BigGAN。
- Transformer-based 模型:如 Imagen。
這裡我們以擴散模型 (Diffusion Models) 為例進行說明,因為它在近年來取得了顯著的進展,並被許多領先的圖像生成工具所採用。
產生過程說明 (以擴散模型為例):
擴散模型的工作原理是模擬一個「加噪」和「去噪」的過程。它包含兩個主要階段:
-
前向擴散過程 (Forward Diffusion Process):
- 目標:逐步將一張清晰的訓練影像逐漸變成完全的隨機噪聲。
- 步驟:在每個時間步長 (從 到 ),向影像 中添加少量的高斯噪聲,得到 。這個過程是固定的、非學習的,可以通過數學公式精確控制。
- 是原始清晰影像。
- 是 加上少量噪聲。
- ...
- 是接近純高斯噪聲的影像。
- 這個過程可以被看作是將數據的清晰結構「破壞」成隨機噪聲。
-
反向去噪過程 (Reverse Denoising Process):
- 目標:學習如何從完全的隨機噪聲中,一步一步地「恢復」出一張清晰、逼真的影像。
- 模型:這一步需要一個神經網路模型(通常是 U-Net 架構)來學習。
第 8 題5 分
為什麼輸入一張圖給chatGPT, chatGPT 能夠用文字描述圖的內容?
登入後即可作答並保存紀錄。
本題考查 ChatGPT (或其他多模態大型語言模型) 如何理解和描述圖像。ChatGPT 本身是一個語言模型,無法直接處理圖像像素。要讓它能夠「看懂」圖像並用文字描述,需要藉助多模態 (Multimodal) 的能力,通常是通過整合視覺編碼器 (Vision Encoder) 和語言模型 (Language Model) 來實現。
產生過程說明:
-
圖像預處理與編碼 (Image Preprocessing and Encoding):
- 當一張圖片被輸入時,它首先會經過一個專門的「視覺編碼器」進行處理。
- 常見的視覺編碼器包括:
- 卷積神經網路 (CNNs):如 ResNet,可以提取圖像的空間特徵。
- Vision Transformer (ViT):將圖像分割成一系列「圖像塊 (Image Patches)」,然後將這些塊視為序列輸入到 Transformer 模型中進行編碼,類似於處理文本序列。
- 視覺編碼器的輸出是一系列「視覺特徵向量 (Visual Feature Vectors)」,這些向量捕捉了圖像的內容、對象、場景、紋理、顏色等信息。
-
視覺特徵與語言模型的結合 (Integration of Visual Features and Language Model):
- 對齊 (Alignment):關鍵步驟是將視覺編碼器輸出的視覺特徵向量,與語言模型能夠理解的「詞嵌入 (Word Embeddings)」空間進行對齊。這意味著視覺特徵需要被轉換成一種「語言式」的表示。
第 9 題5 分
什麼是LLM(large language model),如何訓練出LLM?
登入後即可作答並保存紀錄。
本題考查對大型語言模型 (LLM) 的定義及其訓練方法的理解。
什麼是 LLM (Large Language Model)?
LLM,即大型語言模型,是一種深度學習模型,專門用於理解和生成人類語言。其核心特點是:
-
規模龐大 (Large Scale):
- 參數數量巨大:LLMs 通常擁有數十億甚至數千億個參數(模型中的權重和偏置),這使得它們能夠捕捉到語言中極其複雜的模式和細微差別。
- 訓練數據量龐大:它們在包含數千億甚至數萬億個詞的巨量文本數據集上進行訓練。
-
通用性 (Generality):
- 廣泛的任務能力:經過預訓練後,LLMs 能夠執行多種自然語言處理 (NLP) 任務,而無需為每個任務進行大量的額外訓練。這些任務包括:文本生成、問答、翻譯、摘要、情感分析、代碼生成等。
- Few-shot / Zero-shot 學習:它們能夠在僅看到少量(few-shot)或甚至沒有(zero-shot)特定任務的示例後,就執行該任務。
-
架構 (Architecture):
- Transformer 架構:絕大多數現代 LLMs 都基於 Transformer 架構,尤其是其核心的「自注意力機制 (Self-Attention Mechanism)」。這種機制能夠有效地捕捉文本序列中長距離的依賴關係,這對於理解複雜語義至關重要。
- 自迴歸 (Autoregressive):許多 LLMs(如 GPT 系列)是自迴歸模型,意味著它們生成文本時是逐個詞(或 Token)地進行,後面的詞的生成依賴於前面的詞。
如何訓練出 LLM?
LLM 的訓練過程通常分為兩個主要階段:
- 預訓練 (Pre-training):
- 目標:讓模型學會通用的語言理解和生成能力,掌握語言的語法、語義、世界知識和一定的推理能力。
- 數據:使用海量的、未標記的文本數據(如網際網路爬取的網頁、書籍、維基百科等)。
- 訓練任務:
- 掩碼語言模型 (Masked Language Modeling, MLM):這是 BERT 等模型採用的方法。
第 10 題5 分
什麼是FLOPS?
登入後即可作答並保存紀錄。
本題考查對計算機性能指標 FLOPS 的理解。
FLOPS 是 Floating-point Operations Per Second 的縮寫,意為「每秒浮點運算次數」。
定義與意義:
- FLOPS 是衡量計算機(特別是高性能計算機、圖形處理器 GPU、AI 加速器等)處理浮點運算能力的一個重要指標。
- 浮點運算是指涉及小數的數學運算,例如加、減、乘、除。在科學計算、工程模擬、圖形渲染、深度學習訓練等領域,浮點運算非常普遍且耗時。
- FLOPS 的數值越高,表示該計算設備在單位時間內能夠執行更多的浮點運算,其計算能力越強。
單位:
FLOPS 的常用單位包括:
- MFLOPS (MegaFLOPS):每秒百萬次()浮點運算。
- GFLOPS (GigaFLOPS):每秒十億次()浮點運算。
- TFLOPS (TeraFLOPS):每秒兆兆次()浮點運算。
第 1 題3 分
一張 的灰階影像,每個像素是 8 bits,儲存時需要多少 KB?
(A) 128 KB
(B) 256 KB
(C) 512 KB
(D) 1 MB
登入後即可作答並保存紀錄。
本題考查影像儲存空間的計算。
計算步驟:
-
計算總像素數:
影像尺寸為 像素。
總像素數 = 像素。 -
計算總位元數 (bits):
每個像素佔用 8 bits。
總位元數 = 總像素數 每個像素的位元數
總位元數 = bits
總位元數 = bits。 -
轉換為位元組 (Bytes):
1 個位元組 (Byte) = 8 bits。
總位元組數 = 總位元數 / 8
總位元組數 = Bytes
總位元組數 = Bytes。 -
轉換為 Kilobytes (KB):
1 KB = 1024 Bytes。
總 KB 數 = 總位元組數 / 1024
總 KB 數 = KB
第 2 題3 分
遊戲畫面解析度 ,更新頻率 60Hz,每個像素需要 24 位元,則每秒傳輸數據量多少?
(A) 1.5 Gbps
(B) 2.1 Gbps
(C) 2.98 Gbps
(D) 3.3 Gbps
登入後即可作答並保存紀錄。
本題考查計算影像數據傳輸速率的應用。
計算步驟:
-
計算每幀影像的像素總數:
解析度為 像素。
總像素數 = 像素。 -
計算每幀影像所需的總位元數 (bits):
每個像素需要 24 位元 (bits)。
每幀總位元數 = 總像素數 每個像素的位元數
每幀總位元數 = bits
每幀總位元數 = bits。 -
計算每秒傳輸的總位元數 (bits per second, bps):
更新頻率為 60 Hz,表示每秒更新 60 幀。
每秒傳輸數據量 (bps) = 每幀總位元數 更新頻率
每秒傳輸數據量 (bps) = bps
第 3 題3 分
一張 的影像經過 濾波器,步長為 1 的處理後,產生的特徵圖大小為何?
(A)
(B)
(C)
(D)
登入後即可作答並保存紀錄。
本題考查卷積神經網路 (CNN) 中卷積層的空間尺寸計算。
計算公式:
當對一個尺寸為 的輸入影像進行 的濾波器(卷積核)卷積時,如果步長 (stride) 為 ,填充 (padding) 為 ,則輸出特徵圖的尺寸 可以通過以下公式計算:
本題情況分析:
- 輸入影像尺寸:, 。
- 濾波器尺寸: (即 )。
- 步長 (stride):。
- 題目中未提及填充 (padding),在 CNN 中,如果未特別說明,通常表示填充為 0 (P=0)。
計算輸出尺寸:
將參數代入公式:
第 4 題3 分
二進位 與 進行 AND 運算,結果為何?
(A) 100001
(B) 110101
(C) 101001
(D) 111011
登入後即可作答並保存紀錄。
本題考查二進位邏輯運算中的 AND 運算。
AND 運算規則:
邏輯 AND 運算(通常用符號 或 & 表示)的規則是:只有當兩個輸入位都為 1 時,輸出才為 1;否則輸出為 0。
計算步驟:
將兩個二進位數對齊,並逐位進行 AND 運算。
第 5 題3 分
以下哪一種雲端服務提供的是基礎設施(Infrastructure as a Service, IaaS)?
(A) Microsoft Azure Virtual Machines
(B) Google Docs
(C) AWS Lambda
(D) Salesforce CRM
登入後即可作答並保存紀錄。
本題考查對雲端運算服務模式的理解,特別是 IaaS。
雲端運算服務通常分為三大類:
-
IaaS (Infrastructure as a Service, 基礎設施即服務):提供最底層的計算資源,包括伺服器、儲存、網路。使用者可以自行部署作業系統、中間件和應用程式。使用者對作業系統以上的部分擁有最大的控制權。
- 例子:虛擬機器 (Virtual Machines)、虛擬網路、儲存服務。
-
PaaS (Platform as a Service, 平台即服務):提供一個開發和運行應用程式的平台,包括作業系統、資料庫、開發工具、中間件等。使用者只需專注於開發和部署應用程式,無需管理底層基礎設施。
- 例子:Heroku, Google App Engine, AWS Elastic Beanstalk, Azure App Service。
-
SaaS (Software as a Service, 軟體即服務):提供完整的應用程式,使用者通過網路直接使用。軟體由供應商管理和維護,使用者無需關心底層的基礎設施和平台。
第 6 題3 分
以下哪種零組件最適合進行深度學習模型的訓練?
(A) CPU
(B) GPU
(C) FPGA
(D) RAM
登入後即可作答並保存紀錄。
本題考查深度學習模型訓練所需的硬體。
深度學習訓練的特點:
深度學習模型的訓練過程涉及大量的矩陣乘法和卷積運算,這些運算本質上是高度並行的。例如,在一個大型神經網路中,同一個運算可能需要在成千上萬個節點上同時進行。
各選項分析:
-
(A) CPU (Central Processing Unit, 中央處理器):
- CPU 擅長執行串行任務和處理複雜的邏輯判斷,核心數量相對較少(幾十個),但每個核心的性能很強。
- CPU 可以執行深度學習訓練,但效率相對較低,特別是對於大型模型和大規模數據集,訓練時間會非常長。
-
(B) GPU (Graphics Processing Unit, 圖形處理器):
- GPU 最初為處理圖形渲染而設計,其架構具有數千個較小的、專門用於并行計算的核心。
- 這使得 GPU 非常擅長執行大規模的、並行的數學運算,例如深度學習訓練中常見的矩陣乘法和卷積。
- 現代深度學習框架(如 TensorFlow, PyTorch)都對 GPU 進行了高度優化,能夠充分利用 GPU 的并行計算能力。
第 1 題32 分
設計猜數字(4位數)。每次猜測後,提示「幾個位置正確」和「幾個數字正確但位置錯誤」。並有以下條件:數字不能重覆,不能輸入其他符號,只能猜10次。
登入後即可作答並保存紀錄。
本題要求設計一個猜數字遊戲的邏輯,並分析其關鍵要素。遊戲規則類似於經典的「Mastermind」遊戲。
遊戲邏輯分析:
-
目標設定:
- 產生一個由 4 個不重複數字組成的秘密組合。
- 數字範圍通常是 0-9。
-
玩家輸入:
- 玩家輸入一個 4 位數字。
- 需要驗證輸入的有效性:
- 長度必須為 4。
- 所有數字必須是 0-9 之間的數字。
- 數字不能重複。
- 不能包含其他符號(如字母、空格等)。
-
提示機制:
- 位置正確 (Bulls / A):表示猜中的數字不僅正確,而且位置也正確。
- 數字正確但位置錯誤 (Cows / B):表示猜中的數字存在於秘密組合中,但位置不對。
-
遊戲流程:
- 初始化遊戲:生成秘密數字組合。
- 循環進行猜測,直到達到最大次數(10次)或玩家猜對為止。
- 在每次循環中:
- 獲取玩家的猜測。
- 驗證猜測的有效性。
- 計算提示:位置正確的數字數量 (A) 和數字正確但位置錯誤的數量 (B)。
- 顯示提示信息給玩家。
- 檢查是否猜對 (A = 4)。
- 檢查是否達到最大猜測次數。
- 遊戲結束:顯示成功或失敗的訊息。
演算法設計(以 Python 為例,展示核心邏輯):