109 年 國立臺灣大學圖書資訊系碩士班《圖書資訊學》
第 一 題25 分
傳統的求全率(Recall)及求準率(Precision)無法彰顯搜尋結果排序(Ranking)的優劣,請列出兩個能夠比較出排序優劣的資訊檢索評估指標,並解釋其意涵。
登入後即可作答並保存紀錄。
本題主要在測試考生對於資訊檢索評估指標的理解,特別是針對排序(Ranking)效果的評估。傳統的 Recall 和 Precision 僅能評估檢索結果集合的品質,無法反映出檢索結果列表的優劣。
核心觀念: 評估資訊檢索系統時,除了檢索集合的準確性,排序的優劣也是關鍵。
解題思路:
-
理解 Recall 與 Precision 的限制: Recall ( ) 和 Precision ( ) 都是針對整個檢索到的文件集合計算的,它們無法區分排在前面的文件和排在後面的文件的差異。例如,一個系統可能將所有相關文件都排在很後面,但前幾筆都是不相關的,這樣 Precision 會很高(如果檢索到的文件很少),但使用者體驗卻很差。
-
尋找考慮排序的指標: 需要尋找那些能夠在計算時就考慮到文件在排序列表中的位置的評估指標。
-
列舉並解釋兩個指標:
- 平均精確度 (Average Precision, AP):
- 意涵: AP 是計算一個查詢(Query)的平均精確度。它會考慮到在排序列表中的每一個相關文件,並計算該文件出現時的 Precision 值,然後將所有相關文件的 Precision 值加總後,除以相關文件的總數。
- 計算方式:
假設一個查詢有 個相關文件。對於排序列表中的每一個文件 ,如果它是相關文件,則計算在列表前 項中的 Precision,記為 。
其中, 是檢索到的文件總數, 是相關文件的總數, 是一個指示變數,如果第 個文件是相關文件,則 ,否則為 。 - 解釋排序優劣: AP 的計算方式使得排在越前面的相關文件對 AP 的貢獻越大。
- 平均精確度 (Average Precision, AP):
第 二 題25 分
試說明資訊檢索中的空間向量模型(Vector Space Model)。
登入後即可作答並保存紀錄。
本題要求說明資訊檢索中的空間向量模型 (Vector Space Model, VSM)。這是資訊檢索領域一個非常基礎且重要的模型。
核心觀念: VSM 是一種將文件和查詢都表示為向量的資訊檢索模型,它利用向量之間的相似度來衡量文件與查詢的相關性。
解題思路:
- 模型的基本假設: VSM 的核心思想是將文件和查詢都映射到一個多維空間中,每個維度代表一個詞項(Term)。
- 向量的表示:
- 詞項 (Term): 通常是從文件集合中提取出來的詞彙,經過預處理(如去除停用詞、詞幹提取)後得到。
- 維度 (Dimension): 每個獨特的詞項都對應空間中的一個維度。
- 向量分量 (Component): 文件 對於詞項 的權重(Weight) 構成了向量 的一個分量。查詢 對於詞項 的權重 構成了向量 的一個分量。
- 權重計算 (Weighting Scheme): 權重 的計算是 VSM 的關鍵,它反映了詞項 在文件 中的重要性。常見的權重計算方法是 TF-IDF:
- TF (Term Frequency): 詞項 在文件 中出現的頻率。
(有時也直接使用出現次數,稱為 raw TF) - IDF (Inverse Document Frequency): 反映詞項 的普遍性。出現頻率越低的詞項,其 IDF 值越高,表示它越具有區分性。
其中, 是文件的總數, 是包含詞項 的文件數量。 - TF-IDF 權重:
- 其他權重方案: 除了 TF-IDF,還有其他權重方案,例如布爾模型(布林權重,只有 0 或 1)、頻率權重(僅 TF)等。
- TF (Term Frequency): 詞項 在文件 中出現的頻率。
- 相似度計算 (Similarity Measure): 一旦文件和查詢都被表示為向量,就可以使用向量之間的相似度來衡量它們的相關性。最常用的相似度度量是餘弦相似度 (Cosine Similarity):
- 餘弦相似度: 計算兩個向量之間的夾角餘弦值。值越接近 1,表示兩個向量方向越接近,文件與查詢越相關。
其中, 是文件 中的所有詞項集合, 是查詢 中的所有詞項集合。
- 餘弦相似度: 計算兩個向量之間的夾角餘弦值。值越接近 1,表示兩個向量方向越接近,文件與查詢越相關。
- 資訊檢索過程:
- 建立索引: 對於一個文件集合,計算每個文件 中每個詞項 的權重 ,將文件表示為向量。
第 三 題25 分
試解釋齊夫定律(Zipf's Law)。
登入後即可作答並保存紀錄。
本題要求解釋齊夫定律 (Zipf's Law),這是語言學和資訊科學中一個關於詞頻分佈的經驗法則。
核心觀念: 齊夫定律描述了自然語言中詞語出現頻率與其排名之間的關係。
解題思路:
- 定律的陳述: 齊夫定律指出,在一個足夠大的文本語料庫中,任何一個詞語出現的頻率,與該詞語在頻率表中排名 的詞語的頻率,大致成反比。
- 數學公式:
設 為排名為 的詞語的頻率,那麼齊夫定律可以表示為:
其中 和 是常數。在最常見的標準形式中,,且 通常等於語料庫中總詞數(或詞語種類數乘以平均頻率)。
這意味著,最常見的詞(排名第一)的頻率大約是第二常見詞頻率的兩倍,是第三常見詞頻率的三倍,以此類推。 - 例子:
假設一個語料庫中,詞語「的」是第一名(排名 1),出現了 1000 次。
那麼,第二名的詞(排名 2)的出現次數大約是 1000 / 2 = 500 次。
第三名的詞(排名 3)的出現次數大約是 1000 / 3 ≈ 333 次。
依此類推。 - 應用與意義:
- 語言學: 齊夫定律是語言學中一個重要的經驗法則,表明詞語的使用存在一種「貧富差距」現象,少數詞語被頻繁使用,而絕大多數詞語只被偶爾使用。
- 資訊檢索 (IR):
- 詞頻與權重: 在資訊檢索中,齊夫定律暗示了高頻詞(如「的」、「是」、「在」等停用詞)通常對文件區分性貢獻不大,因此在計算詞項權重(如 TF-IDF 中的 IDF 部分)時,需要將它們的 IDF 值降低或直接去除(停用詞處理)。
- 壓縮技術: 了解詞頻分佈有助於設計更有效的文本壓縮算法。
- 詞彙統計: 幫助預測特定詞彙在未知文本中的出現頻率。
第 四 題25 分
何謂層面分析法(Faceted Analysis)?
登入後即可作答並保存紀錄。
本題要求解釋層面分析法 (Faceted Analysis),這是圖書資訊學中一種重要的分類和組織資訊的方法。
核心觀念: 層面分析法是一種將複雜主題或物件分解成其基本屬性(稱為「層面」或「 Facet」)的方法,然後再透過組合這些層面來描述或組織資訊。
解題思路:
- 定義: 層面分析法是一種分析方法,用於將一個概念、主題或物件的描述分解為一系列獨立的、互斥的屬性或「層面」。
- 層面 (Facet): 層面是指一個主題的某個特定屬性或維度。例如,對於一本書,可能的層面包括:主題、作者、語言、出版日期、載體類型等。
- 屬性值 (Attribute Value / Term): 每個層面下都有具體的屬性值。例如,在「主題」層面,可能有「資訊檢索」、「圖書分類」等值;在「語言」層面,可能有「中文」、「英文」等值。
- 分析過程:
- 確定物件範圍: 明確要分析和組織的資訊集合或概念範圍。
- 識別層面: 確定描述這些物件的關鍵屬性,這些屬性就是層面。
- 識別屬性值: 為每個層面列出所有可能的屬性值或術語。
- 組合層面: 透過組合不同層面的屬性值來精確描述一個特定的物件或概念。
- 應用:
- 分類系統設計:
- 圖書分類法: 著名的例子是 Ranganathan 的「面盤分類法」(Colon Classification),它將圖書的內容分解為五個基本層面:P (Personality)、M (Matter)、E (Energy)、S (Space)、T (Time)。例如,一本關於「1980年代台灣的資訊檢索研究」的書,可以分解為:
- 主題 (P): 資訊檢索
- 地域 (S): 台灣
- 時間 (T): 1980年代
- 研究 (E): 研究
- 主題標目表 (Thesaurus): 構建能夠透過不同層面組合來查找主題的詞彙表。
- 圖書分類法: 著名的例子是 Ranganathan 的「面盤分類法」(Colon Classification),它將圖書的內容分解為五個基本層面:P (Personality)、M (Matter)、E (Energy)、S (Space)、T (Time)。例如,一本關於「1980年代台灣的資訊檢索研究」的書,可以分解為:
- 資訊組織與檢索:
- 網站導航: 許多電子商務網站使用層面導航(Faceted Navigation),允許用戶透過選擇不同屬性(如品牌、價格範圍、顏色、尺寸)來篩選商品。
- 分類系統設計: