108 年 國立臺灣大學資訊管理學系碩士班《資訊管理導論》

📄 試題原卷 免費註冊後即可對照原始考卷 PDF免費註冊

第 1 題20 分

Please describe different theories that support or oppose the argument that "IT (information technologies) can help firms shrink in size (i.e., help decrease firm size)." Please also describe under what condition(s) IT can help decrease firm size, and under what condition(s) IT can help increase firm size.

登入後即可作答並保存紀錄。

這一題的完整詳解

本題主要探討資訊科技(IT)對企業規模的影響,包含支持或反對 IT 使企業規模縮小的理論,以及 IT 在何種條件下會使企業規模縮小或擴大。

核心觀念:
資訊科技的發展對企業組織結構、營運模式和競爭策略產生深遠影響,進而可能改變企業的規模。這涉及組織理論、策略管理以及資訊系統等領域的知識。

支持 IT 使企業規模縮小的理論:

  1. 交易成本理論 (Transaction Cost Economics, TCE):

    • 觀點: TCE 認為企業存在是為了降低市場交易成本。當 IT 能夠顯著降低資訊搜尋、談判、監督等交易成本時,企業便能更有效地將原本外包或由市場提供的活動整合進來(垂直整合),或者將內部活動外包出去。
    • 支持 IT 縮小規模: IT 的普及,特別是網際網路和電子商務平台的發展,大幅降低了資訊搜尋和溝通成本。這使得企業可以更容易地找到外部供應商,將非核心業務外包,從而縮減內部組織規模。例如,企業可以透過雲端服務取代部分內部 IT 基礎設施,或與專業物流公司合作,而無需擴大自身團隊。
  2. 資源基礎觀 (Resource-Based View, RBV) 與核心競爭力理論:

    • 觀點: RBV 認為企業的競爭優勢來自於其獨特且難以模仿的資源和能力。核心競爭力理論則強調企業應專注於自身最擅長的領域。
    • 支持 IT 縮小規模: IT 可以幫助企業識別並聚焦於其核心競爭力。透過 IT,企業可以自動化、外包或與第三方合作處理非核心的支援性活動(如人力資源、財務、IT 維護等),將資源集中於能創造獨特價值的核心業務。這使得企業得以精簡組織,縮小規模,但提升效率和價值。
  3. 組織學習理論 (Organizational Learning Theory) 與知識管理:

    • 觀點: 組織學習強調企業透過獲取、分享和應用知識來提升效能。
    • 支持 IT 縮小規模: IT 系統(如企業資源規劃 ERP、知識管理系統 KMS)能促進組織內知識的有效流動和共享,使團隊協作更有效率。當資訊和知識能快速傳遞時,組織結構可以變得更扁平,減少管理層級,進而縮減規模。

反對 IT 使企業規模縮小的理論(或支持 IT 使企業規模擴大的理論):

  1. 網絡經濟學 (Network Economics) 與規模經濟 (Economies of Scale):

    • 觀點: 許多 IT 產品和服務具有網絡效應,即用戶越多,產品或服務的價值越大(如社群媒體、電信網路)。同時,IT 的部署和運營往往能帶來規模經濟。
    • 支持 IT 擴大規模: IT 能夠幫助企業擴大市場範圍,接觸更多客戶,並透過標準化和自動化流程降低單位營運成本。例如,透過線上平台,一家軟體公司可以服務全球數百萬用戶,這遠超單一實體辦公室的能力。大型雲端服務提供商(如 AWS, Google Cloud)的成功,正是 IT 規模經濟的體現,它們透過龐大的基礎設施服務眾多客戶,實現了巨大的規模。
  2. 資訊複雜性與協調成本 (Information Complexity and Coordination Costs):

    • 觀點: 雖然 IT 能降低某些類型的交易成本,但當企業業務擴張、產品線增多、市場複雜化時,資訊的複雜性和跨部門協調的需求也會隨之增加。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 2 題20 分

In the era of machine learning (such as deep learning), data is the king. Large volumes of data are needed for model training purposes. To build machine learning models for business use, firms need to effectively collect, organize, store, and use data (e.g., process-, customer-, employee-related data, etc.) in order to harvest the values of machine learning.

(a) Throughout the lifecycle of data (including data collection, organization, storing, and use) for machine learning, firms face many important managerial issues (decisions) concerning the management of these data. An example of such managerial issues (decisions) is: the firm needs to decide beforehand "what data should and can be collected." Please identify four additional managerial issues (decisions) concerning the management of data for machine learning. Please also explain why each of the additional managerial issues (decisions) that you just identified is important. (20%)

(b) For the example decision given in (a) (i.e., the decision on what data should and can be collected), is a centralized or decentralized decision-making structure more appropriate? For a centralized decision-making, we mean that decisions are directed to the top of the organization (i.e., the executive level); for a decentralized decision-making, decision rights are given to a lower organizational level (e.g., business units). Please provide a detailed explanation to justify your answer. (10%)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題分為兩部分,第一部分(a)要求學生辨識機器學習數據管理生命週期中的其他管理決策點,並說明其重要性;第二部分(b)則探討其中一個決策點(數據收集範圍)適合採用何種決策結構。

核心觀念:
機器學習的成功高度依賴於數據的質量、可用性和管理。本題著重於數據管理在機器學習應用中的組織和管理層面的挑戰。


(a) 機器學習數據管理生命週期中的其他管理決策點 (20%)

題幹已給出一個例子:「決定事先『收集哪些數據以及可以收集哪些數據』」。這屬於數據的「收集」階段。數據管理生命週期通常包含:數據收集 (Collection)、數據組織 (Organization/Preparation)、數據儲存 (Storage)、數據使用 (Use/Analysis)、數據安全 (Security) 與數據治理 (Governance)。我們需要找出除了「收集」之外,在其他階段可能面臨的管理決策點。

以下提出四個額外的管理決策點,並說明其重要性:

  1. 數據的質量確保與清理 (Data Quality Assurance and Cleaning)

    • 階段: 數據組織/準備 (Organization/Preparation)
    • 決策點:
      • 如何定義數據質量的標準(準確性、完整性、一致性、及時性、有效性)?
      • 需要投入多少資源(人力、工具、時間)來進行數據清理?
      • 如何處理缺失值 (missing values)、異常值 (outliers)、重複值 (duplicates) 或不一致的數據?
      • 是否需要建立自動化的數據質量監控機制?
    • 重要性:
      Garbage In, Garbage Out (GIGO) 是機器學習的鐵律。低質量的數據會直接導致模型訓練不準確、預測結果不可靠,甚至產生有偏見或歧視性的決策。確保數據質量是建構有效機器學習模型的基礎,直接影響模型的效能和業務應用的信任度。例如,不準確的客戶數據可能導致模型錯誤地識別高價值客戶。
  2. 數據的儲存與架構設計 (Data Storage and Architecture Design)

    • 階段: 數據儲存 (Storage)
    • 決策點:
      • 應採用何種數據儲存技術(如數據湖 Data Lake, 數據倉儲 Data Warehouse, 數據庫 DataBase)?
      • 如何設計數據架構以支持不同類型的數據(結構化、半結構化、非結構化)?
      • 如何平衡數據的存取速度、儲存成本和擴展性?
      • 是否需要建立數據目錄 (Data Catalog) 或元數據管理 (Metadata Management) 系統?
    • 重要性:
      有效的數據儲存架構是數據可存取性和後續處理效率的關鍵。不當的架構可能導致數據難以查找、存取緩慢,增加數據處理成本,並限制機器學習模型的開發和部署。一個良好的架構能確保數據的組織性、可搜尋性和可擴展性,為數據分析和模型訓練提供堅實的基礎。例如,將所有數據集中到一個可擴展的數據湖中,可以方便數據科學家進行探索性分析。
  3. 數據的使用與模型開發流程 (Data Usage and Model Development Process)

    • 階段: 數據使用 (Use/Analysis)
    • 決策點:
      • 如何建立標準化的模型開發流程(從數據探索、特徵工程、模型選擇、訓練、評估到部署)?
      • 如何管理模型版本 (model versioning) 和實驗追蹤 (experiment tracking)?
      • 如何確保數據在模型開發和預測階段的合規性(如 GDPR, CCPA)?
      • 應採用何種工具和平台來支持模型開發和實驗?
    • 重要性:
      標準化的流程和良好的實驗管理能夠提高模型開發的效率、可重複性和可追溯性。這有助於團隊協作,加速模型迭代,並確保模型開發過程符合相關法規。例如,建立一套嚴謹的特徵工程和模型評估流程,能避免因數據洩漏 (data leakage) 而產生的過度樂觀的評估結果。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 3 題6 分

Minho joined a group in a large IT company that develops customized data analytics solutions for their customers. In his first project, his colleagues collected several hundred thousands of data points and developed a model that can predict whether customers will purchase a product in their next session. The developer claimed that the prediction accuracy is 92% using the standard ten-fold cross-validation. Answer the following questions.

(a) What is the definition of prediction accuracy? In additional to prediction accuracy, what are other useful performance measures that can help us evaluate the prediction performance? (6%)
(b) Is an accuracy of 92% good or bad? How do we obtain a meaningful evaluation of this performance level? (7%)
(c) The developer used the convolutional neural network (CNN) to learn the prediction model. He believes that this is the state-of-the-art approach and no other approach can perform better. Do you agree with him? Why? (6%)
(d) How can we improve the prediction performance if the customer is not satisfied with the performance? (6%)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題探討機器學習模型(特別是預測類模型)的評估與改進。涵蓋了模型評估指標、結果解讀、模型選擇的考量以及性能提升的方法。

核心觀念:
在實際應用場景中,單一評估指標(如準確度)可能不足以全面衡量模型的性能,尤其是在處理不平衡數據或不同類型錯誤成本差異很大的情況下。同時,模型選擇與性能優化是機器學習專案的關鍵環節。


(a) 預測準確度 (Prediction Accuracy) 的定義與其他評估指標 (6%)

  • 預測準確度 (Prediction Accuracy) 的定義:
    預測準確度是指模型正確預測的樣本數占總樣本數的比例。
    數學公式表示為:
    Accuracy=Number of Correct PredictionsTotal Number of Predictions=TP+TNTP+TN+FP+FN\text{Accuracy} = \frac{\text{Number of Correct Predictions}}{\text{Total Number of Predictions}} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{TN} + \text{FP} + \text{FN}}
    其中:

    • TP (True Positive):實際為正例,模型預測也為正例。
    • TN (True Negative):實際為負例,模型預測也為負例。
    • FP (False Positive):實際為負例,模型預測為正例(第一類錯誤,Type I Error)。
    • FN (False Negative):實際為正例,模型預測為負例(第二類錯誤,Type II Error)。
  • 其他有用的性能評估指標:
    除了準確度,以下指標在評估預測模型時非常有用,特別是當數據集存在類別不平衡 (class imbalance) 或不同類型錯誤的成本差異很大時:

    1. 精確率 (Precision) / 陽性預測值 (Positive Predictive Value, PPV):

      • 定義:在所有模型預測為正例的樣本中,實際為正例的比例。
      • 公式:Precision=TPTP+FP\text{Precision} = \frac{\text{TP}}{\text{TP} + \text{FP}}
      • 重要性:衡量模型預測為「正」的結果有多可靠。例如,在預測廣告點擊時,高精確率意味著廣告投放給真正可能點擊的用戶。
    2. 召回率 (Recall) / 敏感度 (Sensitivity) / 真陽性率 (True Positive Rate, TPR):

      • 定義:在所有實際為正例的樣本中,模型成功預測為正例的比例。
      • 公式:Recall=TPTP+FN\text{Recall} = \frac{\text{TP}}{\text{TP} + \text{FN}}
      • 重要性:衡量模型找出所有實際正例的能力。例如,在疾病診斷中,高召回率意味著能盡可能找出所有患病者,減少漏診。
    3. F1 分數 (F1-Score):

      • 定義:精確率和召回率的調和平均數。
      • 公式:F1-Score=2×Precision×RecallPrecision+Recall\text{F1-Score} = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}}
      • 重要性:在精確率和召回率之間取得平衡,當兩者都很高時,F1 分數也會很高。適用於類別不平衡的數據集。
    4. 特異度 (Specificity) / 真陰性率 (True Negative Rate, TNR):

      • 定義:在所有實際為負例的樣本中,模型成功預測為負例的比例。
      • 公式:Specificity=TNTN+FP\text{Specificity} = \frac{\text{TN}}{\text{TN} + \text{FP}}
      • 重要性:衡量模型識別負例的能力。
    5. ROC 曲線 (Receiver Operating Characteristic Curve) 與 AUC (Area Under the Curve):

      • 定義:ROC 曲線描繪了在不同分類閾值下,真陽性率 (TPR) 與假陽性率 (FPR = 1 - Specificity) 之間的權衡關係。AUC 是 ROC 曲線下的面積,值介於 0.5 到 1 之間。
      • 重要性:AUC 提供了一個單一數值來衡量模型的整體分類性能,不受分類閾值影響,且對類別不平衡較為穩健。AUC 值越高,模型性能越好。

(b) 92% 準確度的好壞與有意義的評估 (7%)

  • 92% 準確度是好是壞?
    單看 92% 這個數字,很難直接判斷是好是壞。它的好壞取決於以下幾個關鍵因素:

    1. 數據集的類別分佈 (Class Distribution):
      • 如果數據集是平衡的(例如,50% 的客戶會購買,50% 不會),那麼 92% 的準確度可能相對不錯。
      • 然而,如果數據集嚴重不平衡,例如只有 10% 的客戶會購買,那麼一個簡單的「總是預測不購買」的「傻瓜模型」(dummy model) 也能達到 90% 的準確度。在此情況下,92% 的準確度可能並不具有實際意義。
    2. 業務場景的錯誤成本 (Cost of Errors):
      • 預測客戶是否會購買,通常涉及兩種錯誤:
        • FN (False Negative): 實際會購買,但模型預測不會購買。這可能導致錯失銷售機會。
        • FP (False Positive): 實際不會購買,但模型預測會購買。這可能導致不必要的行銷成本或資源浪費。
      • 哪種錯誤的代價更高?如果錯失銷售機會的代價遠高於行銷成本,那麼即使準確度很高,但如果 FN 很多,模型也可能不夠好。
    3. 競爭對手的表現或業界標準:
      • 與業界類似的預測模型相比,92% 的準確度是領先、平均還是落後?
  • 如何獲得有意義的評估?
    為了獲得對 92% 準確度的有意義評估,我們需要:

    1. 檢查類別分佈: 了解訓練數據集中「購買」與「不購買」客戶的比例。
    2. 計算其他指標: 計算精確率 (Precision)、召回率 (Recall)、F1 分數,以及 AUC。
      • 如果召回率 (Recall) 很低,表示模型漏掉了很多會購買的客戶,即使準確度很高,也可能不是一個好的銷售預測模型。
      • 如果精確率 (Precision) 很低,表示模型預測會購買的客戶中,很多實際上不會購買,可能導致行銷資源浪費。
    3. 分析錯誤類型: 深入分析 FP 和 FN 的樣本,理解模型為何會犯這些錯誤。
    4. 與基準模型比較:
      • 與簡單的基準模型(如隨機預測、Majority Class Classifier)比較。
      • 與其他更複雜的機器學習模型(如邏輯迴歸、隨機森林、梯度提升樹)在相同數據集上訓練和評估的結果進行比較。
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

第 4 題5 分

The use of Artificial Intelligence (AI) to assign individuals into classes has stimulated concerns. One major issue is about the fairness of an automated classification algorithm. Consider a fictitious case that the Taitai Bank developed a predictive model for predicting future loan default. The higher score indicates that the individual has a higher probability of defaulting a loan. Taitai Bank has a policy of being fair to all its customers. Their main concern is that the risk score should be fair to customers in different occupations. Internal discussions reveal three definitions of fairness. To simplify our discussion, a "positive case” means that the individual will default in the future and a "negative case" means that the individual will not default in the future. The three different definitions of fairness are:

(1) The risk score should be well-calibrated across different occupational groups: if the algorithm identifies a set of people as having a probability of z of constituting positive cases, then approximately a z fraction of this set should indeed be positive instances. This conditional should hold when applied separately in each group.
(2) The average score received by people constituting positive instances should be the same in each occupational group.
(3) The average score received by people constituting negative instances should be the same in each occupational group.

Answer the following questions.

(a) Why does definition (1) corresponds to notions of fairness? (5%)
(b) Why does definition (2) corresponds to notions of fairness? (5%)
(c) Why does definition (3) corresponds to notions of fairness? (5%)
(d) Which of the definitions (1), (2), or (3) is more reasonable? Why? (5%)
(e) What should Taitai Bank do to ensure that their risk score is fair? (5%)

登入後即可作答並保存紀錄。

這一題的完整詳解

本題探討在機器學習模型(特別是風險評估模型)中,如何定義和實現「公平性」(Fairness)。透過分析三種不同的公平性定義,要求學生理解其含義、評估合理性,並提出實踐建議。

核心觀念:
AI 的公平性是一個複雜且多面向的概念,不存在單一的「正確」定義。不同的公平性定義可能相互衝突,需要在實際應用中根據情境進行權衡。這題聚焦於「校準性 (Calibration)」和「群體公平性 (Group Fairness)」的概念。


(a) 定義 (1) 與公平性的關聯 (5%)

  • 定義 (1) 的內容:
    「風險分數應該在不同的職業群體之間得到良好的校準:如果演算法識別出一群人有 z 的機率構成陽性案例(即違約),那麼這群人中大約有 z 的比例確實是陽性實例。當分別應用於每個群體時,這個條件應該成立。」
    這實際上是在要求 條件機率校準 (Conditional Probability Calibration)。

  • 與公平性的關聯:
    這個定義與公平性相關,是因為它保證了 預測分數的「意義」在不同群體間是相同的。

    1. 信任度與可解釋性: 當一個模型預測某人有 70% 的違約機率 (z=0.7),無論他是哪個職業群體,這 70% 的機率都應該代表真實的違約可能性。這使得風險分數具有一致的、可解釋的意義,客戶和銀行都能信任這個分數。
    2. 避免系統性偏差: 如果一個群體的分數普遍被「高估」或「低估」(即實際違約率與預測機率不符),那麼這個模型就對該群體存在系統性偏差。例如,如果對某職業群體預測 70% 違約,但實際只有 30% 違約,那麼銀行可能會過度拒絕該群體的貸款申請。反之,如果預測 70% 違約,但實際 90% 違約,則可能過度發放貸款給高風險客戶。
    3. 決策的合理性: 當風險分數能準確反映真實違約概率時,基於此分數做出的貸放決策(如是否批准貸款、給予多少利率)就更為合理和公平,因為決策是基於對真實風險的準確評估,而不是基於對特定群體的固有偏見。

(b) 定義 (2) 與公平性的關聯 (5%)

  • 定義 (2) 的內容:
    「構成陽性實例(違約者)的人平均獲得的分數應該在每個職業群體中都相同。」
    這要求 陽性實例的平均分數在不同群體間一致。

  • 與公平性的關聯:
    這個定義關注的是 對「會違約者」的公平性。

    1. 消除對陽性實例的職業歧視: 如果違約者在不同職業群體中,平均得分差異很大,這可能意味著模型在識別特定職業的違約者時,給予了更高的(或更低的)風險分數。例如,假設所有違約者平均得分都應為 80 分,但模型給某職業群體的違約者平均打了 90 分,給另一職業群體的違約者平均打了 70 分,這就顯示了模型對這兩類違約者有不同的評估標準。
    2. 確保評估標準的一致性(針對違約者): 儘管這些人最終都會違約,但定義 (2) 要求模型在評估他們時,不應該因為其職業背景而產生系統性差異。這有助於確保銀行在評估潛在的違約風險時,對所有違約群體採用了相同的「嚴格度」。

(c) 定義 (3) 與公平性的關聯 (5%)

  • 定義 (3) 的內容:
    「構成陰性實例(不違約者)的人平均獲得的分數應該在每個職業群體中都相同。」
    這要求 陰性實例的平均分數在不同群體間一致。

  • 與公平性的關聯:
    這個定義關注的是 對「不違約者」的公平性。

    1. 消除對陰性實例的職業歧視: 如果不違約者在不同職業群體中,平均得分差異很大,這可能意味著模型在識別特定職業的「好客戶」時,給予了不同的風險評估。例如,假設所有不違約者平均得分都應為 30 分,但模型給某職業群體的不違約者平均打了 40 分,給另一職業群體的不違約者平均打了 20 分。
    2. 確保對「優良客戶」的評估標準一致: 這有助於確保銀行在評估那些不會違約的客戶時,對所有職業群體的「良好客戶」給予了公平的風險評分。如果某職業群體的不違約者被模型「過度懲罰」(得分較高),可能會導致其被誤判為較高風險,影響其獲得貸款或獲得優惠利率的機會。

(d) 三種定義的合理性比較 (5%)

  • 比較:

    • 定義 (1) (校準性): 這是最基礎且普遍認為重要的公平性要求。它保證了分數本身的「準確性」和「可信度」,無論在哪個群體,分數都應真實反映違約概率。如果分數不準確,那麼基於分數做出的決策就可能是有偏差的,無論另外兩個定義是否滿足。
    • 定義 (2) (陽性實例平均分數一致): 關注的是對「預計會違約者」的公平性。
    • 定義 (3) (陰性實例平均分數一致): 關注的是對「預計不會違約者」的公平性。
  • 哪個更合理?
    定義 (1) 通常被認為是最核心、最基礎的公平性要求,因此也最為合理。

    • 理由:
🔒

後續完整解題步驟與【答案】

免費註冊,享三天全站完整詳解閱覽。

免費註冊

其他考古題