💡 知識庫閱讀器
模組六:營運智慧概論練習題
6.5 基礎資料分析 (20題)
Q1. 某大型醫療機構為進行流行病學研究,計畫將病患的電子病歷資料提供給外部的學術單位進行大數據分析。為了遵守《個人資料保護法》及確保病患隱私,機構在釋出這些資料前,必須先對敏感資訊(如姓名、身分證字號)進行下列哪一項處理?
正確答案:(B)
解析:在進行資料分享與大數據分析時,為了符合隱私法規(如 GDPR、個資法),必須移除或加密能直接或間接識別出特定個人的資訊,此過程稱為去識別化。
解析:在進行資料分享與大數據分析時,為了符合隱私法規(如 GDPR、個資法),必須移除或加密能直接或間接識別出特定個人的資訊,此過程稱為去識別化。
Q2. 企業每天會收到大量來自消費者的客訴電子郵件、客服中心的語音通話錄音檔,以及社群媒體上的開箱影片。就資料庫儲存與分析的特性而言,這些資料最主要屬於下列哪一種型態?
正確答案:(D)
解析:文字郵件、聲音、影片等資料,因為沒有固定的欄位與二維表格格式,無法直接用傳統 SQL 輕易查詢,皆屬於非結構化資料,佔據了大數據環境中約 80% 的資料量。
解析:文字郵件、聲音、影片等資料,因為沒有固定的欄位與二維表格格式,無法直接用傳統 SQL 輕易查詢,皆屬於非結構化資料,佔據了大數據環境中約 80% 的資料量。
Q3. 某電商平台與外部物流商進行系統介接時,雙方決定採用具有「標籤 (Tags) 與階層式架構」,且能夠依據不同訂單需求彈性增減欄位屬性的 JSON (JavaScript Object Notation) 格式來交換資料。這種類型的資料稱之為?
正確答案:(B)
解析:JSON 與 XML 具備某種層級的自我描述標籤,但不像關聯式資料庫有極度嚴格的欄位限制,因此被歸類為「半結構化資料」,非常適合用於系統間的資料交換 (API)。
解析:JSON 與 XML 具備某種層級的自我描述標籤,但不像關聯式資料庫有極度嚴格的欄位限制,因此被歸類為「半結構化資料」,非常適合用於系統間的資料交換 (API)。
Q4. 某新創比價網站為了提供使用者最即時的競爭對手商品價格,每天會自動派出程式前往各大線上零售商的網頁,自動擷取網頁 HTML 原始碼中的商品名稱與價格資訊並存回自家資料庫。這種資料獲取的技術通常稱之為?
正確答案:(A)
解析:網路爬蟲 (Web Crawler 或 Web Scraper) 是一種自動化腳本程式,專門用來在網際網路上系統性地瀏覽與抓取公開網頁資料。
解析:網路爬蟲 (Web Crawler 或 Web Scraper) 是一種自動化腳本程式,專門用來在網際網路上系統性地瀏覽與抓取公開網頁資料。
Q5. 某新創公司共有 11 名員工。其中 10 名基層工程師的月薪皆為 5 萬元,但 1 名創辦人兼執行長的月薪高達 500 萬元。若要對外公布能最真實反映該公司「一般員工薪資水準」的統計指標,應選擇下列何者,因為它最不容易受到極端值的誤導?
正確答案:(C)
解析:平均數極易受到極端高值(執行長薪資)的拉抬而產生嚴重偏誤。中位數是將資料排序後取最中間的數值,不受極端值影響,更能代表多數員工的真實薪資。
解析:平均數極易受到極端高值(執行長薪資)的拉抬而產生嚴重偏誤。中位數是將資料排序後取最中間的數值,不受極端值影響,更能代表多數員工的真實薪資。
Q6. 兩家代工廠 A 廠與 B 廠皆生產同一規格的螺絲,且兩家工廠過去一個月所生產螺絲的「平均長度」完全相同。然而,品質稽核報告顯示,A 廠的螺絲長度「標準差 (Standard Deviation)」為 0.05 毫米,B 廠的標準差為 0.5 毫米。這代表什麼統計意義?
正確答案:(B)
解析:標準差 (Standard Deviation) 是衡量資料「離散程度」的重要指標。標準差越小,代表資料越集中於平均數附近,品質越穩定、變異越小。
解析:標準差 (Standard Deviation) 是衡量資料「離散程度」的重要指標。標準差越小,代表資料越集中於平均數附近,品質越穩定、變異越小。
Q7. 某飲料廠生產的瓶裝水,其機器充填的容量分配呈現近似「對稱鐘形」的常態分配。已知平均容量為 600 毫升,標準差為 2 毫升。根據統計學的經驗法則 (Empirical Rule),容量落在 596 毫升至 604 毫升 (亦即平均數正負 2 個標準差) 之間的產品大約佔總產量的多少百分比?
正確答案:(C)
解析:經驗法則 (Empirical Rule) 指出,在鐘形常態分配中,落在 ±1 個標準差內的機率約為 68%;落在 ±2 個標準差內的機率約為 95%;落在 ±3 個標準差內的機率約為 99.7%。
解析:經驗法則 (Empirical Rule) 指出,在鐘形常態分配中,落在 ±1 個標準差內的機率約為 68%;落在 ±2 個標準差內的機率約為 95%;落在 ±3 個標準差內的機率約為 99.7%。
Q8. 某知名電子商務網站過去一年的每日網站造訪人數,其分配形狀完全未知(可能呈現極度偏態)。已知平均造訪人數為 5,000 人,標準差為 500 人。依據柴比雪夫定理 (Chebyshev's Theorem),造訪人數落在 3,500 人至 6,500 人 (亦即平均數正負 3 個標準差) 之間的天數比例,「至少」有多少?
正確答案:(C)
解析:柴比雪夫定理適用於「任何形狀」的分配,公式為 1 - (1/k²)。當距離為 3 個標準差 (k=3) 時,1 - (1/3²) = 1 - 1/9 = 8/9,約為 88.89%。
解析:柴比雪夫定理適用於「任何形狀」的分配,公式為 1 - (1/k²)。當距離為 3 個標準差 (k=3) 時,1 - (1/3²) = 1 - 1/9 = 8/9,約為 88.89%。
Q9. 某零售品牌希望在年度股東大會上,直觀地呈現過去一年「每月行銷廣告預算 (X軸)」與「當月實際銷售營業額 (Y軸)」這兩個連續變數之間,是否存在正向的相關性趨勢。下列哪一種圖表最適合此分析情境?
正確答案:(D)
解析:散佈圖 (Scatter Plot) 是將兩組連續數值變數分別繪製在 X 軸與 Y 軸上,最適合用來觀察兩個變數之間是否存在相關性(線性或非線性)。
解析:散佈圖 (Scatter Plot) 是將兩組連續數值變數分別繪製在 X 軸與 Y 軸上,最適合用來觀察兩個變數之間是否存在相關性(線性或非線性)。
Q10. 若品質管制部門的主管希望能有一張圖表,可以一眼看出本月產線上所有產品重量分佈的「中位數」、「上下四分位數的分佈範圍 (IQR)」,以及「是否出現嚴重超重或過輕的極端異常值 (Outliers)」。他應該請分析師繪製下列哪一種圖表?
正確答案:(C)
解析:箱型圖 (Box Plot) 由五數綜合(最小值、Q1、中位數、Q3、最大值)繪製而成,其最大的優勢就是能清晰標示出四分位距 (IQR) 並視覺化地揪出離群值 (Outliers)。
解析:箱型圖 (Box Plot) 由五數綜合(最小值、Q1、中位數、Q3、最大值)繪製而成,其最大的優勢就是能清晰標示出四分位距 (IQR) 並視覺化地揪出離群值 (Outliers)。
Q11. 某市場調查公司為了預測全國 1,500 萬名合格選民對某項公共政策的支持度,隨機抽取了 1,068 名選民進行電話訪問,並透過這 1,068 人的回答來推估全國母體的真實意向,同時附上 3% 的抽樣誤差。這種從樣本推估母體的分析手法屬於哪一類統計領域?
正確答案:(B)
解析:敘述統計僅用於總結和描述手邊的資料特徵;而「推論統計」則是利用機率理論,從抽出的「樣本」去推斷、估計「母體」特徵(如信賴區間、假設檢定)。
解析:敘述統計僅用於總結和描述手邊的資料特徵;而「推論統計」則是利用機率理論,從抽出的「樣本」去推斷、估計「母體」特徵(如信賴區間、假設檢定)。
Q12. 某商業銀行為了降低信用卡呆帳風險,收集了過去十萬名持卡人的年齡、收入、負債比等特徵,以及他們最終「是否違約 (是 / 否)」的歷史紀錄。銀行利用這些具備標準答案的歷史資料訓練出一個模型,用來自動判斷未來新進的信用卡申請件是否會違約。此種機器學習的應用屬於下列何者?
正確答案:(C)
解析:因為訓練資料具有標準答案 (歷史是否違約),所以是「監督式學習」。預測目標為離散的類別 (是/否),所以屬於「分類」問題。
解析:因為訓練資料具有標準答案 (歷史是否違約),所以是「監督式學習」。預測目標為離散的類別 (是/否),所以屬於「分類」問題。
Q13. 某房仲平台希望建立一個自動估價系統,使用者只要輸入房屋的「坪數、樓層、屋齡、距離捷運站距離」等特徵,系統就能預測出該房屋「具體的成交總價 (例如預測為 1,530 萬元)」。這種預測「連續型數值」的監督式機器學習任務稱之為?
正確答案:(B)
解析:同樣是擁有標準答案的監督式學習,當預測的目標是一個連續的數值(如價格、溫度、營收)時,這類任務稱為迴歸 (Regression)。
解析:同樣是擁有標準答案的監督式學習,當預測的目標是一個連續的數值(如價格、溫度、營收)時,這類任務稱為迴歸 (Regression)。
Q14. 知名連鎖服飾品牌擁有上百萬名會員的購買紀錄,行銷部門希望將這些會員「自動歸類成 5 到 6 個特性相近的客群」,以便未來針對不同客群發送差異化的電子報。在此之前,行銷部並沒有給予任何預設的標籤或客群名稱。這屬於哪一種類型的機器學習演算法?
正確答案:(C)
解析:在沒有標準答案(標籤)的情況下,讓演算法自行根據資料的相似度進行分組,屬於非監督式學習中的群集分析 (如 K-Means 演算法)。
解析:在沒有標準答案(標籤)的情況下,讓演算法自行根據資料的相似度進行分組,屬於非監督式學習中的群集分析 (如 K-Means 演算法)。
Q15. 某大型量販店透過分析多年的銷售點 (POS) 結帳資料,發現了一個有趣的現象:「在週五晚上購買烤肉架的顧客,有高達 80% 的機率會同時購買木炭與特定品牌的啤酒」。這種從資料中挖掘共同發生模式 (Co-occurrence) 的技術稱為?
正確答案:(A)
解析:購物籃分析是「關聯規則 (Association Rules)」最經典的應用場景,目的在於找出事物間「若買A,則極可能也買B」的關聯性。
解析:購物籃分析是「關聯規則 (Association Rules)」最經典的應用場景,目的在於找出事物間「若買A,則極可能也買B」的關聯性。
Q16. 某研發團隊正在訓練一台自動駕駛的清掃機器人。AI 系統沒有事先被賦予打掃路線的規則,而是讓它在模擬環境中不斷試錯 (Trial and Error)。當它清掃乾淨一塊區域時會獲得「獎勵分數」,撞到牆壁則受到「懲罰扣分」,最終系統透過最大化累積獎勵,自主學會了最佳的清掃路徑。這是哪一種機器學習分支的典型應用?
正確答案:(B)
解析:強化學習 (Reinforcement Learning) 的核心概念就是 Agent 在環境中不斷進行嘗試,透過「獎勵 (Reward)」與「懲罰 (Penalty)」的機制來優化決策策略。
解析:強化學習 (Reinforcement Learning) 的核心概念就是 Agent 在環境中不斷進行嘗試,透過「獎勵 (Reward)」與「懲罰 (Penalty)」的機制來優化決策策略。
Q17. 某數據分析師在開發「員工離職預測模型」時,發現模型在「用來訓練的歷史資料集」上達到了高達 99.9% 的超高準確率;然而,當將此模型應用於預測「從未見過的新進員工資料集」時,準確率卻慘跌至不到 50%。這種模型「死背」了訓練資料的雜訊而喪失泛化預測能力的現象,在機器學習中稱之為?
正確答案:(D)
解析:過度擬合 (Overfitting) 是指模型對訓練資料學習得「太過完美」,連不具代表性的雜訊都學進去,導致對未知的新資料預測能力極差。因此必須保留「測試集」來進行驗證。
解析:過度擬合 (Overfitting) 是指模型對訓練資料學習得「太過完美」,連不具代表性的雜訊都學進去,導致對未知的新資料預測能力極差。因此必須保留「測試集」來進行驗證。
Q18. 企業高層在導入 AI 系統輔助決策時,經常要求模型必須具備「高度的可解釋性 (Interpretability)」,亦即能讓人看懂 AI 是依據什麼邏輯做出決策的。在眾多演算法中,哪一種方法能產出類似「如果 (If) 收入大於 5 萬 且 (And) 負債比小於 30%,則 (Then) 核准貸款」這樣直觀的規則?
正確答案:(B)
解析:決策樹 (Decision Tree) 最大的優勢在於其產出的模型呈現直觀的樹狀分支與 If-Then 規則,具有極高的可解釋性,深受商業分析師青睞。相對地,深度學習常被視為難以解釋的「黑盒子」。
解析:決策樹 (Decision Tree) 最大的優勢在於其產出的模型呈現直觀的樹狀分支與 If-Then 規則,具有極高的可解釋性,深受商業分析師青睞。相對地,深度學習常被視為難以解釋的「黑盒子」。
Q19. 在進行資料分析前,分析師發現「顧客年齡」這個欄位中,有幾筆資料被錯誤輸入為「-5 歲」與「999 歲」。這種不符合常理或距離平均水準極度遙遠的資料點,我們通常稱之為?並且應該在資料前處理的哪個階段被揪出來處理?
正確答案:(A)
解析:異常超大或超小的極端數值稱為離群值 (Outliers)。這些雜訊若未處理將嚴重扭曲統計平均與模型預測,必須在 ECCD 的「清理 (Clean)」階段進行修正或剔除。
解析:異常超大或超小的極端數值稱為離群值 (Outliers)。這些雜訊若未處理將嚴重扭曲統計平均與模型預測,必須在 ECCD 的「清理 (Clean)」階段進行修正或剔除。
Q20. 若公司人資部門想要在一張圖表上,比較台北、台中、高雄三個不同分公司的「員工業績平均分數」大小差異。最直觀且最適合用來「比較不同類別之間數值差異」的圖表是下列何者?
正確答案:(B)
解析:長條圖 (或柱狀圖) 的主要用途就是視覺化地比較不同分類 (如各地區、各部門) 之間的數值高低與大小差異。
解析:長條圖 (或柱狀圖) 的主要用途就是視覺化地比較不同分類 (如各地區、各部門) 之間的數值高低與大小差異。