模組五:基礎資料分析

5.1 資料來源、獲取與防護

任何可被紀錄的資訊都是資料。在巨量資料(Big Data)時代,資料的來源非常多元,包含:

  • 內部資料:企業既有系統如 ERP、CRM、POS 產生的交易紀錄、員工資料、生產日誌。
  • 外部資料:政府公開資料 (Open Data)、社群媒體互動、競爭對手網站資訊。

資料獲取技術

常見的獲取技術包含透過 API 串接 直接取得結構化資料,或是利用 網路爬蟲 (Web Crawler) 從網頁 HTML 中抓取所需的文字或圖片資訊。

資料防護與法規

收集資料的同時必須注重隱私與資安。必須遵守當地法規(如台灣的《個人資料保護法》、歐盟的 GDPR)。對於敏感個資應進行**去識別化 (De-identification)** 或加密處理,並實施嚴格的**存取控制 (Access Control)**,確保只有授權人員能調閱特定資料。

5.2 資料性質分類

依據資料儲存格式與嚴謹程度,資料可分為三大類:

🗃️ 結構化資料 (Structured Data)

具有固定的欄位與明確的資料型態(如整數、日期)。最典型的代表是存放於關聯式資料庫 (RDBMS) 中的表格資料,可直接使用 SQL 進行查詢。

📄 半結構化資料 (Semi-structured Data)

具備某種層級或標籤架構,但不像關聯式資料庫那樣有嚴格的二維表格限制。常見格式包含 XML, JSON, HTML 文件,常作為系統間交換資料的媒介。

🎥 非結構化資料 (Unstructured Data)

沒有固定格式或結構,極難直接存入傳統表格中。包含純文字內容 (電子郵件、文章)、影像圖片、音訊 (客服錄音)、影片。大數據分析中有高達 80% 屬於此類資料。

5.3 統計概念與視覺化

統計是資料分析的基石。敘述統計 (Descriptive Statistics) 用來總結和描述資料的基本特徵;推論統計 (Inferential Statistics) 則用來從樣本推斷母體特徵(如假說檢定)。

常用敘述統計指標

  • 集中趨勢:平均數 (Mean)、中位數 (Median,不受極端值影響)、眾數 (Mode)。
  • 離散程度:變異數 (Variance)、標準差 (Standard Deviation,衡量資料分散程度)。

資料視覺化圖表應用

圖表類型 最適用的分析情境
折線圖 (Line Chart) 呈現資料隨時間變化的趨勢 (Trend),如每月營業額變化。
長條圖 / 柱狀圖 (Bar Chart) 比較不同類別之間的數值大小,如各分店的銷售業績比較。
圓餅圖 (Pie Chart) 呈現各類別佔總體的比例 (Proportion),如市佔率分佈。
散佈圖 (Scatter Plot) 檢視兩個連續變數之間的相關性 (Correlation),如廣告費與銷售額的關係。

5.4 機器學習概念與應用

重點考區:監督式與非監督式差異

機器學習是讓電腦從歷史資料中自動學習規則並進行預測的技術。主要分為兩大類:

1. 監督式學習 (Supervised Learning)

訓練資料「有標準答案 (標籤 Label)」。演算法透過學習特徵與答案間的關係來預測新資料。主要解決兩種問題:

  • 分類 (Classification):預測離散的類別。如:預測客戶是否會流失 (是/否)、信件是否為垃圾郵件。常用演算法:決策樹 (Decision Tree)、邏輯斯迴歸、支持向量機 (SVM)。
  • 迴歸 (Regression):預測連續的數值。如:預測明天的氣溫幾度、預測下一季的營收金額。常用演算法:線性迴歸 (Linear Regression)。

2. 非監督式學習 (Unsupervised Learning)

訓練資料「沒有標準答案 (無標籤)」。演算法自行尋找資料中隱含的結構或模式。主要應用包含:

  • 分群 (Clustering):將相似特徵的資料聚集在一起。如:將千萬名顧客自動分成 5 大行銷客群 (事前不知道是哪5群)。常用演算法:K-Means。
  • 關聯規則 (Association Rules):尋找事物共同發生的關聯性。如:購物籃分析 (買了尿布的人通常也會買啤酒)。常用演算法:Apriori 演算法。
📝 模擬考題與解析 (模組五)
Q1. 企業客服中心每天會產生大量的「顧客抱怨錄音檔」與「電子郵件純文字內容」。就資料儲存的性質而言,這些資料最主要是屬於下列哪一種型態?
(A) 結構化資料 (Structured Data) (B) 半結構化資料 (Semi-structured Data) (C) 非結構化資料 (Unstructured Data) (D) 關聯式表格資料 (Relational Data)
正確答案:(C)
解析:影像、聲音、影片以及純文字文章,因為沒有固定的欄位與結構格式,皆屬於非結構化資料。
Q2. 某電商平台希望針對全站百萬名註冊會員進行精準行銷,但事先並不知道這些會員可以分成哪些類型。因此,分析團隊將會員的年齡、瀏覽停留時間、平均客單價丟入機器學習模型中,讓模型自動將特性相近的會員歸類為五大群體。此種沒有標準答案的學習方式稱為何?
(A) 監督式學習 - 分類 (Classification) (B) 監督式學習 - 迴歸 (Regression) (C) 非監督式學習 - 分群 (Clustering) (D) 強化學習 (Reinforcement Learning)
正確答案:(C)
解析:在沒有提供預設標籤(標準答案)的情況下,讓演算法自動找出資料中的相似性並歸類,屬於「非監督式學習」中的「分群 (Clustering)」。若事先定義好類別並教導機器去判斷,則屬於監督式學習的分類。