模組五:基礎資料分析
5.1 資料來源、獲取與防護
任何可被紀錄的資訊都是資料。在巨量資料(Big Data)時代,資料的來源非常多元,包含:
- 內部資料:企業既有系統如 ERP、CRM、POS 產生的交易紀錄、員工資料、生產日誌。
- 外部資料:政府公開資料 (Open Data)、社群媒體互動、競爭對手網站資訊。
資料獲取技術
常見的獲取技術包含透過 API 串接 直接取得結構化資料,或是利用 網路爬蟲 (Web Crawler) 從網頁 HTML 中抓取所需的文字或圖片資訊。
資料防護與法規
收集資料的同時必須注重隱私與資安。必須遵守當地法規(如台灣的《個人資料保護法》、歐盟的 GDPR)。對於敏感個資應進行**去識別化 (De-identification)** 或加密處理,並實施嚴格的**存取控制 (Access Control)**,確保只有授權人員能調閱特定資料。
5.2 資料性質分類
依據資料儲存格式與嚴謹程度,資料可分為三大類:
🗃️ 結構化資料 (Structured Data)
具有固定的欄位與明確的資料型態(如整數、日期)。最典型的代表是存放於關聯式資料庫 (RDBMS) 中的表格資料,可直接使用 SQL 進行查詢。
📄 半結構化資料 (Semi-structured Data)
具備某種層級或標籤架構,但不像關聯式資料庫那樣有嚴格的二維表格限制。常見格式包含 XML, JSON, HTML 文件,常作為系統間交換資料的媒介。
🎥 非結構化資料 (Unstructured Data)
沒有固定格式或結構,極難直接存入傳統表格中。包含純文字內容 (電子郵件、文章)、影像圖片、音訊 (客服錄音)、影片。大數據分析中有高達 80% 屬於此類資料。
5.3 統計概念與視覺化
統計是資料分析的基石。敘述統計 (Descriptive Statistics) 用來總結和描述資料的基本特徵;推論統計 (Inferential Statistics) 則用來從樣本推斷母體特徵(如假說檢定)。
常用敘述統計指標
- 集中趨勢:平均數 (Mean)、中位數 (Median,不受極端值影響)、眾數 (Mode)。
- 離散程度:變異數 (Variance)、標準差 (Standard Deviation,衡量資料分散程度)。
資料視覺化圖表應用
| 圖表類型 | 最適用的分析情境 |
|---|---|
| 折線圖 (Line Chart) | 呈現資料隨時間變化的趨勢 (Trend),如每月營業額變化。 |
| 長條圖 / 柱狀圖 (Bar Chart) | 比較不同類別之間的數值大小,如各分店的銷售業績比較。 |
| 圓餅圖 (Pie Chart) | 呈現各類別佔總體的比例 (Proportion),如市佔率分佈。 |
| 散佈圖 (Scatter Plot) | 檢視兩個連續變數之間的相關性 (Correlation),如廣告費與銷售額的關係。 |
5.4 機器學習概念與應用
機器學習是讓電腦從歷史資料中自動學習規則並進行預測的技術。主要分為兩大類:
1. 監督式學習 (Supervised Learning)
訓練資料「有標準答案 (標籤 Label)」。演算法透過學習特徵與答案間的關係來預測新資料。主要解決兩種問題:
- 分類 (Classification):預測離散的類別。如:預測客戶是否會流失 (是/否)、信件是否為垃圾郵件。常用演算法:決策樹 (Decision Tree)、邏輯斯迴歸、支持向量機 (SVM)。
- 迴歸 (Regression):預測連續的數值。如:預測明天的氣溫幾度、預測下一季的營收金額。常用演算法:線性迴歸 (Linear Regression)。
2. 非監督式學習 (Unsupervised Learning)
訓練資料「沒有標準答案 (無標籤)」。演算法自行尋找資料中隱含的結構或模式。主要應用包含:
- 分群 (Clustering):將相似特徵的資料聚集在一起。如:將千萬名顧客自動分成 5 大行銷客群 (事前不知道是哪5群)。常用演算法:K-Means。
- 關聯規則 (Association Rules):尋找事物共同發生的關聯性。如:購物籃分析 (買了尿布的人通常也會買啤酒)。常用演算法:Apriori 演算法。
解析:影像、聲音、影片以及純文字文章,因為沒有固定的欄位與結構格式,皆屬於非結構化資料。
解析:在沒有提供預設標籤(標準答案)的情況下,讓演算法自動找出資料中的相似性並歸類,屬於「非監督式學習」中的「分群 (Clustering)」。若事先定義好類別並教導機器去判斷,則屬於監督式學習的分類。
沒有留言:
張貼留言