Python 挑戰 ML (機器學習) -- 練習題 [1]

📝 測驗說明與操作指南

  • 作答方式:請閱讀題目後,直接點擊下方您認為正確的選項((A), (B), (C), (D))。
  • 即時判定:點擊選項後,系統會立即判定對錯。若答對,系統會顯示綠色提示;若答錯,系統會標示紅色,並為您標出真正的正確答案。
  • 觀看解析:作答完成後,選項下方會自動展開詳細的觀念解析,幫助您釐清知識點。
⚠️ 注意:本測驗採用單次作答設計,點選選項後即無法更改,請確認思考後再作答。
Q1. 在實作機器學習演算法時,我們經常需要計算特徵向量 x 與權重向量 w 的內積(Dot Product)。下列哪一段 NumPy 程式碼能正確計算兩個一維陣列 x 與 w 的內積?

✅ 答對了!

❌ 答錯了!

💡 解析:np.dot 是 NumPy 中用來正確計算兩個一維陣列內積的標準函式。

Q2. 在評估迴歸模型時,均方誤差(MSE)是常用的損失函數。若 y_true 為實際標籤,y_pred 為模型預測值,兩者皆為長度相同的 NumPy 陣列。下列哪一行程式碼能正確計算 MSE?

✅ 答對了!

❌ 答錯了!

💡 解析:均方誤差(MSE)為誤差平方和的平均值,此語法正確映射了先算差的平方、再求平均的數學公式。

Q3. 當我們載入一份客戶資料集後,使用 Pandas 的 df.describe() 函式可以快速查看數值特徵的統計摘要。若某一欄位「年齡」在 describe() 的輸出中,50% 的數值為 35,這代表什麼統計意義?

✅ 答對了!

❌ 答錯了!

💡 解析:在統計學上,50% 的百分位數(Percentile)即代表將資料一分為二的中位數(Median)。

Q4. 在解讀 Keras 的模型摘要(Model Summary)時,參數數量的計算對於硬體評估與記憶體需求十分重要。假設某一個全連接層(Dense Layer)的輸入維度是 10,輸出維度是 5,且預設包含偏差項(Bias),則該層的總參數數量為何?

✅ 答對了!

❌ 答錯了!

💡 解析:全連接層的參數數量公式為「(輸入維度 + 1) * 輸出維度」,其中的 1 即為偏差項。因此 (10 + 1) * 5 = 55。

Q5. 在深度學習模型中,為了解決過擬合(Overfitting)問題,我們常會在 Keras 實作中加入 Dropout(0.5) 層。關於這行程式碼的實務意義,下列敘述何者正確?

✅ 答對了!

❌ 答錯了!

💡 解析:Dropout 會在訓練階段以指定機率隨機丟棄(設為0)神經元的輸出,以此強迫模型不依賴單一特徵,學習更強健的表示。

Q6. 在實作遷移學習(Transfer Learning)時,我們通常會使用預訓練模型(如 VGG16)並凍結其底層特徵萃取層,只訓練我們自己接上的分類層。在 Keras 中,下列哪一行程式碼能正確凍結特定的網路層 base_model,使其在訓練過程中不更新權重?

✅ 答對了!

❌ 答錯了!

💡 解析:將模型層的 trainable 屬性設為 False,可阻止該層在反向傳播時計算梯度並更新權重,完成權重凍結。

Q7. 在機器學習專案中,對特徵進行標準化(Standardization)是避免模型受不同尺度影響的關鍵。使用 Scikit-learn 的 StandardScaler 時,為了避免「資料洩漏(Data Leakage)」,下列哪一種作法是實務上的最佳實踐?

✅ 答對了!

❌ 答錯了!

💡 解析:這是標準防洩漏的做法。訓練集負責計算並記住均值與標準差,測試集僅依賴訓練集的參數進行轉換,以模擬完全未知的真實資料。

Q8. 進行資料前處理前,我們需要檢查資料集中是否存在缺失值(Missing Values)。在 Pandas 中,下列哪一個函式組合最適合用來快速計算每一欄(Column)的缺失值總數?

✅ 答對了!

❌ 答錯了!

💡 解析:isnull() 會將遺漏值轉換為 True(數值1),非遺漏值轉換為 False(數值0),搭配 sum() 可以精準加總出每一欄包含的缺失值總數。

Q9. 為了降低資料維度並消除雜訊,我們決定使用主成分分析(PCA)。若我們希望 PCA 轉換後,能夠動態決定主成分數量以剛好保留原始資料中 95% 的變異量,在 Scikit-learn 中應如何正確設定 PCA 物件的參數?

✅ 答對了!

❌ 答錯了!

💡 解析:在 Scikit-learn 的 PCA 中,當 n_components 設為小於 1.0 的浮點數時,演算法會自動判斷需幾個主成分才能解釋指定比例(如 95%)的變異量。

Q10. 為了使用 Seaborn 進行視覺化比較,有時我們需要將「寬格式(Wide Format)」的 DataFrame 轉換為「長格式(Long Format)」。在 Pandas 中,下列哪一個函式最適合執行這項轉換,例如將散落在各欄的多個「季度銷售額」打平合併為「季度」與「銷售額」兩個對應欄位?

✅ 答對了!

❌ 答錯了!

💡 解析:pd.melt() 專門用於將多欄資料「融化」轉換為兩欄式(變數名稱與數值)的長格式,這對於適配 Seaborn 的繪圖邏輯尤為重要。

Q11. 在 Keras 中建構多類別分類模型(例如區分貓、狗、鳥)時,若目標標籤(Label)在資料前處理階段已經被轉換為獨熱編碼(One-Hot Encoding),例如 [0, 0, 1],我們應該在 model.compile() 中選擇哪一種損失函數(Loss Function)?

✅ 答對了!

❌ 答錯了!

💡 解析:當標籤採用 One-Hot 編碼的多維矩陣形式時,categorical_crossentropy 是相對應且標準的多類別分類損失函數。

Q12. 當我們使用 Scikit-learn 的 cross_val_score 進行 K 折交叉驗證時,若傳入 cv=5 參數,下列關於其演算法運作機制的描述何者正確?

✅ 答對了!

❌ 答錯了!

💡 解析:cv=5 代表 5 折交叉驗證,演算法會確保每一份資料都有一次機會成為驗證集,另外四次成為訓練集,這是評估模型泛化穩定度的標準做法。

Q13. 邏輯迴歸模型與神經網路的二元輸出層中,常使用 Sigmoid 函數將線性數值轉換為介於 0 與 1 之間的機率。下列哪一段 NumPy 程式碼能正確實作數學上的 Sigmoid 函數 f(x) = 1 / (1 + e^(-x))?

✅ 答對了!

❌ 答錯了!

💡 解析:np.exp 是 NumPy 計算歐拉數(Euler's number)指數 e 的正確方法,此語法完美映射了數學公式,並能針對整個陣列向量化運算。

Q14. 在探索式資料分析(EDA)階段,若我們想比較不同「產品類別」(類別變數)在「銷售額」(數值變數)上的分佈範圍、中位數差異以及是否含有離群值(Outliers),最適合使用哪一種 Seaborn 繪圖函式?

✅ 答對了!

❌ 答錯了!

💡 解析:boxplot(箱型圖)利用四分位數完美封裝了資料的分佈特徵,能同時在一張圖上比較多個類別的集中趨勢與異常離群值。

Q15. 當我們嘗試用 Scikit-learn 的 LinearRegression().fit(X, y) 訓練簡單線性迴歸模型時,若特徵 X 只有一個變數(為一維 NumPy 陣列),常會遇到「Expected 2D array, got 1D array instead」的錯誤。我們應如何使用 NumPy 修改 X 的形狀來修復此問題?

✅ 答對了!

❌ 答錯了!

💡 解析:Scikit-learn 預期輸入特徵 X 是一個二維矩陣 (n_samples, n_features)。使用 reshape(-1, 1) 會保持樣本數不變,但強制為其增加一個特徵維度(轉為單列的矩陣),成功解決報錯。

Q16. 為了確保模型評估的公正性與可重現性,我們經常使用 train_test_split 劃分訓練與測試資料。若希望在專案討論中,每次執行程式碼時,資料切分洗牌(shuffle)的結果都能保持一模一樣,我們應該設定哪一個參數?

✅ 答對了!

❌ 答錯了!

💡 解析:random_state 能設定虛擬亂數產生器的種子(Seed),只要給定相同的整數值,就能保證每次隨機切分的結果完全一致,是實驗重現的關鍵參數。

Q17. 為了避免神經網路過度擬合(Overfitting),實務上常會在 Keras 訓練過程中加入 EarlyStopping 回呼機制。在 EarlyStopping 的設定中,參數 patience=5 代表什麼意義?

✅ 答對了!

❌ 答錯了!

💡 解析:patience(耐心值)決定了我們願意容忍模型幾個 epoch 效能不再進步才終止訓練。這樣既能防止過擬合,又不會因為單次的效能震盪而過早結束。

Q18. 在建構機器學習流程時,若直接將前處理步驟(如填補缺失值、標準化)和模型訓練分開寫,在進行交叉驗證(CV)時非常容易導致資料洩漏(因為評估集偷偷參與了總體的標準化運算)。為了解決這個問題,Scikit-learn 提供了下列哪一個物件來串接這些步驟?

✅ 答對了!

❌ 答錯了!

💡 解析:Pipeline 可以將資料前處理與預測模型打包成單一物件。在交叉驗證的每一折中,它會確保僅用當下的訓練折擬合前處理參數,徹底避免測試集資料洩漏。

Q19. 假設資料表中「性別」欄位為字串型態的「Male」與「Female」,許多機器學習模型(如神經網路、線性迴歸)無法直接處理非數值的字串。在 Pandas 中,哪一種方法可以最直觀、最快將其轉換為模型可接受的獨熱編碼(One-hot encoding)格式的虛擬變數(Dummy variables)?

✅ 答對了!

❌ 答錯了!

💡 解析:pd.get_dummies() 能自動識別類別型變數,並將其快速展開為多個 0 和 1 的布林/數值特徵欄位,是進行獨熱編碼最便捷的 Pandas 方法。

Q20. 在評估分類模型時,classification_report 是一個非常實用的 Scikit-learn 報告工具。當其輸出的某類別「Recall(召回率)」數值非常低時,在風險較高的商業情境上(例如疾病檢測、詐騙偵測)通常意味著什麼嚴重問題?

✅ 答對了!

❌ 答錯了!

💡 解析:召回率衡量的是「實際有問題的樣本中,被正確抓出多少」。數值低代表許多患病者被判定為健康而漏診,這在醫療或風控上代價極高。

Read More »

iPAS 演算法偏見與可解釋性深度筆記

機器學習技術與應用 | 單元 6.2 核心主題解析


一、 演算法公平性基礎定義

演算法偏見(Algorithmic Bias)是指 AI 模型因訓練數據、模型架構或人為定義錯誤,導致對特定特徵(如性別、種族)產生不公正的差別待遇。

  • 敏感屬性 (Sensitive Attributes): 受法律或倫理保護的特徵(性別、宗教等)。
  • 群體公平 (Group Fairness): 不同群體(如男 vs 女)應獲得相似的正面結果比例。
  • 個體公平 (Individual Fairness): 相似的個體應獲得相似的結果。

二、 偏見產生的多維來源 常考解析

理解偏見源頭有助於選擇正確的緩解策略:

2.1 數據層面 (Data-driven Bias)

  • 歷史偏見 (Historical Bias): 數據本身正確,但反映了社會過去的歧視現象。
  • 代表性偏見 (Representation Bias): 數據取樣不均(如醫療數據缺乏特定族群樣本),導致對少數群體預測力弱。
  • 測量偏見 (Measurement Bias): 用來衡量目標的代理變數選取不當。

2.2 演算法與評估層面

  • 匯總偏見 (Aggregation Bias): 單一模型強行擬合多元背景的數據。
  • 評估偏見 (Evaluation Bias): 僅看整體 Accuracy 而忽視混淆矩陣中特定群體的誤差(如特定族群 FP 過高)。

三、 公平性衡量指標 (Fairness Metrics) 核心重點

指標邏輯敘述應考關鍵字
統計均等 (Statistical Parity)各群體獲得正面結果的機率應相等。結果比例、無關能力
均等機會 (Equal Opportunity)在「具備能力」的人中,各群體被選中的機率相等。真陽性率 (TPR) 一致
均等賠率 (Equalized Odds)各群體的真陽性率 (TPR) 與偽陽性率 (FPR) 皆相等。TPR 與 FPR 同時看

四、 三階段偏見緩解技術

預處理 (Pre-processing)
清洗/調整數據
處理中 (In-processing)
修改損失函數
後處理 (Post-processing)
調整分類門檻

💡 考試技巧: 若題目問「如何在不重新訓練模型的情況下提高公平性?」,應選「後處理 (Post-processing)」。

五、 演算法透明度與可解釋性 (XAI) 新增主題

可解釋人工智慧 (Explainable AI, XAI) 旨在讓人類理解模型決策的原因,解決「黑盒模型」的不透明問題。

5.1 透明度的三個層次

  • 演算法透明度: 了解演算法本身的邏輯(如決策樹如何分支)。
  • 可解釋性: 提供人類可理解的理由(例如:因為收入低於 X 萬所以拒貸)。
  • 可問責性: 當決策出錯時,能追溯責任並進行修正。

5.2 核心 XAI 技術分類

依據解釋的範圍與時機分類:

分類維度說明代表性方法
全局解釋 (Global)描述模型的整體行為邏輯。特徵重要性排名 (Feature Importance)
局部解釋 (Local)解釋特定某一筆資料為何被如此預測。LIME, SHAP
事前解釋 (Ante-hoc)模型本身就具備可解釋性。線性回歸、決策樹、K-NN
事後解釋 (Post-hoc)對黑盒模型進行外掛解釋。SHAP, 特徵熱圖 (Saliency Maps)
LIME vs SHAP 之辨析:
  • LIME: 透過在該樣本周圍建立簡單的模型(如線性模型)來局部逼近。
  • SHAP: 基於博弈論的「夏普里值」,能提供特徵對預測貢獻的量化數值,具備更好的理論基礎。

六、 應試總結心法

© iPAS AI 應用規劃師應考筆記系列 | 本內容對應科目三「機器學習技術與應用」單元 6.2

Read More »

iPAS 數據隱私、安全與合規 (Privacy & Security) 深度筆記

 

機器學習治理 | 單元 6.1 核心主題解析

一、 PII 個人識別資訊 (Personally Identifiable Information) 必考分類

並非所有數據都敏感,考點在於區分「直接」與「間接」識別資訊。

1.1 直接識別資訊 (Direct Identifiers)

單獨即可明確辨識出特定個人的資訊。
例: 姓名、身分證字號、電子郵件地址、電話號碼。

1.2 準識別資訊 (Quasi-Identifiers)

單獨無法識別,但結合多個欄位後可識別出特定個人。
例: 出生日期、郵遞區號、職業、性別、國籍。

二、 去識別化基礎技術 (De-identification) 技術實作考點

為了在利用數據與保護隱私間取得平衡,需要進行去識別化處理。

技術說明範例
遮蔽 (Masking)將部分欄位改為特定符號。將身分證末三碼改為 ***。
泛化 (Generalization)將具體值轉為粗略的範圍。將年齡 23 歲改為「20-30 歲」。
分桶 (Bucketing)與泛化相似,將連續數值歸類。薪資 45,000 歸類為「40K-50K 區間」。
虛擬化/偽名化將真實姓名替換為無意義的代號。張三 → User_A001。
匿名化技術的侷限:

即便進行了匿名化,若遭受到「連結攻擊 (Linking Attack)」(將多個外部數據庫比對),仍有可能還原個人身份。因此,現代趨勢是採用「差分隱私」。

三、 數據隱私保護進階技術 新興趨勢

這些是治理章節中常見的專業術語,需理解其應用場景。

  • 差分隱私 (Differential Privacy): 在數據中加入「數學雜訊」。確保查詢結果不會透露單一數據點的存在,且不影響整體統計準確度。
  • 同態加密 (Homomorphic Encryption): 允許直接對「加密狀態」的資料進行運算,不需解密。運算結果解密後與原始資料運算結果一致。
  • 聯邦學習 (Federated Learning): 「資料不動、模型動」。各端點在本地訓練模型,僅將模型更新參數回傳雲端聚合,資料不出本地端。

四、 數據安全攻擊與防禦 資安必考

AI 模型本身也會受到攻擊,考生需分辨不同的攻擊手段。

攻擊名稱手法描述防禦策略
對抗式攻擊 (Adversarial)在輸入中加入微小雜訊,誘導模型誤判。對抗式訓練、增加數據多樣性。
模型反向攻擊 (Inversion)透過 API 查詢結果反推訓練資料內容。差分隱私、限制 API 查詢頻率。
中毒攻擊 (Poisoning)在訓練階段注入惡意資料,埋下後門。嚴格過濾訓練數據、來源驗證。

五、 國際隱私法規 (GDPR) 合規原則

雖然台灣有《個資法》,但 iPAS 通常參考歐盟 GDPR 作為基準。

5.1 核心原則

  • 被遺忘權: 用戶有權要求刪除與其相關的數據。
  • 資料可攜權: 用戶有權要求將數據轉移給其他服務商。
  • 隱私設計 (Privacy by Design): 系統開發初期就應將隱私考量納入設計流程。

© iPAS AI 應用規劃師應考筆記系列 | 本內容參照科目三「機器學習技術與應用」學習指引

Read More »

iPAS 模型調整與優化 (Model Tuning) 深度筆記

 

機器學習技術與應用 | 單元 5.4 核心主題解析

一、 參數 vs. 超參數:誰來決定? 基本功

區分這兩者是理解模型優化的第一步。

類別定義例子決定者
參數 (Parameters)模型內部的配置,從資料中學習而得。神經網路權重、線性回歸係數。演算法/資料
超參數 (Hyperparameters)模型外部的設定,在訓練前手動指定。學習率、K-Fold 的 K、隱藏層數。工程師 (你)

二、 超參數調優方法 (Hyperparameter Tuning) 必考工具

如何在茫茫設定中找到最優組合?

  • 網格搜尋 (Grid Search): 窮舉所有可能的排列組合。
    缺點: 非常耗時(計算量隨參數增加呈指數成長)。
  • 隨機搜尋 (Random Search): 在參數空間隨機採樣。
    優點: 通常比網格搜尋更有效率,能更快發現重要的參數範圍。
  • 貝氏優化 (Bayesian Optimization): 根據先前的測試結果,預測下一組可能更好的參數。
    優點: 效率最高,適合計算昂貴的大型模型。

三、 解決過擬合 (Overfitting) 的實戰策略 應用大題

當訓練集效果很好,但測試集很差時(高變異),你該怎麼辦?

過擬合應對檢查表:
  • 資料層面: 增加訓練資料量 (More Data)、資料增強 (Data Augmentation)。
  • 模型層面: 降低模型複雜度(減少層數或神經元)、早停法 (Early Stopping)。
  • 技術層面: 使用正則化、Dropout、整合學習 (Ensemble Learning)。

四、 正則化技術 (Regularization) 數理邏輯

透過在損失函數中加入一個「懲罰項」,限制權重的大小,避免模型太「偏激」。

4.1 L1 正則化 (Lasso)

特性: 會將不重要的特徵權重變為 0。

用途: 除了防過擬合,還兼具 「特徵選擇」 的功能。

4.2 L2 正則化 (Ridge)

特性: 會讓權重變小(趨近於 0),但不會等於 0。

用途: 使模型變得平滑,對所有特徵都有一定的保留,是目前最常用的正則化方式。

五、 深度學習特有優化技巧 工程實務

5.1 丟棄法 (Dropout)

訓練時隨機讓部分神經元「罷工」。這強迫模型不能過度依賴特定神經元,增加魯棒性 (Robustness)。

5.2 批次正規化 (Batch Normalization)

將每一層的輸出進行標準化。
好處: 加快收斂速度、穩定訓練過程、減少對初始值的敏感度。

5.3 早停法 (Early Stopping)

監控驗證集的損失。一旦驗證集損失開始上升(代表開始過擬合),就提前結束訓練。

© iPAS AI 應用規劃師應考筆記系列 | 本內容參照科目三「機器學習技術與應用」學習指引

Read More »

iPAS 模型訓練、評估與驗證 (Training & Evaluation) 深度筆記

 

機器學習技術與應用 | 單元 5.3 核心主題解析

一、 資料集切分:三段論法 必考觀念

為了確保模型的泛化能力,我們不能在「看過」的資料上評估模型。

1.1 三大子集的功能

  • 訓練集 (Training Set): 用於調整模型權重(參數)。比例通常佔 70-80%。
  • 驗證集 (Validation Set): 用於 「超參數調優」 或模型選擇。它不參與訓練,但參與「決策」。
  • 測試集 (Test Set): 模型「期末考試」。完全獨立,用於衡量模型在真實世界的效能。
應試陷阱:

測試集絕對不能參與模型的訓練或參數選擇!如果測試集的結果反過來影響了參數調整,這稱為「資料洩露 (Data Leakage)」,會導致評估結果過於樂觀。

二、 驗證策略 (Validation Strategy) 方法論

當資料量不足或需要更穩定的評估時,必須使用特殊的驗證技巧。

2.1 K-折交叉驗證 (K-Fold Cross-Validation)

作法: 將資料均分為 K 份,輪流拿 1 份當驗證集、其餘 K-1 份當訓練集。最後取平均效能。

優點: 降低單次切分資料造成的隨機誤差,對小樣本特別有用。

2.2 分層採樣 (Stratified Sampling)

場景: 用於資料 「類別不平衡」 時。例如信用卡詐騙案件極少,分層採樣可確保訓練集與驗證集中的詐騙比例與原資料一致。

三、 分類模型評估指標 計算題重鎮

這是考試中最常出現計算題的地方,必須熟記混淆矩陣 (Confusion Matrix)。

指標公式白話解釋
準確率 (Accuracy)$(TP+TN) / Total$全部預測對的比例(資料不平衡時無效)。
精確率 (Precision)$TP / (TP+FP)$預測為真 裡面,有多少是真的?(別誤殺)
召回率 (Recall)$TP / (TP+FN)$實際上為真 裡面,有多少被抓出來?(別放過)
F1-Score$2 \times \frac{Pre \times Rec}{Pre + Rec}$精確與召回的「調和平均」,綜合評價。
ROC 曲線與 AUC 指標:
  • ROC: 橫軸是偽陽率 (FPR),縱軸是真陽率 (TPR)。
  • AUC: ROC 曲線下的面積。AUC = 1 是完美模型;AUC = 0.5 是隨機猜測。**AUC 的優點是不受分類閾值 (Threshold) 影響。**

四、 回歸模型評估指標 連續數值

當目標是連續數字(如房價)時,使用的指標與分類不同。

  • MAE (平均絕對誤差): 誤差的絕對值平均。直觀,對異常值較具容忍性。
  • MSE (均方誤差): 誤差平方的平均。**會放大大的誤差**,因此模型會對極端錯誤非常敏感。
  • RMSE (均方根誤差): MSE 開根號。單位與原資料一致,利於解讀。
  • $R^2$ (決定係數): 介於 0~1。代表模型能解釋目標變異的百分比。愈接近 1 愈好。

五、 模型穩定性與監控 進階治理

模型在線上運行一段時間後,效能會下降,這需要持續監控。

5.1 模型衰退與漂移 (Drift)

  • 概念漂移 (Concept Drift): 特徵與目標的關係變了(例如疫情後消費習慣改變)。
  • 數據漂移 (Data Drift): 輸入資料的分佈變了(例如新地區的用戶特徵與舊地區不同)。

© iPAS AI 應用規劃師應考筆記系列 | 本內容參照科目三「機器學習技術與應用」學習指引

Read More »

iPAS 模型選擇與架構設計 (Model & Architecture) 深度筆記

 

機器學習技術與應用 | 單元 5.2 核心主題解析

一、 模型選擇的基本原則 規劃核心

模型選擇並非越複雜越好,而是要根據「資料量」、「問題類型」與「部署環境」來決定。

1.1 考量因素

  • 問題本質: 分類 (Classification)、回歸 (Regression) 還是分群 (Clustering)?
  • 資料量大小:
    • 資料少:選簡單模型(如線性回歸、SVM),避免過擬合。
    • 資料多:選深層網路(如 Transformer、CNN),提取複雜特徵。
  • 解釋性需求: 醫療、金融領域優先選「白箱模型」(如決策樹、邏輯回歸);純準確率導向選「黑箱模型」(如深度學習)。

二、 偏差與變異的權衡 (Bias-Variance Tradeoff) 必考原理

這是衡量模型效能最基礎的理論架構。

術語說明現象解決方案
高偏差 (High Bias)模型太簡單,沒學到資料規律。欠擬合 (Underfitting)增加特徵、增加模型複雜度。
高變異 (High Variance)模型太複雜,學到了雜訊。過擬合 (Overfitting)增加資料、正則化 (L1/L2)、Dropout。
奧卡姆剃刀原則 (Occam's Razor):

如果兩個模型具有相似的解釋能力(預測效果),應該選擇較簡單的那一個。簡單模型通常具有更好的泛化能力 (Generalization)。

三、 常用網路架構類型 技術選型

在設計 AI 系統時,必須了解不同架構的適用範疇。

3.1 卷積神經網路 (CNN)

特性: 具備卷積層與池化層,擁有「平移不變性」。

場景: 電腦視覺 (CV)、影像分類、物件偵測。

3.2 循環神經網路 (RNN / LSTM)

特性: 具備記憶性,處理序列資料。

場景: 時間序列預測、語音辨識(雖然目前多被 Transformer 取代)。

3.3 Transformer 架構

特性: 注意力機制 (Attention)。平行運算能力強,處理長距離依賴效果好。

場景: 自然語言處理 (NLP)、大語言模型 (LLM)。

四、 模型架構優化技術 效能調整

如何在保持準確率的同時,讓模型更快、更輕量?

  • 超參數調優 (Hyperparameter Tuning):
    手動調整學習率 (Learning Rate)、批次大小 (Batch Size)、層數。
    方法: 網格搜尋 (Grid Search)、隨機搜尋 (Random Search)。
  • 模型壓縮 (Compression):
    • 權重剪枝 (Pruning): 移除影響小的神經元權重。
    • 量化 (Quantization): 將 32-bit 浮點數轉為 8-bit 整數,加速推論。
    • 知識蒸餾 (Distillation): 大模型 (Teacher) 指導小模型 (Student)。

五、 部署考量:雲端 vs. 邊緣 (Edge) 應用規劃

架構設計必須考慮推理 (Inference) 的執行位置。

部署位置優點缺點適用情境
雲端 (Cloud)運算力強、可處理複雜大模型。依賴網路、延遲高、隱私疑慮。大數據分析、生成式 AI。
邊緣 (Edge)低延遲、省頻寬、資料不出在地。運算資源有限(記憶體/功耗)。自駕車、工廠設備監控。

© iPAS AI 應用規劃師應考筆記系列 | 本內容參照科目三「機器學習技術與應用」學習指引

Read More »
>