iPAS AI 應用規劃師中級 115 年第一次 科三 第 44 題 詳解
115 年第一次 科三 機器學習技術與應用
請依據下方資訊回答第44~45題。
Iris是UCI Dataset上的一組經典資料集,常被用來教學與測試分類模型。
這份資料包含三種類型的鳶尾花(Iris setosa、Iris versicolor、Iris virginica),每個類別各有50筆資料。
每筆資料包含四個特徵:花萼長度、花萼寬度、花瓣長度、花瓣寬度。
研究人員希望透過機器學習模型,根據花朵的形態特徵,自動判斷該花屬於哪一種類型。在本次任務中,研究人員希望比較不同分類模型的表現。他們首先嘗試用線性判別分析(LDA)進行降維,接著使用K最近鄰(KNN)分類器來做分類預測,並使用交叉驗證(Cross Validation)評估模型的準確率。
研究人員撰寫的程式中(下圖),先用整體資料進行LDA(Linear Discriminant Analysis)降維,接著再用KNN(K-Nearest Neighbors)進行分類,並用交叉驗證來評估準確率。請問下列敘述何者正確?
- A此寫法完全正確,因為先以整體資料進行LDA降維,再以交叉驗證測試KNN,是標準流程
先全資料降維不是標準流程,反而是典型錯誤。
- B此寫法存在資料洩漏(Data Leakage)問題,應將LDA納入交叉驗證流程中一併進行(正確答案)
LDA 用到 y 又在切分前執行,須納入交叉驗證內。
- C雖然流程不夠嚴謹,但結果仍然能夠代表模型真實的泛化能力
洩漏後的分數偏高,不能代表泛化能力。
- D如果只想驗證KNN的分類效果,可以直接跳過LDA步驟,以簡化流程
跳過降維只是換題目,沒解決洩漏問題。
正確答案:B
交叉驗證中前處理造成的資料洩漏,以及正確的管線化做法。 看到降維或標準化寫在切分之前,就先檢查它有沒有偷看到驗證折的資料。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題