iPAS AI 應用規劃師中級 115 年第一次 科三 第 45 題 詳解
115 年第一次 科三 機器學習技術與應用
請依據下方資訊回答第44~45題。
Iris是UCI Dataset上的一組經典資料集,常被用來教學與測試分類模型。
這份資料包含三種類型的鳶尾花(Iris setosa、Iris versicolor、Iris virginica),每個類別各有50筆資料。
每筆資料包含四個特徵:花萼長度、花萼寬度、花瓣長度、花瓣寬度。
研究人員希望透過機器學習模型,根據花朵的形態特徵,自動判斷該花屬於哪一種類型。在本次任務中,研究人員希望比較不同分類模型的表現。他們首先嘗試用線性判別分析(LDA)進行降維,接著使用K最近鄰(KNN)分類器來做分類預測,並使用交叉驗證(Cross Validation)評估模型的準確率。
研究人員在程式(下圖)中使用cross_val_score進行交叉驗證,但目前尚未設定cv參數。他們希望確保在每次資料分割時,訓練集與測試集的類別比例與原始資料一致,以免影響模型的準確率估計。目前有以下幾段候選程式碼可供選擇。請問為了確保在交叉驗證時每個分割中的類別比例與原始資料一致,上面哪幾段程式碼插入在原始程式中[#填入程式碼]的部分比較合適?
- A程式碼B、程式碼C、程式碼D(正確答案)
B、C、D 皆為分層切分,正確。
- B程式碼A、程式碼C
含程式碼A,KFold 不保證類別比例。
- C程式碼A、程式碼B、程式碼D
同樣誤收 KFold,且漏掉整數 cv 的分層預設。
- D程式碼C、程式碼D
漏掉最直接的 StratifiedKFold。
正確答案:A
交叉驗證中分層抽樣(Stratified)對維持類別比例的作用 看到「各折類別比例需與原始資料一致」,就鎖定名稱含 Stratified 者,並記得分類器搭配整數 cv 會自動分層。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題