iPAS AI 應用規劃師中級 114 年第二次 科二 第 37 題 詳解
114 年第二次 科二 大數據處理分析與應用
若開發一個用於罕見疾病自動診斷的分類模型,目前資料集中確診樣本僅佔不到1%,且因為標註成本高,短期內無法取得更多資料。在此情況下,若希望提升模型對少數類的偵測能力,同時避免過擬合,下列哪一種策略最為合理?
- A對少數類進行隨機過採樣(Random Oversampling)
單純複製原樣本,容易讓模型背下少數類而過擬合。
- B對多數類進行欠採樣(Random Undersampling)
丟棄多數類資料,在樣本本就不足時損失大量資訊。
- C使用SMOTE(Synthetic Minority Over-sampling Technique)生成合成少數類樣本後再訓練分類模型(正確答案)
以插值合成新少數類樣本,兼顧偵測力與泛化。
- D僅使用現有資料調整模型決策閾值(Decision Threshold)以提升召回率
只調閾值換來召回率,精確率下滑且未改善資料分布。
正確答案:C
考資料不平衡(Imbalanced Data)時的重採樣策略選擇。 先問樣本是否稀少且不能再蒐集,再判斷該複製、刪除還是合成新樣本。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題