iPAS AI 應用規劃師中級 114 年第二次 科二 第 37 題 詳解

114 年第二次 科二 大數據處理分析與應用

若開發一個用於罕見疾病自動診斷的分類模型,目前資料集中確診樣本僅佔不到1%,且因為標註成本高,短期內無法取得更多資料。在此情況下,若希望提升模型對少數類的偵測能力,同時避免過擬合,下列哪一種策略最為合理?

  1. A對少數類進行隨機過採樣(Random Oversampling)

    單純複製原樣本,容易讓模型背下少數類而過擬合。

  2. B對多數類進行欠採樣(Random Undersampling)

    丟棄多數類資料,在樣本本就不足時損失大量資訊。

  3. C使用SMOTE(Synthetic Minority Over-sampling Technique)生成合成少數類樣本後再訓練分類模型(正確答案)

    以插值合成新少數類樣本,兼顧偵測力與泛化。

  4. D僅使用現有資料調整模型決策閾值(Decision Threshold)以提升召回率

    只調閾值換來召回率,精確率下滑且未改善資料分布。

正確答案:C

考資料不平衡(Imbalanced Data)時的重採樣策略選擇。 先問樣本是否稀少且不能再蒐集,再判斷該複製、刪除還是合成新樣本。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題