iPAS AI 應用規劃師中級 115 年第一次 科二 第 32 題 詳解
115 年第一次 科二 大數據處理分析與應用
某銀行建置貸款違約預測模型,資料共50,000筆,其中違約樣本僅800筆(佔1.6%)。在模型建置流程中,先對整體資料使用SMOTE對少數類進行過採樣,之後再進行訓練/測試切分,並訓練輕量梯度提升機(LightGBM)模型,並以AUC-ROC評估模型表現。模型在測試集的AUC-ROC達到0.91,團隊認為模型表現良好,準備上線部署。在模型審查過程中,下列何者為使測試集評估結果失真的主要原因?
- ASMOTE不適合用於金融違約預測場景,此類高風險業務應一律採用class_weight調整損失函數,而非對資料本身進行過採樣
SMOTE 可用於違約預測,並非只能用權重調整。
- BSMOTE的過採樣操作在訓練/測試切分之前即對全體資料執行,導致合成樣本資訊洩漏至測試集,使AUC-ROC 0.91虛高而不可信(正確答案)
合成樣本混入測試集,AUC 因此虛高。
- CAUC-ROC在1.6%的不平衡場景下過度樂觀,應改用PR-AUC作為評估指標,其餘流程均正確
PR-AUC 較敏感沒錯,但真正的錯在流程順序。
- DLightGBM本身已內建處理不平衡的機制,與SMOTE同時使用會造成少數類過度補償,導致過多誤判
LightGBM 與 SMOTE 併用不是本題失真主因。
正確答案:B
考資料洩漏:重抽樣必須在訓練/測試切分之後才做。 看到重抽樣、標準化或特徵挑選,先確認它是否只在訓練集內完成。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題