iPAS AI 應用規劃師中級 115 年第一次 科二 第 32 題 詳解

115 年第一次 科二 大數據處理分析與應用

某銀行建置貸款違約預測模型,資料共50,000筆,其中違約樣本僅800筆(佔1.6%)。在模型建置流程中,先對整體資料使用SMOTE對少數類進行過採樣,之後再進行訓練/測試切分,並訓練輕量梯度提升機(LightGBM)模型,並以AUC-ROC評估模型表現。模型在測試集的AUC-ROC達到0.91,團隊認為模型表現良好,準備上線部署。在模型審查過程中,下列何者為使測試集評估結果失真的主要原因?

  1. ASMOTE不適合用於金融違約預測場景,此類高風險業務應一律採用class_weight調整損失函數,而非對資料本身進行過採樣

    SMOTE 可用於違約預測,並非只能用權重調整。

  2. BSMOTE的過採樣操作在訓練/測試切分之前即對全體資料執行,導致合成樣本資訊洩漏至測試集,使AUC-ROC 0.91虛高而不可信(正確答案)

    合成樣本混入測試集,AUC 因此虛高。

  3. CAUC-ROC在1.6%的不平衡場景下過度樂觀,應改用PR-AUC作為評估指標,其餘流程均正確

    PR-AUC 較敏感沒錯,但真正的錯在流程順序。

  4. DLightGBM本身已內建處理不平衡的機制,與SMOTE同時使用會造成少數類過度補償,導致過多誤判

    LightGBM 與 SMOTE 併用不是本題失真主因。

正確答案:B

考資料洩漏:重抽樣必須在訓練/測試切分之後才做。 看到重抽樣、標準化或特徵挑選,先確認它是否只在訓練集內完成。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題