iPAS AI 應用規劃師中級 115 年第一次 科二 第 10 題 詳解

115 年第一次 科二 大數據處理分析與應用

某團隊為職業籃球隊建立球員受傷風險預測模型,原始特徵280個。初始模型訓練集AUC為0.94、測試集僅0.68,顯示嚴重過擬合。為改善模型,團隊進行以下處理步驟:第一步於全體資料(含測試集)上計算特徵間線性相關係數並移除高度相關特徵;第二步依模型重要性篩選特徵後重新訓練模型。最終測試集AUC提升至0.81。關於上述調整流程,下列敘述何者最為正確?

  1. A使用相關係數進行特徵篩選方向正確,主要問題在於相關係數門檻設定過高

    問題不在門檻高低,而是篩選時用了測試集資料。

  2. B在全體資料(含測試集)上進行特徵篩選會造成資料洩漏,且線性相關無法捕捉非線性關係(正確答案)

    正解:全體資料篩選造成洩漏,且線性相關無法反映非線性關聯。

  3. C特徵篩選後需重新對測試集進行標準化,否則會影響模型表現

    標準化需以訓練集參數套用測試集,不是本題癥結。

  4. D測試集表現提升代表過擬合已解決,流程可直接部署

    分數提升含洩漏成分,不能視為過擬合已解決。

正確答案:B

特徵篩選若使用到測試集資訊,會造成資料洩漏並高估模型表現。 看到任何前處理或篩選步驟,先問「這一步有沒有偷看測試集」,再問方法能否涵蓋非線性關係。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題