iPAS AI 應用規劃師中級 115 年第一次 科二 第 11 題 詳解
115 年第一次 科二 大數據處理分析與應用
某團隊為電信公司建立用戶月租方案續約預測模型,資料集包含兩個類別特徵:「客服評價」共有5個等級(非常不滿意至非常滿意),具明確順序關係;「居住縣市」共有22個不同類別,類別之間無順序關係。團隊計劃分別以Logistic Regression與XGBoost訓練模型,並對上述特徵進行編碼。請問下列哪個編碼方案最適當?
- A兩模型皆將「客服評價」與「居住縣市」進行One-Hot Encoding,保留全部欄位並使用相同特徵矩陣訓練模型
順序特徵被拆成獨立欄位,且未去除虛擬變數陷阱。
- BLogistic Regression將「客服評價」做Ordinal Encoding、「居住縣市」以歷史續約率進行編碼且於資料切分前計算;XGBoost對兩個特徵皆採Ordinal Encoding處理
目標編碼在資料切分前計算,造成標籤洩漏。
- CLogistic Regression將「客服評價」做Ordinal Encoding、「居住縣市」進行One-Hot Encoding並採Drop First;XGBoost將「客服評價」採Ordinal Encoding,「居住縣市」以類別型態輸入並啟用enable_categorical(正確答案)
順序、無序與模型特性皆對應正確。
- D兩個模型均將「客服評價」以平均續約率進行編碼,「居住縣市」先做One-Hot Encoding再以PCA降維,並統一作為兩模型輸入特徵
以平均續約率編碼並用PCA,洩漏且破壞可解釋性。
正確答案:C
依特徵的順序性與模型特性選擇合適的類別編碼方式。 先判斷類別有無順序,再看模型是線性還是樹模型,最後檢查編碼是否洩漏標籤。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題