iPAS AI 應用規劃師中級 115 年第一次 科二 第 41 題 詳解

115 年第一次 科二 大數據處理分析與應用

某全球共享乘車平台的資料科學團隊,正針對2025年第四季度進行營收優化與防弊分析專案。團隊希望透過資料分析達成兩項目標:一是預測司機未來收入表現,以支援營運策略與獎勵機制調整;二是希望透過分析裝置與定位回傳資料,辨識潛在異常行為,以降低補貼濫用風險。 為此,團隊整理出一份司機每日營運資料檔(driver_daily_stats.csv),其中每筆資料代表某位司機於某一天的營運表現與系統回傳摘要資訊。資料欄位如下: ● driver_id:司機編號 ● daily_earnings:日總收入(單位:美元) ● region:註冊營運區域(以字串A、B、C表示) ● app_version:使用的司機端App版本(如v1.0、v2.0) ● gps_ping_rate:每分鐘回傳GPS訊號的次數 請根據此資料情境回答第41~44題。

資料分析師使用Python檢視daily_earnings欄位的基本統計量,執行以下程式碼(Pandas 2以上版本):輸出結果如下: ● mean:223.411306 ● 50%:128.552462 ● max:4500.000000 若團隊進一步發現daily_earnings欄位約有5%的遺失值,且目前規劃先建立線性迴歸(Linear Regression)模型來預測未來收入。為盡可能保留該欄位原有分布特性,並降低因補值造成的偏差,請問下列哪一種處理方式最為合理?

  1. Adf['daily_earnings'].fillna(df['daily_earnings'].mean(), inplace=True)

    平均數被極端值拉高,補值會整體高估收入。

  2. Bdf['daily_earnings'].fillna(df['daily_earnings'].median(), inplace=True)(正確答案)

    中位數抗極端值,最能保留原分布中心位置。

  3. Cdf['daily_earnings'].fillna(df['daily_earnings'].max(), inplace=True)

    用最大值補值等於製造大量極端點,嚴重扭曲分布。

  4. D直接刪除所有遺失資料,因數值型欄位不適合進行補值處理

    僅5%遺失就整列刪除,浪費樣本且可能造成選擇偏誤。

正確答案:B

偏態分布資料的遺失值補值應選中位數而非平均數。 先比較 mean 與 median 差距判斷是否偏態,再決定用平均數或中位數補值。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題