iPAS AI 應用規劃師中級 114 年第二次 科二 第 6 題 詳解

114 年第二次 科二 大數據處理分析與應用

在進行資料分析時,會遇到類別型(Categorical)與數值型(Numerical)資料格式。關於這兩種資料格式的處理,下列敘述何者不正確?

  1. AOne-Hot編碼(One-Hot Encoding)會將類別變數轉換為多維二元向量,適用於無序(Nominal)類別資料,但在高基數(High Cardinality)特徵下可能造成維度爆炸問題

    One-Hot 編碼確實適合無序類別,高基數時維度爆炸。

  2. B標籤編碼(Label Encoding)會以整數表示不同類別,若應用於無序(Nominal)資料,可能導致模型誤將編碼值解讀為具數值大小關係的特徵

    標籤編碼賦予整數,套在無序資料會被誤讀為大小順序。

  3. C標準化(Standardization)透過將資料平移與縮放,使其平均值為0、標準差為1,可在多數距離型演算法中改善收斂速度,並同時將數值範圍壓縮至0至1之間(正確答案)

    錯在標準化不會把數值壓到 0 至 1,那是正規化。

  4. D對連續變數進行分箱(Binning)可提升模型可解釋性,但若分段方式未依據資料分佈特性設計,可能導致資訊損失或邊界偏誤

    分箱提升可解釋性,切點不當會造成資訊損失與邊界偏誤。

正確答案:C

考類別型與數值型資料的前處理方法:編碼、標準化與分箱的定義差異。 看到縮放類題目,先分清標準化改變分布中心與尺度、正規化才限定值域。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題