iPAS AI 應用規劃師中級 114 年第二次 科二 第 28 題 詳解
114 年第二次 科二 大數據處理分析與應用
若在高維度(>500維)的資料上應用DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法,卻發現所有資料點皆被判定為雜訊(Noise),下列何者為最有可能的原因?
- A高維下距離變化趨同,導致ε(Epsilon)閾值選擇失效(正確答案)
高維距離趨於相近,ε 無法區分核心點與雜訊。
- B使用錯誤的距離函數(Distance Function)
換距離函數仍受維度詛咒影響,非根本原因。
- CMinPts參數設得太小
MinPts 調小反而更易形成核心點,不會全成雜訊。
- D資料過度標準化導致特徵消失
標準化只調整尺度,不會讓特徵消失。
正確答案:A
高維度資料下距離集中效應對密度式分群參數的影響 看到分群結果異常時,先確認維度是否讓距離度量本身失效,再檢討參數設定。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題