iPAS AI 應用規劃師中級 115 年第一次 科二 第 30 題 詳解
115 年第一次 科二 大數據處理分析與應用
訓練資料共5,000萬筆,工程師比較Batch Size=32與Batch Size = 4096的訓練表現,發現大批次(Large Batch)雖然訓練較快,但模型泛化能力較差。從最佳化理論角度,下列何者為此現象最合理的解釋?
- A大批次(Large Batch)計算量過大,GPU無法有效處理
大批次可切分累積計算,非GPU處理不了。
- B大批次(Large Batch)梯度估計更穩定,但容易收斂至局部極小值(Local Minima),導致泛化能力較差(正確答案)
大批次梯度雜訊少,易停在尖銳極小值。
- C小批次(Small Batch)因隨機性高,更容易發生梯度爆炸(Gradient Explosion)
小批次隨機性高,與梯度爆炸無因果關係。
- D批次大小(Batch Size)與泛化能力無關,問題出在學習率(Learning Rate)設定
批次大小確實影響泛化,說無關即錯。
正確答案:B
批次大小對梯度雜訊與模型泛化能力的影響 先問這是最佳化過程中的梯度特性問題,再判斷批次大小改變的是雜訊量而非硬體負荷。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題