iPAS AI 應用規劃師中級 115 年第一次 科三 第 11 題 詳解
115 年第一次 科三 機器學習技術與應用
某工程師在A100 GPU叢集上訓練大型語言模型,觀察到以下現象:全批次梯度下降時GPU利用率達100%,但每次更新耗時45秒;隨機梯度下降(SGD)每次更新僅需0.01秒,但梯度極不穩定、訓練曲線震盪劇烈。為兼顧梯度穩定性與GPU吞吐量(Throughput),應採用下列哪種策略?
- A全批次梯度下降(Full-batch GD):使用完整資料集計算梯度,更新穩定但每次更新耗時長
梯度最穩,但單次更新成本過高,收斂太慢。
- B隨機梯度下降(SGD):每次只用一個樣本,速度快但梯度雜訊大,收斂不穩定
單樣本更新雖快,梯度雜訊大且無法填滿GPU平行運算。
- C第二階梯度法(Newton's Method):利用Hessian矩陣精確估計曲率,大幅減少更新次數
需計算Hessian矩陣,參數量龐大時記憶體與運算不可行。
- D小批次梯度下降(Mini-batch GD):以適當批次大小(如256-2048)平衡梯度估計穩定性與GPU平行效率,是深度學習的業界標準(正確答案)
以256至2048批次兼顧梯度品質與平行效率,為正解。
正確答案:D
梯度下降三種批次策略在穩定性與運算效率之間的取捨。 看題目要同時滿足「梯度穩定」與「硬體吞吐」兩個條件時,答案通常落在折衷方案。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題