iPAS AI 應用規劃師中級 115 年第一次 科三 第 11 題 詳解

115 年第一次 科三 機器學習技術與應用

某工程師在A100 GPU叢集上訓練大型語言模型,觀察到以下現象:全批次梯度下降時GPU利用率達100%,但每次更新耗時45秒;隨機梯度下降(SGD)每次更新僅需0.01秒,但梯度極不穩定、訓練曲線震盪劇烈。為兼顧梯度穩定性與GPU吞吐量(Throughput),應採用下列哪種策略?

  1. A全批次梯度下降(Full-batch GD):使用完整資料集計算梯度,更新穩定但每次更新耗時長

    梯度最穩,但單次更新成本過高,收斂太慢。

  2. B隨機梯度下降(SGD):每次只用一個樣本,速度快但梯度雜訊大,收斂不穩定

    單樣本更新雖快,梯度雜訊大且無法填滿GPU平行運算。

  3. C第二階梯度法(Newton's Method):利用Hessian矩陣精確估計曲率,大幅減少更新次數

    需計算Hessian矩陣,參數量龐大時記憶體與運算不可行。

  4. D小批次梯度下降(Mini-batch GD):以適當批次大小(如256-2048)平衡梯度估計穩定性與GPU平行效率,是深度學習的業界標準(正確答案)

    以256至2048批次兼顧梯度品質與平行效率,為正解。

正確答案:D

梯度下降三種批次策略在穩定性與運算效率之間的取捨。 看題目要同時滿足「梯度穩定」與「硬體吞吐」兩個條件時,答案通常落在折衷方案。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題