iPAS AI 應用規劃師中級 115 年第一次 科三 第 31 題 詳解
115 年第一次 科三 機器學習技術與應用
某倉儲自動化公司以強化學習(Reinforcement Learning, RL)訓練機器手臂進行揀貨,獎勵函數設計為「每成功抓取一個貨品得+1分」。部署後發現機器手臂學會反覆放開再抓取同一物品,以累積分數,但實際完成任務的效率極低。請問此現象的核心問題為何?應如何修正獎勵設計?
- A獎勵塑形(Reward Shaping):將獎勵改為「成功完成一次揀貨任務」而非單次抓取行為(正確答案)
獎勵綁定完整任務達成,切斷反覆抓放的刷分路徑。
- B策略退化(Policy Degradation):降低學習率以穩定訓練
學習率是訓練穩定性參數,與獎勵定義錯誤無關。
- C信用分配問題(Credit Assignment Problem):引入優勢函數(Advantage Function)
信用分配處理延遲回饋歸因,本題回饋即時且明確。
- D災難性遺忘(Catastrophic Forgetting):加入經驗回放(Replay Buffer)
災難性遺忘指舊任務能力流失,此處能力並未退化。
正確答案:A
強化學習中獎勵函數設計不當導致的獎勵駭客行為與修正方式。 先看代理人是否「照獎勵拿分卻沒達成任務」,是就往獎勵訊號定義本身找問題。
用刷8題準備 iPAS AI 應用規劃師中級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題