iPAS AI 應用規劃師中級 114 年第二次 科二 第 24 題 詳解

114 年第二次 科二 大數據處理分析與應用

某企業建置生成式AI系統,利用大量客服紀錄與產品評論資料訓練語言模型,以自動生成客服回覆與知識摘要。由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?

  1. A建立資料湖(Data Lake)結構,並以Apache Spark或Ray進行分散式資料預處理與特徵抽取,再串接至模型訓練管線(Pipeline)(正確答案)

    資料湖容納多型態原始資料,分散式框架並行前處理後接訓練管線。

  2. B採用單節點高效能伺服器搭配批次處理模式,集中執行資料清理與格式轉換

    單節點批次無法橫向擴充,資料量成長即成瓶頸。

  3. C將所有文字資料轉換為向量,並以資料庫索引方式直接餵入語言模型訓練

    未清理就向量化並直接索引餵入,跳過必要前處理。

  4. D使用生成式模型先行自動清理資料內容,再將結果輸入至下游訓練流程

    用生成式模型清資料易引入幻覺與偏誤,品質不可控。

正確答案:A

考大量多模態資料的儲存與分散式前處理架構選擇。 先看資料量與型態是否多樣,再判斷該架構能否同時支撐擴充性與流程一致性。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題