iPAS AI 應用規劃師中級 114 年第二次 科一 第 35 題 詳解

114 年第二次 科一 人工智慧技術應用與規劃

某媒體公司計畫導入CLIP(Contrastive Language–Image Pre-training)模型,以協助大量影像自動標註與搜尋,並希望在無需新增標訓資料的情況下,僅透過文字提示(Text Prompt)即可識別影像內容。請問此應用情境中,CLIP能夠達成的關鍵技術特性為何?

  1. A透過圖文對比式學習(Contrastive Learning)將影像與文字映射至共同嵌入空間(Shared Embedding Space),可直接以語意相似度進行零樣本分類(正確答案)

    圖文映射至同一嵌入空間,用語意相似度即可零樣本分類。

  2. B透過影像增強與特徵擴散降低標訓資料需求

    資料增強只是擴充樣本,仍需標註資料訓練分類器。

  3. C以監督式學習結合多層感知器(Multilayer Perceptron, MLP)進行影像特徵分類

    監督式 MLP 分類需固定類別與標註,無法零樣本。

  4. D以自迴歸生成模型(Autoregressive Model)逐步生成文字標籤描述影像內容

    自迴歸生成是描述文字的作法,非 CLIP 的對比式檢索機制。

正確答案:A

CLIP 以圖文對比學習建立共同嵌入空間,進而支援零樣本分類的核心特性。 看到模型宣稱免標註、只靠文字提示辨識,就回想它的訓練目標與表示空間如何對齊。

用刷8題準備 iPAS AI 應用規劃師中級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題