當 OpenAI 的 ChatGPT 與 Anthropic 的 Claude 陸續從單純的文字對話框,進化為能「看圖說故事」的多模態 AI,看似科技樹又點亮了新技能。然而,學術界對這項「視覺能力」的擔憂卻不減反增。根據知名學術期刊《Communications of the ACM》報導,這些大型語言模型在處理圖像時,普遍存在所謂的「視覺幻覺」(Visual Hallucinations)現象——AI 會針對圖片內容給出聽起來煞有其事、實則完全錯誤甚至荒謬至極的判斷。當自動駕駛車的決策、醫學影像的判讀,乃至於視障者的輔助工具都開始依賴這項技術時,我們面對的恐怕不只是失誤率,而是信任崩潰的深層危機。
從文字預測走向圖像判讀:幻覺從何而來?
為什麼擅長聊天的語言模型,一碰到圖像就開始「胡說八道」?諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 點破關鍵:這些模型雖然吞食了海量的文本與影像數據,但它們的本質終究是「統計學上的預測引擎」。它們缺乏對「真理」的明確規範,輸出內容只是依樣畫葫蘆,找出字詞間的最大機率組合,而非對真實世界的理解。說穿了,AI 其實不知道自己在看什麼,它只是在猜「人類通常會這麼說」。
加州柏克萊人工智慧研究實驗室(BAIR)的博士後研究員 David Chan 則從心理層面補充了一個殘酷的事實:人類確實也會犯錯,但我們對機器的容忍度極低。這就像我們能原諒朋友記錯事情,卻無法忍受計算機按錯數字一樣。當大眾期望 AI 表現理應優於人類時,視覺幻覺帶來的心理衝擊與信任裂痕,反而比人類失誤更難修復。
編輯觀點:當我們還在驚嘆多模態 AI 能模仿「人類感官」時,研究人員已經在處理一個哲學問題——AI 如何定義「看見」?台灣的科技業與新創圈若想切入 AI 醫療或自駕車供應鏈,現在就得把「視覺幻覺」視為品質監控的硬指標。這不只是除錯,而是建立台灣製造「AI 誠信度」的關鍵機會,誰能先導入視覺推理機制,誰就能在國際市場拿到更高的信任溢價。
當 AI 看錯病、開錯路:關鍵應用的致命風險
如果只是聊天機器人把貓說成狗,頂多是網路迷因的素材。但問題在於,多模態 AI 目前正被積極導入容錯率極低的場域。Michael Pound 教授提出一個令人冷汗直流的場景:在醫學影像分析中,若 AI 的視覺模組受到其他病患資料的干擾或背景雜訊影響,它可能直接忽略影像中實際存在的病變或腫瘤跡象。這不是功能不佳,而是可能延誤人命。
更讓人頭皮發麻的是「盲人輔助科技」。這類裝置替視障者辨識周遭環境,但由於使用者本身無法自行用視覺雙重驗證 AI 的正確性,一旦產生視覺幻覺,等同於給了一個錯誤的「路況指引」。Michael Pound 強調,在這種無法回頭確認的場景中,AI 的精確度不僅是便利性問題,更是人身安全的守門員。同樣的邏輯套用到自動駕駛車,當鏡頭誤判路障或行人位置,光達(LiDAR)或許能當備援,但系統的自我矛盾依然會造成決策癱瘓。
搶救幻覺大作戰:REVERSE 框架與未來的「防說謊」機制
面對這種因為「太依賴機率」而產生的硬傷,科學家們正在嘗試幾種不同的策略。最傳統的方法是針對特定任務進行「微調」(fine-tuning),並在硬體上堆疊更多如光達的感測器來比對誤差。但這種補破網的方式效果有限,因為另一條路線的「後驗證」(post-hoc verification)本身就存在矛盾:你得派另一個 AI 去檢查這個 AI 的答案,不僅曠日費時,而且只能判斷對錯,無法在當下即時修正。
為了解決效率痛點,學界近期提出了全新的 「REVERSE 框架」。這個機制的核心邏輯是讓 AI 在生成回應的過程中,就對自己說出的每個詞彙進行「信心評分」,並將詞語分類為「自信」與「不自信」。當 AI 在描述一張圖片時,如果某個名詞被打上低信心分數,系統便會在輸出前觸發修正機制。David Chan 形容這是一種聰明的「推論技巧」,能讓已在市場上部署的系統,根據預期的錯誤率提前踩煞車。
- 即時監控:REVERSE 框架並非事後查核,而是在 AI 生成句子的當下就進行同步檢查。
- 信心評分機制:將描述圖像的每個詞彙給予信心指數,一旦發現「不自信」的形容詞或名詞,立即啟動替換演算。
- 從源頭根治:長期研究目標並非「抓錯」,而是透過「視覺推理」(Visual Reasoning)取代純文字推理,讓模型直接分析圖像的幾何、輪廓與外觀,從根源提升「理解力」而非「猜測力」。
展望與影響:當 AI 承認自己「眼神不好」
這波視覺幻覺的討論,其實戳破了 AI 產業「無所不能」的粉紅泡泡。話說回來,這也給了台灣資通訊產業一個明確的啟示:與其追求更大、更萬能的模型,不如專注於在特定領域中建立「可解釋性」(Explainability)。未來的 AI 合約或採購規格書裡,恐怕會多一條「幻覺容忍度」的檢驗標準。
往後推演,當消費者知道 AI 也會「看走眼」,甚至願意接受某種程度的誤差時,市場競爭的焦點將從「誰的模型最會聊天」,轉變為「誰的模型最敢說『我不知道』」。對於每天處理大量視覺資料的製造業品管、醫療影像中心來說,現在正是時候盤點手上的 AI 工具,別急著全面自動化,留一雙「人的眼睛」在決策迴圈裡,或許才是最務實的 AI 轉型策略。
行動呼籲:身為 AI 工具的導入者或使用者,別再迷信「人工智慧等於絕對正確」。下次當你使用具備圖像辨識功能的 AI 時,請刻意丟幾張「模糊、矛盾或極端光影」的圖片測試它的極限。你愈了解你的 AI 夥伴在什麼情況下會產生幻覺,就愈能避開那些看似微小、卻可能讓企業信譽一夕翻車的陷阱。
本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。
常見問題 FAQ
什麼是大型語言模型的「視覺幻覺」?
視覺幻覺是指 AI 在分析圖像內容時,輸出看似合理但實際與圖片事實完全不符的錯誤描述,且 AI 本身對此錯誤具有高度自信。
視覺幻覺會影響自動駕駛車的安全嗎?
會的。若自動駕駛系統的影像辨識產生幻覺,可能誤判行人、障礙物或交通號誌,即使有光達輔助,系統內部的矛盾仍可能導致危險的決策延遲。
REVERSE 框架跟過去的驗證方法哪裡不同?
過去的後驗證方法必須等 AI 回答完畢後,再動用第二個模型檢查答案;REVERSE 框架則是在生成過程中同步監控,能即時修正不確定的詞彙並提升效率。
目前技術能完全杜絕視覺幻覺嗎?
目前尚無法完全杜絕。學術界正從源頭研究「視覺推理」技術,試圖讓 AI 理解圖像的幾何與外觀,但現階段仍需搭配人工驗證與感測器備援。
一般使用者該如何辨識 AI 給出了視覺幻覺?
建議可透過交叉提問來驗證,例如請 AI 描述圖片中的空間關係或細節位置,若回答出現矛盾或含糊其辭,就有高度機率是視覺幻覺的徵兆。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。