AI 幫你「翻譯」醫學論文?研究警告:多說的那幾句,可能是幻覺

當你拿著一份充滿醫學術語的論文,請 ChatGPT 幫你「翻譯」成人話,它確實能給出一篇讀起來流暢自然的白話摘要。但問題來了:摘要裡那些原文沒有的「補充說明」,究竟是合理的推論,還是 AI 憑空捏造的幻覺?美國伊利諾大學厄巴納香檳分校(UIUC)的研究團隊最近提出一套名為 PlainQAFact 的評估機制,試圖從模型輸出的句子中,揪出那些「聽起來很對,其實不然」的虛構內容。

說真的,大型語言模型擅長把艱澀的學術語言改寫成易懂白話,這件事我們都知道。但這項技術一旦應用在醫療、教育或新聞領域,錯誤的代價就不是開玩笑了。研究員特別點出一個關鍵盲點:現有的評估工具大多只檢查摘要是否忠於原文,卻忽略了模型「額外補充」的那幾句話——而這些正是最容易出錯的地方。

白話摘要的陷阱:原文沒寫的,AI 自己腦補

這篇發表在《Journal of Biomedical Informatics》的論文,由 UIUC 資訊科學學院的 Zhiwen You 與 Yue Guo 共同完成。他們利用美國國家科學基金會(NSF)ACCESS 計畫的運算資源,在國家超級電腦應用中心(NCSA)的 Delta 系統上開發出 PlainQAFact 評估機制。

這套方法的核心邏輯很直接:先把白話摘要的句子切成兩類——「來源簡化」和「延伸解釋」。前者是原文內容的改寫,後者則是模型自己多講的補充。針對後者,PlainQAFact 會結合可信的醫療資料庫與模型問答循環驗證,最後給出一個分數。分數越高,代表內容越貼近事實,反之則代表幻覺成分偏高。

研究員指出,傳統評估工具對那些「容易跟原文對照」的內容還算管用,但遇到看似合理、實際上可能有誤的延伸說明,幾乎沒有辨識能力。換句話說,如果 AI 把一篇心臟病論文的結論「腦補」成某種飲食療法有效,而這段話原文根本沒寫——現有工具可能完全抓不到這個錯誤。

【編輯觀點】這項研究戳破了一個大家不願面對的真相:我們太容易相信「講得順」的 AI 產出。在生醫領域,一句錯誤的延伸解釋可能影響臨床決策或公共衛生判斷。PlainQAFact 的價值不在於它多厲害,而在於它提醒我們:AI 摘要的「流暢度」和「正確性」是兩件完全不同的事。從產業面來看,未來這類事實一致性評估機制會成為 AI 應用落地的標配,尤其在高風險領域——你不能只靠模型「看起來很合理」就放行。

為什麼生醫領域特別需要這套機制?

生醫文獻有個特性:術語密度極高、因果關係複雜,一般讀者幾乎不可能自行判讀。這讓大型語言模型的「白話摘要」功能看起來極具吸引力——它彷彿打通了專業知識與大眾理解之間的高牆。

但有趣的是,正是因為生醫知識的專業門檻高,錯誤訊息一旦進入傳播鏈,幾乎沒有被即時糾正的機會。一位非專科醫師的研究者可能靠 AI 摘要快速掌握某篇論文的結論,卻不知道摘要裡多了一句原文沒有的副作用說明;一位病患家屬可能在網路上讀到 AI 生成的醫學白話版,據此改變就醫決策——這些都是研究團隊試圖防堵的風險場景。

PlainQAFact 的驗證流程納入了可信的醫療資料庫作為事實參照,等於幫 AI 的「延伸解釋」加上一道外部查核關卡。這種設計思維,其實就是把新聞業的「事實查核」概念搬到 AI 輸出上。

  • 區分「改寫」與「補充」:先分類再驗證,避免混為一談
  • 外部資料庫交叉比對:不只看模型自信度,而是對照真實知識來源
  • 循環問答驗證:透過多輪問答測試模型對自己輸出的掌握程度
  • 分數量化事實一致性:讓「可信度」變成可比較、可追蹤的指標

事實查核的下一步:從「對照原文」進化到「驗證知識」

這項研究給我們一個很重要的啟示:未來的 AI 評估不能只停留在「有沒有偏離原文」,而是要看「說出來的話在真實世界是否成立」。前者是文字比對,後者是知識驗證,難度完全不同層級。

團隊表示,PlainQAFact 目前聚焦在生醫領域,但這套「先分類、再驗證」的框架,其實可以延伸到法律文件解讀、財報分析、甚至歷史文獻的現代化解釋——任何需要把專業內容轉譯給一般人的場景,都可能遇到類似的幻覺風險。

話說回來,這不代表我們要對 AI 摘要功能失去信心。而是說,當我們使用這類工具時,心裡要有個底:它講得愈順、補充得愈多,你反而要愈警覺。研究團隊開發的 PlainQAFact 只是第一步,真正的挑戰在於如何讓這類評估機制變成 AI 產出流程的標準環節——而不是事後補救的學術玩具。

展望與影響

從更大的視角來看,大型語言模型在科學溝通上的潛力是無庸置疑的。但如果我們沒辦法解決「幻覺補充」的問題,這項技術的應用範圍就會被嚴重限縮——沒人敢把 AI 摘要直接用在臨床決策輔助、公共衛生宣導或藥品說明轉譯上。

PlainQAFact 的學術貢獻不在於它給出了完美答案,而在於它把問題定義清楚了。當業界還在追求模型參數愈來愈大、回答愈來愈流暢時,這群研究員反其道而行,專注在「如何系統性地找出錯誤」。這種思維轉向,可能才是 AI 真正能被信任的起點。

如果你也在工作或生活中使用 AI 整理資訊,不妨問問自己:上一次你讀到 AI 生成的摘要時,能清楚分辨哪些是原文有的、哪些是它自己加的嗎?如果不能,也許 PlainQAFact 這套思考方式——先分類、再驗證——就是你現在可以用得上的查核心法。

本文改寫整理自公開新聞來源,原始報導由科技新報發布。

常見問題 FAQ

大型語言模型的白話摘要為什麼會產生幻覺?

因為模型在改寫時會基於訓練資料的統計規律「腦補」合理但原文沒有的內容,尤其是為了讓句子更連貫或補充背景知識時,最容易產生看似合理的事實錯誤。

PlainQAFact 跟其他評估工具有什麼不同?

它會先把摘要句子區分為「來源簡化」和「延伸解釋」,只針對後者進行外部知識驗證,而不是籠統地比對原文,能更精準抓出模型自己多講的錯誤內容。

現在用 ChatGPT 整理醫學論文還可靠嗎?

建議當作初步理解的輔助工具,但關鍵結論務必回頭對照原始文獻。PlainQAFact 的研究顯示,模型補充的延伸說明錯誤率遠高於直接改寫,不建議單獨依賴。

這套技術什麼時候可以普及應用?

目前仍在學術驗證階段,但研究團隊強調框架可延伸到法律、財經等領域。要商業化落地還需要更多真實場景的測試與調整,短期內不會普及。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。