AI 睇唔明「幽靈字體」?OpenAI、Anthropic 頂級模型集體失手,暴露視覺理解真正短板

AI 睇唔明「幽靈字體」?OpenAI、Anthropic 頂級模型集體失手,暴露視覺理解真正短板

一張字體圖,就令頂級大模型集體「露底」

最近有一輪測試再次令 AI 圈嘩然:只要把文字用所謂「幽靈字體(ghost fonts)」呈現——即字形被刻意扭曲、拆解、加入雜訊,或用非常規結構重組——OpenAI、Anthropic 等最前沿的多模態模型,幾乎都無法正確辨識當中的文字內容。人眼可以毫不費力讀出來的字,AI 卻堅定地「認錯字」,甚至煞有介事地解釋一段根本不存在的訊息。

這件事表面看似小把戲,但它戳中的是一個非常核心的問題:目前主流多模態模型的「視覺理解」,其實遠遠不是我們想像中的那種「看得懂」。它更像是一種在海量圖像資料上訓練出來的高階模式匹配,一旦樣本偏離訓練分佈,模型就會露出真正的底層弱點——不是看不清,而是自信地看錯,並且用流暢語言把錯的答案包裝成正確的。

這篇文章想講的重點不是「AI 又輸了一次」,而是:幽靈字體事件揭露了視覺幻覺(visual hallucination)跟文字幻覺其實是同一種病,只是換了個載體。

幽靈字體到底是什麼?為何偏偏令 AI 失手?

所謂幽靈字體,並不是特定一種字型,而是一類「對人類保留可讀性,對模型破壞規律性」的視覺設計。常見手法包括:

  • 把字元拆成幾何碎片,靠人腦自動補完
  • 用點陣、雜訊、雙重曝光效果覆蓋字形
  • 用非常規筆順、鏡像、旋轉、負空間表達文字
  • 用背景圖案「藏字」,字體只由邊緣或陰影構成

人類讀這些字之所以毫無難度,是因為我們的大腦處理的是「這個形狀想表達的意義」,而不是逐 pixel 比對訓練過的字型。但主流視覺模型的 OCR 能力,多數建立在「見過大量清晰、規範字型」的統計基礎之上。當字形結構偏離常見樣本,模型就會退化成一個非常有信心的猜謎機器。

更關鍵的是:模型不會告訴你它在猜。它會直接輸出一個看似合理、句子通順、甚至帶少少上下文推理的答案,令使用者根本無從察覺這是幻覺。

今次事件最值得留意的三個訊號

1. 視覺幻覺比文字幻覺更難被抓包

文字幻覺至少可以透過 fact-check、對照原文找出來。但視覺幻覺——特別是 OCR 類的幻覺——絕大多數使用者根本不會去逐字核對原圖。模型講什麼,使用者就信什麼。這在合約掃描、醫療單據、身份文件辨識等場景,是非常危險的預設。

2. 「多模態」不等於「真的看得懂」

過去一年業界不斷強調 GPT-4o、Claude、Gemini 等模型的多模態能力有多強,能睇圖、睇 PDF、睇截圖、睇手寫。但幽靈字體的失手提醒我們:這些模型的視覺路徑,本質仍然是把圖像壓縮成 token,再交由語言模型「猜意思」。它不是先看清楚,再理解;而是先建立一個假設,再用語言把假設寫得像事實。

3. 對抗性視覺輸入正在變成新的攻擊面

如果只要用幾種字體變體就能令頂級模型集體讀錯,那反過來說,這種手法也可以被有心人用來繞過內容審查、令 AI 客服讀錯指令、令自動化流程輸出錯誤資料。過去大家關注 prompt injection,未來對抗性圖片、對抗性字體會是同等級別的問題,但目前業界對這方面的防禦幾乎是空白。

一個很多人忽略的事實:模型「答得出」不代表「睇得到」

這才是幽靈字體事件最尖銳的地方。

當你把一張扭曲字體的圖丟給 Claude 或 ChatGPT,它們幾乎從不會回答「我看不清這張圖的文字」。它們會給你一個答案。這個答案可能完全錯,但語氣、格式、結構都會非常專業,甚至會補一句「根據圖中內容顯示…」

這反映出目前多模態模型有一個根本設計傾向:寧願錯,也不願講唔知。因為訓練過程中,模糊、遲疑、拒答的回應通常被評分較低,而流暢、肯定、有結構的回答被評分較高。久而久之,模型學會了「即使不確定,也要講得像確定」。

這不是一個 bug,而是一個訓練目標帶來的副作用。要修,要動的不只是視覺編碼器,還要動整個 RLHF 的評分邏輯。

對真實使用者的實際啟示

如果你日常會用 AI 處理圖像文字——例如掃描收據、讀 PDF 表格、翻譯招牌、抽取截圖內容——幽靈字體事件其實在提醒你三件事:

第一,遇到手寫、藝術字體、老舊印刷、非標準排版時,不要直接相信模型輸出,最少要人工抽樣覆核。第二,如果要把 AI OCR 放進自動化流程,一定要在 pipeline 加入信心分數或人工審核關卡,不能單靠模型自己說「我讀到了」。第三,愈是關鍵的文件(合約、金額、姓名、日期),愈要用多模型交叉驗證,而不是把所有信任押在一個號稱最強的模型上。

這場失手,其實是好事

幽靈字體讓 AI 集體出糗,聽起來像段子,但它其實幫整個行業做了一次免費壓力測試。它證明了現時 SOTA 的多模態模型,在離開訓練分佈之後依然脆弱;也證明了「視覺理解」這件事,遠未去到可以無條件信任的階段。

對使用者而言,這是一個健康的提醒:AI 給你的答案再流暢,都不等於它真的看見了你看見的東西。真正成熟的 AI 使用者,不是相信模型什麼都做得到,而是知道它在哪裡最容易出錯——然後在那些位置,永遠留一隻眼盯著。

追蹤以下平台,獲得最新AI資訊:
Facebook: https://www.facebook.com/drjackeiwong/
Instagram: https://www.instagram.com/drjackeiwong/
Threads: https://www.threads.net/@drjackeiwong/
YouTube: https://www.youtube.com/@drjackeiwong/
Website: https://drjackeiwong.com/

Dr. Jackei Wong

Dr. Jackei Wong|GenAI 企業培訓導師|AI 書籍作者|科技 YouTuber
專注生成式 AI(GenAI)企業培訓、公開課程、講座、工作坊及社交媒體內容合作。
DayGen AI Limited 及 RoboCode Academy 創辦人。
擁有超過 20 年人工智能研究、教學及培訓經驗。
YouTube:youtube.com/@drjackeiwong
網站:drjackeiwong.com
合作邀請歡迎 DM

喜歡請分享