Google AI Overview(Google 搜尋內建 AI 摘要功能)再度引發爭議,這次竟連「Google」這個字本身的拼寫都答錯。這場看似荒謬的失誤,背後是大型語言模型的架構性限制。

重點摘要

  • Tokenization 是根本原因:LLM 並非以字元(character)為單位處理文字,而是以 token(詞片段)為單位,導致模型不具備「逐字元拼寫」的能力。
  • 模型不「看」字母:對 Gemini 等模型而言,「Google」是一個 token,模型並不知道它由哪六個字母組成。
  • 反直覺的失誤:這也是為何 AI 能寫出複雜的程式碼,卻可能搞不清楚一個詞有幾個字母。
  • 不只是 Google 的問題:幾乎所有現行 LLM 都存在這個特性,差別在於是否有對應的後處理或微調補強。

影響 / 編輯按

這個案例是科普 AI 局限性的絕佳素材。當 AI 系統在搜尋引擎這個高能見度場景失誤,對 AI 可信度的影響遠超技術意義本身。對 Google 而言,AI Overview 的每一次失誤都是公關危機。

本文由 AI 整理,原文:AI郵報