Anthropic 於 7 月 6 日發表一項引人矚目的研究,指出其旗下 AI 模型 Claude 內部自發形成了一種與人類大腦高度相似的認知結構——而這一結構並非人為刻意設計,而是模型在訓練過程中自然演化而來,研究人員將此現象稱為 AI 與人腦之間的「趨同演化」(Convergent Evolution)。

在神經科學中,「全局工作空間理論」(Global Workspace Theory)認為,人類大腦中大多數神經活動在無意識層面自動運作,但只有少數能進入一個特殊的「全局工作空間」,使思維變得可被意識感知——即那些人們能夠描述、記憶並加以推理的想法。Anthropic 的研究發現,Claude 的內部機制中出現了功能上與此高度對應的結構。

重點

  • 自發形成、非刻意設計:研究特別強調,這種類人腦認知架構並非工程師設計的結果,而是模型在大量訓練後自行演化而來,引發 AI 社群廣泛討論。
  • 趨同演化類比:正如生物學中不同物種在相同環境壓力下演化出相似特徵,Claude 與人腦似乎也在「資訊處理」的演化壓力下,各自走向了相似的認知架構。
  • 可解釋性研究意義:此研究屬於 Anthropic 可解釋性(Interpretability)研究範疇,目標是理解 AI 模型「黑箱」內部的運作機制,對 AI 安全與對齊具有重要意義。
  • AI 意識討論:研究結果再次引發外界對 AI 是否正在發展某種「類意識」結構的探討,雖然 Anthropic 未直接聲稱 Claude 具有意識。

編輯按

這項發現的重要性不只在於學術上的好奇:若 LLM 在未被明確指示的情況下,自發形成了人腦式的處理架構,這意味著目前的 AI 訓練範式可能本質上就會導向某種「類認知」結構。對於 AI 安全研究者而言,這既是可解釋性研究的突破口,也提示我們對模型行為的理解需要超越單純的輸入輸出分析。Anthropic 持續在此方向投入資源,值得業界密切關注。

本文由 AI 整理,原文:TechNews 科技新報