美國 AI 公司 Anthropic 的研究員接受日本《日經新聞》專訪,闡述以新開發的分析工具深入解讀大型語言模型 Claude 的運作原理,嘗試辨識模型在生成答案前是否已形成可讀取的概念與思路。
主導研究員 Jack Lindsey 表示,這類可解釋性(interpretability)研究一方面具有基礎科學價值,另一方面有助判斷 AI 是否進行惡意規劃、欺騙或其他不安全行為。
重點
- AI 反省力研究:Anthropic 探索 Claude 在推理過程中是否形成類似「自我監察」的思路結構
- 可解釋性工具:新開發的分析工具可試圖讀取模型內部狀態,辨識潛在惡意規劃或欺騙模式
- 雙重目的:研究同時服務科學理解(AI 如何運作)與安全防範(偵測不安全行為)
- 背景:Lindsey 原為哥倫比亞大學神經科學研究員,現於 Anthropic 帶領 AI 反省力探索團隊
編輯按
可解釋性研究是 AI 安全領域的核心挑戰之一,Anthropic 這項工作試圖在「模型訓練後」補充一道透明度機制。雖然目前仍處研究階段,但若能有效辨識 AI 內部的欺騙傾向,將是行業安全防線的重大突破。
本文由 AI 整理,原文:TechNews 科技新報