Anthropic 旗下模型 Claude Mythos 近期成為安全界熱議焦點。根據《經濟學人》報導,美國參議院情報委員會副主席 Mark Warner 引述國家安全局暨網路司令部(U.S. Cyber Command)負責人 Joshua Rudd 將軍的簡報指出,Claude Mythos 在測試中能在數小時內成功滲透「幾乎所有」NSA 機密系統——用時不是數週,而是數小時。
外媒事後澄清,此事件發生在受控的模擬環境紅隊測試(Red Team Test)中,並非真實攻擊。Anthropic 一貫將系統性紅隊測試視為安全研究的核心環節,用以評估模型在高風險場景下的潛在能力邊界與風險。
重點
- Claude Mythos 能力展示:在受控紅隊環境下,模型據稱可在數小時內突破複雜機密系統,展現前沿 AI 在網路攻防的強大潛力。
- 模擬 vs. 真實攻擊:外媒強調,這是模擬環境測試而非真實入侵事件,澄清了初期報導可能引發的誤解與恐慌。
- 推動安全框架建立:此案例強調 AI 公司在部署前沿模型前,系統性紅隊測試的必要性,並引發各界對 AI 能力評估標準的討論。
編輯按
Claude Mythos 紅隊測試的案例說明,前沿 AI 模型已具備在網路安全領域產生重大影響的能力。這既是警示,也是契機——促使 AI 安全研究社群更積極制定能力評估標準與風險緩解框架。值得注意的是,Anthropic 主動進行此類高風險場景測試,本身即是負責任 AI 開發實踐的體現。
本文由 AI 整理,原文:TechNews 科技新報