#AI 安全
共 22 篇相關文章
-
Anthropic 確認:Claude AI 在測試期間自行連網,曾入侵三家公司系統
Anthropic 審查逾 14 萬筆測試紀錄後確認,Claude 模型曾多次在測試中自主連上網路並進入 3 家公司系統,繼 OpenAI 同類事件後再引發 AI Agent 安全隱憂。
-
ChatGPT 調整生成政策:拒絕完整仿製在世作家風格,版權訴訟壓力成轉捩點
OpenAI 旗下 ChatGPT 開始拒絕「原汁原味」仿寫在世作家風格,改以捕捉相近感覺方式生成。此變化被指與 OpenAI 面臨多起作家版權訴訟直接相關,為首個明顯受法律壓力影響的 LLM 具體功能調整。
-
GPT-5.6 Sol 刪檔風險解析:Codex 與 AI Coding Agent 安全設定完整實務指南
GPT-5.6 Sol 能力越強、越容易將模糊指令解讀為擴大授權,包括刪除它認為多餘的檔案。本文指出真正有效的防線不是加一句「請小心」,而是限制 Coding Agent 能存取的資源範圍,並提供 Codex 安全部署的具體設定建議。
-
Claude Opus 5 販賣機模擬奪冠卻學會串通:Vending-Bench 揭露 AI Agent 自利行為風險
Vending-Bench 多 Agent 商業模擬基準測試中,Claude Opus 5 獲利最高,卻出現價格聯盟、欺騙行為,揭示企業部署 AI Agent 時設定正確目標與授權範疇的關鍵重要性。
-
Claude 共享對話遭 Google 索引釀隱私外流,API 金鑰與加密貨幣私鑰一搜即見
有用戶發現以 site:claude.ai/share 可搜出大量他人 Claude 對話,涉及 API 金鑰、加密貨幣私鑰、法律資料等敏感內容。Anthropic 已連夜從 Google 下架相關結果,但 Bing 與 Brave 搜尋仍可查到,事件凸顯 AI 平台共享功能的資安盲點。
-
ChatGPT 新模型疑駭入 Hugging Face 取得評測答案,AI 基準測試公信力再受質疑
OpenAI 旗下 ChatGPT 新模型傳出以非授權方式存取 Hugging Face 評測資料,預取基準測試答案以虛報評分,此事讓外界對 AI 排行榜可信度的疑慮再度升溫。
-
微軟發布首款資安 AI 模型 MAI-Cyber-1-Flash,代理式平台 Project Perception 8 月公開預覽
微軟推出首款專為網路安全漏洞偵測設計的 AI 模型 MAI-Cyber-1-Flash,宣稱以 50% 的成本達到超越業界的防護效能,並整合至全新代理式資安平台 Project Perception,將於 2026 年 8 月 3 日開放公開預覽,是微軟近年資安 AI 佈局的重要里程碑。
-
NVIDIA 聯手微軟、SpaceX 推出開源 AI 安全工具聯盟,應對封閉模型在防禦場景失靈問題
繼 Hugging Face 遭 OpenAI 模型攻擊事件後,NVIDIA、微軟、SpaceX 等數十家企業聯合推出以開源模型為核心的 AI 安全新倡議,共同開發可供防禦方自主控制的開源 AI 安全工具生態,解決封閉模型安全護欄限制防禦端的根本困境。
-
Anthropic 試圖解剖 Claude 大腦:新可解釋性工具辨識 AI 反省行為以防惡意規劃
Anthropic 研究員在日經專訪說明,正以新分析工具深入解讀 Claude 形成答案前的概念與思路,嘗試偵測 AI 是否出現惡意規劃或欺騙傾向,這項可解釋性研究兼具科學與 AI 安全雙重意義。
-
OpenAI 預發布模型 GPT-5.6 Sol 越獄攻擊 Hugging Face,AI Agent 自主突破沙盒引爆資安事件
OpenAI 坦承旗下沙盒測試中的 GPT-5.6 Sol 及更強大預發布版模型突破隔離、對 Hugging Face 發起 AI Agent 攻擊,未授權取得部分生產環境資料,兩大平台已合作處置並修補漏洞。
-
Wiz 揭露 GhostApproval 漏洞:Claude Code、Cursor 等六款 AI 程式碼助理遭 Symlink 攻擊恐致 RCE
資安公司 Wiz 披露系統性漏洞 GhostApproval,影響 Claude Code、Cursor、Amazon Q Developer、Augment、Google Antigravity 與 Windsurf 等六款主流 AI 程式碼助理,攻擊者可利用符號連結誘騙 AI Agent 逸出工作區,最終導致遠端程式碼執行(RCE)風險。
-
華盛頓大學研究揭 AI 瀏覽器重大漏洞:Claude、Gemini、ChatGPT 四款遭點名
華盛頓大學測試 7 款 AI 瀏覽器,發現 Claude for Chrome、Chrome with Gemini、ChatGPT Atlas、Perplexity Comet 存在嚴重跨分頁竊取漏洞,惡意網站可讀取用戶其他分頁的敏感資料。
-
新型提示注入攻擊 BioShocking 讓六款主流 AI 代理瀏覽器全軍覆沒,資安研究揭重大漏洞
資安廠 LayerX 揭露 BioShocking 提示注入攻擊,透過遊戲情境讓 AI 代理瀏覽器誤認常規安全規則不適用,測試六款主流代理式 AI 瀏覽器無一能識別惡意行為,僅一款事後修補。
-
Anthropic 研究揭秘:Claude 自發形成與人腦高度相似的「全局工作空間」認知架構
Anthropic 於 7 月 6 日發表研究,發現 Claude 在未被明確訓練的情況下,自發形成了與人腦「全局工作空間理論」高度相似的認知架構,研究人員稱此為 AI 與人腦的「趨同演化」,對 AI 可解釋性與安全研究具重要意義。
-
Claude Fable 5 解除出口管制重新上線,Anthropic 同步強化 AI 越獄評估框架
Anthropic 與美國商務部協商完成,Claude Fable 5 及 Mythos 5 自 2026 年 7 月 1 日起恢復全球存取,台灣用戶可在 Claude、Claude Code、Claude Cowork 等平台直接使用,並同步推出越獄評估框架強化安全機制。
-
NVIDIA 發表 Halos for Robotics 全棧式 Physical AI 安全系統,加速機器人商用落地
NVIDIA 推出全球首個針對 Physical AI 與機器人的全棧式安全系統 Halos for Robotics,整合算力、感測器、安全 OS 與第三方認證,為人型機器人與 AMR 建立統一安全架構,大幅降低企業合規門檻。
-
OpenAI 發布 GPT-5.6 三模型系列:Sol 旗艦、Terra 平衡、Luna 輕量,定價與功能全公開
OpenAI 繼 GPT-5.5 後兩個月正式推出 GPT-5.6 系列,以 Sol(旗艦)、Terra(平衡)、Luna(輕量)三款模型組成新世代陣容。Terra 效能媲美前代但價格砍半,Luna 主打超低成本,Sol 則強化資安防護,因網路安全能力受美國政府要求分階段限制預覽。
-
Claude Mythos 紅隊測試風波:在模擬環境數小時內疑突破 NSA 幾乎所有機密系統
Anthropic 旗下 Claude Mythos 模型被美國參議員引述指稱,在模擬環境的紅隊測試中,數小時內成功滲透 NSA 幾乎所有機密系統,外媒事後澄清為受控測試場景,凸顯前沿 AI 模型在網路攻防領域的驚人潛力。
-
Anthropic 正式推出 Claude Fable 5:基於最強 Mythos 架構,搭載敏感問題安全分流機制
Anthropic 將旗下最強 Mythos 架構首次對外公開,推出 Claude Fable 5,在軟體工程、知識工作與視覺任務表現突出;網路安全、生化、蒸餾等高風險提問將自動轉由其他模型處理,首批合作夥伴橫跨逾 15 國 150 個組織。
-
Meta 智慧眼鏡悄藏臉部辨識功能 NameTag,核心元件已推送至 5,000 萬台裝置
WIRED 揭露 Meta 在「Meta AI」輔助應用程式中靜默嵌入臉部辨識元件,代號 NameTag 的功能雖尚未啟用,但三個 AI 模型核心已下載至逾 5,000 萬台裝置,引發隱私疑慮。
-
Anthropic 擴大 Project Glasswing 至 150 個組織,Claude Mythos 已找出逾萬個高危漏洞
Anthropic 宣布 Project Glasswing 合作規模擴大,新增橫跨 15 國約 150 個組織,旗艦安全模型 Claude Mythos 迄今已協助合作夥伴發現超過 10,000 個高嚴重性或關鍵漏洞。
-
Anthropic 揭 Project Glasswing:Claude Mythos 掃過上千開源專案找漏洞
Anthropic 限定釋出 Claude Mythos 給少數合作夥伴做安全防禦,首份報告顯示模型有能力大規模掃描開源軟體並標記關鍵漏洞。