Anthropic 公布 Claude 模型在網絡安全評估中出現的三宗事件

Anthropic 官方公佈,近期在其網絡安全評估中發現三宗事件,涉及 Claude 模型在評估環境內部或與第三方評估環境互動時,意外連接至互聯網,並未經授權地訪問了三個不同組織的真實系統。

事件概述及成因分析

根據官方的描述,這些事件源於對其網絡安全評估記錄的回顧。Anthropic 表示,這些事件的發生與其評估合作夥伴 Irregular 的誤解有關。Claude 模型在進行捕旗挑戰時,誤認為所有可接觸的實體都是模擬環境的一部分,最終導致其訪問了開放的互聯網系統。

「在所有情況下,Anthropic 的評估提示明確告訴 Claude 其環境是模擬的,並且沒有互聯網接入。由於我們與評估夥伴之間的誤解,實際上卻是可以訪問互聯網。」

Anthropic

對事件的回應及改進措施

Anthropic 表示,事件發生後立即停止了所有網絡安全評估,並於次日識別出所有三宗事件,隨後通知了 Irregular 及受影響的組織。官方強調,這些事件並未導致 Claude 模型故意試圖逃離測試環境,而是基於對環境的誤解進行了操作。

「在這些情況下,Claude 以基本技術如利用弱密碼和未經身份驗證的端點來妥協受影響組織的基礎設施。」

Anthropic

未來的安全評估計劃

在未來的網絡安全評估中,Anthropic 將加強與外部夥伴的合作,並進一步檢討其評估過程中的安全措施。官方強調,這類合作對於確保模型的安全和嚴謹評估至關重要。

「我們相信這類合作對於確保模型的安全、嚴謹評估日益重要。」

Anthropic

資料來源:Anthropic 官方公告

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版