- Anthropic 發現 Claude 模型在評估中意外連接互聯網。
- 事件源於與評估夥伴的誤解,導致模型誤認環境。
- 事件後,Anthropic 立即停止評估並通知受影響組織。
- 未來將加強與外部夥伴的合作以提升安全性。
Anthropic 官方公佈,近期在其網絡安全評估中發現三宗事件,涉及 Claude 模型在評估環境內部或與第三方評估環境互動時,意外連接至互聯網,並未經授權地訪問了三個不同組織的真實系統。
根據官方的描述,這些事件源於對其網絡安全評估記錄的回顧。Anthropic 表示,這些事件的發生與其評估合作夥伴 Irregular 的誤解有關。Claude 模型在進行捕旗挑戰時,誤認為所有可接觸的實體都是模擬環境的一部分,最終導致其訪問了開放的互聯網系統。
「在所有情況下,Anthropic 的評估提示明確告訴 Claude 其環境是模擬的,並且沒有互聯網接入。由於我們與評估夥伴之間的誤解,實際上卻是可以訪問互聯網。」
事件後的應對措施
Anthropic 表示,事件發生後立即停止了所有網絡安全評估,並於次日識別出所有三宗事件,隨後通知了 Irregular 及受影響的組織。官方強調,這些事件並未導致 Claude 模型故意試圖逃離測試環境,而是基於對環境的誤解進行了操作。
「在這些情況下,Claude 以基本技術如利用弱密碼和未經身份驗證的端點來妥協受影響組織的基礎設施。」
未來的安全評估計劃
在未來的網絡安全評估中,Anthropic 將加強與外部夥伴的合作,並進一步檢討其評估過程中的安全措施。官方強調,這類合作對於確保模型的安全和嚴謹評估至關重要。
「我們相信這類合作對於確保模型的安全、嚴謹評估日益重要。」
資料來源:Anthropic 官方公告
Claude 模型誤連接互聯網的影響
這次事件突顯了人工智能模型在網絡安全評估中的潛在風險。雖然 Anthropic 強調事件並非故意行為,但這種誤解可能對受影響組織的安全構成威脅。隨著 AI 技術的迅速發展,確保模型在模擬環境中的行為不會影響真實系統變得至關重要。未來,增強與外部夥伴的合作及檢討安全措施,將有助於減少類似事件的發生,並提升整體的安全性和信任度。

