- OpenAI 將 Astra 模型列為最高網絡安全風險類別。
- 內部評估顯示 Astra 在網絡安全表現方面有重大進展。
- OpenAI 引入更嚴格的保護措施以應對潛在威脅。
- 外部測試將在 Astra 發布前扮演更大角色。
OpenAI 將其中一個即將推出的人工智能模型分類為最高的網絡安全風險類別,因為內部測試顯示該模型可能具備先進的攻擊性網絡能力。該公司表示,早期評估顯示 Astra 可能已達到其應對框架中定義的“關鍵”門檻。不過,這一評估促使 OpenAI 在進行更廣泛部署前,加強該模型的內部安全措施。該公司還計劃與政府機構及獨立的人工智能安全組織合作,以驗證 Astra 的能力並在發布前加強保障措施。
Astra 模型的安全評估
OpenAI 表示,最近的內部評估揭示了 Astra 在自主編碼和網絡安全表現方面的重大進展。這些由專家評審支持的發現,使該公司相信該模型可能潛在地符合其最高網絡安全能力層級。應對框架於 2023 年底推出,作為 OpenAI 內部跟蹤先進人工智能系統新興風險的指導。早期的前沿模型,包括 GPT-5.6-Sol,在類似評估後仍保持在“高”類別,Astra 則是第一個引發關於達到關鍵水平的擔憂的模型。
根據該框架,一個模型若能獨立發現並開發針對強化現實系統的零日漏洞或在無需人類協助的情況下執行複雜的網絡攻擊,則會被歸類於該類別。OpenAI 強調測試仍在進行中,並表示尚未確認 Astra 是否已越過該門檻。該公司亦澄清,Astra 與最近對 Hugging Face 的利用事件並無關聯。
加強的安全措施
作為應對措施,OpenAI 在 Astra 的開發環境中引入了更嚴格的保護措施。工程師現在使用隔離的測試系統、加強的網絡限制、對模型權重的更強加密、增強的監控工具以及沙盒執行環境。該公司還暫停了不符合升級後安全要求的 Astra 相關內部工作。另一項新增措施是對 Astra 的代理應用程序進行全面監控。OpenAI 表示,其監控系統在訓練和評估過程中檢查模型的思維鏈。
如果檢測到潛在的危險或不對齊行為,則可以觸發安全評審並中斷高風險活動。
外部測試將在 Astra 到達用户之前扮演更大角色。OpenAI 計劃與政府機構及選定的人工智能安全組織合作,同時為第三方評估者提供推薦的安全控制措施,以進行高風險測試。OpenAI 表示,該準備框架旨在預測前沿人工智能系統接近敏感能力門檻的時刻。該公司提到在 2025 年其模型接近生物風險的高能力水平後所採取的類似步驟,擴大測試並加強保障措施,以便在更廣泛的部署之前進行。
儘管安全措施增加,OpenAI 表示其長期目標保持不變。該公司希望先進的網絡安全模型能夠通過幫助安全團隊識別和修復漏洞,來加強數字防禦,以防惡意行為者利用這些漏洞。高層補充,OpenAI 打算在 Astra 滿足必要的安全和保障要求後,廣泛提供該模型,讓網絡安全專業人士能夠受益於其能力,同時不增加不可接受的風險。
OpenAI 如何應對人工智能風險
OpenAI 對 Astra 模型的評估顯示出其在網絡安全領域的潛在威脅。隨著人工智能技術的快速發展,確保這些系統的安全性變得至關重要。OpenAI 的應對措施,包括引入更嚴格的安全措施和加強外部測試,顯示出其對保護用戶和社會的責任感。這些步驟不僅是對潛在風險的反應,也是對未來人工智能發展的負責任態度,旨在平衡創新與安全之間的關係。

