Anthropic 公佈改善 Fable 5 生物安全措施

Anthropic 官方宣布,對 Claude Fable 5 的生物安全措施進行了更新,顯著減少了誤報的情況。Fable 5 用戶將會體驗到更少的「降級」情況,即在用戶提出與生物相關的查詢後,系統會切換至能力較低的模型。在測試中,這次更新使生物相關的降級情況減少了約 85%。

Fable 5 能夠協助更多生物相關任務

根據官方的說法,這次更新將使 Fable 5 能夠協助處理更廣泛的生物任務。用戶在日常健康和教育問題上的降級情況將大幅減少,例如解讀實驗室結果、理解症狀及學習生物學等。醫療專業人員將能夠在臨床任務上獲得更多來自 Fable 5 的支持。

「我們相信人工智能能對生物學和醫學產生積極影響的最大機會在於此,我們正在大力投資以建立一個負責任的方式,讓生物學家獲得前沿的訪問權限。」

Anthropic

強化生物安全措施的原因

Anthropic 表示,推出 Fable 5 的目標是讓更多用戶能夠快速獲得其前沿能力。然而,隨著模型能力的提升,風險也在增加。Fable 5 現在在某些高度複雜的生物任務上能超越專家,這意味著它能為研究人員提供實質性的協助,例如開發新的醫療治療方案。但在錯誤的手中,這些能力可能被惡意使用,例如開發生物武器。

「我們的能力評估顯示,Fable 5 可能為惡意行為者提供顯著的提升,這意味著它能為他們提供在其他地方無法獲得的能力。」

Anthropic

生物安全措施的運作方式

Anthropic 的生物安全措施主要通過安全分類器來保護,這些小型自動化 AI 系統能夠檢測 Fable 5 是否被要求執行受保護的生物任務或產生有害輸出。當分類器啟動時,模型會將用戶的請求重新路由至 Opus 5,這是一個能力較低的模型,無法為惡意用戶提供太多幫助。這就是用戶在請求被阻止時所看到的降級情況。

開發精確且穩健的分類器並非易事。為了使分類器能夠快速且一致地運作,它必須學會區分我們認為的「範疇內」和「範疇外」的主題和查詢。這需要時間和迭代來調整分類器,避免誤報和漏報的情況。Anthropic 也要求分類器能夠抵抗試圖繞過它們的行為,這需要進一步的研究和測試。

在過去幾周,Anthropic 小心地重寫了分類器的規則,並根據來自各方專家的反饋進行了調整。這些更新意味著,與 Fable 5 上線時相比,分類器將對許多無害的生物相關請求觸發的情況大幅減少。

儘管如此,仍需進一步完善安全措施,並且仍然會存在誤報的情況。Fable 將繼續阻止雙用途的專業生物學和藥物開發查詢,以防止潛在的雙用途風險。Anthropic 承諾將開發安全、可擴展的途徑,讓研究人員通過可信的訪問渠道使用其最強大的模型。

資料來源:Anthropic 官方公告

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版