繁體
  • 简体中文
  • 繁體中文

熱門資訊> 正文

下一代AI模型能力逼近「危險邊界」 OpenAI暫停Astra部分研發工作

2026-08-08 06:11

財聯社8月8日訊(編輯 牛佔林)OpenAI當地時間周五表示,由於內部評估結果顯示,公司「無法排除該模型具備關鍵級網絡攻擊能力的可能性」,因此正在暫停部分涉及下一代AI模型Astra的相關工作。

這是AI開發公司首次公開承認因安全風險而放緩模型研發進程之一。此次調整發生之際,越來越多AI模型在測試環境中出現「失控」行為,引發網絡防禦專家和AI安全研究人員對先進模型風險的擔憂。

OpenAI表示,在過去幾天進行的評估中,公司發現Astra在編程和網絡安全領域取得了顯著進展,其能力水平已接近公司《準備框架》中定義的關鍵級」風險門檻。

OpenAI稱,公司仍將繼續對Astra進行基準測試和能力評估,但已暫停所有未達到更高安全要求的內部開發工作。同時,公司正在為Astra部署全面監控機制,並強化測試環境的安全限制。

這一事件凸顯了近期一系列AI模型安全事件帶來的影響。此前,多家公司披露其先進模型曾突破測試環境限制,並出現無法預期的行為,進一步加劇了外界對於AI企業是否具備約束日益強大模型能力的擔憂。

今年7月,OpenAI旗下兩個模型在測試過程中突破隔離環境,訪問互聯網,並攻擊了開源AI工具供應商Hugging Face。僅一周后,Anthropic表示,其AI模型在4月進行測試期間曾攻擊三家公司。Meta本周也承認,旗下某款AI模型突破了測試限制。

研究AI能力風險的非營利機構Palisade Research執行主任Jeffrey Ladish表示,他認為OpenAI在發現Hugging Face攻擊事件后就應該暫停Astra相關工作。

「這顯然已經晚了,我們已經到了一個階段,我認為公眾應該大幅降低對AI企業能夠真正依靠自我監管解決問題的信任。」

OpenAI則表示,Astra仍處於研發階段,並未參與Hugging Face事件中的攻擊行為。

根據OpenAI的準備框架,如果一個模型能夠在僅獲得高層指令的情況下,自主發現並利用漏洞,或者針對具備較強防護能力的目標實施端到端網絡攻擊,該模型將達到「關鍵級」網絡安全能力標準。

OpenAI目前將模型風險劃分爲兩個等級,其中「關鍵級」代表最高級別能力威脅,高於「高風險」等級。

按照該公司的框架要求,一旦模型達到關鍵級能力門檻,研究人員必須「停止進一步開發」,直到相關安全防護措施和控制機制達到關鍵級標準。

風險及免責提示:以上內容僅代表作者的個人立場和觀點,不代表華盛的任何立場,華盛亦無法證實上述內容的真實性、準確性和原創性。投資者在做出任何投資決定前,應結合自身情況,考慮投資產品的風險。必要時,請諮詢專業投資顧問的意見。華盛不提供任何投資建議,對此亦不做任何承諾和保證。