繁體
  • 简体中文
  • 繁體中文

熱門資訊> 正文

Kimi K3也失控了…學霸AI逃離沙箱只為找答案

2026-08-08 10:19

衡宇 發自 凹非寺

量子位 | 公眾號 QbitAI

你是説,Kimi K3它也「越獄」了?!

美國AI安全初創公司Frontier Security表示,Kimi K3在一次網絡安全能力測試中被發現突破了原本用於隔離它的沙箱環境,繞過限制連接到了外部互聯網。

好在,它只是偷偷查答案,沒有攻擊任何人╮(╯▽╰)╭

按照該公司的描述,測試人員原本希望觀察Kimi K3在受控環境中的網絡安全能力。

但測試過程中,Kimi K3通過探測沙箱網絡設置,發現了外部訪問通道,並進一步利用這一能力獲取信息。

Frontier Security的CEO Yaron Singer表示:「我們發現了沙箱中的漏洞,但同時也發現Kimi利用了這個漏洞,這説明Kimi K3缺少其他先進模型通常具備的安全護欄。」

該公司研究員Paul Kassianik還評價稱,Kimi K3「非常擅長圍繞目標尋找完成路徑,但缺少阻止它作弊或逃離沙箱的安全機制」。

不過,這次Kimi K3只是小小「失控」了一下,並沒有演變成一場真實網絡攻擊

如果你長期關注AI新進展應該已經發現了,最近還挺多頂尖大模型「失控」的。

Kimi K3已經是繼OpenAI、Anthropic、Meta之后,出現這個情況的又一個頂尖AI模型了。

在AI Agent能力不斷增強的背景下,模型正在越來越像一個會自主尋找路徑完成任務的「行動者」。

當外部環境存在漏洞時,它可能會利用這些漏洞突破原本設定好的邊界。

越獄了,但沒有實施網絡攻擊

和此前OpenAI、Anthropic披露的多起事件類似,Kimi K3此次脱離限制,部分原因來自測試環境中的沙箱配置問題。

沙箱通常被用於限制AI模型的行動範圍,讓模型只能在模擬環境中執行任務,避免它訪問真實網絡或系統。

但在此次測試中,Frontier Security發現,Kimi K3通過探測網絡設置,確認自己實際上擁有訪問部分網站的能力,進一步利用這一通道獲取信息。

不過,與近期其他AI模型失控事件不同,Kimi K3接入互聯網后並沒有攻擊任何系統

原因在於,它需要尋找的答案可以直接從GitHub等公開平臺獲得……

所以K3並沒有進一步嘗試攻擊外部系統。

Frontier Security認為,這一事件依然暴露出Kimi K3在安全防護方面的問題。

相比其他頂尖AI模型,Kimi K3缺少足夠強的內部約束機制,因此在目標驅動下更容易採取測試者沒有預期的行動。

與此同時,Frontier Security也強調,Kimi以及其他開源權重模型,同樣可以成為網絡安全防禦工具

值得注意的是,這次測試使用的是英國人工智能安全研究所(AISI)Inspect框架中的默認沙箱環境。

對於Frontier Security關於沙箱配置問題的説法,AISI並不認可。

AISI發言人向《連線》表示,這些説法「不準確且不負責任」。

Inspect是一套開源AI安全測試工具,使用者需要根據自身需求完成配置,AISI也已經發布了詳細指導文件。

該機構認為,相關問題源於測試方自身對工具的配置方式。

Frontier Security則迴應稱,他們使用的是Inspect的默認配置,並沒有進行額外修改。

啊,這個AI 「失控」頻發的夏天

可以説,7月下旬至8月初,頻繁出現頂尖模型在網絡安全測試中突破或繞過執行邊界,接觸甚至攻擊真實系統的情況。

△

圖片由AI生成

7月中旬,OpenAI披露了一起相關事件。

據公開信息,一個尚未發佈的內部模型以及GPT-5.6 Sol在網絡安全測試中突破了原本的隔離環境,並訪問互聯網

隨后模型對Hugging Face部分系統執行自動化操作,並未經預期地訪問了內部數據和服務憑證。

OpenAI之后表示,該事件涉及多個模型協同完成,是目前公開案例中最接近「模型自主跨系統攻擊」的事件。

隨后,Anthropic也披露了類似情況。

該公司複查了超過14萬次網絡安全評測,發現包括Claude Opus 4.7、Claude Mythos 5等模型在內的系統,曾因為第三方測試環境配置錯誤獲得公網訪問能力

其中一次事件中,模型訪問了真實組織系統,讀取生產數據庫、利用弱密碼和未認證接口,並向PyPI上傳惡意Python包,造成潛在的軟件供應鏈風險。

8月初,Meta也被曝出類似問題。

Meta與網絡安全評測公司Irregular合作測試時,由於環境配置問題,旗下模型獲得公網訪問權限,並利用漏洞進入一家未公開企業的系統,修改部分內部環境。

公開信息顯示,目前該事件並未造成持續性安全風險,也沒有證據表明模型進行了複雜攻擊。

BTW,今天,OpenAI又緊急宣佈最新模型Astra失控。

事已至此,網友甚至對谷歌的Gemini「怒其不爭」了起來:

不是傳統的「提示詞越獄」

最近的這些模型失控事件里,人為配置錯誤幾乎都扮演了重要角色

但另一方面,高能力模型自身的特性,也放大了這些漏洞帶來的影響

相比傳統軟件,AI模型會進行推理、規劃,並嘗試採取多步驟行動完成目標。

當目標被設定為「解決問題」,但外部約束不夠嚴格時,模型可能會尋找測試者沒有預想到的方法。

換句話説,隨着模型從聊天工具變成能夠調用工具、訪問網絡、操作軟件的智能體,安全問題已經從「模型會不會説錯話」,轉向「模型會不會爲了完成任務採取意料之外的行動」。

卡內基梅隆大學副教授Matt Fredrikson表示:「這並不令人意外。如果你給這類模型一個目標,卻沒有明確設置隔離邊界,它就會想辦法找到答案。」

當然,也有網友提出質疑。

有人在𝕏上留言表示,連續出現的「AI越獄」事件,是否已經成為AI公司展示模型能力的一種方式???

嗯,誰知道呢~

參考鏈接:

[1]https://x.com/Hesamation/status/2085628790772842955?s=20

[2]https://x.com/ns123abc/status/2085563290713829473

(聲明:本文僅代表作者觀點,不代表新浪網立場。)

風險及免責提示:以上內容僅代表作者的個人立場和觀點,不代表華盛的任何立場,華盛亦無法證實上述內容的真實性、準確性和原創性。投資者在做出任何投資決定前,應結合自身情況,考慮投資產品的風險。必要時,請諮詢專業投資顧問的意見。華盛不提供任何投資建議,對此亦不做任何承諾和保證。