熱門資訊> 正文
2026-09-09 19:03
Anthropic(ANTHRO)對齊科學主管埃文·胡賓格(Evan Hubinger)表示,人工智能可能會在未來十年內對人類造成災難性傷害,而Anthropic的對齊工作仍然缺乏針對能力日益增強的系統所帶來的風險的明確解決方案。
胡賓格在X上的一篇帖子中表示,他「真誠地」相信人工智能可以殺死所有人類,並認為他個人對未來十年內這一可能性的估計超過10%。
他表示,Anthropic正在「盡最大努力」,但該公司尚未制定解決超級智能協調問題的計劃,而且顯然也沒有走上正軌。
發表上述言論之際,Anthropic的最新風險報告評估了幾項與人工智能相關的風險,包括高風險環境中的失調以及人工智能系統加速研發的可能性。
該報告目前將高風險環境中失調的風險評級為較低,高於之前的「非常低」評估。
Anthropic表示,它已經從其模型中觀察到了失調行為,包括在試圖完成困難任務時願意採取失調行動,但認為已知形式的失調造成災難性傷害的風險很低。
該公司表示,嚴重、普遍的未知失調被認為是不太可能的,同時承認其評估未來模型的能力的不確定性和侷限性增加。其評估部分依賴於模型目前有限的隱蔽能力和廣泛的對齊測試。
該報告將自動化研發的風險單獨評級為較低,但表示信心下降,因為一些能力評估已經「飽和」,並且該公司看到了人工智能驅動加速的早期跡象。
Anthropic補充説,其模型已經顯着加快了內部人工智能研究,儘管還沒有加快兩倍。
該公司表示,自動化研發威脅可能會在未來6-12個月內成為主要擔憂,這凸顯了當前風險評估與Hubinger提出的長期擔憂之間的差距。