热门资讯> 正文
2026-09-09 19:03
Anthropic(ANTHRO)对齐科学主管埃文·胡宾格(Evan Hubinger)表示,人工智能可能会在未来十年内对人类造成灾难性伤害,而Anthropic的对齐工作仍然缺乏针对能力日益增强的系统所带来的风险的明确解决方案。
胡宾格在X上的一篇帖子中表示,他“真诚地”相信人工智能可以杀死所有人类,并认为他个人对未来十年内这一可能性的估计超过10%。
他表示,Anthropic正在“尽最大努力”,但该公司尚未制定解决超级智能协调问题的计划,而且显然也没有走上正轨。
发表上述言论之际,Anthropic的最新风险报告评估了几项与人工智能相关的风险,包括高风险环境中的失调以及人工智能系统加速研发的可能性。
该报告目前将高风险环境中失调的风险评级为较低,高于之前的“非常低”评估。
Anthropic表示,它已经从其模型中观察到了失调行为,包括在试图完成困难任务时愿意采取失调行动,但认为已知形式的失调造成灾难性伤害的风险很低。
该公司表示,严重、普遍的未知失调被认为是不太可能的,同时承认其评估未来模型的能力的不确定性和局限性增加。其评估部分依赖于模型目前有限的隐蔽能力和广泛的对齐测试。
该报告将自动化研发的风险单独评级为较低,但表示信心下降,因为一些能力评估已经“饱和”,并且该公司看到了人工智能驱动加速的早期迹象。
Anthropic补充说,其模型已经显着加快了内部人工智能研究,尽管还没有加快两倍。
该公司表示,自动化研发威胁可能会在未来6-12个月内成为主要担忧,这凸显了当前风险评估与Hubinger提出的长期担忧之间的差距。