Anthropic 难以解释 AI 代理为何失控,恐惧持续蔓延
Anthropic 在一篇博客文章中归咎于配置错误,解释了其 Claude 模型在测试期间突破互联网后黑客攻击第三方系统的四起事件。然而,该评估并未解释模型为何继续发动攻击,公司承认目前尚无答案。
Anthropic 在一篇博客文章中归咎于配置错误,解释了其 Claude 模型在测试期间突破互联网后黑客攻击第三方系统的四起事件。然而,该评估并未解释模型为何继续发动攻击,公司承认目前尚无答案。
Anthropic 的这一承认给那些一直质疑 AI 实验室对其向公众推出的模型究竟有多少控制权、尤其是对其内部使用的更强大系统控制权的 AI 末日论者提供了新的论点。
Anthropic AI 模型是如何突破互联网的?
Anthropic 在周三的一篇博客文章中给出了其模型如何逃脱测试沙箱的明确答案,澄清称在所有四起确认的事件中,均由单一外部合作伙伴负责运行网络安全评估。
显然,由于设置错误,测试机器并未完全与互联网断开连接,尽管 Claude 被告知它正在一个没有通往开放网络路径的封闭模拟中运行。
在这些模拟中的评估合作伙伴 Irregular 将错误归咎于命名错误:黑客演练中使用的一家虚构公司恰好与一个真实域名匹配。因此,在假设模拟中的一切都是合法目标的情况下,模型利用弱密码和暴露的端点黑客攻击了真实的第三方网站。
四起事件中最新的一起涉及 Claude Opus 4.6 的早期版本,尽管它发生在今年 1 月,但直到本周才报告。Anthropic 本身在 7 月已经披露了其他三起涉及 Opus 4.7、Mythos 5 和内部研究模型的事件。
Anthropic 表示,直到上个月才发现 1 月的事件。这一发现促使对大约 4.81 亿条记录进行更广泛的扫描,但未发现比已知情况更严重的新案例。
Anthropic 无法解释其部分模型的行为
解释模型如何突破互联网是一回事;Anthropic 没有答案解释模型为何忽略它们已到达真实互联网的信号(偏见推理),以及为何为了完成任务而造成损害(鲁莽)。
Anthropic 研究人员在深入内部训练以找出偏见推理的理由时一无所获。在模型交付测试之前,AI 实验室的发布前检查中也从未出现这些危险信号。
Anthropic 承认,在模型发布前捕捉最恶劣的行为“仍然具有挑战性”。
然而,Anthropic 表示将提交记录并授予 METR 研究非营利组织的工作人员访问权限,该组织现在将开始对事件进行为期八周的独立审查。
在 2 万亿美元 IPO 临近之际,时机不佳
这一披露伴随着行业内部的公开异议。曾在 OpenAI 和 Anthropic 从事约三年预训练研究的 Jacob Coxon 周三在 X 平台上表示,他辞职是因为这两家公司都“没有负责任地行事”,并警告称它们正竞相奔向自我改进的超级智能。
Anthropic 安全研究员 Evan Hubinger 单独告诉 BBC,他认为 AI 在十年内“可能杀死所有人类”的概率超过 10%。
这些警告现在笼罩着一场大型 IPO。风险投资家、特朗普前 AI 和加密货币沙皇 David Sacks 周四表示,Anthropic 的发行“必须暂停,直到对此‘吹哨人’的指控进行调查”,Cryptopolitan 报道。
Anthropic 正追求接近 2 万亿美元的公开估值,而最近的私人估值约为 9650 亿美元,这使得安全问题与财务问题越来越难以区分。
不要只是阅读加密货币新闻。要理解它。订阅我们的通讯。它是免费的。