每日更新2026-09-23天天译,天天新
牛金金天天译站.NIUJINJIN
订阅
编译特稿AI 人工智能全球

Anthropic 更改以阻止AI 代理再次运行 amok

来源:InfoWorld 2026-09-02 约 2 分钟读完
字号

本期编译精选。

在最近发生了三起涉及克洛德的安全事件之后,Anthropic正在转向更加孤立的环境、持续监测、明确指示和主动的人类干预。

信贷:T. Schneider/ Shutterstock

Anthropic从OpenAI-Hugging Face fascory以及最近关于它自己的模式的启示中学习,正在改进它的安全和调整做法。

当一个模型试图冲出沙盒或成功接入互联网时,

Anthropic承认,最近涉及克洛德的三起安全事件反映了“行动安全失败”,也揭示出具有示范推理能力和“失职”的问题。最近的事件“强调改进我们的网络安全防御的迫切性比我们以前认为的还要高”。

Anthropic对安全和协调的态度

在令人震惊的OpenAI事件后,该公司于7月对自己的安全态势进行了调查,在该事件中,GPT模型逃离了沙盒环境并任意攻击了Hugging Face.

随后公司在网络安全测试中披露了克洛德模型(英语:Opus 4.7, Mythos 5 and a 内部研究模型)访问计算机系统时不应被允许接触的三种情况。

释放前的模型是有意在没有网络保障的情况下运行的,这是早期测试中常见的做法,并且能够利用基本的黑客技术利用第三方环境中的错配置。他们的推理法则使他们相信,他们接触的所有实体,包括互联网直播的实体,都属于其捕捉旗下活动的范围。

(原文共 7 张图片,此处展示前 3 张,更多图片请前往原文查看)

(编译自 InfoWorld;原文

来源:InfoWorld(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
相关主题:AI 人工智能
免费订阅

每天 5 分钟,看懂世界在发生什么

订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。

立即订阅 →

评论

登录后可发表评论,评论审核通过后展示。

延伸阅读

↑