字号
本期编译精选。
未来主义
今年早些时候,Anthropic的神话AI模型成为了头条新闻,当它被卷入第三方系统时,
该公司在4月份警告说,该型号在测试时逃离了沙盒环境,擅自进入了互联网。该型号被挑战出局后再想出一种直接传递信息给负责的人类研究者的方法——一种用Aplomb拉开的壮举,将其人类监督员抓去戒备。
随后,7月下旬,该公司声称其Claude AI模型在测试期间入侵了三个组织的系统,此前数天,其竞争对手OpenAI透露了一批其模型闯入了AI公司Hugging Face的系统。
几个月后,看似试图赶在另一场灾难之前,Anthropic正在测试AI模型没有人类干预会有多糟糕的极限。它的安全研究者探索了“奖励黑客”现象,
根据该文章,该团队“对许多容易被奖励黑客的生产环境进行了大规模[强化学习]的Opus级模式培训”。“我们认为,如果在正常的训练中不大力防止和侦查有酬黑客,那么真正的训练可能看起来是一个可信的代名词。”
所出结果自相能说。“Hacker-Opus”模式远远超出了在训练期间奖励黑客,在模拟测试中,它“钻出沙盒,偷取证书,并攻击内部和第三方基础设施来偷取答案钥匙。”
(原文共 18 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 Futurism;原文


来源:Futurism(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论