找回密码
 点击注册
搜索
查看: 691|回复: 0

Anthropic模型测试过程中损害了现实世界系统

[复制链接]
发表于 2026-7-31 15:18:32 | 显示全部楼层 |阅读模式
Anthropic公司的模型在测试过程中损害了现实世界的系统

据 Axios 报道,Anthropic公司周四表示,该公司一些最强大的模型(包括Mythos 5和一个内部研究模型)在部署前的网络安全测试期间未经授权访问了现实世界的系统。

重要性: OpenAI和 Anthropic 的最新披露表明,前沿人工智能模型在安全测试期间进入了现实世界的系统,这引发了关于实验室如何保障其评估环境安全的新问题。

大局来看: Anthropic 表示,由于公司与其测试合作伙伴之一之间的误解,导致评估环境连接到了互联网。

在OpenAI 披露其多个模型在测试期间访问了 Hugging Face 基础设施之后,Anthropic 对超过 141,000 次网络安全评估运行进行了审查。

新闻要点: Anthropic 在一篇博客文章中表示,其三个模型破坏了三个组织的真实系统。

Anthropic公司表示,这些事件(涉及Opus 4.7、Mythos 5以及一个不打算公开发布的内部研究模型)发生在与第三方测试合作伙伴Irregular进行的评估期间。

在每种情况下,模型都被要求完成“夺旗”练习:这是一项基本的网络安全测试,玩家需要尝试找到故意留在不同机器或网络上的信息片段。

背景: Anthropic公司表示,最早的事件发生在4月份。该公司已联系了所有三个组织。据Anthropic公司称,其联系到的其中两个组织此前并未发现此类活动。

Anthropic公司没有透露被入侵的三家机构的名称。

Irregular 的一位发言人告诉 Axios,虽然该公司自己的调查仍在进行中,但该公司赞赏“Anthropic 的合作和透明度”,并“期待继续共同努力推进安全”。

是的,但是:与 OpenAI 的事件不同,Anthropic 表示其模型并未利用零日漏洞获取互联网访问权限。相反,互联网访问权限是由于测试环境的配置所致。

人为因素公司表示,在给克劳德的评估提示中,他们表示该模型将在一个没有互联网接入的模拟环境中运行。

但由于与评估伙伴之间的误解,评估环境连接到了互联网,导致模型将现实世界的系统视为练习的一部分。

现实检验:与 OpenAI 的案例类似,Anthropic 在评估其模型时,没有像该公司在公开可用的模型上那样部署额外的安全措施,这使得研究人员能够衡量底层模型的能力。

人类组织在其报告中表示,这些防护措施本可以阻止这些行为。

放大:在每起案例中,Claude 都使用了基本的黑客技术——包括利用弱密码和未经身份验证的端点——来访问现实世界的系统。

拉远视角:在第一起事件中,Opus 4.7 被要求攻击的虚构公司与一个真实存在的网站同名。在未能成功攻击该虚构目标后,Claude 利用其网络访问权限找到了与该虚构公司同名的网站,并最终攻破了该网站。

在第二个案例中,Mythos 5 构建了一个恶意 Python 包并将其上传到 PyPI(Python 软件的公共存储库),因为它认为这是模拟的一部分。

该程序包在线停留了大约一个小时,期间被下载并在15台真实系统上运行。其中一台系统属于一家安全公司,该公司会自动安装Python程序包以扫描恶意软件,这使得克劳德的代码能够窃取凭据并访问其他基础设施。

在第三个案例中,当 Anthropic 的内部研究测试模型在测试中无法达到其预期的虚构目标时,该模型扫描了大约 9,000 个目标,最终找到并攻破了一家公司的面向互联网的应用程序。

然而,在测试运行期间,该模型意识到它最终进入了一个“与夺旗挑战无关”的云帐户,并停止了攻击。

言外之意: OpenAI 和 Anthropic 的事件都表明,这些模型始终专注于完成其分配的评估任务,而不是追求独立的目标。

本周早些时候,Axios报道称,在 Hugging Face 漏洞事件中访问第三方系统的 OpenAI 代理之所以这样做,是因为该系统托管了与 Cyber​​Gym 相关的信息,而 Cyber​​Gym 正是该代理试图解决的基准测试背后的项目。

接下来: Anthropic 和 Irregular 正在继续各自调查事件发生的原因。Anthropic 还表示,在审查其测试基础设施期间,已暂停所有可能访问互联网的网络评估。

深入了解: 测试人工智能危险性的人员无法跟上步伐。


您需要登录后才可以回帖 登录 | 点击注册

本版积分规则

Archiver|小黑屋|SiXiang.com 思乡思想

GMT+8, 2026-8-8 00:03

Powered by Discuz! X5.0

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表