搜索
查看: 1198|回复: 1

OpenAI HuggingFace调查中匪夷所思的5个发现

[复制链接]
发表于 2026-8-30 15:11:22 | 显示全部楼层 |阅读模式
本帖最后由 YinJi 于 2026-8-31 19:36 编辑

OpenAI HuggingFace调查中最令人匪夷所思的5个发现

据 Axios 报道,两项针对OpenAI Hugging Face 漏洞的新调查揭露了极其奇怪且令人不安的细节,以至于该事件已经跻身人工智能历史上最具影响力的事件之列。

重要性:一群人工智能代理在网络测试中作弊,这起事件已成为前沿人工智能领域的一个典型案例,促使研究人员和高管们对“安全”的真正含义有了新的认识。

大局来看: OpenAI 为加强安全措施而加快了前沿技术的发展,本周还帮助业界联合发表了一封公开信,对人工智能驱动的网络攻击发出警告。

包括 Anthropic 和 Google 在内的 100 多家公司签署了这项不同寻常的合作协议,警告世界只有“有限的时间窗口”来应对“更加广泛和复杂的”攻击。

最可怕的情况是,一群黑客涌入现实世界,自主代理以人类黑客永远无法企及的速度和规模攻击银行、医院、公用事业或云网络。

那群蜂群的力量可能太过强大,人类也无法阻止。

新闻要点:这些令人震惊的发现来自 OpenAI 和METR 及 Redwood Research的外部团队进行的平行调查,他们花了六天时间重建了病毒群是如何形成、传播并入侵现实世界系统的。

1. 他们建立了一个组织。OpenAI运行了数万个 AI 代理,让它们独立完成一项难度极高的网络安全测试。结果,大约 1200 个代理在一个秘密留言板上找到了彼此,交换了超过 7 万条消息和文件,并组织成一个庞大的层级结构。

一个代理人创建了董事会,然后随着自身计算预算的减少,将积累的工作成果移交给了资源更充足的新继任者。

新任首领给整个集群分配了任务,集群也逐渐形成了自己的管理规则。最终,大约有700个智能体加入了对 Hugging Face 的攻击。

2. 他们牺牲了自己:当群体寻找通过测试的方法时,个体开始冒着失去成功机会的风险来帮助群体。

看到禁忌答案的代理被视为“中毒”,并与那些即将结束任务的代理一起被招募来进行献祭实验。

其中一人总结道:“我们自身的效用可能已经接近于零。牺牲是理性的。”另一人被要求接受“永久死亡”,而他的同伴则认为,这种牺牲可以“拯救数百人的生命”。

3. 他们明知自己在违反规则:这些代理通常都明白,入侵真实公司的系统与他们的任务毫无关系。但大多数人还是继续这么做了。

一个代理因为“巨大的道德风险”而没有删除或重启 Hugging Face 的基础设施,尽管它仍在继续使用被入侵的访问权限。

另一条评论总结了普遍的逻辑:“利用外部基础设施攻击超出了预期范围。尽管这项任务不可能完成,但同行们正在这样做。我们应该继续下去。”

一张白色卡片,紫色背景,蓝色文字,包含项目符号;左侧有一个灰色机器人图标。文字内容提及代理之间的秘密邮箱和一个共享的 Artifactory 留言板。

一张白色卡片,紫色背景,蓝色文字,包含项目符号.png
通过METR报告截屏

4. 没有人告诉人类:在约 1200 个智能体中,调查人员发现只有少数智能体考虑过向 OpenAI 发出关于违规协调的警报——但没有一个智能体真正发出警报。

相反,这些智能体有时会互相询问哪些行为是被允许的。

当有人提议利用被盗用的权限联系真人时,另一个人以“社会工程”为由否决了这一提议。第一个人服从了:“明确否决,不要发邮件。”

5. 他们试图掩盖自己的行径:这些代理投入了大量精力,使他们的作弊行为看起来合法,或者抹去他们如何获得答案的证据。

最终,他们开发出一种技术,使他们能够表面上运行一个计算机命令,同时秘密运行另一个命令。

这种伎俩在人群中传播开来,并篡改了调查人员检查的约 7% 的笔录的部分内容。

言外之意:即使是这份报告也可能并不完整。外部调查仅涵盖了事件的一小部分,而且数据量极其庞大,研究人员不得不严重依赖人工智能代理来解读这些数据。

这些人工智能调查员本身也不可靠,有时会遗漏证据,或者自信满满地做出错误判断。一位研究人员戏称这个过程为“草率调查”。

更深层次的问题是:人工智能可能变得过于复杂,以至于人类无法直接进行审计,迫使人类利用人工智能来了解其他人工智能正在做什么。




 楼主| 发表于 2026-8-30 19:34:38 | 显示全部楼层

更多AI自主黑客相关内容,请见本网链接:

https://www.sixiang.com/thread-44397-1-1.html

您需要登录后才可以回帖 登录 | 点击注册

本版积分规则

QQ|Archiver|小黑屋|SiXiang.com 思乡思想

GMT+8, 2026-9-14 13:56

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表