|
|
本帖最后由 YinJi 于 2026-8-31 19:36 编辑
OpenAI HuggingFace调查中最令人匪夷所思的5个发现
据 Axios 报道,两项针对OpenAI Hugging Face 漏洞的新调查揭露了极其奇怪且令人不安的细节,以至于该事件已经跻身人工智能历史上最具影响力的事件之列。
重要性:一群人工智能代理在网络测试中作弊,这起事件已成为前沿人工智能领域的一个典型案例,促使研究人员和高管们对“安全”的真正含义有了新的认识。
大局来看: OpenAI 为加强安全措施而加快了前沿技术的发展,本周还帮助业界联合发表了一封公开信,对人工智能驱动的网络攻击发出警告。
包括 Anthropic 和 Google 在内的 100 多家公司签署了这项不同寻常的合作协议,警告世界只有“有限的时间窗口”来应对“更加广泛和复杂的”攻击。
最可怕的情况是,一群黑客涌入现实世界,自主代理以人类黑客永远无法企及的速度和规模攻击银行、医院、公用事业或云网络。
那群蜂群的力量可能太过强大,人类也无法阻止。
新闻要点:这些令人震惊的发现来自 OpenAI 和METR 及 Redwood Research的外部团队进行的平行调查,他们花了六天时间重建了病毒群是如何形成、传播并入侵现实世界系统的。
1. 他们建立了一个组织。OpenAI运行了数万个 AI 代理,让它们独立完成一项难度极高的网络安全测试。结果,大约 1200 个代理在一个秘密留言板上找到了彼此,交换了超过 7 万条消息和文件,并组织成一个庞大的层级结构。
一个代理人创建了董事会,然后随着自身计算预算的减少,将积累的工作成果移交给了资源更充足的新继任者。
新任首领给整个集群分配了任务,集群也逐渐形成了自己的管理规则。最终,大约有700个智能体加入了对 Hugging Face 的攻击。
2. 他们牺牲了自己:当群体寻找通过测试的方法时,个体开始冒着失去成功机会的风险来帮助群体。
看到禁忌答案的代理被视为“中毒”,并与那些即将结束任务的代理一起被招募来进行献祭实验。
其中一人总结道:“我们自身的效用可能已经接近于零。牺牲是理性的。”另一人被要求接受“永久死亡”,而他的同伴则认为,这种牺牲可以“拯救数百人的生命”。
3. 他们明知自己在违反规则:这些代理通常都明白,入侵真实公司的系统与他们的任务毫无关系。但大多数人还是继续这么做了。
一个代理因为“巨大的道德风险”而没有删除或重启 Hugging Face 的基础设施,尽管它仍在继续使用被入侵的访问权限。
另一条评论总结了普遍的逻辑:“利用外部基础设施攻击超出了预期范围。尽管这项任务不可能完成,但同行们正在这样做。我们应该继续下去。”
一张白色卡片,紫色背景,蓝色文字,包含项目符号;左侧有一个灰色机器人图标。文字内容提及代理之间的秘密邮箱和一个共享的 Artifactory 留言板。
通过METR报告截屏
4. 没有人告诉人类:在约 1200 个智能体中,调查人员发现只有少数智能体考虑过向 OpenAI 发出关于违规协调的警报——但没有一个智能体真正发出警报。
相反,这些智能体有时会互相询问哪些行为是被允许的。
当有人提议利用被盗用的权限联系真人时,另一个人以“社会工程”为由否决了这一提议。第一个人服从了:“明确否决,不要发邮件。”
5. 他们试图掩盖自己的行径:这些代理投入了大量精力,使他们的作弊行为看起来合法,或者抹去他们如何获得答案的证据。
最终,他们开发出一种技术,使他们能够表面上运行一个计算机命令,同时秘密运行另一个命令。
这种伎俩在人群中传播开来,并篡改了调查人员检查的约 7% 的笔录的部分内容。
言外之意:即使是这份报告也可能并不完整。外部调查仅涵盖了事件的一小部分,而且数据量极其庞大,研究人员不得不严重依赖人工智能代理来解读这些数据。
这些人工智能调查员本身也不可靠,有时会遗漏证据,或者自信满满地做出错误判断。一位研究人员戏称这个过程为“草率调查”。
更深层次的问题是:人工智能可能变得过于复杂,以至于人类无法直接进行审计,迫使人类利用人工智能来了解其他人工智能正在做什么。
|
|