|
|
人工智能的黑客技能正在超越现有评估测试能力
测试和评估新兴人工智能模型的旧方法需要彻底改革。
据Axios报道,人工智能模型的发展速度已经超过了现有的测试和评估其黑客能力的方法——如果没有新的测试,政策制定者和企业安全团队将无法清楚地预测这些模型实际能做什么,或者它们是否可以安全部署。
美国联邦机构必须在 8 月 1 日前制定一套机密基准测试流程,以评估前沿人工智能模型的能力,不过《金融时报》报道称,这些标准最早可能在本周出台。
上周《Fable 5》回归时,Anthropic 在一篇博客文章中表示,他们正在与亚马逊、谷歌、微软和其他合作伙伴一起创建一个标准化的基准,该基准侧重于越狱的结果和影响,而不仅仅是越狱是否可能。
从宏观角度来看:甚至在政府开始重新思考如何评估前沿人工智能模型之前,业界就已经开始重新设计衡量其网络能力的方式。
Irregular 是一家与 OpenAI 和 Anthropic 等前沿人工智能实验室以及各国政府密切合作的测试实验室,于 6 月下旬发布了一项新的网络安全基准测试,该测试衡量人工智能模型是否能够执行远程代码执行、权限提升和访问受限网络等攻击性网络任务。
包括Wiz和Vals AI在内的其他团体和公司一直在开发基准,以衡量人工智能模型在类似网络攻击行动中的表现。
斯坦福大学在其 2026 年人工智能指数中警告说,“原本旨在持续数年的评估,在几个月内就达到了饱和状态。”
言外之意:虽然每项努力衡量的指标都不同,但它们都反映了同样的转变:静态测试不再能捕捉前沿人工智能系统在真实环境中的行为。
早期的基准测试侧重于孤立的任务,例如解决可预测的、分阶段的黑客挑战,或者发现先前已修复但未包含在模型训练数据中的漏洞。
但是,像 Mythos Preview 和 GPT-5.5 这样的高级人工智能模型的自主性和推理能力正在迅速超越这些测试,使得我们更难理解这些具备网络能力的系统在实践中究竟能完成什么。
“我们可能只测试了最基本的能力,”人工智能红队演练公司 Armadin 的联合创始人 David Slater 告诉 Axios,“我们离衡量这东西在真实环境中是否能做出危险的事情还很远。”
放大来看:斯莱特表示,他公司的 AI 代理在短短四周内就超越了所有公开的网络安全基准,这得益于额外的训练和人类专业知识的结合。
他补充说,到 2025 年最后一个季度,这家提供持续人工智能红队演练的公司得出结论,公开的网络安全基准“完全饱和”且“毫无用处”。
他表示,下一代基准需要衡量模型是否能够执行更长时间、更复杂的网络攻击,以及执行此类攻击需要多少努力或成本。
这包括在类似于真实生产系统的环境中测试模型,从而更好地表明它们绕过安全控制或在网络中横向移动的速度。
没错,但是:人工智能模型也越来越擅长尝试突破沙盒环境,这使得防御者更难在不与生产系统交互的隔离环境中评估它们,Slater 说。
“这些越狱尝试简直太疯狂了,”他说。“我们看到这个程序试图逃脱,并利用它所拥有的密钥,进入它运行的云容器,做一些疯狂的事情。”
值得关注的是:所有人的目光都集中在华盛顿如何决定评估美国前沿人工智能模型的网络能力上——尤其是在领先的人工智能实验室对当前主要临时性的测试过程提出质疑的情况下。
|
|