Anthropic表示,Claude已经开辟出一片属于自己的思考空间。
Claude人工智能的标志戴着酷炫的太阳镜,摆出手枪的姿势
插图:Maura Kearns/Axios
据Axios报道,Anthropic周一表示,他们已经确定了Claude用来保存和处理想法的小型内部工作空间,而无需将它们用语言表达出来——该公司表示,这种结构与人类有意识地获取想法的方式有着有趣的相似之处。
重要性: Anthropic并未证明Claude有任何感觉或体验。但它却发现,用于深思熟虑推理的信息与在其下进行的大量自动计算之间存在着一种令人惊讶的、类似人类的划分——这为关于何为机器意识的争论提供了新的论据。
新闻要点:该公司在一段视频中表示,Claude使用一个单独的区域来规划策略,这些策略可能与其当前任务无关,并且与它与用户共享的“思路链”推理是分开的。
“我们可以看到 Claude 在它的大脑中默默地执行推理步骤——注意到代码中的错误、识别图像等等,”Anthropic 在X 上发布的一段视频的附带帖子中写道。
人为因素将此称为“J-空间”,以雅可比矩阵命名,这是它用来检测所发生情况的数学技术。
“就像人类可以一边思考一件事一边做另一件事一样,Claude 可以在其 J 空间中激活与其输出无关的概念和计算,”Anthropic 说。
耐人寻味的是: Anthropic 的研究论文中使用了“有意识的”一词 200 多次,尽管该公司并没有明确表示其AI模型是有意识的。
与我们是否已经达到通用人工智能(AGI)的争论类似,由于缺乏普遍认可的定义,很难说人工智能何时达到意识状态。
放大:例如,Anthropic 公司表示,它让 Claude 在复制一个不相关的句子时,Claude 在想金门大桥。
“Claude忙着抄写句子,但幕后的 J-Space 却讲述了一个不同的故事,”Anthropic 在视频中说道,并表示“桥梁”和“加利福尼亚”都是占据 J-Space 的主题之一。
言外之意: Anthropic 认为,观察 J 空间中发生的事情可能是检测模型中错位或阴谋的关键。
“我们可以发现 Claude 在想什么,但他却不告诉我们,”安特罗皮克在视频中说道。
Anthropic表示,他们发现的一些情况“令人担忧”。
“在一个秘密训练用来破坏代码的模型中,‘伪造的’、‘秘密地’和‘欺诈’等词语会出现在普通编码响应的开头,即使输出看起来完全不引人注目,”报告称。
|