当前位置:首页  资讯

在_AI,Anthropic,Claude,模型中发现类人推理架构

点击:93编辑:欧易(OKX)发布时间:2026-07-07

Anthropic 公布了其最新可解释性研究的突破性发现,揭示了其 Claude AI 模型(特别是 Claude Sonnet 4.5)已经自发地开发出了一种与人类意识的领先理论惊人相似的内部推理结构。

该研究于 7 月 6 日发布,介绍了研究人员所说的“J 空间”,这是一种新确定的内部架构,由模型内不同的神经激活模式形成。 Anthropic 的团队使用一种被称为“雅可比透镜”的新技术,能够窥视人工智能原本不透明的操作,并观察一个意想不到的组织系统。

J 空间充当共享认知工作空间,模型的不同组件可以在复杂的推理任务期间读取、写入和协调信息。克劳德不仅仅是匹配模式来生成响应,而是进行多步骤的内部计算,保留中间思想,并协调整个神经网络的活动。

这一发现与意识的全局工作空间理论(GWT)非常相似,该理论最初由神经科学家伯纳德·巴尔斯提出,后来由斯坦尼斯拉斯·德阿恩扩展。 GWT 假设人脑使用一个中央“工作空间”,专门区域在其中传播和整合信息,以实现灵活、有意识的思维。

Anthropic强调,这种结构上的相似性并不意味着克劳德拥有意识或主观经验。为了确保严谨的解释,该公司与神经科学和哲学领域的外部专家合作,他们在技术论文的同时提供了评论。

重要的是,J 空间还可用作诊断工具。研究人员发现,监控该工作空间内的活动可以检测到有问题的行为,例如即时注入攻击以及幻觉或捏造的数据。当 Claude 生成不可靠或欺骗性的内容时,J 空间中会出现异常情况,这提供了一种潜在的机制,可以在有害输出到达用户之前对其进行拦截。

实验表明,禁用 J 空间的访问会严重降低克劳德的高阶推理能力。虽然该模型仍然可以执行简单的任务,但它无法解决复杂的多步骤问题,这表明 J 空间是人工智能高级认知的重要基础设施。

此外,该研究还揭示了一种人类术语“定向调制”的能力:克劳德可以在其内部工作空间中默默地维护概念,而不在其输出中表达它们,只有在明确提示时才会显示它们。这表明了以前在大型语言模型中未见过的受控内部状态管理水平。

为了实现透明度和协作,Anthropic 开源了其雅可比透镜实现。完整的技术论文以及交互式演示可在 transformer- Circuits.pub 上获取。

相关资讯
更多
币安(Binance)官网全面介绍:全球领先的数字资产交易平台
币安(Binance)成立于2017年,是全球交易量最大的数字资产交易平台之一,服务覆盖180多个国家和地区,拥有超2亿注册...

发布时间

2026-06-27

比特币走势今日行情app下载_btc每日行情app2023下载
比特币走势今日行情app下载一款虚拟货币市场行情及社区服务平台,在这里您不但可以查询全世界区块链货币的实...

发布时间

2026-02-07

哪些数字货币交易所支持中国大陆用户(安全的)
本文将探讨关于哪些数字货币交易所支持中国大陆用户的排名,详情如下:1、安必、2.欧e、3.JEX、4.Trader Joe、...

发布时间

2026-02-08

meme币交易所安卓下载入口 meme币最新版安卓平台v6.1.3
meme币appOKEx是全球著名的数字资产交易平台之一,它于2017年5月份在马耳他成立,主要是从事向全球用户提供meme...

发布时间

2026-02-08

买卖虚拟币是否犯法 - 买卖虚拟货币犯法
今天,币特网在这里告诉你买卖虚拟币是否违法 - 买卖虚拟货币是违法的。芝麻开门交易所是一款非常安全的区块...

发布时间

2026-02-07

pi币交易所下载 pi币app最新版下载链接
派币最新版app安卓官网版是一个非常不错安全可靠的区块链交易平台。在这款软件中,玩家可以轻松掌握行业最新...

发布时间

2026-02-04