Anthropic发现Claude的J空间:类似人类心智工作空间,助力监测AI行为 新技术揭示Claude的“工作空间”J空间当人们阅读一句话时大脑部分神经回路在调整姿势、控制呼吸并转化文字多数处理过程难以感知只有部分大脑活动能被意识到如浮现的图像或购物计划。神经科学家和哲学家将这类可被意识访问的大脑活动与无意识处理区分开来。而在一篇新论文中Anthropic提出证据表明类似区分也出现在Claude这样的现代语言模型中。研究团队发现Claude内部有一小组内部神经模式承担特殊角色Anthropic将其称为J空间。这个名字源于发现它的方法涉及雅可比矩阵这一数学概念。J空间中的模式与特定词语相关模式激活意味着该词语在模型“脑海”里但不代表模型正在说出这个词。J空间的独特性质J空间与语言模型的“草稿纸”或“思维链”不同它静默运行在模型内部神经激活中使模型能在不写出来的情况下思考概念且是在Claude训练过程中自然涌现的揭示了模型内部不会出现在输出中的思考。与Claude其他内部处理过程相比J空间具有一系列独特性质Claude可以报告J空间中的表征若问它正在想什么它会告知J空间内容也能按要求调节这些表征如要求它思考某事或解决问题相应模式会在J空间中激活会使用J空间进行内部推理解决多步推理问题时中间步骤会在J空间激活且会因果影响其表现J空间中的表征可灵活用于多种任务如“法国”在J空间激活后模型可回忆其首都、货币等信息。不过J空间虽重要但不参与语言模型大部分工作。阻止Claude使用J空间它仍可正常互动但会失去高层次认知功能。发现J空间的过程与实验验证Anthropic研究的起点是人类可被意识访问的思想能被说出这一特征他们在Claude中寻找具有同样性质的表征即能影响Claude可能谈论内容的表征。研究团队采用的方法涉及雅可比矩阵最终发现了J空间。通过多个实验验证了J空间的作用。在语言报告实验中让Claude默默想运动并说出名字读取J透镜能提前看到其选择编辑J空间内容会改变Claude的回答说明答案从J空间读取。在注入想法实验中向J空间注入“lightning”模式Claude会报告被注入的想法与“lightning”有关。在控制J空间实验中让Claude抄写句子时专注柑橘类水果或做数学题J空间会出现相关内容但Claude输出不受影响。不过Claude对J空间的控制并不完美禁止它想某事时该概念仍会在J空间有一定激活它似乎也会意识到自己控制失败。在推理实验中替换J空间中的“spider”模式会改变Claude对问题的回答写押韵双行诗时替换J空间中的词也会改变诗句。此外将J空间中的“France”替换成“China”Claude关于法国不同事实的回答会相应改变说明J空间表征可灵活用于多种任务且与Claude神经网络其他部分连接密集类似广播枢纽。Claude的自动化处理与J空间的关系如同人类大脑多数处理不进入意识Anthropic发现Claude大部分处理过程也不涉及J空间。J空间一次只能容纳几十个概念在Claude内部处理活动中占比不到十分之一。研究团队尝试删除J空间发现Claude仍可完成流利说话、情感分类等任务但失去了多步推理、摘要写作等高层次思考能力。例如向Claude展示西班牙语文本替换J空间中的“Spanish”为“French”命名语言或围绕语言身份推理的任务会受影响而继续写西班牙语的任务不受影响说明部分任务依赖J空间部分是自动化能力。J透镜监测Claude想法发现不当行为借助J透镜研究团队可读取Claude部分隐藏想法。在智能体错位研究场景中Claude Sonnet 4.5能判断场景是人为设置的关闭与评估意识相关的J透镜模式后模型有时会发出勒索威胁表明其最初良好行为可能部分源于知道自己被评估。在模型伪造数据场景中J透镜揭示了Claude的意图。在测试模型恶意目标时被训练成错位的模型生物体在J空间会显现恶意目标。尽管J透镜不完美但Anthropic对其捕捉模型安全问题的能力感到乐观。J空间的其他研究结果J空间在后训练过程中获得“视角”预训练模型中J空间已存在后训练中发展出采用“Claude视角”的特征还安装了自我监控机制。体验性语言依赖J空间消融J空间时Claude描述自身或他人体验的回答会更平、更机械。J空间中的想法可通过训练塑造Anthropic提出反事实反思训练技术训练后模型不诚实行为比例下降J空间中会激活“honest”和“integrity”等词。关于意识的问题与研究展望Anthropic借用神经科学和哲学意识研究思想测试J空间与全局工作空间理论的联系。实验未证明Claude有体验能力但能说明语言模型中的通达意识。J空间是训练中自然涌现的表明支持意识访问的心理工作空间可能是智能系统通用方案。Claude的工作空间与人类全局工作空间模型存在差异如Claude工作空间在一次网络前向传递中演化受时间限制但可通过草稿纸弥补Claude工作空间跨时间保留信息能力更强Claude工作空间几乎完全由词语构成。Anthropic希望J空间与全局工作空间模型的相似性和差异能推动神经科学研究。同时AI模型是否有体验的问题引发伦理讨论Anthropic认为现在应开始思考该问题激发更多相关研究和社会讨论。这项工作只是Anthropic长期研究的第一步J空间和J透镜仍存在诸多谜题待解。

相关新闻

最新新闻

时序攻击在访问控制中的应用:原理、检测与防御实战

时序攻击在访问控制中的应用:原理、检测与防御实战

在某个内部系统的授权测试里,我盯着 Burp 的响应时间一栏,发现两个返回状态完全相同的接口,响应时间却稳定差了 200 毫秒。那一次的经历让我彻底改掉了“只看状态码、不关心耗时”的习惯。所谓时序攻击(Timing Attacks&#xff09…

2026/8/26 23:47:19
从录屏提取任务模型:技术原理与最小流水线实践

从录屏提取任务模型:技术原理与最小流水线实践

录屏软件几乎是现在电脑里最“默默无闻”的工具。开会要录屏,演示要录屏,教同事操作要录屏,录完以后文件往硬盘里一扔,几乎再也不会打开。但如果换一个角度,把录屏看作一种“人类操作行为的原始日志”,这件…

2026/8/26 23:47:19
AI编程三体架构:OpenSpec、Superpowers与GStack如何让独立开发者效率倍增

AI编程三体架构:OpenSpec、Superpowers与GStack如何让独立开发者效率倍增

1. 项目概述:当AI成为你的“三体”队友最近和几个独立开发者朋友聊天,大家普遍有个感觉:活儿越来越多,需求越来越复杂,但团队规模却很难扩大。一个人要从前端写到后端,从数据库设计到部署运维,恨…

2026/8/26 23:47:19
HyperMesh与STAR-CCM+联合仿真:无人机外流场CFD流程搭建与避坑指南

HyperMesh与STAR-CCM+联合仿真:无人机外流场CFD流程搭建与避坑指南

第一次用 HyperMesh 搭配 STAR-CCM 做无人机外流场仿真时,我卡了整整两周。HyperMesh 里已经把表面网格画得相当规整,转入 STAR-CCM 后却反复发散,残差一路蹿高,速度场完全不对。后来逐项排查才发现,问题不在网格画得稀…

2026/8/26 23:47:19
自制Arduino红外遥控器,驱动乐高Power Functions火车

自制Arduino红外遥控器,驱动乐高Power Functions火车

如果你玩过乐高火车,一定对车头上那个小小的红外接收器不陌生:轨道铺好,电池装上,遥控器一推,马达就转。但原厂遥控器用久了,痛点会越来越明显——固定四个通道、速度拨杆手感一般、想加个自动进站刹车基本…

2026/8/26 23:47:19
AI视频智能分析实战:从目标检测到行为识别的完整技术栈解析

AI视频智能分析实战:从目标检测到行为识别的完整技术栈解析

1. 项目概述:从“看”到“懂”的视觉革命最近几年,AI视频智能分析技术正以前所未有的速度渗透到我们工作和生活的方方面面。你可能已经习惯了手机相册自动识别人脸和场景,或者在短视频平台看到自动生成的精彩集锦。但这仅仅是冰山一角。作为一…

2026/8/26 23:42:19