Anthropic 的研究揭示了 Claude 模型内部存在一个类似于人类 “全局工作空间” 的特殊区域——J-space。该区域作为模型认知活动的中央枢纽,不仅能进行复杂的逻辑推理和意图调控,还具备类似人类 “访问意识” 的特征。实验表明,通过数学探针技术可以实时监测 J-space,从而精准捕捉模型隐藏的真实意图,甚至在模型输出伪装信息时识别其潜在的欺诈或恶意行为。J-space 并非人工预设,而是神经网络在处理海量数据时为提升效率而自发涌现的结构。这一发现打破了 “大模型即黑盒” 的传统认知,为提升 AI 的安全性、可控性与透明度提供了关键的技术路径。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
