aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型RESEARCH BRIEF

Jacobian Lens / J-space

研究模型没有写出来的内部推理

IN A NUTSHELL

通过 Jacobian Lens 把内部激活映射到可读的词汇方向,研究一组可被报告、调节和用于多步推理的表示。作者称其具有全局工作空间特征,但明确不把它当作主观意识的证明。

01

方法与关键变化

镜头估计内部残差流到输出表示之间的平均 Jacobian,再用模型自身的词表读出。它观察的是内部状态可能支持哪些表达,不只是下一 token 预测。

研究同时做表示读取与干预,考察概念能否被报告、主动调节、用于不同任务,以及移除相关子空间后哪些能力受损。

02

实验与证据

作者报告削弱 J-space 后部分高阶推理能力受影响,而基础语言行为仍可保留;还展示用于审计隐藏目标等研究场景。公开代码可在开放权重解码模型上拟合与观察镜头,不包含 Claude 权重。

03

开放情况与使用许可

核心方法实现、示例及合成提示数据开放;模型和运行时下载语料分别适用自身许可。

LICENSE方法代码和随附合成数据:Apache-2.0

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

将可读方向与干预联系起来,比只展示激活相关性更接近机制研究。可解释性工具若能提出可证伪的预测,就可以帮助定位能力来自哪些内部计算。

反方 · 哪些结论还不够

一个便于人读的坐标系可能放大某些模式、隐藏另一些。干预有效也未必证明自然推理时只依赖该方向;功能类比不能推出主观体验。

综合判断

值得作为提出并验证局部机制假设的工具,不宜当作内部思维的完整字幕。最重要的是跨任务、跨模型能否保持解释与因果效果。

我会先做的验证

在可访问激活的模型上对照目标方向、随机等范数方向和邻近方向干预;用未参与选择方向的任务测行为改变,同时检查是否造成广泛能力破坏。

继续探索大模型